Document Qwen image prompt enhancer test
This commit is contained in:
1 parent
57309f3722
commit
b832157226
2 files changed
+67
No files matched your search
@@ -150,3 +150,69 @@ und anschließend Router und Controller neu ausgerollt werden. Keine dieser
|
|||||||
Historische FLUX-Messwerte und Grenzen stehen in
|
Historische FLUX-Messwerte und Grenzen stehen in
|
||||||
[FLUX_9B_BETA.md](FLUX_9B_BETA.md) und
|
[FLUX_9B_BETA.md](FLUX_9B_BETA.md) und
|
||||||
[FLUX_RESOLUTION_TEST_20260912.md](FLUX_RESOLUTION_TEST_20260912.md).
|
[FLUX_RESOLUTION_TEST_20260912.md](FLUX_RESOLUTION_TEST_20260912.md).
|
||||||
|
|
||||||
|
## Offizieller Prompt Enhancer: Vorabtest vom 21. September 2026
|
||||||
|
|
||||||
|
Qwen veröffentlicht für Referenzbild-Aufträge einen separaten, auf
|
||||||
|
Qwen3.5-VL 9B nachtrainierten Prompt Enhancer. Er ist kein Bestandteil der
|
||||||
|
Qwen-Image-Gewichte und wird vom ComfyUI-Workflow nicht automatisch geladen.
|
||||||
|
Der produktive Router verwendet ihn derzeit noch nicht; der folgende Test
|
||||||
|
prüfte zunächst Speicherbedarf, Laufzeit und Wirkung.
|
||||||
|
|
||||||
|
Geprüft wurde `Qwen/Qwen-Image-2.1-PE-I2I`, Revision
|
||||||
|
`72927bc08afc99b7888ceb7d7d51a12db3700bbd`. Der offizielle Systemprompt
|
||||||
|
verlangt bei mehreren Eingabebildern eine strukturierte Zuordnung und liefert
|
||||||
|
zusätzlich `wh_ratio` beziehungsweise `ratio_follow`.
|
||||||
|
|
||||||
|
### FP8 auf der RTX 3060
|
||||||
|
|
||||||
|
Der vorquantisierte Testcheckpoint
|
||||||
|
`prithivMLmods/Qwen-Image-2.1-PE-I2I-FP8`, Revision
|
||||||
|
`ac9065ce94fdc39b9aecfff7d11f297b77a5c178`, umfasst 13,54 GB und passt
|
||||||
|
einschließlich Laufzeit- und Aktivierungsspeicher nicht vollständig in die
|
||||||
|
12-GB-RTX-3060:
|
||||||
|
|
||||||
|
- mit 11.264 MiB Modellbudget scheiterte das Laden bei nur noch 32 MiB freiem
|
||||||
|
VRAM an einer weiteren 96-MiB-Allokation;
|
||||||
|
- mit 9.216 MiB Modellbudget und CPU-Offload scheiterte die Inferenz bei nur
|
||||||
|
noch 78 MiB freiem VRAM an einer 136-MiB-Allokation;
|
||||||
|
- mit 7.168 MiB Modellbudget, CPU-Offload und auf 262.144 Pixel verkleinerten
|
||||||
|
Referenzen lief die Inferenz, erzeugte wegen der langsamen Transformers-
|
||||||
|
Referenzkerne aber auch nach mehr als drei Minuten noch keinen Rewrite.
|
||||||
|
|
||||||
|
Der FP8-Testcheckpoint wurde anschließend wieder entfernt. FP8 mit CPU-Offload
|
||||||
|
ist damit kein sinnvoller Produktionspfad auf dieser 3060.
|
||||||
|
|
||||||
|
### Q5 vollständig auf der RTX 3060
|
||||||
|
|
||||||
|
Als funktionierender Vergleich wurde dieselbe PE-I2I-Feinabstimmung als
|
||||||
|
`Q5_K_M`-GGUF aus
|
||||||
|
`prithivMLmods/Qwen-Image-2.1-PE-I2I-GGUF`, Revision
|
||||||
|
`55b9c1a326599e142d59bcad8715d5601ccf8daa`, mit llama.cpp Build 10930
|
||||||
|
getestet. Die Dateien liegen vorerst außerhalb von Git unter
|
||||||
|
`/data/models/qwen-image-2.1-pe-i2i-q5-test`:
|
||||||
|
|
||||||
|
| Datei | SHA-256 |
|
||||||
|
|---|---|
|
||||||
|
| `Qwen-Image-2.1-PE-I2I.Q5_K_M.gguf` | `cb71f71fe5fe5938570d65a7c403fbcb1a9065dff9dd9a021f58aec42785b84e` |
|
||||||
|
| `Qwen-Image-2.1-PE-I2I.mmproj-bf16.gguf` | `8dedb71dbc3092dc47de9108ad373d68a12854e2527d59bd9399601738f3bce1` |
|
||||||
|
|
||||||
|
Mit vier Peter-Maffay-Referenzbildern belegte der Rewriter 7.167 MiB VRAM.
|
||||||
|
Der erste Prefill umfasste 10.045 Tokens und lief mit 791,3 Token/s; die
|
||||||
|
Ausgabe lief mit 45,9 Token/s. Ohne Denkbudget verbrauchte das Modell mehr als
|
||||||
|
4.096 Ausgabetokens. Mit `thinking_budget_tokens: 2048` lieferte es nach 52,0
|
||||||
|
Sekunden gültiges JSON mit 2.384 Ausgabetokens. Der Rewrite erkannte die vier
|
||||||
|
Bilder als dieselbe Person und formulierte ausdrücklich eine einzelne Person,
|
||||||
|
genau eine Gummiente und ein neues 3:4-Motiv.
|
||||||
|
|
||||||
|
Der anschließende Ende-zu-Ende-Lauf hielt den Rewriter auf der RTX 3060 und
|
||||||
|
Qwen-Image-2.1 auf der RTX 5080. Qwen-Image benötigte 193,18 Sekunden und
|
||||||
|
erzeugte ein neues PNG mit 1.312 × 1.824 Pixeln, genau einer Person und genau
|
||||||
|
einer gelben Gummiente. Das Ergebnis liegt im Router-Bildvolume als
|
||||||
|
`qwen-pe-e2e.png`; SHA-256:
|
||||||
|
`931cd3cf46993aee735e95c7c2447c500a498ffb600a26a96f5faab87a0260e9`.
|
||||||
|
|
||||||
|
Nach dem Test wurden beide Testworker gestoppt und Medium sowie Qwen3-TTS
|
||||||
|
wieder gesund gestartet. Der Q5-Checkpoint bleibt für die geplante
|
||||||
|
Routerintegration liegen, ist aber noch kein automatisch gestarteter
|
||||||
|
Produktionsdienst.
|
||||||
@@ -55,6 +55,7 @@ Titelgenerierung und Kontextkompression in Hermes.
|
|||||||
| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
||||||
| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue als 4B; produktiver Zwei-GPU-Pfad, auf 1024 × 1024 begrenzt | **Standby seit 21.09.2026** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue als 4B; produktiver Zwei-GPU-Pfad, auf 1024 × 1024 begrenzt | **Standby seit 21.09.2026** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
||||||
| 21.09.2026 | Qwen-Image-2.1 INT8 | im direkten Vergleich fotorealistischer, bessere Textdarstellung und Prompttreue; 1024 × 1024 bei 25 Schritten in rund 49 s Pipeline-Lauf | **produktiv** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md) |
|
| 21.09.2026 | Qwen-Image-2.1 INT8 | im direkten Vergleich fotorealistischer, bessere Textdarstellung und Prompttreue; 1024 × 1024 bei 25 Schritten in rund 49 s Pipeline-Lauf | **produktiv** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md) |
|
||||||
|
| 21.09.2026 | Qwen-Image-2.1 PE-I2I, FP8 und Q5_K_M | FP8 passt nicht vollständig in 12 GB und ist mit CPU-Offload unpraktisch langsam; Q5_K_M samt BF16-MMProj belegt 7.167 MiB auf der RTX 3060 und erzeugt mit 2.048 Denktokens in 52,0 s einen gültigen Mehrbild-Rewrite | **Vorabtest bestanden, noch nicht produktiv verdrahtet** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md#offizieller-prompt-enhancer-vorabtest-vom-21-september-2026) |
|
||||||
| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
||||||
| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
||||||
|
|
||||||
|
|||||||
Reference in new issue
Block a user