Document Qwen image prompt enhancer test

This commit is contained in:
Mikei386
2026-09-21 14:27:14 +02:00
parent 57309f3722
commit b832157226
2 changed files with 67 additions and 0 deletions
+66
View File
@@ -150,3 +150,69 @@ und anschließend Router und Controller neu ausgerollt werden. Keine dieser
Historische FLUX-Messwerte und Grenzen stehen in Historische FLUX-Messwerte und Grenzen stehen in
[FLUX_9B_BETA.md](FLUX_9B_BETA.md) und [FLUX_9B_BETA.md](FLUX_9B_BETA.md) und
[FLUX_RESOLUTION_TEST_20260912.md](FLUX_RESOLUTION_TEST_20260912.md). [FLUX_RESOLUTION_TEST_20260912.md](FLUX_RESOLUTION_TEST_20260912.md).
## Offizieller Prompt Enhancer: Vorabtest vom 21. September 2026
Qwen veröffentlicht für Referenzbild-Aufträge einen separaten, auf
Qwen3.5-VL 9B nachtrainierten Prompt Enhancer. Er ist kein Bestandteil der
Qwen-Image-Gewichte und wird vom ComfyUI-Workflow nicht automatisch geladen.
Der produktive Router verwendet ihn derzeit noch nicht; der folgende Test
prüfte zunächst Speicherbedarf, Laufzeit und Wirkung.
Geprüft wurde `Qwen/Qwen-Image-2.1-PE-I2I`, Revision
`72927bc08afc99b7888ceb7d7d51a12db3700bbd`. Der offizielle Systemprompt
verlangt bei mehreren Eingabebildern eine strukturierte Zuordnung und liefert
zusätzlich `wh_ratio` beziehungsweise `ratio_follow`.
### FP8 auf der RTX 3060
Der vorquantisierte Testcheckpoint
`prithivMLmods/Qwen-Image-2.1-PE-I2I-FP8`, Revision
`ac9065ce94fdc39b9aecfff7d11f297b77a5c178`, umfasst 13,54 GB und passt
einschließlich Laufzeit- und Aktivierungsspeicher nicht vollständig in die
12-GB-RTX-3060:
- mit 11.264 MiB Modellbudget scheiterte das Laden bei nur noch 32 MiB freiem
VRAM an einer weiteren 96-MiB-Allokation;
- mit 9.216 MiB Modellbudget und CPU-Offload scheiterte die Inferenz bei nur
noch 78 MiB freiem VRAM an einer 136-MiB-Allokation;
- mit 7.168 MiB Modellbudget, CPU-Offload und auf 262.144 Pixel verkleinerten
Referenzen lief die Inferenz, erzeugte wegen der langsamen Transformers-
Referenzkerne aber auch nach mehr als drei Minuten noch keinen Rewrite.
Der FP8-Testcheckpoint wurde anschließend wieder entfernt. FP8 mit CPU-Offload
ist damit kein sinnvoller Produktionspfad auf dieser 3060.
### Q5 vollständig auf der RTX 3060
Als funktionierender Vergleich wurde dieselbe PE-I2I-Feinabstimmung als
`Q5_K_M`-GGUF aus
`prithivMLmods/Qwen-Image-2.1-PE-I2I-GGUF`, Revision
`55b9c1a326599e142d59bcad8715d5601ccf8daa`, mit llama.cpp Build 10930
getestet. Die Dateien liegen vorerst außerhalb von Git unter
`/data/models/qwen-image-2.1-pe-i2i-q5-test`:
| Datei | SHA-256 |
|---|---|
| `Qwen-Image-2.1-PE-I2I.Q5_K_M.gguf` | `cb71f71fe5fe5938570d65a7c403fbcb1a9065dff9dd9a021f58aec42785b84e` |
| `Qwen-Image-2.1-PE-I2I.mmproj-bf16.gguf` | `8dedb71dbc3092dc47de9108ad373d68a12854e2527d59bd9399601738f3bce1` |
Mit vier Peter-Maffay-Referenzbildern belegte der Rewriter 7.167 MiB VRAM.
Der erste Prefill umfasste 10.045 Tokens und lief mit 791,3 Token/s; die
Ausgabe lief mit 45,9 Token/s. Ohne Denkbudget verbrauchte das Modell mehr als
4.096 Ausgabetokens. Mit `thinking_budget_tokens: 2048` lieferte es nach 52,0
Sekunden gültiges JSON mit 2.384 Ausgabetokens. Der Rewrite erkannte die vier
Bilder als dieselbe Person und formulierte ausdrücklich eine einzelne Person,
genau eine Gummiente und ein neues 3:4-Motiv.
Der anschließende Ende-zu-Ende-Lauf hielt den Rewriter auf der RTX 3060 und
Qwen-Image-2.1 auf der RTX 5080. Qwen-Image benötigte 193,18 Sekunden und
erzeugte ein neues PNG mit 1.312 × 1.824 Pixeln, genau einer Person und genau
einer gelben Gummiente. Das Ergebnis liegt im Router-Bildvolume als
`qwen-pe-e2e.png`; SHA-256:
`931cd3cf46993aee735e95c7c2447c500a498ffb600a26a96f5faab87a0260e9`.
Nach dem Test wurden beide Testworker gestoppt und Medium sowie Qwen3-TTS
wieder gesund gestartet. Der Q5-Checkpoint bleibt für die geplante
Routerintegration liegen, ist aber noch kein automatisch gestarteter
Produktionsdienst.
+1
View File
@@ -55,6 +55,7 @@ Titelgenerierung und Kontextkompression in Hermes.
| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) | | bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue als 4B; produktiver Zwei-GPU-Pfad, auf 1024 × 1024 begrenzt | **Standby seit 21.09.2026** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) | | 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue als 4B; produktiver Zwei-GPU-Pfad, auf 1024 × 1024 begrenzt | **Standby seit 21.09.2026** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
| 21.09.2026 | Qwen-Image-2.1 INT8 | im direkten Vergleich fotorealistischer, bessere Textdarstellung und Prompttreue; 1024 × 1024 bei 25 Schritten in rund 49 s Pipeline-Lauf | **produktiv** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md) | | 21.09.2026 | Qwen-Image-2.1 INT8 | im direkten Vergleich fotorealistischer, bessere Textdarstellung und Prompttreue; 1024 × 1024 bei 25 Schritten in rund 49 s Pipeline-Lauf | **produktiv** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md) |
| 21.09.2026 | Qwen-Image-2.1 PE-I2I, FP8 und Q5_K_M | FP8 passt nicht vollständig in 12 GB und ist mit CPU-Offload unpraktisch langsam; Q5_K_M samt BF16-MMProj belegt 7.167 MiB auf der RTX 3060 und erzeugt mit 2.048 Denktokens in 52,0 s einen gültigen Mehrbild-Rewrite | **Vorabtest bestanden, noch nicht produktiv verdrahtet** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md#offizieller-prompt-enhancer-vorabtest-vom-21-september-2026) |
| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) | | 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) | | 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |