Document Qwen image prompt enhancer test
This commit is contained in:
@@ -150,3 +150,69 @@ und anschließend Router und Controller neu ausgerollt werden. Keine dieser
|
||||
Historische FLUX-Messwerte und Grenzen stehen in
|
||||
[FLUX_9B_BETA.md](FLUX_9B_BETA.md) und
|
||||
[FLUX_RESOLUTION_TEST_20260912.md](FLUX_RESOLUTION_TEST_20260912.md).
|
||||
|
||||
## Offizieller Prompt Enhancer: Vorabtest vom 21. September 2026
|
||||
|
||||
Qwen veröffentlicht für Referenzbild-Aufträge einen separaten, auf
|
||||
Qwen3.5-VL 9B nachtrainierten Prompt Enhancer. Er ist kein Bestandteil der
|
||||
Qwen-Image-Gewichte und wird vom ComfyUI-Workflow nicht automatisch geladen.
|
||||
Der produktive Router verwendet ihn derzeit noch nicht; der folgende Test
|
||||
prüfte zunächst Speicherbedarf, Laufzeit und Wirkung.
|
||||
|
||||
Geprüft wurde `Qwen/Qwen-Image-2.1-PE-I2I`, Revision
|
||||
`72927bc08afc99b7888ceb7d7d51a12db3700bbd`. Der offizielle Systemprompt
|
||||
verlangt bei mehreren Eingabebildern eine strukturierte Zuordnung und liefert
|
||||
zusätzlich `wh_ratio` beziehungsweise `ratio_follow`.
|
||||
|
||||
### FP8 auf der RTX 3060
|
||||
|
||||
Der vorquantisierte Testcheckpoint
|
||||
`prithivMLmods/Qwen-Image-2.1-PE-I2I-FP8`, Revision
|
||||
`ac9065ce94fdc39b9aecfff7d11f297b77a5c178`, umfasst 13,54 GB und passt
|
||||
einschließlich Laufzeit- und Aktivierungsspeicher nicht vollständig in die
|
||||
12-GB-RTX-3060:
|
||||
|
||||
- mit 11.264 MiB Modellbudget scheiterte das Laden bei nur noch 32 MiB freiem
|
||||
VRAM an einer weiteren 96-MiB-Allokation;
|
||||
- mit 9.216 MiB Modellbudget und CPU-Offload scheiterte die Inferenz bei nur
|
||||
noch 78 MiB freiem VRAM an einer 136-MiB-Allokation;
|
||||
- mit 7.168 MiB Modellbudget, CPU-Offload und auf 262.144 Pixel verkleinerten
|
||||
Referenzen lief die Inferenz, erzeugte wegen der langsamen Transformers-
|
||||
Referenzkerne aber auch nach mehr als drei Minuten noch keinen Rewrite.
|
||||
|
||||
Der FP8-Testcheckpoint wurde anschließend wieder entfernt. FP8 mit CPU-Offload
|
||||
ist damit kein sinnvoller Produktionspfad auf dieser 3060.
|
||||
|
||||
### Q5 vollständig auf der RTX 3060
|
||||
|
||||
Als funktionierender Vergleich wurde dieselbe PE-I2I-Feinabstimmung als
|
||||
`Q5_K_M`-GGUF aus
|
||||
`prithivMLmods/Qwen-Image-2.1-PE-I2I-GGUF`, Revision
|
||||
`55b9c1a326599e142d59bcad8715d5601ccf8daa`, mit llama.cpp Build 10930
|
||||
getestet. Die Dateien liegen vorerst außerhalb von Git unter
|
||||
`/data/models/qwen-image-2.1-pe-i2i-q5-test`:
|
||||
|
||||
| Datei | SHA-256 |
|
||||
|---|---|
|
||||
| `Qwen-Image-2.1-PE-I2I.Q5_K_M.gguf` | `cb71f71fe5fe5938570d65a7c403fbcb1a9065dff9dd9a021f58aec42785b84e` |
|
||||
| `Qwen-Image-2.1-PE-I2I.mmproj-bf16.gguf` | `8dedb71dbc3092dc47de9108ad373d68a12854e2527d59bd9399601738f3bce1` |
|
||||
|
||||
Mit vier Peter-Maffay-Referenzbildern belegte der Rewriter 7.167 MiB VRAM.
|
||||
Der erste Prefill umfasste 10.045 Tokens und lief mit 791,3 Token/s; die
|
||||
Ausgabe lief mit 45,9 Token/s. Ohne Denkbudget verbrauchte das Modell mehr als
|
||||
4.096 Ausgabetokens. Mit `thinking_budget_tokens: 2048` lieferte es nach 52,0
|
||||
Sekunden gültiges JSON mit 2.384 Ausgabetokens. Der Rewrite erkannte die vier
|
||||
Bilder als dieselbe Person und formulierte ausdrücklich eine einzelne Person,
|
||||
genau eine Gummiente und ein neues 3:4-Motiv.
|
||||
|
||||
Der anschließende Ende-zu-Ende-Lauf hielt den Rewriter auf der RTX 3060 und
|
||||
Qwen-Image-2.1 auf der RTX 5080. Qwen-Image benötigte 193,18 Sekunden und
|
||||
erzeugte ein neues PNG mit 1.312 × 1.824 Pixeln, genau einer Person und genau
|
||||
einer gelben Gummiente. Das Ergebnis liegt im Router-Bildvolume als
|
||||
`qwen-pe-e2e.png`; SHA-256:
|
||||
`931cd3cf46993aee735e95c7c2447c500a498ffb600a26a96f5faab87a0260e9`.
|
||||
|
||||
Nach dem Test wurden beide Testworker gestoppt und Medium sowie Qwen3-TTS
|
||||
wieder gesund gestartet. Der Q5-Checkpoint bleibt für die geplante
|
||||
Routerintegration liegen, ist aber noch kein automatisch gestarteter
|
||||
Produktionsdienst.
|
||||
|
||||
@@ -55,6 +55,7 @@ Titelgenerierung und Kontextkompression in Hermes.
|
||||
| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
||||
| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue als 4B; produktiver Zwei-GPU-Pfad, auf 1024 × 1024 begrenzt | **Standby seit 21.09.2026** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
||||
| 21.09.2026 | Qwen-Image-2.1 INT8 | im direkten Vergleich fotorealistischer, bessere Textdarstellung und Prompttreue; 1024 × 1024 bei 25 Schritten in rund 49 s Pipeline-Lauf | **produktiv** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md) |
|
||||
| 21.09.2026 | Qwen-Image-2.1 PE-I2I, FP8 und Q5_K_M | FP8 passt nicht vollständig in 12 GB und ist mit CPU-Offload unpraktisch langsam; Q5_K_M samt BF16-MMProj belegt 7.167 MiB auf der RTX 3060 und erzeugt mit 2.048 Denktokens in 52,0 s einen gültigen Mehrbild-Rewrite | **Vorabtest bestanden, noch nicht produktiv verdrahtet** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md#offizieller-prompt-enhancer-vorabtest-vom-21-september-2026) |
|
||||
| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
||||
| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
||||
|
||||
|
||||
Reference in New Issue
Block a user