From b8321572264730aa0d0b5b6b2e8564ab3515a28b Mon Sep 17 00:00:00 2001 From: Mikei386 <44135113+Mikei386@users.noreply.github.com> Date: Mon, 21 Sep 2026 14:27:14 +0200 Subject: [PATCH] Document Qwen image prompt enhancer test --- docs/QWEN_IMAGE_21.md | 66 +++++++++++++++++++++++++++++++++++++++++++ docs/TESTED_MODELS.md | 1 + 2 files changed, 67 insertions(+) diff --git a/docs/QWEN_IMAGE_21.md b/docs/QWEN_IMAGE_21.md index bf26b66..8e09b88 100644 --- a/docs/QWEN_IMAGE_21.md +++ b/docs/QWEN_IMAGE_21.md @@ -150,3 +150,69 @@ und anschließend Router und Controller neu ausgerollt werden. Keine dieser Historische FLUX-Messwerte und Grenzen stehen in [FLUX_9B_BETA.md](FLUX_9B_BETA.md) und [FLUX_RESOLUTION_TEST_20260912.md](FLUX_RESOLUTION_TEST_20260912.md). + +## Offizieller Prompt Enhancer: Vorabtest vom 21. September 2026 + +Qwen veröffentlicht für Referenzbild-Aufträge einen separaten, auf +Qwen3.5-VL 9B nachtrainierten Prompt Enhancer. Er ist kein Bestandteil der +Qwen-Image-Gewichte und wird vom ComfyUI-Workflow nicht automatisch geladen. +Der produktive Router verwendet ihn derzeit noch nicht; der folgende Test +prüfte zunächst Speicherbedarf, Laufzeit und Wirkung. + +Geprüft wurde `Qwen/Qwen-Image-2.1-PE-I2I`, Revision +`72927bc08afc99b7888ceb7d7d51a12db3700bbd`. Der offizielle Systemprompt +verlangt bei mehreren Eingabebildern eine strukturierte Zuordnung und liefert +zusätzlich `wh_ratio` beziehungsweise `ratio_follow`. + +### FP8 auf der RTX 3060 + +Der vorquantisierte Testcheckpoint +`prithivMLmods/Qwen-Image-2.1-PE-I2I-FP8`, Revision +`ac9065ce94fdc39b9aecfff7d11f297b77a5c178`, umfasst 13,54 GB und passt +einschließlich Laufzeit- und Aktivierungsspeicher nicht vollständig in die +12-GB-RTX-3060: + +- mit 11.264 MiB Modellbudget scheiterte das Laden bei nur noch 32 MiB freiem + VRAM an einer weiteren 96-MiB-Allokation; +- mit 9.216 MiB Modellbudget und CPU-Offload scheiterte die Inferenz bei nur + noch 78 MiB freiem VRAM an einer 136-MiB-Allokation; +- mit 7.168 MiB Modellbudget, CPU-Offload und auf 262.144 Pixel verkleinerten + Referenzen lief die Inferenz, erzeugte wegen der langsamen Transformers- + Referenzkerne aber auch nach mehr als drei Minuten noch keinen Rewrite. + +Der FP8-Testcheckpoint wurde anschließend wieder entfernt. FP8 mit CPU-Offload +ist damit kein sinnvoller Produktionspfad auf dieser 3060. + +### Q5 vollständig auf der RTX 3060 + +Als funktionierender Vergleich wurde dieselbe PE-I2I-Feinabstimmung als +`Q5_K_M`-GGUF aus +`prithivMLmods/Qwen-Image-2.1-PE-I2I-GGUF`, Revision +`55b9c1a326599e142d59bcad8715d5601ccf8daa`, mit llama.cpp Build 10930 +getestet. Die Dateien liegen vorerst außerhalb von Git unter +`/data/models/qwen-image-2.1-pe-i2i-q5-test`: + +| Datei | SHA-256 | +|---|---| +| `Qwen-Image-2.1-PE-I2I.Q5_K_M.gguf` | `cb71f71fe5fe5938570d65a7c403fbcb1a9065dff9dd9a021f58aec42785b84e` | +| `Qwen-Image-2.1-PE-I2I.mmproj-bf16.gguf` | `8dedb71dbc3092dc47de9108ad373d68a12854e2527d59bd9399601738f3bce1` | + +Mit vier Peter-Maffay-Referenzbildern belegte der Rewriter 7.167 MiB VRAM. +Der erste Prefill umfasste 10.045 Tokens und lief mit 791,3 Token/s; die +Ausgabe lief mit 45,9 Token/s. Ohne Denkbudget verbrauchte das Modell mehr als +4.096 Ausgabetokens. Mit `thinking_budget_tokens: 2048` lieferte es nach 52,0 +Sekunden gültiges JSON mit 2.384 Ausgabetokens. Der Rewrite erkannte die vier +Bilder als dieselbe Person und formulierte ausdrücklich eine einzelne Person, +genau eine Gummiente und ein neues 3:4-Motiv. + +Der anschließende Ende-zu-Ende-Lauf hielt den Rewriter auf der RTX 3060 und +Qwen-Image-2.1 auf der RTX 5080. Qwen-Image benötigte 193,18 Sekunden und +erzeugte ein neues PNG mit 1.312 × 1.824 Pixeln, genau einer Person und genau +einer gelben Gummiente. Das Ergebnis liegt im Router-Bildvolume als +`qwen-pe-e2e.png`; SHA-256: +`931cd3cf46993aee735e95c7c2447c500a498ffb600a26a96f5faab87a0260e9`. + +Nach dem Test wurden beide Testworker gestoppt und Medium sowie Qwen3-TTS +wieder gesund gestartet. Der Q5-Checkpoint bleibt für die geplante +Routerintegration liegen, ist aber noch kein automatisch gestarteter +Produktionsdienst. diff --git a/docs/TESTED_MODELS.md b/docs/TESTED_MODELS.md index 73c1566..650e7ee 100644 --- a/docs/TESTED_MODELS.md +++ b/docs/TESTED_MODELS.md @@ -55,6 +55,7 @@ Titelgenerierung und Kontextkompression in Hermes. | bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) | | 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue als 4B; produktiver Zwei-GPU-Pfad, auf 1024 × 1024 begrenzt | **Standby seit 21.09.2026** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) | | 21.09.2026 | Qwen-Image-2.1 INT8 | im direkten Vergleich fotorealistischer, bessere Textdarstellung und Prompttreue; 1024 × 1024 bei 25 Schritten in rund 49 s Pipeline-Lauf | **produktiv** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md) | +| 21.09.2026 | Qwen-Image-2.1 PE-I2I, FP8 und Q5_K_M | FP8 passt nicht vollständig in 12 GB und ist mit CPU-Offload unpraktisch langsam; Q5_K_M samt BF16-MMProj belegt 7.167 MiB auf der RTX 3060 und erzeugt mit 2.048 Denktokens in 52,0 s einen gültigen Mehrbild-Rewrite | **Vorabtest bestanden, noch nicht produktiv verdrahtet** | [QWEN_IMAGE_21.md](QWEN_IMAGE_21.md#offizieller-prompt-enhancer-vorabtest-vom-21-september-2026) | | 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) | | 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |