33 lines
1.7 KiB
Markdown
33 lines
1.7 KiB
Markdown
# FLUX-Wiederholungsfehler am 20.09.2026
|
||
|
||
Beim OpenClaw-Bildauftrag erzeugte der Worker ein Bild erfolgreich und scheiterte
|
||
beim folgenden Bild mit CUDA OOM (angeforderte 4,23 GiB bei 3,73 GiB frei).
|
||
Der Router hatte Qwen und TTS korrekt gestoppt. Kein Benchmarkcontainer war aktiv.
|
||
Die experimentelle Qwen-Mindestreserve war nicht die Ursache.
|
||
|
||
## Korrektur
|
||
|
||
- Den globalen FP8-Checkpoint-Konverter nur während des Ladens ersetzen und auch
|
||
bei Fehlern wiederherstellen. Die bisher verschachtelten Wrapper entfernten
|
||
beim zweiten Laden Skalierungswerte, bevor der aktuelle Wrapper sie verwenden
|
||
konnte. Ein Regressionstest deckt zwei Ladevorgänge und den Fehlerpfad ab.
|
||
- Den gesamten Tensorpfad einschließlich direkter Textencoder- und VAE-Aufrufe
|
||
unter `torch.inference_mode()` ausführen.
|
||
- Echte Modell-/Tensorreferenzen und Argument-Dictionaries vor GC und
|
||
`empty_cache()` freigeben. `del value` auf einer Schleifenvariablen hatte die
|
||
eigentlichen lokalen Referenzen nicht entfernt.
|
||
- Generierungen im Worker serialisieren; Health-Endpunkt bleibt erreichbar.
|
||
|
||
## Validierung und Betrieb
|
||
|
||
88 GPU-freie Tests bestanden. Ein echter Router-Auftrag mit `n=2`, 1024×1024,
|
||
vier Schritten und Seed 12345 erzeugte beide Bilder im selben Worker-Prozess;
|
||
beide `/generate`-Aufrufe lieferten HTTP 200. Die Modellgewichte und
|
||
Quantisierung bleiben unverändert. Der Test prüft Wiederholbarkeit des Ablaufs,
|
||
nicht die Gleichheit mit Bildern vor der Reparatur.
|
||
|
||
Nur das Worker-Image wurde aktualisiert, auf Basis der vorhandenen Abhängigkeiten
|
||
(kein Paket-, Treiber- oder Kernelupdate). Das vorherige Image bleibt als
|
||
`mike-ai/image-worker:before-repeat-fix-20260920` für Rollback vorhanden.
|
||
Remote-Testunterlagen: `/data/benchmarks/flux-repeat-fix-20260920/`.
|