1.7 KiB
FLUX-Wiederholungsfehler am 20.09.2026
Beim OpenClaw-Bildauftrag erzeugte der Worker ein Bild erfolgreich und scheiterte beim folgenden Bild mit CUDA OOM (angeforderte 4,23 GiB bei 3,73 GiB frei). Der Router hatte Qwen und TTS korrekt gestoppt. Kein Benchmarkcontainer war aktiv. Die experimentelle Qwen-Mindestreserve war nicht die Ursache.
Korrektur
- Den globalen FP8-Checkpoint-Konverter nur während des Ladens ersetzen und auch bei Fehlern wiederherstellen. Die bisher verschachtelten Wrapper entfernten beim zweiten Laden Skalierungswerte, bevor der aktuelle Wrapper sie verwenden konnte. Ein Regressionstest deckt zwei Ladevorgänge und den Fehlerpfad ab.
- Den gesamten Tensorpfad einschließlich direkter Textencoder- und VAE-Aufrufe
unter
torch.inference_mode()ausführen. - Echte Modell-/Tensorreferenzen und Argument-Dictionaries vor GC und
empty_cache()freigeben.del valueauf einer Schleifenvariablen hatte die eigentlichen lokalen Referenzen nicht entfernt. - Generierungen im Worker serialisieren; Health-Endpunkt bleibt erreichbar.
Validierung und Betrieb
88 GPU-freie Tests bestanden. Ein echter Router-Auftrag mit n=2, 1024×1024,
vier Schritten und Seed 12345 erzeugte beide Bilder im selben Worker-Prozess;
beide /generate-Aufrufe lieferten HTTP 200. Die Modellgewichte und
Quantisierung bleiben unverändert. Der Test prüft Wiederholbarkeit des Ablaufs,
nicht die Gleichheit mit Bildern vor der Reparatur.
Nur das Worker-Image wurde aktualisiert, auf Basis der vorhandenen Abhängigkeiten
(kein Paket-, Treiber- oder Kernelupdate). Das vorherige Image bleibt als
mike-ai/image-worker:before-repeat-fix-20260920 für Rollback vorhanden.
Remote-Testunterlagen: /data/benchmarks/flux-repeat-fix-20260920/.