Files
AI-Profile-Router/docs/FLUX_REPEAT_FIX_20260920.md

1.7 KiB
Raw Permalink Blame History

FLUX-Wiederholungsfehler am 20.09.2026

Beim OpenClaw-Bildauftrag erzeugte der Worker ein Bild erfolgreich und scheiterte beim folgenden Bild mit CUDA OOM (angeforderte 4,23 GiB bei 3,73 GiB frei). Der Router hatte Qwen und TTS korrekt gestoppt. Kein Benchmarkcontainer war aktiv. Die experimentelle Qwen-Mindestreserve war nicht die Ursache.

Korrektur

  • Den globalen FP8-Checkpoint-Konverter nur während des Ladens ersetzen und auch bei Fehlern wiederherstellen. Die bisher verschachtelten Wrapper entfernten beim zweiten Laden Skalierungswerte, bevor der aktuelle Wrapper sie verwenden konnte. Ein Regressionstest deckt zwei Ladevorgänge und den Fehlerpfad ab.
  • Den gesamten Tensorpfad einschließlich direkter Textencoder- und VAE-Aufrufe unter torch.inference_mode() ausführen.
  • Echte Modell-/Tensorreferenzen und Argument-Dictionaries vor GC und empty_cache() freigeben. del value auf einer Schleifenvariablen hatte die eigentlichen lokalen Referenzen nicht entfernt.
  • Generierungen im Worker serialisieren; Health-Endpunkt bleibt erreichbar.

Validierung und Betrieb

88 GPU-freie Tests bestanden. Ein echter Router-Auftrag mit n=2, 1024×1024, vier Schritten und Seed 12345 erzeugte beide Bilder im selben Worker-Prozess; beide /generate-Aufrufe lieferten HTTP 200. Die Modellgewichte und Quantisierung bleiben unverändert. Der Test prüft Wiederholbarkeit des Ablaufs, nicht die Gleichheit mit Bildern vor der Reparatur.

Nur das Worker-Image wurde aktualisiert, auf Basis der vorhandenen Abhängigkeiten (kein Paket-, Treiber- oder Kernelupdate). Das vorherige Image bleibt als mike-ai/image-worker:before-repeat-fix-20260920 für Rollback vorhanden. Remote-Testunterlagen: /data/benchmarks/flux-repeat-fix-20260920/.