Files
AI-Profile-Router/docs/FLUX_RESOLUTION_TEST_20260912.md

3.2 KiB
Raw Permalink Blame History

FLUX-9B-Auflösungstest auf Athena

Stand: 12. September 2026

Gemessener Live-Stand

Getestet wurde der auf Athena installierte Bildworker FLUX.2 Klein 9B FP8 Beta, nicht der in älteren Teilen dieses Repositorys beschriebene 4B-Worker. Der Live-Checkout meldete Commit 5d8abd4 mit zahlreichen lokalen Änderungen; der Test ist daher kein Benchmark des unveränderten Git-Commits.

Der Transformer verwendet die RTX 5080 (16 GB), der NF4-Textencoder die RTX 3060 (12 GB). Die Pipeline verwendet bereits VAE-Slicing und VAE-Tiling.

Testbedingungen und Ergebnisse

  • Text-zu-Bild, ein Bild je Auflösung, keine Referenzbilder
  • vier Inferenzschritte, Guidance 1,0, Seed 9072026
  • gleiches Motiv: gelber Spielzeugbagger links, roter Spielzeug-LKW rechts, Holztisch, Studiolicht und feine Materialdetails
  • quadratische Auflösungen, Steigerung von 1024 auf 1280 Pixel
  • normale Router-Orchestrierung einschließlich Stoppen und Wiederherstellen von Qwen und TTS; temporäre Auflösungsfreigabe nur für den Testworker
Auflösung Pixel Ergebnis Zeit im Worker Gesamter Router-Aufruf
1024 × 1024 1.048.576 erfolgreich; PNG-Abmessungen bestätigt 16,497 s 38,13 s
1280 × 1280 1.638.400 CUDA-Out-of-Memory auf der RTX 5080 nicht separat ermittelt 38,26 s einschließlich Fehlerbehandlung

Bei 1024 Pixeln betrug die gemessene maximale PyTorch-Speicherbelegung 11.852 MiB auf der RTX 5080 und 6.722 MiB auf der RTX 3060. Diese Werte bezeichnen belegten PyTorch-Speicher, nicht den gesamten GPU-Verbrauch; die Peak-Zähler wurden nach dem Laden des Transformers zurückgesetzt.

Beim 1280-Test scheiterte eine zusätzliche Allokation von 128 MiB, während nur noch 122,94 MiB frei waren. Laut CUDA-Fehler belegte der Prozess insgesamt 15,34 GiB, davon 14,75 GiB durch PyTorch allokiert.

Schlussfolgerung und Grenzen

1024 × 1024 ist die höchste in diesem Versuch erfolgreich getestete Auflösung. 1280 × 1280 funktioniert mit diesem Worker und Testmotiv nicht. Zwischenwerte und höhere Auflösungen wurden nicht getestet. Ein erfolgreicher Einzeltest ist keine Garantie für jedes Motiv oder für Bildbearbeitung.

Frühere Schätzungen wie „1280 ist ein guter Sweet Spot“ oder „1536 sollte mit FP8 gut machbar sein“ sind für diesen Live-Stack durch die Messung widerlegt. FP8 reduziert den Speicherbedarf der Gewichte, garantiert aber keinen entsprechenden Speicherbedarf der Aktivierungen und Zwischenberechnungen. Eine allgemeine Modellobergrenze von 2048 Pixeln wurde nicht nachgewiesen.

Die bestehende produktive Freigabe von 1024 × 1024 bleibt unverändert.

Wiederherstellung und Bereinigung

Nach dem OOM stellte der Router Medium und Qwen3-TTS wieder her. Beide Dienste und der Router waren gesund; /ready meldete den Upstream als bereit.

Der Bildworker wurde auf sein ursprüngliches Image und seine ursprünglichen Mounts zurückgesetzt. Die temporäre Testdatei, der Compose-Override und das Testbild einschließlich seiner Metadaten wurden entfernt. Es wurde kein separater Testcontainer und kein Testimage angelegt. Der reguläre, bedarfsgesteuerte Bildworker bleibt vorhanden. Host, SSH und Netzwerk wurden nicht verändert oder neu gestartet.