65 lines
3.2 KiB
Markdown
65 lines
3.2 KiB
Markdown
# FLUX-9B-Auflösungstest auf Athena
|
||
|
||
Stand: 12. September 2026
|
||
|
||
## Gemessener Live-Stand
|
||
|
||
Getestet wurde der auf Athena installierte Bildworker **FLUX.2 Klein 9B FP8
|
||
Beta**, nicht der in älteren Teilen dieses Repositorys beschriebene 4B-Worker.
|
||
Der Live-Checkout meldete Commit `5d8abd4` mit zahlreichen lokalen Änderungen;
|
||
der Test ist daher kein Benchmark des unveränderten Git-Commits.
|
||
|
||
Der Transformer verwendet die RTX 5080 (16 GB), der NF4-Textencoder die
|
||
RTX 3060 (12 GB). Die Pipeline verwendet bereits VAE-Slicing und VAE-Tiling.
|
||
|
||
## Testbedingungen und Ergebnisse
|
||
|
||
- Text-zu-Bild, ein Bild je Auflösung, keine Referenzbilder
|
||
- vier Inferenzschritte, Guidance 1,0, Seed `9072026`
|
||
- gleiches Motiv: gelber Spielzeugbagger links, roter Spielzeug-LKW rechts,
|
||
Holztisch, Studiolicht und feine Materialdetails
|
||
- quadratische Auflösungen, Steigerung von 1024 auf 1280 Pixel
|
||
- normale Router-Orchestrierung einschließlich Stoppen und Wiederherstellen
|
||
von Qwen und TTS; temporäre Auflösungsfreigabe nur für den Testworker
|
||
|
||
| Auflösung | Pixel | Ergebnis | Zeit im Worker | Gesamter Router-Aufruf |
|
||
|---|---:|---|---:|---:|
|
||
| 1024 × 1024 | 1.048.576 | erfolgreich; PNG-Abmessungen bestätigt | 16,497 s | 38,13 s |
|
||
| 1280 × 1280 | 1.638.400 | CUDA-Out-of-Memory auf der RTX 5080 | nicht separat ermittelt | 38,26 s einschließlich Fehlerbehandlung |
|
||
|
||
Bei 1024 Pixeln betrug die gemessene maximale PyTorch-Speicherbelegung
|
||
11.852 MiB auf der RTX 5080 und 6.722 MiB auf der RTX 3060. Diese Werte
|
||
bezeichnen belegten PyTorch-Speicher, nicht den gesamten GPU-Verbrauch;
|
||
die Peak-Zähler wurden nach dem Laden des Transformers zurückgesetzt.
|
||
|
||
Beim 1280-Test scheiterte eine zusätzliche Allokation von 128 MiB, während
|
||
nur noch 122,94 MiB frei waren. Laut CUDA-Fehler belegte der Prozess insgesamt
|
||
15,34 GiB, davon 14,75 GiB durch PyTorch allokiert.
|
||
|
||
## Schlussfolgerung und Grenzen
|
||
|
||
**1024 × 1024 ist die höchste in diesem Versuch erfolgreich getestete
|
||
Auflösung. 1280 × 1280 funktioniert mit diesem Worker und Testmotiv nicht.**
|
||
Zwischenwerte und höhere Auflösungen wurden nicht getestet. Ein erfolgreicher
|
||
Einzeltest ist keine Garantie für jedes Motiv oder für Bildbearbeitung.
|
||
|
||
Frühere Schätzungen wie „1280 ist ein guter Sweet Spot“ oder „1536 sollte mit
|
||
FP8 gut machbar sein“ sind für diesen Live-Stack durch die Messung widerlegt.
|
||
FP8 reduziert den Speicherbedarf der Gewichte, garantiert aber keinen
|
||
entsprechenden Speicherbedarf der Aktivierungen und Zwischenberechnungen.
|
||
Eine allgemeine Modellobergrenze von 2048 Pixeln wurde nicht nachgewiesen.
|
||
|
||
Die bestehende produktive Freigabe von 1024 × 1024 bleibt unverändert.
|
||
|
||
## Wiederherstellung und Bereinigung
|
||
|
||
Nach dem OOM stellte der Router Medium und Qwen3-TTS wieder her. Beide Dienste
|
||
und der Router waren gesund; `/ready` meldete den Upstream als bereit.
|
||
|
||
Der Bildworker wurde auf sein ursprüngliches Image und seine ursprünglichen
|
||
Mounts zurückgesetzt. Die temporäre Testdatei, der Compose-Override und das
|
||
Testbild einschließlich seiner Metadaten wurden entfernt. Es wurde kein
|
||
separater Testcontainer und kein Testimage angelegt. Der reguläre,
|
||
bedarfsgesteuerte Bildworker bleibt vorhanden. Host, SSH und Netzwerk wurden
|
||
nicht verändert oder neu gestartet.
|