Files
AI-Profile-Router/docs/FLUX_RESOLUTION_TEST_20260912.md

65 lines
3.2 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# FLUX-9B-Auflösungstest auf Athena
Stand: 12. September 2026
## Gemessener Live-Stand
Getestet wurde der auf Athena installierte Bildworker **FLUX.2 Klein 9B FP8
Beta**, nicht der in älteren Teilen dieses Repositorys beschriebene 4B-Worker.
Der Live-Checkout meldete Commit `5d8abd4` mit zahlreichen lokalen Änderungen;
der Test ist daher kein Benchmark des unveränderten Git-Commits.
Der Transformer verwendet die RTX 5080 (16 GB), der NF4-Textencoder die
RTX 3060 (12 GB). Die Pipeline verwendet bereits VAE-Slicing und VAE-Tiling.
## Testbedingungen und Ergebnisse
- Text-zu-Bild, ein Bild je Auflösung, keine Referenzbilder
- vier Inferenzschritte, Guidance 1,0, Seed `9072026`
- gleiches Motiv: gelber Spielzeugbagger links, roter Spielzeug-LKW rechts,
Holztisch, Studiolicht und feine Materialdetails
- quadratische Auflösungen, Steigerung von 1024 auf 1280 Pixel
- normale Router-Orchestrierung einschließlich Stoppen und Wiederherstellen
von Qwen und TTS; temporäre Auflösungsfreigabe nur für den Testworker
| Auflösung | Pixel | Ergebnis | Zeit im Worker | Gesamter Router-Aufruf |
|---|---:|---|---:|---:|
| 1024 × 1024 | 1.048.576 | erfolgreich; PNG-Abmessungen bestätigt | 16,497 s | 38,13 s |
| 1280 × 1280 | 1.638.400 | CUDA-Out-of-Memory auf der RTX 5080 | nicht separat ermittelt | 38,26 s einschließlich Fehlerbehandlung |
Bei 1024 Pixeln betrug die gemessene maximale PyTorch-Speicherbelegung
11.852 MiB auf der RTX 5080 und 6.722 MiB auf der RTX 3060. Diese Werte
bezeichnen belegten PyTorch-Speicher, nicht den gesamten GPU-Verbrauch;
die Peak-Zähler wurden nach dem Laden des Transformers zurückgesetzt.
Beim 1280-Test scheiterte eine zusätzliche Allokation von 128 MiB, während
nur noch 122,94 MiB frei waren. Laut CUDA-Fehler belegte der Prozess insgesamt
15,34 GiB, davon 14,75 GiB durch PyTorch allokiert.
## Schlussfolgerung und Grenzen
**1024 × 1024 ist die höchste in diesem Versuch erfolgreich getestete
Auflösung. 1280 × 1280 funktioniert mit diesem Worker und Testmotiv nicht.**
Zwischenwerte und höhere Auflösungen wurden nicht getestet. Ein erfolgreicher
Einzeltest ist keine Garantie für jedes Motiv oder für Bildbearbeitung.
Frühere Schätzungen wie „1280 ist ein guter Sweet Spot“ oder „1536 sollte mit
FP8 gut machbar sein“ sind für diesen Live-Stack durch die Messung widerlegt.
FP8 reduziert den Speicherbedarf der Gewichte, garantiert aber keinen
entsprechenden Speicherbedarf der Aktivierungen und Zwischenberechnungen.
Eine allgemeine Modellobergrenze von 2048 Pixeln wurde nicht nachgewiesen.
Die bestehende produktive Freigabe von 1024 × 1024 bleibt unverändert.
## Wiederherstellung und Bereinigung
Nach dem OOM stellte der Router Medium und Qwen3-TTS wieder her. Beide Dienste
und der Router waren gesund; `/ready` meldete den Upstream als bereit.
Der Bildworker wurde auf sein ursprüngliches Image und seine ursprünglichen
Mounts zurückgesetzt. Die temporäre Testdatei, der Compose-Override und das
Testbild einschließlich seiner Metadaten wurden entfernt. Es wurde kein
separater Testcontainer und kein Testimage angelegt. Der reguläre,
bedarfsgesteuerte Bildworker bleibt vorhanden. Host, SSH und Netzwerk wurden
nicht verändert oder neu gestartet.