Document measured FLUX 9B resolution limit and test cleanup
This commit is contained in:
@@ -30,6 +30,16 @@ Bild- und Sprachausgabe. **Hermes und die Fach-MCPs laufen auf Unraid.**
|
|||||||
Hermes nutzt Athenas Router unter `http://192.168.1.212:8081/v1`. Ein MCPHub
|
Hermes nutzt Athenas Router unter `http://192.168.1.212:8081/v1`. Ein MCPHub
|
||||||
ist nicht mehr Bestandteil der produktiven Architektur.
|
ist nicht mehr Bestandteil der produktiven Architektur.
|
||||||
|
|
||||||
|
## Verifizierte Bildauflösung auf dem Live-System
|
||||||
|
|
||||||
|
Der am 12. September geprüfte Live-Worker verwendet **FLUX.2 Klein 9B FP8
|
||||||
|
Beta** und weicht damit vom oben beschriebenen 4B-Stand ab. Im Auflösungstest
|
||||||
|
war **1024 × 1024 erfolgreich**, während **1280 × 1280 einen CUDA-OOM** auf
|
||||||
|
der RTX 5080 auslöste. Höhere Auflösungen sind damit nicht freigegeben;
|
||||||
|
Zwischenwerte wurden nicht getestet. Die produktive 1024-Begrenzung bleibt
|
||||||
|
bestehen. Messwerte, Testbedingungen und die Korrektur früherer optimistischer
|
||||||
|
Schätzungen stehen in [Auflösungstest vom 12. September](docs/FLUX_RESOLUTION_TEST_20260912.md).
|
||||||
|
|
||||||
## Installation – ein Befehl
|
## Installation – ein Befehl
|
||||||
|
|
||||||
```bash
|
```bash
|
||||||
|
|||||||
@@ -0,0 +1,64 @@
|
|||||||
|
# FLUX-9B-Auflösungstest auf Athena
|
||||||
|
|
||||||
|
Stand: 12. September 2026
|
||||||
|
|
||||||
|
## Gemessener Live-Stand
|
||||||
|
|
||||||
|
Getestet wurde der auf Athena installierte Bildworker **FLUX.2 Klein 9B FP8
|
||||||
|
Beta**, nicht der in älteren Teilen dieses Repositorys beschriebene 4B-Worker.
|
||||||
|
Der Live-Checkout meldete Commit `5d8abd4` mit zahlreichen lokalen Änderungen;
|
||||||
|
der Test ist daher kein Benchmark des unveränderten Git-Commits.
|
||||||
|
|
||||||
|
Der Transformer verwendet die RTX 5080 (16 GB), der NF4-Textencoder die
|
||||||
|
RTX 3060 (12 GB). Die Pipeline verwendet bereits VAE-Slicing und VAE-Tiling.
|
||||||
|
|
||||||
|
## Testbedingungen und Ergebnisse
|
||||||
|
|
||||||
|
- Text-zu-Bild, ein Bild je Auflösung, keine Referenzbilder
|
||||||
|
- vier Inferenzschritte, Guidance 1,0, Seed `9072026`
|
||||||
|
- gleiches Motiv: gelber Spielzeugbagger links, roter Spielzeug-LKW rechts,
|
||||||
|
Holztisch, Studiolicht und feine Materialdetails
|
||||||
|
- quadratische Auflösungen, Steigerung von 1024 auf 1280 Pixel
|
||||||
|
- normale Router-Orchestrierung einschließlich Stoppen und Wiederherstellen
|
||||||
|
von Qwen und TTS; temporäre Auflösungsfreigabe nur für den Testworker
|
||||||
|
|
||||||
|
| Auflösung | Pixel | Ergebnis | Zeit im Worker | Gesamter Router-Aufruf |
|
||||||
|
|---|---:|---|---:|---:|
|
||||||
|
| 1024 × 1024 | 1.048.576 | erfolgreich; PNG-Abmessungen bestätigt | 16,497 s | 38,13 s |
|
||||||
|
| 1280 × 1280 | 1.638.400 | CUDA-Out-of-Memory auf der RTX 5080 | nicht separat ermittelt | 38,26 s einschließlich Fehlerbehandlung |
|
||||||
|
|
||||||
|
Bei 1024 Pixeln betrug die gemessene maximale PyTorch-Speicherbelegung
|
||||||
|
11.852 MiB auf der RTX 5080 und 6.722 MiB auf der RTX 3060. Diese Werte
|
||||||
|
bezeichnen belegten PyTorch-Speicher, nicht den gesamten GPU-Verbrauch;
|
||||||
|
die Peak-Zähler wurden nach dem Laden des Transformers zurückgesetzt.
|
||||||
|
|
||||||
|
Beim 1280-Test scheiterte eine zusätzliche Allokation von 128 MiB, während
|
||||||
|
nur noch 122,94 MiB frei waren. Laut CUDA-Fehler belegte der Prozess insgesamt
|
||||||
|
15,34 GiB, davon 14,75 GiB durch PyTorch allokiert.
|
||||||
|
|
||||||
|
## Schlussfolgerung und Grenzen
|
||||||
|
|
||||||
|
**1024 × 1024 ist die höchste in diesem Versuch erfolgreich getestete
|
||||||
|
Auflösung. 1280 × 1280 funktioniert mit diesem Worker und Testmotiv nicht.**
|
||||||
|
Zwischenwerte und höhere Auflösungen wurden nicht getestet. Ein erfolgreicher
|
||||||
|
Einzeltest ist keine Garantie für jedes Motiv oder für Bildbearbeitung.
|
||||||
|
|
||||||
|
Frühere Schätzungen wie „1280 ist ein guter Sweet Spot“ oder „1536 sollte mit
|
||||||
|
FP8 gut machbar sein“ sind für diesen Live-Stack durch die Messung widerlegt.
|
||||||
|
FP8 reduziert den Speicherbedarf der Gewichte, garantiert aber keinen
|
||||||
|
entsprechenden Speicherbedarf der Aktivierungen und Zwischenberechnungen.
|
||||||
|
Eine allgemeine Modellobergrenze von 2048 Pixeln wurde nicht nachgewiesen.
|
||||||
|
|
||||||
|
Die bestehende produktive Freigabe von 1024 × 1024 bleibt unverändert.
|
||||||
|
|
||||||
|
## Wiederherstellung und Bereinigung
|
||||||
|
|
||||||
|
Nach dem OOM stellte der Router Medium und Qwen3-TTS wieder her. Beide Dienste
|
||||||
|
und der Router waren gesund; `/ready` meldete den Upstream als bereit.
|
||||||
|
|
||||||
|
Der Bildworker wurde auf sein ursprüngliches Image und seine ursprünglichen
|
||||||
|
Mounts zurückgesetzt. Die temporäre Testdatei, der Compose-Override und das
|
||||||
|
Testbild einschließlich seiner Metadaten wurden entfernt. Es wurde kein
|
||||||
|
separater Testcontainer und kein Testimage angelegt. Der reguläre,
|
||||||
|
bedarfsgesteuerte Bildworker bleibt vorhanden. Host, SSH und Netzwerk wurden
|
||||||
|
nicht verändert oder neu gestartet.
|
||||||
Reference in New Issue
Block a user