Document measured FLUX 9B resolution limit and test cleanup

This commit is contained in:
Mikei386
2026-09-12 19:27:36 +02:00
parent 9c7bfcc1c8
commit 6c00b00add
2 changed files with 74 additions and 0 deletions
+10
View File
@@ -30,6 +30,16 @@ Bild- und Sprachausgabe. **Hermes und die Fach-MCPs laufen auf Unraid.**
Hermes nutzt Athenas Router unter `http://192.168.1.212:8081/v1`. Ein MCPHub Hermes nutzt Athenas Router unter `http://192.168.1.212:8081/v1`. Ein MCPHub
ist nicht mehr Bestandteil der produktiven Architektur. ist nicht mehr Bestandteil der produktiven Architektur.
## Verifizierte Bildauflösung auf dem Live-System
Der am 12. September geprüfte Live-Worker verwendet **FLUX.2 Klein 9B FP8
Beta** und weicht damit vom oben beschriebenen 4B-Stand ab. Im Auflösungstest
war **1024 × 1024 erfolgreich**, während **1280 × 1280 einen CUDA-OOM** auf
der RTX 5080 auslöste. Höhere Auflösungen sind damit nicht freigegeben;
Zwischenwerte wurden nicht getestet. Die produktive 1024-Begrenzung bleibt
bestehen. Messwerte, Testbedingungen und die Korrektur früherer optimistischer
Schätzungen stehen in [Auflösungstest vom 12. September](docs/FLUX_RESOLUTION_TEST_20260912.md).
## Installation – ein Befehl ## Installation – ein Befehl
```bash ```bash
+64
View File
@@ -0,0 +1,64 @@
# FLUX-9B-Auflösungstest auf Athena
Stand: 12. September 2026
## Gemessener Live-Stand
Getestet wurde der auf Athena installierte Bildworker **FLUX.2 Klein 9B FP8
Beta**, nicht der in älteren Teilen dieses Repositorys beschriebene 4B-Worker.
Der Live-Checkout meldete Commit `5d8abd4` mit zahlreichen lokalen Änderungen;
der Test ist daher kein Benchmark des unveränderten Git-Commits.
Der Transformer verwendet die RTX 5080 (16 GB), der NF4-Textencoder die
RTX 3060 (12 GB). Die Pipeline verwendet bereits VAE-Slicing und VAE-Tiling.
## Testbedingungen und Ergebnisse
- Text-zu-Bild, ein Bild je Auflösung, keine Referenzbilder
- vier Inferenzschritte, Guidance 1,0, Seed `9072026`
- gleiches Motiv: gelber Spielzeugbagger links, roter Spielzeug-LKW rechts,
Holztisch, Studiolicht und feine Materialdetails
- quadratische Auflösungen, Steigerung von 1024 auf 1280 Pixel
- normale Router-Orchestrierung einschließlich Stoppen und Wiederherstellen
von Qwen und TTS; temporäre Auflösungsfreigabe nur für den Testworker
| Auflösung | Pixel | Ergebnis | Zeit im Worker | Gesamter Router-Aufruf |
|---|---:|---|---:|---:|
| 1024 × 1024 | 1.048.576 | erfolgreich; PNG-Abmessungen bestätigt | 16,497 s | 38,13 s |
| 1280 × 1280 | 1.638.400 | CUDA-Out-of-Memory auf der RTX 5080 | nicht separat ermittelt | 38,26 s einschließlich Fehlerbehandlung |
Bei 1024 Pixeln betrug die gemessene maximale PyTorch-Speicherbelegung
11.852 MiB auf der RTX 5080 und 6.722 MiB auf der RTX 3060. Diese Werte
bezeichnen belegten PyTorch-Speicher, nicht den gesamten GPU-Verbrauch;
die Peak-Zähler wurden nach dem Laden des Transformers zurückgesetzt.
Beim 1280-Test scheiterte eine zusätzliche Allokation von 128 MiB, während
nur noch 122,94 MiB frei waren. Laut CUDA-Fehler belegte der Prozess insgesamt
15,34 GiB, davon 14,75 GiB durch PyTorch allokiert.
## Schlussfolgerung und Grenzen
**1024 × 1024 ist die höchste in diesem Versuch erfolgreich getestete
Auflösung. 1280 × 1280 funktioniert mit diesem Worker und Testmotiv nicht.**
Zwischenwerte und höhere Auflösungen wurden nicht getestet. Ein erfolgreicher
Einzeltest ist keine Garantie für jedes Motiv oder für Bildbearbeitung.
Frühere Schätzungen wie „1280 ist ein guter Sweet Spot“ oder „1536 sollte mit
FP8 gut machbar sein“ sind für diesen Live-Stack durch die Messung widerlegt.
FP8 reduziert den Speicherbedarf der Gewichte, garantiert aber keinen
entsprechenden Speicherbedarf der Aktivierungen und Zwischenberechnungen.
Eine allgemeine Modellobergrenze von 2048 Pixeln wurde nicht nachgewiesen.
Die bestehende produktive Freigabe von 1024 × 1024 bleibt unverändert.
## Wiederherstellung und Bereinigung
Nach dem OOM stellte der Router Medium und Qwen3-TTS wieder her. Beide Dienste
und der Router waren gesund; `/ready` meldete den Upstream als bereit.
Der Bildworker wurde auf sein ursprüngliches Image und seine ursprünglichen
Mounts zurückgesetzt. Die temporäre Testdatei, der Compose-Override und das
Testbild einschließlich seiner Metadaten wurden entfernt. Es wurde kein
separater Testcontainer und kein Testimage angelegt. Der reguläre,
bedarfsgesteuerte Bildworker bleibt vorhanden. Host, SSH und Netzwerk wurden
nicht verändert oder neu gestartet.