diff --git a/README.md b/README.md index dc90043..d5255a6 100644 --- a/README.md +++ b/README.md @@ -30,6 +30,16 @@ Bild- und Sprachausgabe. **Hermes und die Fach-MCPs laufen auf Unraid.** Hermes nutzt Athenas Router unter `http://192.168.1.212:8081/v1`. Ein MCPHub ist nicht mehr Bestandteil der produktiven Architektur. +## Verifizierte Bildauflösung auf dem Live-System + +Der am 12. September geprüfte Live-Worker verwendet **FLUX.2 Klein 9B FP8 +Beta** und weicht damit vom oben beschriebenen 4B-Stand ab. Im Auflösungstest +war **1024 × 1024 erfolgreich**, während **1280 × 1280 einen CUDA-OOM** auf +der RTX 5080 auslöste. Höhere Auflösungen sind damit nicht freigegeben; +Zwischenwerte wurden nicht getestet. Die produktive 1024-Begrenzung bleibt +bestehen. Messwerte, Testbedingungen und die Korrektur früherer optimistischer +Schätzungen stehen in [Auflösungstest vom 12. September](docs/FLUX_RESOLUTION_TEST_20260912.md). + ## Installation – ein Befehl ```bash diff --git a/docs/FLUX_RESOLUTION_TEST_20260912.md b/docs/FLUX_RESOLUTION_TEST_20260912.md new file mode 100644 index 0000000..80dd5b1 --- /dev/null +++ b/docs/FLUX_RESOLUTION_TEST_20260912.md @@ -0,0 +1,64 @@ +# FLUX-9B-Auflösungstest auf Athena + +Stand: 12. September 2026 + +## Gemessener Live-Stand + +Getestet wurde der auf Athena installierte Bildworker **FLUX.2 Klein 9B FP8 +Beta**, nicht der in älteren Teilen dieses Repositorys beschriebene 4B-Worker. +Der Live-Checkout meldete Commit `5d8abd4` mit zahlreichen lokalen Änderungen; +der Test ist daher kein Benchmark des unveränderten Git-Commits. + +Der Transformer verwendet die RTX 5080 (16 GB), der NF4-Textencoder die +RTX 3060 (12 GB). Die Pipeline verwendet bereits VAE-Slicing und VAE-Tiling. + +## Testbedingungen und Ergebnisse + +- Text-zu-Bild, ein Bild je Auflösung, keine Referenzbilder +- vier Inferenzschritte, Guidance 1,0, Seed `9072026` +- gleiches Motiv: gelber Spielzeugbagger links, roter Spielzeug-LKW rechts, + Holztisch, Studiolicht und feine Materialdetails +- quadratische Auflösungen, Steigerung von 1024 auf 1280 Pixel +- normale Router-Orchestrierung einschließlich Stoppen und Wiederherstellen + von Qwen und TTS; temporäre Auflösungsfreigabe nur für den Testworker + +| Auflösung | Pixel | Ergebnis | Zeit im Worker | Gesamter Router-Aufruf | +|---|---:|---|---:|---:| +| 1024 × 1024 | 1.048.576 | erfolgreich; PNG-Abmessungen bestätigt | 16,497 s | 38,13 s | +| 1280 × 1280 | 1.638.400 | CUDA-Out-of-Memory auf der RTX 5080 | nicht separat ermittelt | 38,26 s einschließlich Fehlerbehandlung | + +Bei 1024 Pixeln betrug die gemessene maximale PyTorch-Speicherbelegung +11.852 MiB auf der RTX 5080 und 6.722 MiB auf der RTX 3060. Diese Werte +bezeichnen belegten PyTorch-Speicher, nicht den gesamten GPU-Verbrauch; +die Peak-Zähler wurden nach dem Laden des Transformers zurückgesetzt. + +Beim 1280-Test scheiterte eine zusätzliche Allokation von 128 MiB, während +nur noch 122,94 MiB frei waren. Laut CUDA-Fehler belegte der Prozess insgesamt +15,34 GiB, davon 14,75 GiB durch PyTorch allokiert. + +## Schlussfolgerung und Grenzen + +**1024 × 1024 ist die höchste in diesem Versuch erfolgreich getestete +Auflösung. 1280 × 1280 funktioniert mit diesem Worker und Testmotiv nicht.** +Zwischenwerte und höhere Auflösungen wurden nicht getestet. Ein erfolgreicher +Einzeltest ist keine Garantie für jedes Motiv oder für Bildbearbeitung. + +Frühere Schätzungen wie „1280 ist ein guter Sweet Spot“ oder „1536 sollte mit +FP8 gut machbar sein“ sind für diesen Live-Stack durch die Messung widerlegt. +FP8 reduziert den Speicherbedarf der Gewichte, garantiert aber keinen +entsprechenden Speicherbedarf der Aktivierungen und Zwischenberechnungen. +Eine allgemeine Modellobergrenze von 2048 Pixeln wurde nicht nachgewiesen. + +Die bestehende produktive Freigabe von 1024 × 1024 bleibt unverändert. + +## Wiederherstellung und Bereinigung + +Nach dem OOM stellte der Router Medium und Qwen3-TTS wieder her. Beide Dienste +und der Router waren gesund; `/ready` meldete den Upstream als bereit. + +Der Bildworker wurde auf sein ursprüngliches Image und seine ursprünglichen +Mounts zurückgesetzt. Die temporäre Testdatei, der Compose-Override und das +Testbild einschließlich seiner Metadaten wurden entfernt. Es wurde kein +separater Testcontainer und kein Testimage angelegt. Der reguläre, +bedarfsgesteuerte Bildworker bleibt vorhanden. Host, SSH und Netzwerk wurden +nicht verändert oder neu gestartet.