Files
AI-Profile-Router/docs/LIVE_STATE.md
T

3.4 KiB
Raw Blame History

Geprüfter Live-Stand auf Athena

Stand: 12. September 2026. Quelle: SSH-Abgleich von Containerbestand, Startkonfiguration und den dokumentierten Laufzeittests auf Athena.

Laufzeit und Profile

Debian 13, RTX 5080 mit 16 GB und RTX 3060 mit 12 GB. Alle fünf Textprofilcontainer verwenden llama.cpp b10930, Commit 56381e407c0ccfb3a6f71e668a27a901001d22ce, Image mike-ai/llama.cpp:local beziehungsweise mike-ai/llama.cpp:b10930. Image-ID: sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e. Die Startoption lautet --load-mode none; --no-mmap ist entfernt.

Profil Qwen3.8-27B-Variante Kontext GPU-Konfiguration 5080:3060 Vision MTP Draft
Fast IQ4-MIX 76.800 Textmodell nur 5080 ja 2
Medium IQ4_XS Pure 160.000 85:15 ja 3
Large IQ4_XS Pure 192.000 86:14 ja 3
Ultra IQ4_XS Pure 262.144 80:20 nein 2
Uncensored Abliterated Q4_K_M 80.000 90:10 ja 2

Alle Profile nutzen einen Slot. Die GPU-Verhältnisse sind konfigurierte Tensor-Splits, keine gemessenen VRAM-Prozentsätze; KV-Cache, Projektor und weitere Dienste benötigen zusätzlich Speicher. Uncensored nutzt beide Karten, der Vision-Projektor liegt auf der 3060.

Im LLM-Modus läuft genau ein Textprofil. Zum Abschluss des Buildtests war Uncensored aktiv; beim späteren Dokumentationsabgleich war Medium aktiv. Das aktive Profil ist ein veränderlicher Betriebszustand. beta1 steht zusätzlich in der Repository-Matrix, ist auf Athena aber nicht installiert und wurde beim Update nicht getestet.

Bild und Sprache

  • FLUX.2 Klein 9B FP8 Beta, Transformer und VAE auf 5080, Qwen3-8B-Textencoder in NF4 auf 3060.
  • Bildaufträge pausieren LLM und Qwen3-TTS und stellen sie danach wieder her. Produktiv maximal 1024 × 1024, vier Schritte, Guidance 1, höchstens vier Referenzbilder und 128 Textencoder-Tokens.
  • 1024 × 1024 erfolgreich; 1280 × 1280 CUDA-OOM. Zwischenwerte und höhere Größen nicht geprüft. Keine Freigabe oberhalb 1024.
  • Qwen3-TTS 1.7B auf 3060 hinter TTS-Gateway. Kein Piper-Container/Fallback.
  • Whisper.cpp small (/models/ggml-small.bin) auf CPU, persistentes Whisper-Volume.

Git und bereitgestellte Dateien

Der Live-Checkout /opt/mike-ai/stack zeigt beim Abgleich Git-HEAD 5d8abd4. Seine Arbeitsdateien enthalten jedoch neuere Änderungen und zusätzliche Spezialdienste. Der HEAD ist daher kein Nachweis der laufenden Buildversion. Das b10930-Update wurde in Gitea mit Commit 2415b27 dokumentiert und gepinnt. Dieses Dokumentationsupdate gleicht die zentralen Markdown-Dateien zwischen Git und Athena ab; es setzt den Live-Checkout nicht zurück und übernimmt nicht pauschal seine übrigen uncommitteten Änderungen. Ein frischer Clone ist deshalb noch kein vollständiges Abbild aller Live-Dienste.

Prüfumfang und Belege

Alle fünf Textprofile bestanden kurze Textproben. Für Uncensored und Medium wurden zusätzlich Tools und Vision geprüft; Uncensored bestand einen 72.802-Token-Kontexttest. Kein Vollkontext- oder Langzeittest aller Profile. Die übrigen Spezialcontainer wurden bei diesem Abgleich nur inventarisiert.