docs: reconcile Athena overview with verified live deployment
This commit is contained in:
1 parent
2415b27160
commit
9fe51390f6
8 files changed
+223
-134
No files matched your search
@@ -1,65 +1,20 @@
|
||||
# Aktueller produktiver Laufzustand
|
||||
# Aktuelle Laufzeitnotizen
|
||||
|
||||
Stand: 3. September 2026
|
||||
Stand: 12. September 2026.
|
||||
|
||||
## Lokale Spracherkennung
|
||||
Der verbindliche Abgleich steht im [geprüften Live-Stand](LIVE_STATE.md).
|
||||
Produktiv läuft **llama.cpp b10930**, zuvor b10872. Die frühere Angabe b10781
|
||||
war veraltet. Alle fünf installierten Profile wurden aktualisiert; die
|
||||
Startoption wurde auf `--load-mode none` migriert.
|
||||
|
||||
Athena betreibt Whisper.cpp v1.9.1 mit `large-v3-turbo` als CPU-Dienst. Der
|
||||
Profile Router veröffentlicht ihn als OpenAI-kompatiblen Endpunkt
|
||||
`/v1/audio/transcriptions`; Standardsprache ist Deutsch. Modell und Download
|
||||
bleiben im persistenten Docker-Volume `whisper-data` erhalten.
|
||||
[B10930-Updatebericht](LLAMA_B10930_UPDATE_20260912.md): Version, Image-ID,
|
||||
Funktionsproben, Vergleichsmessungen und gesicherter Rückfallstand.
|
||||
|
||||
Ein lokaler Rundlauftest (Athena-TTS → WAV → Athena-STT) wurde erfolgreich
|
||||
durchgeführt. OpenClaw ist ebenfalls auf diesen lokalen Endpunkt eingestellt
|
||||
und wurde mit `openclaw infer audio transcribe` erfolgreich geprüft. Für den
|
||||
lokalen Provider ist der Zugriff auf Athenas private IP ausdrücklich erlaubt;
|
||||
andere private Ziele werden dadurch nicht freigeschaltet.
|
||||
FLUX verwendet **9B FP8 Beta** mit Textencoder auf der RTX 3060.
|
||||
[Auflösungstest](FLUX_RESOLUTION_TEST_20260912.md): 1024 erfolgreich,
|
||||
1280 CUDA-OOM; produktive Begrenzung weiterhin 1024.
|
||||
Sprachausgabe: Qwen3-TTS 1.7B ohne Piper. Spracherkennung: Whisper.cpp small auf CPU.
|
||||
|
||||
## Produktive llama.cpp-Runtime
|
||||
|
||||
Aktualisiert am 12. September 2026: Alle fünf Textprofilcontainer verwenden
|
||||
llama.cpp **Build 10930**, Commit
|
||||
`56381e407c0ccfb3a6f71e668a27a901001d22ce`.
|
||||
|
||||
Der tatsächliche vorherige Live-Build war 10872
|
||||
(`b31b71f3a076bfc4278daad442203a9c51c6e676`), nicht der hier zuvor
|
||||
angegebene Build 10781. Er bleibt unter
|
||||
`mike-ai/llama.cpp:b10872-pre-b10930` als Rückfallimage erhalten.
|
||||
|
||||
Das Update enthält den Fix für die Drafter-Position nach Bildeingaben
|
||||
[#28715](https://github.com/ggml-org/llama.cpp/pull/28715). Modellgewichte,
|
||||
Profilkontexte, GPU-Aufteilung, Vision, Slots und MTP-Parameter bleiben
|
||||
unverändert. Details und Testgrenzen stehen im
|
||||
[Updateprotokoll](LLAMA_B10930_UPDATE_20260912.md).
|
||||
|
||||
## Qwen Medium: Vision-Projektor wieder aktiviert
|
||||
|
||||
`qwen-medium` läuft wieder mit dem Qwen-Vision-Projektor. Der Projektor wird
|
||||
über `--mmproj-offload --mmproj-device CUDA1` gezielt auf der RTX 3060 geladen.
|
||||
Der vorübergehende Text-only-Workaround ist damit auf ausdrücklichen Wunsch
|
||||
beendet.
|
||||
|
||||
Dabei gilt ausdrücklich:
|
||||
|
||||
- Der Gesamtkontext bleibt bei **160.000 Tokens**.
|
||||
- Das Profil verwendet wieder **einen Slot**. Die getestete Zwei-Slot-Variante
|
||||
ist nicht produktiv.
|
||||
- **MTP / Speculative Decoding bleibt aktiviert**; MTP wurde nicht entfernt.
|
||||
- Modell, Quantisierung, GPU-Aufteilung und KV-Cache-Quantisierung bleiben
|
||||
unverändert.
|
||||
- Bildanalyse ist im Medium-Profil wieder verfügbar.
|
||||
- Der bekannte llama.cpp-/MMProj-Cachefehler kann weiterhin vollständige
|
||||
Prompt-Neuverarbeitung in späteren Turns auslösen. Diese Einschränkung wird
|
||||
zugunsten der benötigten Vision-Funktion bewusst akzeptiert.
|
||||
|
||||
Referenz:
|
||||
|
||||
- https://github.com/ggml-org/llama.cpp/issues/19858
|
||||
- https://github.com/ggml-org/llama.cpp/issues/21133
|
||||
|
||||
## Separates bekanntes Problem
|
||||
|
||||
Automatische Hermes-Hintergrundanfragen können weiterhin den einzigen aktiven
|
||||
llama.cpp-Slot belegen und damit den Cache eines großen Chats verdrängen. Dieses
|
||||
Slot-Eviction-Problem ist unabhängig vom MMProj-Workaround und muss separat in
|
||||
der Hermes-Auxiliary-/Hintergrundverarbeitung geklärt werden.
|
||||
Datierte ältere Testberichte beschreiben ihre damaligen Versuchsbedingungen,
|
||||
keine automatische Freigabe für den heutigen Betrieb. Die Repository-Matrix
|
||||
enthält zusätzlich beta1; auf Athena sind nur fünf Textprofile installiert.
|
||||
Reference in new issue
Block a user