# llama.cpp b10930 auf Athena Stand: 12. September 2026 ## Produktiver Stand - Build: **10930** - Upstream-Commit: `56381e407c0ccfb3a6f71e668a27a901001d22ce` - Image: `mike-ai/llama.cpp:local`, zusätzlich `mike-ai/llama.cpp:b10930` - Image-ID: `sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e` - CUDA im Container: 12.8.1; Zielarchitekturen: 86 und 120 - Build aus dem vorhandenen Dockerfile mit zwei parallelen Compiler-Prozessen Alle fünf auf Athena vorhandenen Textprofilcontainer wurden aktualisiert: Fast, Medium, Large, Ultra und Uncensored. Modellgewichte, GPU-Verteilung, Kontextfenster, Slots, Vision- und MTP-Einstellungen wurden beibehalten. Der zusätzliche Git-Matrixeintrag `beta1` ist auf Athena nicht installiert und wurde daher nicht als Laufzeittest gewertet. Der tatsächliche vorherige Live-Build war **10872**, Commit `b31b71f3a076bfc4278daad442203a9c51c6e676`. Die bisherige Dokumentation mit Build 10781 war veraltet. ## Enthaltener Fix und notwendige CLI-Migration [Upstream-PR #28715](https://github.com/ggml-org/llama.cpp/pull/28715), integriert am 11. September, korrigiert die an den Drafter übergebene Position nach Bildeingaben. Der Fix betrifft spekulative Decodierung einschließlich MTP. Er ist kein Nachweis dafür, dass sämtliche MMProj-/Prompt-Cache-Probleme oder Hermes-Slot-Verdrängungen behoben sind. Der neue Build entfernt die bisherige Option `--no-mmap`. Ihre gleichwertige Ersatzform ist `--load-mode none`. Compose und die Referenzprofil-Dateien sind entsprechend angepasst. Beim ersten Start wurde die alte Option abgewiesen; der automatische Rückfall auf b10872 funktionierte. Nach der Migration lädt b10930 Modell, MTP-Kontext und Vision-Projektor erfolgreich. ## Verifikation - Alle fünf Profile über den normalen Router nacheinander aktiviert und mit einer kurzen Rechenaufgabe geprüft: jeweils korrekte Antwort. - Uncensored vor und nach dem Update: Rechnen, strukturierter Tool-Aufruf, synthetisches Bild mit rotem Quadrat links und blauem Kreis rechts sowie eine Folgefrage nach dem Bild bestanden; MTP-Zähler bestätigen Drafting. - Medium nach dem Update: dieselben kurzen Text-, Tool- und Vision-Tests. - Uncensored-Langkontext: **72.802 Eingabetokens**; Kennung vom Anfang nach langem synthetischem Fülltext korrekt wiedergegeben, vor und nach dem Update. | Messung auf Uncensored | b10872 | b10930 | |---|---:|---:| | 300 Ausgabetokens, synthetische Zahlenfolge | 65,92 Token/s | 66,79 Token/s | | Verarbeitung des langen Prompts | 978,29 Token/s | 976,05 Token/s | | Gesamtdauer Langkontextanfrage | 74,104 s | 74,248 s | Dies sind einzelne Funktions- und Vergleichsläufe, kein statistisch abgesicherter Leistungsbenchmark. Die Vorher-Messung lief während des CPU-Builds; Cachezustand und Hintergrundlast können Messwerte beeinflussen. Die Zahlen zeigen hier praktisch gleiches Verhalten, keinen belegten allgemeinen Geschwindigkeitsgewinn. Vollständig gefüllte 160K-, 192K- und 262K-Kontexte sowie Langzeitstabilität wurden nicht geprüft. ## Rückfall und Betriebszustand Das unveränderte vorherige Image bleibt erhalten als `mike-ai/llama.cpp:b10872-pre-b10930`. Originaldateien, Buildlog, Testskripte und Messergebnisse liegen auf Athena in `/data/deploy-backups/20260912-llama-b10930/`. Ein Rückfall benötigt sowohl das alte Image als auch seine bisherige Startoption `--no-mmap`; nur das Image umzuschalten reicht nicht. Die gesicherte Compose-Datei dient als Referenz. Spätere Änderungen dürfen beim Rückfall nicht durch blindes Überschreiben verloren gehen. Nach der Prüfung ist wieder genau das zuvor aktive Profil **Uncensored** aktiv. Die übrigen Profile bleiben bedarfsgesteuert gestoppt. Host, Treiber, SSH, LAN, Firewall und WireGuard wurden nicht verändert oder neu gestartet.