3.7 KiB
llama.cpp b10930 auf Athena
Stand: 12. September 2026
Produktiver Stand
- Build: 10930
- Upstream-Commit:
56381e407c0ccfb3a6f71e668a27a901001d22ce - Image:
mike-ai/llama.cpp:local, zusätzlichmike-ai/llama.cpp:b10930 - Image-ID:
sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e - CUDA im Container: 12.8.1; Zielarchitekturen: 86 und 120
- Build aus dem vorhandenen Dockerfile mit zwei parallelen Compiler-Prozessen
Alle fünf auf Athena vorhandenen Textprofilcontainer wurden aktualisiert:
Fast, Medium, Large, Ultra und Uncensored. Modellgewichte, GPU-Verteilung,
Kontextfenster, Slots, Vision- und MTP-Einstellungen wurden beibehalten.
Der zusätzliche Git-Matrixeintrag beta1 ist auf Athena nicht installiert
und wurde daher nicht als Laufzeittest gewertet.
Der tatsächliche vorherige Live-Build war 10872, Commit
b31b71f3a076bfc4278daad442203a9c51c6e676. Die bisherige Dokumentation
mit Build 10781 war veraltet.
Enthaltener Fix und notwendige CLI-Migration
Upstream-PR #28715, integriert am 11. September, korrigiert die an den Drafter übergebene Position nach Bildeingaben. Der Fix betrifft spekulative Decodierung einschließlich MTP. Er ist kein Nachweis dafür, dass sämtliche MMProj-/Prompt-Cache-Probleme oder Hermes-Slot-Verdrängungen behoben sind.
Der neue Build entfernt die bisherige Option --no-mmap. Ihre gleichwertige
Ersatzform ist --load-mode none. Compose und die Referenzprofil-Dateien sind
entsprechend angepasst. Beim ersten Start wurde die alte Option abgewiesen;
der automatische Rückfall auf b10872 funktionierte. Nach der Migration lädt
b10930 Modell, MTP-Kontext und Vision-Projektor erfolgreich.
Verifikation
- Alle fünf Profile über den normalen Router nacheinander aktiviert und mit einer kurzen Rechenaufgabe geprüft: jeweils korrekte Antwort.
- Uncensored vor und nach dem Update: Rechnen, strukturierter Tool-Aufruf, synthetisches Bild mit rotem Quadrat links und blauem Kreis rechts sowie eine Folgefrage nach dem Bild bestanden; MTP-Zähler bestätigen Drafting.
- Medium nach dem Update: dieselben kurzen Text-, Tool- und Vision-Tests.
- Uncensored-Langkontext: 72.802 Eingabetokens; Kennung vom Anfang nach langem synthetischem Fülltext korrekt wiedergegeben, vor und nach dem Update.
| Messung auf Uncensored | b10872 | b10930 |
|---|---|---|
| 300 Ausgabetokens, synthetische Zahlenfolge | 65,92 Token/s | 66,79 Token/s |
| Verarbeitung des langen Prompts | 978,29 Token/s | 976,05 Token/s |
| Gesamtdauer Langkontextanfrage | 74,104 s | 74,248 s |
Dies sind einzelne Funktions- und Vergleichsläufe, kein statistisch abgesicherter Leistungsbenchmark. Die Vorher-Messung lief während des CPU-Builds; Cachezustand und Hintergrundlast können Messwerte beeinflussen. Die Zahlen zeigen hier praktisch gleiches Verhalten, keinen belegten allgemeinen Geschwindigkeitsgewinn. Vollständig gefüllte 160K-, 192K- und 262K-Kontexte sowie Langzeitstabilität wurden nicht geprüft.
Rückfall und Betriebszustand
Das unveränderte vorherige Image bleibt erhalten als
mike-ai/llama.cpp:b10872-pre-b10930.
Originaldateien, Buildlog, Testskripte und Messergebnisse liegen auf Athena in
/data/deploy-backups/20260912-llama-b10930/.
Ein Rückfall benötigt sowohl das alte Image als auch seine bisherige
Startoption --no-mmap; nur das Image umzuschalten reicht nicht. Die gesicherte
Compose-Datei dient als Referenz. Spätere Änderungen dürfen beim Rückfall
nicht durch blindes Überschreiben verloren gehen.
Nach der Prüfung ist wieder genau das zuvor aktive Profil Uncensored aktiv. Die übrigen Profile bleiben bedarfsgesteuert gestoppt. Host, Treiber, SSH, LAN, Firewall und WireGuard wurden nicht verändert oder neu gestartet.