Files
AI-Profile-Router/docs/LLAMA_B10930_UPDATE_20260912.md
T

3.9 KiB

llama.cpp b10930 auf Athena

Stand: 12. September 2026

Produktiver Stand

  • Build: 10930
  • Upstream-Commit: 56381e407c0ccfb3a6f71e668a27a901001d22ce
  • Image: mike-ai/llama.cpp:local, zusätzlich mike-ai/llama.cpp:b10930
  • Image-ID: sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e
  • CUDA im Container: 12.8.1; Zielarchitekturen: 86 und 120
  • Build aus dem vorhandenen Dockerfile mit zwei parallelen Compiler-Prozessen

Alle fünf auf Athena vorhandenen Textprofilcontainer wurden aktualisiert: Fast, Medium, Large, Ultra und Uncensored. Modellgewichte, GPU-Verteilung, Kontextfenster, Slots, Vision- und MTP-Einstellungen wurden beibehalten. Der zusätzliche Git-Matrixeintrag beta1 ist auf Athena nicht installiert und wurde daher nicht als Laufzeittest gewertet.

Der tatsächliche vorherige Live-Build war 10872, Commit b31b71f3a076bfc4278daad442203a9c51c6e676. Die bisherige Dokumentation mit Build 10781 war veraltet.

Enthaltener Fix und notwendige CLI-Migration

Upstream-PR #28715, integriert am 11. September, korrigiert die an den Drafter übergebene Position nach Bildeingaben. Der Fix betrifft spekulative Decodierung einschließlich MTP. Er ist kein Nachweis dafür, dass sämtliche MMProj-/Prompt-Cache-Probleme oder Hermes-Slot-Verdrängungen behoben sind.

Der neue Build entfernt die bisherige Option --no-mmap. Ihre gleichwertige Ersatzform ist --load-mode none. Compose und die Referenzprofil-Dateien sind entsprechend angepasst. Beim ersten Start wurde die alte Option abgewiesen; der automatische Rückfall auf b10872 funktionierte. Nach der Migration lädt b10930 Modell, MTP-Kontext und Vision-Projektor erfolgreich.

Verifikation

  • Alle fünf Profile über den normalen Router nacheinander aktiviert und mit einer kurzen Rechenaufgabe geprüft: jeweils korrekte Antwort.
  • Uncensored vor und nach dem Update: Rechnen, strukturierter Tool-Aufruf, synthetisches Bild mit rotem Quadrat links und blauem Kreis rechts sowie eine Folgefrage nach dem Bild bestanden; MTP-Zähler bestätigen Drafting.
  • Medium nach dem Update: dieselben kurzen Text-, Tool- und Vision-Tests.
  • Uncensored-Langkontext: 72.802 Eingabetokens; Kennung vom Anfang nach langem synthetischem Fülltext korrekt wiedergegeben, vor und nach dem Update.
Messung auf Uncensored b10872 b10930
300 Ausgabetokens, synthetische Zahlenfolge 65,92 Token/s 66,79 Token/s
Verarbeitung des langen Prompts 978,29 Token/s 976,05 Token/s
Gesamtdauer Langkontextanfrage 74,104 s 74,248 s

Dies sind einzelne Funktions- und Vergleichsläufe, kein statistisch abgesicherter Leistungsbenchmark. Die Vorher-Messung lief während des CPU-Builds; Cachezustand und Hintergrundlast können Messwerte beeinflussen. Die Zahlen zeigen hier praktisch gleiches Verhalten, keinen belegten allgemeinen Geschwindigkeitsgewinn. Vollständig gefüllte 160K-, 192K- und 262K-Kontexte sowie Langzeitstabilität wurden nicht geprüft.

Rückfall und Betriebszustand

Das unveränderte vorherige Image bleibt erhalten als mike-ai/llama.cpp:b10872-pre-b10930. Originaldateien, Buildlog, Testskripte und Messergebnisse liegen auf Athena in /data/deploy-backups/20260912-llama-b10930/.

Ein Rückfall benötigt sowohl das alte Image als auch seine bisherige Startoption --no-mmap; nur das Image umzuschalten reicht nicht. Die gesicherte Compose-Datei dient als Referenz. Spätere Änderungen dürfen beim Rückfall nicht durch blindes Überschreiben verloren gehen.

Zum Abschluss der Updateprüfung wurde das zuvor aktive Profil Uncensored wiederhergestellt. Dies ist ein historischer Abschlusszustand; beim späteren Dokumentationsabgleich war Medium aktiv. Die übrigen Profile bleiben bedarfsgesteuert gestoppt. Host, Treiber, SSH, LAN, Firewall und WireGuard wurden nicht verändert oder neu gestartet.