78 lines
3.9 KiB
Markdown
78 lines
3.9 KiB
Markdown
# llama.cpp b10930 auf Athena
|
|
|
|
Stand: 12. September 2026
|
|
|
|
## Produktiver Stand
|
|
|
|
- Build: **10930**
|
|
- Upstream-Commit: `56381e407c0ccfb3a6f71e668a27a901001d22ce`
|
|
- Image: `mike-ai/llama.cpp:local`, zusätzlich `mike-ai/llama.cpp:b10930`
|
|
- Image-ID: `sha256:c9d78a9375143877574f3d7c6e0dea94ecfebb264e8dd9f57ac4e03f1c96044e`
|
|
- CUDA im Container: 12.8.1; Zielarchitekturen: 86 und 120
|
|
- Build aus dem vorhandenen Dockerfile mit zwei parallelen Compiler-Prozessen
|
|
|
|
Alle fünf auf Athena vorhandenen Textprofilcontainer wurden aktualisiert:
|
|
Fast, Medium, Large, Ultra und Uncensored. Modellgewichte, GPU-Verteilung,
|
|
Kontextfenster, Slots, Vision- und MTP-Einstellungen wurden beibehalten.
|
|
Der zusätzliche Git-Matrixeintrag `beta1` ist auf Athena nicht installiert
|
|
und wurde daher nicht als Laufzeittest gewertet.
|
|
|
|
Der tatsächliche vorherige Live-Build war **10872**, Commit
|
|
`b31b71f3a076bfc4278daad442203a9c51c6e676`. Die bisherige Dokumentation
|
|
mit Build 10781 war veraltet.
|
|
|
|
## Enthaltener Fix und notwendige CLI-Migration
|
|
|
|
[Upstream-PR #28715](https://github.com/ggml-org/llama.cpp/pull/28715),
|
|
integriert am 11. September, korrigiert die an den Drafter übergebene Position
|
|
nach Bildeingaben. Der Fix betrifft spekulative Decodierung einschließlich MTP.
|
|
Er ist kein Nachweis dafür, dass sämtliche MMProj-/Prompt-Cache-Probleme oder
|
|
Hermes-Slot-Verdrängungen behoben sind.
|
|
|
|
Der neue Build entfernt die bisherige Option `--no-mmap`. Ihre gleichwertige
|
|
Ersatzform ist `--load-mode none`. Compose und die Referenzprofil-Dateien sind
|
|
entsprechend angepasst. Beim ersten Start wurde die alte Option abgewiesen;
|
|
der automatische Rückfall auf b10872 funktionierte. Nach der Migration lädt
|
|
b10930 Modell, MTP-Kontext und Vision-Projektor erfolgreich.
|
|
|
|
## Verifikation
|
|
|
|
- Alle fünf Profile über den normalen Router nacheinander aktiviert und mit
|
|
einer kurzen Rechenaufgabe geprüft: jeweils korrekte Antwort.
|
|
- Uncensored vor und nach dem Update: Rechnen, strukturierter Tool-Aufruf,
|
|
synthetisches Bild mit rotem Quadrat links und blauem Kreis rechts sowie
|
|
eine Folgefrage nach dem Bild bestanden; MTP-Zähler bestätigen Drafting.
|
|
- Medium nach dem Update: dieselben kurzen Text-, Tool- und Vision-Tests.
|
|
- Uncensored-Langkontext: **72.802 Eingabetokens**; Kennung vom Anfang nach
|
|
langem synthetischem Fülltext korrekt wiedergegeben, vor und nach dem Update.
|
|
|
|
| Messung auf Uncensored | b10872 | b10930 |
|
|
|---|---:|---:|
|
|
| 300 Ausgabetokens, synthetische Zahlenfolge | 65,92 Token/s | 66,79 Token/s |
|
|
| Verarbeitung des langen Prompts | 978,29 Token/s | 976,05 Token/s |
|
|
| Gesamtdauer Langkontextanfrage | 74,104 s | 74,248 s |
|
|
|
|
Dies sind einzelne Funktions- und Vergleichsläufe, kein statistisch
|
|
abgesicherter Leistungsbenchmark. Die Vorher-Messung lief während des
|
|
CPU-Builds; Cachezustand und Hintergrundlast können Messwerte beeinflussen.
|
|
Die Zahlen zeigen hier praktisch gleiches Verhalten, keinen belegten
|
|
allgemeinen Geschwindigkeitsgewinn. Vollständig gefüllte 160K-, 192K- und
|
|
262K-Kontexte sowie Langzeitstabilität wurden nicht geprüft.
|
|
|
|
## Rückfall und Betriebszustand
|
|
|
|
Das unveränderte vorherige Image bleibt erhalten als
|
|
`mike-ai/llama.cpp:b10872-pre-b10930`.
|
|
Originaldateien, Buildlog, Testskripte und Messergebnisse liegen auf Athena in
|
|
`/data/deploy-backups/20260912-llama-b10930/`.
|
|
|
|
Ein Rückfall benötigt sowohl das alte Image als auch seine bisherige
|
|
Startoption `--no-mmap`; nur das Image umzuschalten reicht nicht. Die gesicherte
|
|
Compose-Datei dient als Referenz. Spätere Änderungen dürfen beim Rückfall
|
|
nicht durch blindes Überschreiben verloren gehen.
|
|
|
|
Zum Abschluss der Updateprüfung wurde das zuvor aktive Profil **Uncensored**
|
|
wiederhergestellt. Dies ist ein historischer Abschlusszustand; beim späteren
|
|
Dokumentationsabgleich war Medium aktiv. Die übrigen Profile bleiben bedarfsgesteuert gestoppt. Host, Treiber,
|
|
SSH, LAN, Firewall und WireGuard wurden nicht verändert oder neu gestartet.
|