Define four-profile production matrix with Medium default

This commit is contained in:
Mikei386
2026-08-22 11:30:38 +02:00
parent 977f8f5c76
commit 41b9c17f0f
33 changed files with 237 additions and 160 deletions
+9 -4
View File
@@ -10,7 +10,9 @@ WireGuard-Isolation.
- llama.cpp selbst gebaut und auf einen geprüften Commit festgelegt
- vier schaltbare Profilcontainer plus ein isolierter Experimentalcontainer;
davon ist immer exakt ein Inferenzcontainer aktiv
- `/fast`, `/medium`, `/long` und `/ultra` über den Profile Router
- `/fast`, `/medium`, `/large` und `/ultra` über den Profile Router
- verbindliche Standardmatrix: Fast MIX 76,8K, Medium Pure 160K (Default),
Large Pure 192K und Ultra Pure 256K
- `/ultra`: getestetes text-only 256K-Profil (IQ4_XS Pure, beide GPUs,
80:20); etwa 68 Token/s und erfolgreicher 220K-Prompt-Fülltest
- Open WebUI als einzige normale Oberfläche
@@ -21,6 +23,9 @@ WireGuard-Isolation.
- KI-Ausgangsverkehr über das Heimnetz, bei Tunnelausfall fail-closed
- keine Secrets, Chats, Logs oder Modelldateien im Repository
Die gemessenen Startparameter und Zuständigkeiten stehen in
[`docs/STANDARD_PROFILE_MATRIX.md`](docs/STANDARD_PROFILE_MATRIX.md).
## Schnellstart
Auf einem frisch installierten Debian 12/13 amd64:
@@ -94,6 +99,6 @@ router/ OpenAI-kompatibler Profile Router
- Ein Blackhole-Fallback verhindert Traffic-Leaks bei WireGuard-Ausfall.
- Das Uni-Netz und das Heimnetz dürfen diesen Host nicht als Transit benutzen.
Die Profilwerte sind Ausgangswerte. Nach dem Neuaufbau werden RTX 5080 und
RTX 3060 mit der bestehenden Standard-Testserie neu vermessen, bevor die zweite
GPU in ein Produktionsprofil einfließt.
Die Profilwerte wurden auf RTX 5080 und RTX 3060 vermessen und bilden die
verbindliche Standardmatrix. Neue Varianten ersetzen sie erst nach demselben
Vergleichstest und einer dokumentierten Entscheidung.