Define four-profile production matrix with Medium default
This commit is contained in:
+23
-24
@@ -1,8 +1,8 @@
|
||||
# Aktueller produktiver Referenzstand
|
||||
|
||||
Stand: 20. August 2026. Dieses Dokument beschreibt die funktionierende
|
||||
Referenz vor dem geplanten Neuaufbau. Es ist keine Empfehlung, jede Altlast des
|
||||
Hosts zu übernehmen.
|
||||
Stand: 22. August 2026. Dieses Dokument beschreibt die auf Athena installierte
|
||||
und geprüfte Docker-Referenz. Die verbindlichen Profilparameter stehen in
|
||||
`STANDARD_PROFILE_MATRIX.md`.
|
||||
|
||||
## Hardware und Betriebssystem
|
||||
|
||||
@@ -12,10 +12,10 @@ Hosts zu übernehmen.
|
||||
| Kernel | 6.12.101+deb13-amd64 |
|
||||
| CPU | AMD Ryzen 5 5600, 6 Kerne/12 Threads |
|
||||
| RAM | 48 GiB DDR4-2666 |
|
||||
| GPU | NVIDIA GeForce RTX 5080, 16 GiB VRAM |
|
||||
| GPUs | NVIDIA GeForce RTX 5080, 16 GiB + RTX 3060, 12 GiB VRAM |
|
||||
| NVIDIA-Treiber | 610.57.04 |
|
||||
| System-SSD | Samsung 980 PRO 1 TB |
|
||||
| Daten-SSD | Samsung 980 PRO 2 TB |
|
||||
| Daten-SSD | WD Blue SN580 1 TB, unter `/data` |
|
||||
|
||||
Die früher verwendete Radeon RX 470 ist ausgebaut und gehört nicht zur
|
||||
Zielplattform.
|
||||
@@ -28,23 +28,22 @@ Zielplattform.
|
||||
| Repository | `https://github.com/ggml-org/llama.cpp.git` |
|
||||
| Commit | `4df29be4f4c3673f428170fda944a5b19f743bb8` |
|
||||
| Compiler | GCC 14.2 |
|
||||
| Hauptdienst | `mike-ai-llama-ui.service` |
|
||||
| llama.cpp-Port | 8080, auf dem alten Host noch im LAN gebunden |
|
||||
| Hauptdienst | jeweils ein Container `mike-ai-llama-<profil>` |
|
||||
| llama.cpp-Port | 8080, ausschließlich im internen Docker-Netz |
|
||||
| Client-Port | 8081 über den Router |
|
||||
| MCP-Konfiguration | getrennte Container unter `/opt/mike-ai/mcp-containers` |
|
||||
|
||||
### Aktives Fast-Profil
|
||||
### Aktives Standardprofil
|
||||
|
||||
- Qwen3.8-27B IQ4-MIX
|
||||
- Dateigröße: 14.111.614.400 Bytes
|
||||
- SHA256: `54879ae8738d5938f46cb3b8cbf16bf42b8c85b7d68d7c73f062b612ec183e36`
|
||||
- Öffentliche Herkunft ist noch nicht ausreichend dokumentiert; für eine
|
||||
bitgenaue Migration muss die geprüfte Datei vom Referenzhost gesichert werden.
|
||||
- Kontext 76.800
|
||||
- vollständig auf CUDA0
|
||||
- Qwen3.8-27B IQ4_XS Pure
|
||||
- Dateigröße: 14.534.384.640 Bytes
|
||||
- SHA256: `ea5a3c45d407f9b9e5d2c0d647f0ea600f486f6b86b92b56d0823ba073dae675`
|
||||
- Quelle: `jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF`
|
||||
- Kontext 160.000
|
||||
- RTX 5080 + RTX 3060 im Verhältnis 90:10
|
||||
- Flash Attention
|
||||
- KV-Cache Q4_0 für K und V
|
||||
- MTP Draft, maximal zwei Tokens
|
||||
- MTP Draft, maximal drei Tokens
|
||||
- sechs Threads und sechs Batch-Threads
|
||||
- Batch 64, Micro-Batch 32
|
||||
- ein paralleler Slot
|
||||
@@ -56,17 +55,17 @@ Zielplattform.
|
||||
| Profil | Virtuelles Modell | Kontext | Besonderheit |
|
||||
|---|---|---:|---|
|
||||
| Fast | `qwen-fast` | 76.800 | IQ4-MIX, MTP2, vollständig GPU, CPU-mmproj |
|
||||
| Medium | `qwen-medium` | 94.208 | IQ4_XS Pure, ohne MTP, CPU-mmproj |
|
||||
| Long | `qwen-long` | 131.072 | IQ4-MIX, MTP2, FFN 0–11 auf CPU, CPU-mmproj |
|
||||
| Medium **(Standard)** | `qwen-medium` | 160.000 | IQ4_XS Pure, MTP3, beide GPUs 90:10, CPU-mmproj |
|
||||
| Large | `qwen-large` | 192.000 | IQ4_XS Pure, MTP3, beide GPUs 86:14, CPU-mmproj |
|
||||
| Ultra | `qwen-ultra` | 262.144 | IQ4_XS Pure, MTP2, beide GPUs 80:20, text-only; 68,2 Tok/s und 220K-Fülltest bestanden |
|
||||
|
||||
## Router
|
||||
|
||||
- Dienst: `mike-ai-profile-router.service`
|
||||
- Container: `mike-ai-router`
|
||||
- Port: 8081
|
||||
- Upstream: `127.0.0.1:8080`
|
||||
- Upstream: `llama-upstream:8080` im internen Inferenznetz
|
||||
- Commit des Plattform-Repositories: siehe jeweils aktuelles `main`
|
||||
- Umschaltskript: `/usr/local/bin/llama-profile`
|
||||
- Umschaltung: `mike-ai-profile-controller` mit fester Container-Allowlist
|
||||
- Timeout für Profilwechsel und Requests: 600 Sekunden
|
||||
|
||||
Der Router übernimmt:
|
||||
@@ -74,7 +73,7 @@ Der Router übernimmt:
|
||||
- OpenAI-kompatibles Chat-Proxying und Streaming
|
||||
- virtuelle Modelle und automatische Profilumschaltung
|
||||
- Tool Calls
|
||||
- direkte integrierte Vision in allen Qwen-Profilen
|
||||
- direkte integrierte Vision in Fast, Medium und Large
|
||||
- FLUX-Hotswap zur Bildgenerierung
|
||||
- Whisper Speech-to-Text
|
||||
- XTTS Text-to-Speech (historische Referenz; Zielsystem verwendet Piper)
|
||||
@@ -87,9 +86,9 @@ Der Router übernimmt:
|
||||
| Text-/Visionmodell | jeweils aktives Qwen3.8-27B-Profil |
|
||||
| Projektor | BF16-mmproj |
|
||||
| Speicherort des Projektors | System-RAM (`--no-mmproj-offload`) |
|
||||
| Kontext | entspricht Fast/Medium/Long |
|
||||
| Kontext | entspricht Fast/Medium/Large; Ultra ist bewusst text-only |
|
||||
|
||||
Vision ist Bestandteil jedes Profils. Der Router prüft Bildgröße und URL,
|
||||
Vision ist Bestandteil von Fast, Medium und Large. Der Router prüft Bildgröße und URL,
|
||||
leitet das Bild dann direkt weiter und führt keinen Modellwechsel mehr aus.
|
||||
|
||||
## Bildgenerierung
|
||||
|
||||
Reference in New Issue
Block a user