Consolidate Athena test history and final MTP2 production state

This commit is contained in:
Mikei386
2026-09-20 23:30:20 +02:00
parent fbe8c6f1e9
commit de3f8fd7aa
11 changed files with 309 additions and 11 deletions
+5 -1
View File
@@ -2,8 +2,12 @@
Stand: 20. September 2026. Modellfamilie bleibt Qwen3.8-27B.
**Aktueller Abschluss:** Medium MTP2/256 und Large MTP2 übernommen.
[Gesamthistorie und Grenzen](ATHENA_SESSION_20260920.md). Nachfolgende
Testabschnitte dokumentieren auch frühere Zwischenstände.
- [x] **1. Abgeschlossen (Textvergleich):** ByteShape ShapeLearn GPU-5 (IQ4_XS, 3.84 bpw) mit MTP gegen Pure IQ4_XS vergleichen. Zuerst RTX 5080 allein, maximal praktisch nutzbaren Kontext bestimmen; danach beide GPUs mit Vorrang für die 5080. Qualität, kaltes Prefill, Generierung, Kontext und VRAM dokumentieren.
- [ ] **2.** Beim besseren Kandidaten GPU-Verteilung und MTP-Parameter gezielt optimieren.
- [x] **2. Kurztest und selektive Übernahme abgeschlossen:** Pure beibehalten; Medium85:15/MTP2/256, Large86:14/MTP2/256. Volle Kontext-/Vision-/Parallelitätsqualifikation bleibt offen.
- [ ] **3.** DFlash2 als separates Textprofil vergleichen, falls Speicher und verifizierte Laufzeitunterstützung ausreichen.
- [ ] **4.** ExLlamaV3/EXL3 als alternative Laufzeit bewerten, einschließlich Funktionsgleichheit und Integrationsaufwand.