Consolidate Athena test history and final MTP2 production state
This commit is contained in:
@@ -2,8 +2,12 @@
|
||||
|
||||
Stand: 20. September 2026. Modellfamilie bleibt Qwen3.8-27B.
|
||||
|
||||
**Aktueller Abschluss:** Medium MTP2/256 und Large MTP2 übernommen.
|
||||
[Gesamthistorie und Grenzen](ATHENA_SESSION_20260920.md). Nachfolgende
|
||||
Testabschnitte dokumentieren auch frühere Zwischenstände.
|
||||
|
||||
- [x] **1. Abgeschlossen (Textvergleich):** ByteShape ShapeLearn GPU-5 (IQ4_XS, 3.84 bpw) mit MTP gegen Pure IQ4_XS vergleichen. Zuerst RTX 5080 allein, maximal praktisch nutzbaren Kontext bestimmen; danach beide GPUs mit Vorrang für die 5080. Qualität, kaltes Prefill, Generierung, Kontext und VRAM dokumentieren.
|
||||
- [ ] **2.** Beim besseren Kandidaten GPU-Verteilung und MTP-Parameter gezielt optimieren.
|
||||
- [x] **2. Kurztest und selektive Übernahme abgeschlossen:** Pure beibehalten; Medium85:15/MTP2/256, Large86:14/MTP2/256. Volle Kontext-/Vision-/Parallelitätsqualifikation bleibt offen.
|
||||
- [ ] **3.** DFlash2 als separates Textprofil vergleichen, falls Speicher und verifizierte Laufzeitunterstützung ausreichen.
|
||||
- [ ] **4.** ExLlamaV3/EXL3 als alternative Laufzeit bewerten, einschließlich Funktionsgleichheit und Integrationsaufwand.
|
||||
|
||||
|
||||
Reference in New Issue
Block a user