65 lines
5.6 KiB
Markdown
65 lines
5.6 KiB
Markdown
# Inferenzoptimierung: TODO und Messvertrag
|
||
|
||
Stand: 20. September 2026. Modellfamilie bleibt Qwen3.8-27B.
|
||
|
||
- [x] **1. Abgeschlossen (Textvergleich):** ByteShape ShapeLearn GPU-5 (IQ4_XS, 3.84 bpw) mit MTP gegen Pure IQ4_XS vergleichen. Zuerst RTX 5080 allein, maximal praktisch nutzbaren Kontext bestimmen; danach beide GPUs mit Vorrang für die 5080. Qualität, kaltes Prefill, Generierung, Kontext und VRAM dokumentieren.
|
||
- [ ] **2.** Beim besseren Kandidaten GPU-Verteilung und MTP-Parameter gezielt optimieren.
|
||
- [ ] **3.** DFlash2 als separates Textprofil vergleichen, falls Speicher und verifizierte Laufzeitunterstützung ausreichen.
|
||
- [ ] **4.** ExLlamaV3/EXL3 als alternative Laufzeit bewerten, einschließlich Funktionsgleichheit und Integrationsaufwand.
|
||
|
||
## Verbindliche Kriterien
|
||
|
||
- 5080 zuerst ausnutzen, 3060 erst bei zusätzlichem Speicherbedarf. Ausschließlich Layer-Splitting; keine experimentelle Tensor-Parallelität.
|
||
- Maximales **getestetes** Kontextfenster und nur hochgerechnete Grenzen getrennt nennen. Kontext umfasst Eingabe plus Ausgabe; Ausgaberreserve ausweisen.
|
||
- Kleine VRAM-Reserve für Betriebs-/Rechenspitzen, keine absichtlichen OOM-Grenztests. Keine CPU-Auslagerung als vermeintlicher Single-GPU-Erfolg.
|
||
- Vergleich mit identischer Laufzeit, KV-Quantisierung, MTP und Sampling. Ein Slot für den kontrollierten Modellvergleich; Produktionsprofil hat derzeit zwei Slots und Vision, deshalb getrennt ausweisen.
|
||
- Text-only Single-GPU-Kapazität ist nicht automatisch die Kapazität mit Vision. TTS-Basislast auf der 3060 dokumentieren.
|
||
- Prefill ohne Prompt-Cache messen, Decode bei kurzen und langen Eingaben. Cache-Treffer und wiederholte Zählfolgen nicht als allgemeine Geschwindigkeit verkaufen.
|
||
- Identische Qualitätsaufgaben, identisches Reasoning-/Ausgabebudget; Deutsch, Logik, Code, evidenzbasiertes Arbeiten, Tool Calling und Long-Context-Recall. Kleine Tests können Qualitätsverluste entdecken, aber keine vollständige Gleichwertigkeit beweisen.
|
||
- Keine Änderungen an Kernel, Treibern, Netzwerk, SSH oder Gateway. Bestehende Produktionscontainer und Images bleiben erhalten; nach Tests wiederherstellen. Isolierter Testcontainer mit Ressourcenlimits, Host-Gesundheit überwachen.
|
||
|
||
## Kandidat
|
||
|
||
- Quelle: https://huggingface.co/byteshape/Qwen3.8-27B-GGUF
|
||
- Datei: `Qwen3.8-27B-IQ4_XS-3.84bpw.gguf`
|
||
- Größe: 13,083,052,416 Bytes
|
||
- SHA256 laut Hugging Face LFS: `89434f23dc89c5f990894e3fe9fdad19d88c370f0d3638a176f29933f218b78b`
|
||
- Benchmarkwerte des Anbieters sind keine Athena-Messungen.
|
||
|
||
## Ergebnis und Wiederverwendung
|
||
|
||
[Messbericht](QWEN38_BYTESHAPE_AB_20260920.md): mehr Single-GPU-Kontext mit ByteShape, aber kein allgemeiner Geschwindigkeitsgewinn und keine belegte Qualitätsgleichheit. Produktivmodelle bleiben unverändert. Punkte 2–4 sind offen.
|
||
|
||
[Feste Qwen-Referenz](../benchmarks/athena-qwen38-reference-20260920/README.md) für alle weiteren Kandidaten verwenden; Qwen nicht automatisch neu testen.
|
||
|
||
## DFlash2-Kurztest
|
||
|
||
20.09.2026: [Medium-Ladetest](DFLASH2_MEDIUM_QUICK_20260920.md) mit 160.000 Kontext/zwei Slots scheitert an zusätzlichem Draft-VRAM auf der 5080. Keine Durchsatz- oder Qualitätswerte. Bisheriges Medium wiederhergestellt; Punkt 3 bleibt offen und benötigt ein anderes Speicherlayout.
|
||
|
||
Ein-Slot-Folgeversuche: [Bericht](DFLASH2_ONE_SLOT_20260920.md). Draft auf 5080 scheitert an Gerätezuordnung; Draft auf 3060 besteht kurze Texttests. Deutsch 37,8 tok/s, Code 75,5 tok/s: kein klarer Vorteil gegenüber gespeicherter MTP-Referenz. Dritter Rückfalltest nicht nötig. Vollständige Bewertung/Tuning in Punkt 3 bleibt offen.
|
||
|
||
## Abschlussbewertung und nächste Priorität
|
||
|
||
[Effizienzcheck](ATHENA_EFFICIENCY_REVIEW_20260920.md): Pure/MIX bleiben produktiv. Medium fällt beim Start wegen fehlender Rechenpuffer auf Betrieb ohne Pipeline-Parallelisierung zurück. Ein späterer Punkt-2-Test sollte gezielt Microbatch/Speicherreserve und tatsächlichen Durchsatz vergleichen. Native NVIDIA-NVFP4-Dateien umfassen 20,42 GiB; nur Kapazität geprüft, kein neuer Inferenzversuch. Keine weiteren Tests automatisch eingeplant.
|
||
|
||
## Medium-Microbatch-Kurztest
|
||
|
||
[512 gegen 256](MEDIUM_MICROBATCH_20260920.md): 256 lädt ohne vorherige Pufferfehler-Meldung, lässt aber nur 461 MiB auf der 5080 frei. Schutzabbruch vor Inferenz; kein Geschwindigkeitsgewinn belegt. 512 wiederhergestellt. Für einen eventuellen Folgetest zuerst mehr 5080-Reserve durch angepassten Split schaffen.
|
||
|
||
Nach expliziter Freigabe: [Reserve448-Folgetest](MEDIUM_MICROBATCH_RESERVE448_20260920.md) bestanden. 256 liefert +7,1 % Prefill im einmaligen 24K-Kurzvergleich; kurze Decodes nahezu gleich. Alle drei Fakten korrekt, keine volle Langkontext-/Vision-/Parallelitätsfreigabe. Produktiv weiter512.
|
||
|
||
## Punkt 2: GPU-Split/MTP-Kurzvergleich
|
||
|
||
[Vier Varianten getestet](MEDIUM_SPLIT_MTP_20260920.md): bei Microbatch256 ist
|
||
85:15/MTP2 der interessanteste Kandidat (+10,3% Deutsch, Code/24K etwa gleich,
|
||
268MiB weniger Peak5080). MTP4 und83:17 ohne allgemeinen Vorteil. Je ein Lauf,
|
||
unterschiedliche Texte, Recall überall3/3; breite Qualität und lange/visuelle/
|
||
parallele Last offen. Produktiv weiterhin85:15/MTP3/Microbatch512. Punkt2 teilweise
|
||
bearbeitet, keine pauschale Freigabe oder höhere Kontextgrenze.
|
||
|
||
[MTP2-Qualitäts-/103K-Folgetest und Hardwareprüfung](MEDIUM_MTP2_VALIDATION_20260920.md):
|
||
sechs vollständige Antworten, korrekter Tool-Call, Recall3/3. Konkreter Codefehler
|
||
und Schwächen in Evidenztreue; keine pauschale Qualitätsgleichheit bewiesen.
|
||
5080max79°C,3060max59°C, keine gesampelte thermische Drosselung. Lastlinks
|
||
Gen4x16/Gen3x4. Produktion unverändert wiederhergestellt; Punkt2 nicht voll freigegeben.
|