Files
AI-Profile-Router/docs/INFERENCE_OPTIMIZATION_TODO_20260920.md
T

2.9 KiB
Raw Blame History

Inferenzoptimierung: TODO und Messvertrag

Stand: 20. September 2026. Modellfamilie bleibt Qwen3.8-27B.

  • 1. Abgeschlossen (Textvergleich): ByteShape ShapeLearn GPU-5 (IQ4_XS, 3.84 bpw) mit MTP gegen Pure IQ4_XS vergleichen. Zuerst RTX 5080 allein, maximal praktisch nutzbaren Kontext bestimmen; danach beide GPUs mit Vorrang für die 5080. Qualität, kaltes Prefill, Generierung, Kontext und VRAM dokumentieren.
  • 2. Beim besseren Kandidaten GPU-Verteilung und MTP-Parameter gezielt optimieren.
  • 3. DFlash2 als separates Textprofil vergleichen, falls Speicher und verifizierte Laufzeitunterstützung ausreichen.
  • 4. ExLlamaV3/EXL3 als alternative Laufzeit bewerten, einschließlich Funktionsgleichheit und Integrationsaufwand.

Verbindliche Kriterien

  • 5080 zuerst ausnutzen, 3060 erst bei zusätzlichem Speicherbedarf. Ausschließlich Layer-Splitting; keine experimentelle Tensor-Parallelität.
  • Maximales getestetes Kontextfenster und nur hochgerechnete Grenzen getrennt nennen. Kontext umfasst Eingabe plus Ausgabe; Ausgaberreserve ausweisen.
  • Kleine VRAM-Reserve für Betriebs-/Rechenspitzen, keine absichtlichen OOM-Grenztests. Keine CPU-Auslagerung als vermeintlicher Single-GPU-Erfolg.
  • Vergleich mit identischer Laufzeit, KV-Quantisierung, MTP und Sampling. Ein Slot für den kontrollierten Modellvergleich; Produktionsprofil hat derzeit zwei Slots und Vision, deshalb getrennt ausweisen.
  • Text-only Single-GPU-Kapazität ist nicht automatisch die Kapazität mit Vision. TTS-Basislast auf der 3060 dokumentieren.
  • Prefill ohne Prompt-Cache messen, Decode bei kurzen und langen Eingaben. Cache-Treffer und wiederholte Zählfolgen nicht als allgemeine Geschwindigkeit verkaufen.
  • Identische Qualitätsaufgaben, identisches Reasoning-/Ausgabebudget; Deutsch, Logik, Code, evidenzbasiertes Arbeiten, Tool Calling und Long-Context-Recall. Kleine Tests können Qualitätsverluste entdecken, aber keine vollständige Gleichwertigkeit beweisen.
  • Keine Änderungen an Kernel, Treibern, Netzwerk, SSH oder Gateway. Bestehende Produktionscontainer und Images bleiben erhalten; nach Tests wiederherstellen. Isolierter Testcontainer mit Ressourcenlimits, Host-Gesundheit überwachen.

Kandidat

  • Quelle: https://huggingface.co/byteshape/Qwen3.8-27B-GGUF
  • Datei: Qwen3.8-27B-IQ4_XS-3.84bpw.gguf
  • Größe: 13,083,052,416 Bytes
  • SHA256 laut Hugging Face LFS: 89434f23dc89c5f990894e3fe9fdad19d88c370f0d3638a176f29933f218b78b
  • Benchmarkwerte des Anbieters sind keine Athena-Messungen.

Ergebnis und Wiederverwendung

Messbericht: mehr Single-GPU-Kontext mit ByteShape, aber kein allgemeiner Geschwindigkeitsgewinn und keine belegte Qualitätsgleichheit. Produktivmodelle bleiben unverändert. Punkte 2–4 sind offen.

Feste Qwen-Referenz für alle weiteren Kandidaten verwenden; Qwen nicht automatisch neu testen.