Files
Athena-Deck/LLM_SAMPLING.md
T

2.8 KiB

LLM-Sampling und Penalties

Unter Chat & Sprachmodelle → Profile → Bearbeiten sind Temperatur, Top-p, Top-k und im Abschnitt Penalties diese Werte editierbar:

Feld Neutral Bedeutung
Wiederholungs-Penalty (repeat_penalty) 1,0 Über 1 dämpft bereits erzeugte Tokens
Presence-Penalty 0 Berücksichtigt, ob ein Token bereits vorkam
Frequency-Penalty 0 Berücksichtigt, wie oft ein Token bereits vorkam

Die Profilwerte gelten im Testchat und am OpenAI-kompatiblen Chat-Endpunkt. Explizite Werte eines API-Clients haben Vorrang. repeat_penalty ist eine llama.cpp-Erweiterung, Presence und Frequency sind OpenAI-Felder. Es gibt keine Hermes-spezifische Übersetzung. Neue Felder werden bei älteren Profilen mit neutralen Werten ergänzt; das Speichern verändert keine GPU-Einstellungen. Backup/Restore übernimmt die Parameter zusammen mit den Profilen.

Geprüfte Empfehlungen (2026-10-01)

Gewichte Temperatur Top-p Top-k Wiederholung Presence Frequency
Qwen3.8 27B, Thinking 1,0 0,95 20 1,0 0 0
Gemma 4 31B IT 1,0 0,95 64 1,0 0 0

Quellen: Qwen, Gemma, llama.cpp-API. Qwen nennt Wiederholung 1,0 und Presence 0 für Thinking ausdrücklich. Frequency 0 ist ein neutraler Deck-Wert, keine gesonderte Modellkarten-Empfehlung. Gemma nennt keine abweichenden Penalties; dort bleiben sie neutral.

Die verwendeten MIX- und JonathanColetti-Quantisierungen nennen keine eigenen Sampling-Empfehlungen; die Werte des Qwen-Basismodells werden übernommen. Für Qwen ohne Thinking empfiehlt die Modellkarte stattdessen Temperatur 0,7, Top-p 0,8, Top-k 20, Presence 1,5 und Wiederholung 1,0. Deck schaltet die Profilwerte bei einer einzelnen Anfrage mit ausgeschaltetem Thinking nicht automatisch um. Bei Bedarf ein eigenes Profil mit diesen Werten speichern. OBLITERATUS-Empfehlungen werden nicht auf andere unzensierte Varianten übertragen.

Bestehende Installation gezielt konfigurieren

python3 deploy/configure_llm_sampling.py --installation /opt/athena-deck-dev/runtime zeigt die geplanten Änderungen. --apply schreibt sie ausschließlich, wenn der zugehörige Deck-Container gestoppt ist, und sichert vorher die Profildatei. Unbekannte Modellquellen und Nicht-Chat-Profile bleiben unberührt. Das optionale --add-large-ultra ergänzt die vom alten Router angeforderten Large-/Ultra-Profile auf Basis des geprüften Medium-Modells; API-Freigaben werden nicht geändert.

Bild-, Video-, Trenn-, STT- und derzeitige Audio-Profile besitzen keine solchen Sampling-Felder. Die Implementierung fügt ihnen keine wirkungslosen Optionen hinzu.