Add editable LLM penalties and preserve sampling through backup restore
This commit is contained in:
1 parent
3779c846db
commit
37b5394df1
14 files changed
+218
-14
No files matched your search
@@ -0,0 +1,51 @@
|
||||
# LLM-Sampling und Penalties
|
||||
|
||||
Unter Chat & Sprachmodelle → Profile → Bearbeiten sind Temperatur, Top-p,
|
||||
Top-k und im Abschnitt **Penalties** diese Werte editierbar:
|
||||
|
||||
| Feld | Neutral | Bedeutung |
|
||||
|---|---:|---|
|
||||
| Wiederholungs-Penalty (`repeat_penalty`) | 1,0 | Über 1 dämpft bereits erzeugte Tokens |
|
||||
| Presence-Penalty | 0 | Berücksichtigt, ob ein Token bereits vorkam |
|
||||
| Frequency-Penalty | 0 | Berücksichtigt, wie oft ein Token bereits vorkam |
|
||||
|
||||
Die Profilwerte gelten im Testchat und am OpenAI-kompatiblen Chat-Endpunkt.
|
||||
Explizite Werte eines API-Clients haben Vorrang. `repeat_penalty` ist eine
|
||||
llama.cpp-Erweiterung, Presence und Frequency sind OpenAI-Felder. Es gibt keine
|
||||
Hermes-spezifische Übersetzung. Neue Felder werden bei älteren Profilen mit
|
||||
neutralen Werten ergänzt; das Speichern verändert keine GPU-Einstellungen.
|
||||
Backup/Restore übernimmt die Parameter zusammen mit den Profilen.
|
||||
|
||||
## Geprüfte Empfehlungen (2026-10-01)
|
||||
|
||||
| Gewichte | Temperatur | Top-p | Top-k | Wiederholung | Presence | Frequency |
|
||||
|---|---:|---:|---:|---:|---:|---:|
|
||||
| Qwen3.8 27B, Thinking | 1,0 | 0,95 | 20 | 1,0 | 0 | 0 |
|
||||
| Gemma 4 31B IT | 1,0 | 0,95 | 64 | 1,0 | 0 | 0 |
|
||||
|
||||
Quellen: [Qwen](https://huggingface.co/Qwen/Qwen3.8-27B#best-practices),
|
||||
[Gemma](https://huggingface.co/google/gemma-4-31B-it#best-practices),
|
||||
[llama.cpp-API](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md).
|
||||
Qwen nennt Wiederholung 1,0 und Presence 0 für Thinking ausdrücklich. Frequency
|
||||
0 ist ein neutraler Deck-Wert, keine gesonderte Modellkarten-Empfehlung.
|
||||
Gemma nennt keine abweichenden Penalties; dort bleiben sie neutral.
|
||||
|
||||
Die verwendeten MIX- und JonathanColetti-Quantisierungen nennen keine eigenen
|
||||
Sampling-Empfehlungen; die Werte des Qwen-Basismodells werden übernommen.
|
||||
Für Qwen ohne Thinking empfiehlt die Modellkarte stattdessen Temperatur 0,7,
|
||||
Top-p 0,8, Top-k 20, Presence 1,5 und Wiederholung 1,0. Deck schaltet die
|
||||
Profilwerte bei einer einzelnen Anfrage mit ausgeschaltetem Thinking nicht
|
||||
automatisch um. Bei Bedarf ein eigenes Profil mit diesen Werten speichern.
|
||||
OBLITERATUS-Empfehlungen werden nicht auf andere unzensierte Varianten übertragen.
|
||||
|
||||
## Bestehende Installation gezielt konfigurieren
|
||||
|
||||
`python3 deploy/configure_llm_sampling.py --installation /opt/athena-deck-dev/runtime`
|
||||
zeigt die geplanten Änderungen. `--apply` schreibt sie ausschließlich, wenn der
|
||||
zugehörige Deck-Container gestoppt ist, und sichert vorher die Profildatei.
|
||||
Unbekannte Modellquellen und Nicht-Chat-Profile bleiben unberührt. Das optionale
|
||||
`--add-large-ultra` ergänzt die vom alten Router angeforderten Large-/Ultra-Profile
|
||||
auf Basis des geprüften Medium-Modells; API-Freigaben werden nicht geändert.
|
||||
|
||||
Bild-, Video-, Trenn-, STT- und derzeitige Audio-Profile besitzen keine solchen
|
||||
Sampling-Felder. Die Implementierung fügt ihnen keine wirkungslosen Optionen hinzu.
|
||||
Reference in new issue
Block a user