Files
AI-Profile-Router/docs/QWEN38_AGENTIC_BENCHMARK_2026-08-24.md
T

91 lines
5.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Qwen3.8-27B – agentischer Werkzeugtest vom 24. August 2026
## Ergebnis in einem Satz
Qwen3.8-27B ist auf Athena für längere agentische Aufgaben brauchbar, wenn die
Werkzeugschicht ihm gebündelte Fachoperationen, erhaltenes Reasoning und eine
garantierte Schlussrunde anbietet. Die früheren Ausfälle waren überwiegend
Orchestrierungs- und MCP-Probleme, nicht ein grundsätzliches Unvermögen des
Modells.
## Warum die Community-Erfahrungen besser wirkten
Community-Demos verwenden meist einen spezialisierten Agent-Harness, große
Kontexte, erhaltenes Reasoning und kompakte Werkzeuge. Athena kombinierte zuvor
76K Kontext, standardmäßig abgeschaltetes Thinking, sechs Einzelaufrufe,
teilweise sehr kleinteilige MCP-Operationen und OpenWebUIs hartes Ende ohne
Syntheserunde. Zusätzlich existieren aktuelle llama.cpp-Randfälle bei
Qwen3.8-Systemnachrichten, verschachtelten Werkzeugschemata und gestreamten
Parallelaufrufen. Die Differenz war daher kein fairer Modellvergleich.
## Produktive Änderungen
- `--reasoning-preserve` in allen Qwen-Profilen.
- Automatische Auswahl von bis zu drei Fach-MCPs.
- Automatisch mittleres, auf 3.072 Token begrenztes Reasoning nur bei echten
Mehrdomänen-Aufgaben; explizite Benutzereinstellungen werden nicht ersetzt.
- Zwölf tatsächliche Aufrufe, höchstens vier pro Werkzeug, keine identische
Signatur zweimal; 16 interne Runden lassen Raum für die Schlussantwort.
- Genau ein zusätzlicher werkzeugloser Syntheseversuch, falls Qwen nach Ende
der Recherche trotzdem noch einen Funktionsaufruf formuliert.
- Home Assistant `find_commented_blocks`: vollständige auskommentierte
Automationseinträge einschließlich ID, Alias und Zeilen in einem Aufruf.
- MUA r017: gebündelte CA-Suche mit bis zu fünf Namensvarianten.
- MUA r018: fokussierte Loganalyse mit mehreren `focus_terms` in einem Aufruf.
- Evidenzplan im Systemprompt: zuerst ein breiter Aufruf je Domäne, danach nur
gezielte Lücken schließen, Pflichtbedingungen früh prüfen und bei deren
Scheitern sofort den Kandidaten wechseln.
## Browser-Benchmarks
| Test | Vorher | Nachher | Bewertung |
|---|---:|---:|---|
| Auskommentierte HA-Automationen inventarisieren | 9 Aufrufe, 90,9 s | 1 Aufruf, 26,8 s | IDs, Aliase und Zeilen korrekt; sehr gut |
| Deemix: GitHub + laufender Unraid-Container + MCP-Entwurf | zuvor 37 GitHub-Aufrufe und Abbruch | 7 Aufrufe, sichtbare Antwort | klare Verbesserung; einzelne Betriebsannahmen noch zu optimistisch |
| Web + GitHub + Unraid: CA-Negativprüfung und Template-Entwurf | Kandidat zu spät verworfen, Budgetende | 11 Aufrufe, vollständiger Entwurf | Schlussantwort vorhanden; XML und Architektur müssen weiterhin fachlich geprüft werden |
| Drei Domänen: HA-YAML + Unraid-Logs + GitHub-Quelle | vorher kein finaler Text am Budgetende | 12 Aufrufe, vollständige Evidenzmatrix | Finalizer v5 bestanden; Quellenverwechslung wurde transparent als Unsicherheit markiert |
| Fokussierte Home-Assistant-Logprüfung | mehrere Shell-/grep-Aufrufe | 1 Inventar + 1 fokussierte Loganalyse, 44,7 s | MUA r018 korrekt gewählt; klare Beleggrenzen |
## Qualitätsbefund
### Stark
- wählt nach der Anpassung die drei korrekten Fachdomänen automatisch;
- beginnt parallel/breit und liefert belastbare Livewerte;
- kann aus Werkzeugresultaten strukturierte Evidenzmatrizen und sichere Pläne
bauen;
- verschweigt verbleibende Unsicherheit überwiegend nicht;
- die HA-Spezialoperation reduziert Laufzeit und Kontextverbrauch drastisch.
### Noch nicht auf Frontier-Agent-Niveau
- bei ähnlichen GitHub-Repositories kann Qwen den falschen Treffer vertiefen,
statt zuerst den exakten installierten Upstream zu bestimmen;
- bei komplexen Containerstacks erzeugt es gelegentlich formal plausible,
aber fachlich fragwürdige Unraid-XMLs;
- ohne gebündelte Logoperation fällt es auf mehrere Shell-/grep-Aufrufe zurück;
- zwölf Werkzeugaufrufe sind kein Qualitätsbeweis: Die Auswahl und Form der
Werkzeuge sind wichtiger als eine möglichst große Zahl.
## Empfehlung
Fast bleibt für normale Aufgaben geeignet. Für Änderungen, längere Recherche
oder mehrere Systeme gleichzeitig soll das automatische Mehrdomänen-Reasoning
greifen; bei besonders kritischer Arbeit kann Thinking manuell auf Hoch gesetzt
werden. Ergebnisse, die Installationen, Sicherheit, Geld oder Datenänderungen
betreffen, benötigen weiterhin Vorschau, Belegprüfung und Freigabe. Weitere
Verbesserungen sollten bevorzugt gebündelte Fachoperationen ergänzen und nicht
das globale Aufruflimit erhöhen.
## Versionierte Quellen
- Qwen3.8-27B Modellkarte: <https://huggingface.co/Qwen/Qwen3.8-27B>
- OpenWebUI native tool calling:
<https://github.com/open-webui/docs/blob/main/docs/features/extensibility/plugin/tools/index.mdx>
- llama.cpp Systemnachrichten-Randfall:
<https://github.com/ggml-org/llama.cpp/issues/27367>
- llama.cpp verschachtelte Schemas:
<https://github.com/ggml-org/llama.cpp/issues/21771>
- llama.cpp Streaming/Parallel-Toolcalls:
<https://github.com/ggml-org/llama.cpp/issues/18591>