91 lines
5.0 KiB
Markdown
91 lines
5.0 KiB
Markdown
# Qwen3.8-27B – agentischer Werkzeugtest vom 24. August 2026
|
||
|
||
## Ergebnis in einem Satz
|
||
|
||
Qwen3.8-27B ist auf Athena für längere agentische Aufgaben brauchbar, wenn die
|
||
Werkzeugschicht ihm gebündelte Fachoperationen, erhaltenes Reasoning und eine
|
||
garantierte Schlussrunde anbietet. Die früheren Ausfälle waren überwiegend
|
||
Orchestrierungs- und MCP-Probleme, nicht ein grundsätzliches Unvermögen des
|
||
Modells.
|
||
|
||
## Warum die Community-Erfahrungen besser wirkten
|
||
|
||
Community-Demos verwenden meist einen spezialisierten Agent-Harness, große
|
||
Kontexte, erhaltenes Reasoning und kompakte Werkzeuge. Athena kombinierte zuvor
|
||
76K Kontext, standardmäßig abgeschaltetes Thinking, sechs Einzelaufrufe,
|
||
teilweise sehr kleinteilige MCP-Operationen und OpenWebUIs hartes Ende ohne
|
||
Syntheserunde. Zusätzlich existieren aktuelle llama.cpp-Randfälle bei
|
||
Qwen3.8-Systemnachrichten, verschachtelten Werkzeugschemata und gestreamten
|
||
Parallelaufrufen. Die Differenz war daher kein fairer Modellvergleich.
|
||
|
||
## Produktive Änderungen
|
||
|
||
- `--reasoning-preserve` in allen Qwen-Profilen.
|
||
- Automatische Auswahl von bis zu drei Fach-MCPs.
|
||
- Automatisch mittleres, auf 3.072 Token begrenztes Reasoning nur bei echten
|
||
Mehrdomänen-Aufgaben; explizite Benutzereinstellungen werden nicht ersetzt.
|
||
- Zwölf tatsächliche Aufrufe, höchstens vier pro Werkzeug, keine identische
|
||
Signatur zweimal; 16 interne Runden lassen Raum für die Schlussantwort.
|
||
- Genau ein zusätzlicher werkzeugloser Syntheseversuch, falls Qwen nach Ende
|
||
der Recherche trotzdem noch einen Funktionsaufruf formuliert.
|
||
- Home Assistant `find_commented_blocks`: vollständige auskommentierte
|
||
Automationseinträge einschließlich ID, Alias und Zeilen in einem Aufruf.
|
||
- MUA r017: gebündelte CA-Suche mit bis zu fünf Namensvarianten.
|
||
- MUA r018: fokussierte Loganalyse mit mehreren `focus_terms` in einem Aufruf.
|
||
- Evidenzplan im Systemprompt: zuerst ein breiter Aufruf je Domäne, danach nur
|
||
gezielte Lücken schließen, Pflichtbedingungen früh prüfen und bei deren
|
||
Scheitern sofort den Kandidaten wechseln.
|
||
|
||
## Browser-Benchmarks
|
||
|
||
| Test | Vorher | Nachher | Bewertung |
|
||
|---|---:|---:|---|
|
||
| Auskommentierte HA-Automationen inventarisieren | 9 Aufrufe, 90,9 s | 1 Aufruf, 26,8 s | IDs, Aliase und Zeilen korrekt; sehr gut |
|
||
| Deemix: GitHub + laufender Unraid-Container + MCP-Entwurf | zuvor 37 GitHub-Aufrufe und Abbruch | 7 Aufrufe, sichtbare Antwort | klare Verbesserung; einzelne Betriebsannahmen noch zu optimistisch |
|
||
| Web + GitHub + Unraid: CA-Negativprüfung und Template-Entwurf | Kandidat zu spät verworfen, Budgetende | 11 Aufrufe, vollständiger Entwurf | Schlussantwort vorhanden; XML und Architektur müssen weiterhin fachlich geprüft werden |
|
||
| Drei Domänen: HA-YAML + Unraid-Logs + GitHub-Quelle | vorher kein finaler Text am Budgetende | 12 Aufrufe, vollständige Evidenzmatrix | Finalizer v5 bestanden; Quellenverwechslung wurde transparent als Unsicherheit markiert |
|
||
| Fokussierte Home-Assistant-Logprüfung | mehrere Shell-/grep-Aufrufe | 1 Inventar + 1 fokussierte Loganalyse, 44,7 s | MUA r018 korrekt gewählt; klare Beleggrenzen |
|
||
|
||
## Qualitätsbefund
|
||
|
||
### Stark
|
||
|
||
- wählt nach der Anpassung die drei korrekten Fachdomänen automatisch;
|
||
- beginnt parallel/breit und liefert belastbare Livewerte;
|
||
- kann aus Werkzeugresultaten strukturierte Evidenzmatrizen und sichere Pläne
|
||
bauen;
|
||
- verschweigt verbleibende Unsicherheit überwiegend nicht;
|
||
- die HA-Spezialoperation reduziert Laufzeit und Kontextverbrauch drastisch.
|
||
|
||
### Noch nicht auf Frontier-Agent-Niveau
|
||
|
||
- bei ähnlichen GitHub-Repositories kann Qwen den falschen Treffer vertiefen,
|
||
statt zuerst den exakten installierten Upstream zu bestimmen;
|
||
- bei komplexen Containerstacks erzeugt es gelegentlich formal plausible,
|
||
aber fachlich fragwürdige Unraid-XMLs;
|
||
- ohne gebündelte Logoperation fällt es auf mehrere Shell-/grep-Aufrufe zurück;
|
||
- zwölf Werkzeugaufrufe sind kein Qualitätsbeweis: Die Auswahl und Form der
|
||
Werkzeuge sind wichtiger als eine möglichst große Zahl.
|
||
|
||
## Empfehlung
|
||
|
||
Fast bleibt für normale Aufgaben geeignet. Für Änderungen, längere Recherche
|
||
oder mehrere Systeme gleichzeitig soll das automatische Mehrdomänen-Reasoning
|
||
greifen; bei besonders kritischer Arbeit kann Thinking manuell auf Hoch gesetzt
|
||
werden. Ergebnisse, die Installationen, Sicherheit, Geld oder Datenänderungen
|
||
betreffen, benötigen weiterhin Vorschau, Belegprüfung und Freigabe. Weitere
|
||
Verbesserungen sollten bevorzugt gebündelte Fachoperationen ergänzen und nicht
|
||
das globale Aufruflimit erhöhen.
|
||
|
||
## Versionierte Quellen
|
||
|
||
- Qwen3.8-27B Modellkarte: <https://huggingface.co/Qwen/Qwen3.8-27B>
|
||
- OpenWebUI native tool calling:
|
||
<https://github.com/open-webui/docs/blob/main/docs/features/extensibility/plugin/tools/index.mdx>
|
||
- llama.cpp Systemnachrichten-Randfall:
|
||
<https://github.com/ggml-org/llama.cpp/issues/27367>
|
||
- llama.cpp verschachtelte Schemas:
|
||
<https://github.com/ggml-org/llama.cpp/issues/21771>
|
||
- llama.cpp Streaming/Parallel-Toolcalls:
|
||
<https://github.com/ggml-org/llama.cpp/issues/18591>
|