feat: harden Qwen agentic tool orchestration
This commit is contained in:
@@ -0,0 +1,90 @@
|
||||
# Qwen3.8-27B – agentischer Werkzeugtest vom 24. August 2026
|
||||
|
||||
## Ergebnis in einem Satz
|
||||
|
||||
Qwen3.8-27B ist auf Athena für längere agentische Aufgaben brauchbar, wenn die
|
||||
Werkzeugschicht ihm gebündelte Fachoperationen, erhaltenes Reasoning und eine
|
||||
garantierte Schlussrunde anbietet. Die früheren Ausfälle waren überwiegend
|
||||
Orchestrierungs- und MCP-Probleme, nicht ein grundsätzliches Unvermögen des
|
||||
Modells.
|
||||
|
||||
## Warum die Community-Erfahrungen besser wirkten
|
||||
|
||||
Community-Demos verwenden meist einen spezialisierten Agent-Harness, große
|
||||
Kontexte, erhaltenes Reasoning und kompakte Werkzeuge. Athena kombinierte zuvor
|
||||
76K Kontext, standardmäßig abgeschaltetes Thinking, sechs Einzelaufrufe,
|
||||
teilweise sehr kleinteilige MCP-Operationen und OpenWebUIs hartes Ende ohne
|
||||
Syntheserunde. Zusätzlich existieren aktuelle llama.cpp-Randfälle bei
|
||||
Qwen3.8-Systemnachrichten, verschachtelten Werkzeugschemata und gestreamten
|
||||
Parallelaufrufen. Die Differenz war daher kein fairer Modellvergleich.
|
||||
|
||||
## Produktive Änderungen
|
||||
|
||||
- `--reasoning-preserve` in allen Qwen-Profilen.
|
||||
- Automatische Auswahl von bis zu drei Fach-MCPs.
|
||||
- Automatisch mittleres, auf 3.072 Token begrenztes Reasoning nur bei echten
|
||||
Mehrdomänen-Aufgaben; explizite Benutzereinstellungen werden nicht ersetzt.
|
||||
- Zwölf tatsächliche Aufrufe, höchstens vier pro Werkzeug, keine identische
|
||||
Signatur zweimal; 16 interne Runden lassen Raum für die Schlussantwort.
|
||||
- Genau ein zusätzlicher werkzeugloser Syntheseversuch, falls Qwen nach Ende
|
||||
der Recherche trotzdem noch einen Funktionsaufruf formuliert.
|
||||
- Home Assistant `find_commented_blocks`: vollständige auskommentierte
|
||||
Automationseinträge einschließlich ID, Alias und Zeilen in einem Aufruf.
|
||||
- MUA r017: gebündelte CA-Suche mit bis zu fünf Namensvarianten.
|
||||
- MUA r018: fokussierte Loganalyse mit mehreren `focus_terms` in einem Aufruf.
|
||||
- Evidenzplan im Systemprompt: zuerst ein breiter Aufruf je Domäne, danach nur
|
||||
gezielte Lücken schließen, Pflichtbedingungen früh prüfen und bei deren
|
||||
Scheitern sofort den Kandidaten wechseln.
|
||||
|
||||
## Browser-Benchmarks
|
||||
|
||||
| Test | Vorher | Nachher | Bewertung |
|
||||
|---|---:|---:|---|
|
||||
| Auskommentierte HA-Automationen inventarisieren | 9 Aufrufe, 90,9 s | 1 Aufruf, 26,8 s | IDs, Aliase und Zeilen korrekt; sehr gut |
|
||||
| Deemix: GitHub + laufender Unraid-Container + MCP-Entwurf | zuvor 37 GitHub-Aufrufe und Abbruch | 7 Aufrufe, sichtbare Antwort | klare Verbesserung; einzelne Betriebsannahmen noch zu optimistisch |
|
||||
| Web + GitHub + Unraid: CA-Negativprüfung und Template-Entwurf | Kandidat zu spät verworfen, Budgetende | 11 Aufrufe, vollständiger Entwurf | Schlussantwort vorhanden; XML und Architektur müssen weiterhin fachlich geprüft werden |
|
||||
| Drei Domänen: HA-YAML + Unraid-Logs + GitHub-Quelle | vorher kein finaler Text am Budgetende | 12 Aufrufe, vollständige Evidenzmatrix | Finalizer v5 bestanden; Quellenverwechslung wurde transparent als Unsicherheit markiert |
|
||||
| Fokussierte Home-Assistant-Logprüfung | mehrere Shell-/grep-Aufrufe | 1 Inventar + 1 fokussierte Loganalyse, 44,7 s | MUA r018 korrekt gewählt; klare Beleggrenzen |
|
||||
|
||||
## Qualitätsbefund
|
||||
|
||||
### Stark
|
||||
|
||||
- wählt nach der Anpassung die drei korrekten Fachdomänen automatisch;
|
||||
- beginnt parallel/breit und liefert belastbare Livewerte;
|
||||
- kann aus Werkzeugresultaten strukturierte Evidenzmatrizen und sichere Pläne
|
||||
bauen;
|
||||
- verschweigt verbleibende Unsicherheit überwiegend nicht;
|
||||
- die HA-Spezialoperation reduziert Laufzeit und Kontextverbrauch drastisch.
|
||||
|
||||
### Noch nicht auf Frontier-Agent-Niveau
|
||||
|
||||
- bei ähnlichen GitHub-Repositories kann Qwen den falschen Treffer vertiefen,
|
||||
statt zuerst den exakten installierten Upstream zu bestimmen;
|
||||
- bei komplexen Containerstacks erzeugt es gelegentlich formal plausible,
|
||||
aber fachlich fragwürdige Unraid-XMLs;
|
||||
- ohne gebündelte Logoperation fällt es auf mehrere Shell-/grep-Aufrufe zurück;
|
||||
- zwölf Werkzeugaufrufe sind kein Qualitätsbeweis: Die Auswahl und Form der
|
||||
Werkzeuge sind wichtiger als eine möglichst große Zahl.
|
||||
|
||||
## Empfehlung
|
||||
|
||||
Fast bleibt für normale Aufgaben geeignet. Für Änderungen, längere Recherche
|
||||
oder mehrere Systeme gleichzeitig soll das automatische Mehrdomänen-Reasoning
|
||||
greifen; bei besonders kritischer Arbeit kann Thinking manuell auf Hoch gesetzt
|
||||
werden. Ergebnisse, die Installationen, Sicherheit, Geld oder Datenänderungen
|
||||
betreffen, benötigen weiterhin Vorschau, Belegprüfung und Freigabe. Weitere
|
||||
Verbesserungen sollten bevorzugt gebündelte Fachoperationen ergänzen und nicht
|
||||
das globale Aufruflimit erhöhen.
|
||||
|
||||
## Versionierte Quellen
|
||||
|
||||
- Qwen3.8-27B Modellkarte: <https://huggingface.co/Qwen/Qwen3.8-27B>
|
||||
- OpenWebUI native tool calling:
|
||||
<https://github.com/open-webui/docs/blob/main/docs/features/extensibility/plugin/tools/index.mdx>
|
||||
- llama.cpp Systemnachrichten-Randfall:
|
||||
<https://github.com/ggml-org/llama.cpp/issues/27367>
|
||||
- llama.cpp verschachtelte Schemas:
|
||||
<https://github.com/ggml-org/llama.cpp/issues/21771>
|
||||
- llama.cpp Streaming/Parallel-Toolcalls:
|
||||
<https://github.com/ggml-org/llama.cpp/issues/18591>
|
||||
Reference in New Issue
Block a user