# Qwen3.8-27B – agentischer Werkzeugtest vom 24. August 2026 ## Ergebnis in einem Satz Qwen3.8-27B ist auf Athena für längere agentische Aufgaben brauchbar, wenn die Werkzeugschicht ihm gebündelte Fachoperationen, erhaltenes Reasoning und eine garantierte Schlussrunde anbietet. Die früheren Ausfälle waren überwiegend Orchestrierungs- und MCP-Probleme, nicht ein grundsätzliches Unvermögen des Modells. ## Warum die Community-Erfahrungen besser wirkten Community-Demos verwenden meist einen spezialisierten Agent-Harness, große Kontexte, erhaltenes Reasoning und kompakte Werkzeuge. Athena kombinierte zuvor 76K Kontext, standardmäßig abgeschaltetes Thinking, sechs Einzelaufrufe, teilweise sehr kleinteilige MCP-Operationen und OpenWebUIs hartes Ende ohne Syntheserunde. Zusätzlich existieren aktuelle llama.cpp-Randfälle bei Qwen3.8-Systemnachrichten, verschachtelten Werkzeugschemata und gestreamten Parallelaufrufen. Die Differenz war daher kein fairer Modellvergleich. ## Produktive Änderungen - `--reasoning-preserve` in allen Qwen-Profilen. - Automatische Auswahl von bis zu drei Fach-MCPs. - Automatisch mittleres, auf 3.072 Token begrenztes Reasoning nur bei echten Mehrdomänen-Aufgaben; explizite Benutzereinstellungen werden nicht ersetzt. - Zwölf tatsächliche Aufrufe, höchstens vier pro Werkzeug, keine identische Signatur zweimal; 16 interne Runden lassen Raum für die Schlussantwort. - Genau ein zusätzlicher werkzeugloser Syntheseversuch, falls Qwen nach Ende der Recherche trotzdem noch einen Funktionsaufruf formuliert. - Home Assistant `find_commented_blocks`: vollständige auskommentierte Automationseinträge einschließlich ID, Alias und Zeilen in einem Aufruf. - MUA r017: gebündelte CA-Suche mit bis zu fünf Namensvarianten. - MUA r018: fokussierte Loganalyse mit mehreren `focus_terms` in einem Aufruf. - Evidenzplan im Systemprompt: zuerst ein breiter Aufruf je Domäne, danach nur gezielte Lücken schließen, Pflichtbedingungen früh prüfen und bei deren Scheitern sofort den Kandidaten wechseln. ## Browser-Benchmarks | Test | Vorher | Nachher | Bewertung | |---|---:|---:|---| | Auskommentierte HA-Automationen inventarisieren | 9 Aufrufe, 90,9 s | 1 Aufruf, 26,8 s | IDs, Aliase und Zeilen korrekt; sehr gut | | Deemix: GitHub + laufender Unraid-Container + MCP-Entwurf | zuvor 37 GitHub-Aufrufe und Abbruch | 7 Aufrufe, sichtbare Antwort | klare Verbesserung; einzelne Betriebsannahmen noch zu optimistisch | | Web + GitHub + Unraid: CA-Negativprüfung und Template-Entwurf | Kandidat zu spät verworfen, Budgetende | 11 Aufrufe, vollständiger Entwurf | Schlussantwort vorhanden; XML und Architektur müssen weiterhin fachlich geprüft werden | | Drei Domänen: HA-YAML + Unraid-Logs + GitHub-Quelle | vorher kein finaler Text am Budgetende | 12 Aufrufe, vollständige Evidenzmatrix | Finalizer v5 bestanden; Quellenverwechslung wurde transparent als Unsicherheit markiert | | Fokussierte Home-Assistant-Logprüfung | mehrere Shell-/grep-Aufrufe | 1 Inventar + 1 fokussierte Loganalyse, 44,7 s | MUA r018 korrekt gewählt; klare Beleggrenzen | ## Qualitätsbefund ### Stark - wählt nach der Anpassung die drei korrekten Fachdomänen automatisch; - beginnt parallel/breit und liefert belastbare Livewerte; - kann aus Werkzeugresultaten strukturierte Evidenzmatrizen und sichere Pläne bauen; - verschweigt verbleibende Unsicherheit überwiegend nicht; - die HA-Spezialoperation reduziert Laufzeit und Kontextverbrauch drastisch. ### Noch nicht auf Frontier-Agent-Niveau - bei ähnlichen GitHub-Repositories kann Qwen den falschen Treffer vertiefen, statt zuerst den exakten installierten Upstream zu bestimmen; - bei komplexen Containerstacks erzeugt es gelegentlich formal plausible, aber fachlich fragwürdige Unraid-XMLs; - ohne gebündelte Logoperation fällt es auf mehrere Shell-/grep-Aufrufe zurück; - zwölf Werkzeugaufrufe sind kein Qualitätsbeweis: Die Auswahl und Form der Werkzeuge sind wichtiger als eine möglichst große Zahl. ## Empfehlung Fast bleibt für normale Aufgaben geeignet. Für Änderungen, längere Recherche oder mehrere Systeme gleichzeitig soll das automatische Mehrdomänen-Reasoning greifen; bei besonders kritischer Arbeit kann Thinking manuell auf Hoch gesetzt werden. Ergebnisse, die Installationen, Sicherheit, Geld oder Datenänderungen betreffen, benötigen weiterhin Vorschau, Belegprüfung und Freigabe. Weitere Verbesserungen sollten bevorzugt gebündelte Fachoperationen ergänzen und nicht das globale Aufruflimit erhöhen. ## Versionierte Quellen - Qwen3.8-27B Modellkarte: - OpenWebUI native tool calling: - llama.cpp Systemnachrichten-Randfall: - llama.cpp verschachtelte Schemas: - llama.cpp Streaming/Parallel-Toolcalls: