Files
AI-Profile-Router/docs/QWEN38_AGENTIC_BENCHMARK_2026-08-24.md
T

5.0 KiB
Raw Blame History

Qwen3.8-27B – agentischer Werkzeugtest vom 24. August 2026

Ergebnis in einem Satz

Qwen3.8-27B ist auf Athena für längere agentische Aufgaben brauchbar, wenn die Werkzeugschicht ihm gebündelte Fachoperationen, erhaltenes Reasoning und eine garantierte Schlussrunde anbietet. Die früheren Ausfälle waren überwiegend Orchestrierungs- und MCP-Probleme, nicht ein grundsätzliches Unvermögen des Modells.

Warum die Community-Erfahrungen besser wirkten

Community-Demos verwenden meist einen spezialisierten Agent-Harness, große Kontexte, erhaltenes Reasoning und kompakte Werkzeuge. Athena kombinierte zuvor 76K Kontext, standardmäßig abgeschaltetes Thinking, sechs Einzelaufrufe, teilweise sehr kleinteilige MCP-Operationen und OpenWebUIs hartes Ende ohne Syntheserunde. Zusätzlich existieren aktuelle llama.cpp-Randfälle bei Qwen3.8-Systemnachrichten, verschachtelten Werkzeugschemata und gestreamten Parallelaufrufen. Die Differenz war daher kein fairer Modellvergleich.

Produktive Änderungen

  • --reasoning-preserve in allen Qwen-Profilen.
  • Automatische Auswahl von bis zu drei Fach-MCPs.
  • Automatisch mittleres, auf 3.072 Token begrenztes Reasoning nur bei echten Mehrdomänen-Aufgaben; explizite Benutzereinstellungen werden nicht ersetzt.
  • Zwölf tatsächliche Aufrufe, höchstens vier pro Werkzeug, keine identische Signatur zweimal; 16 interne Runden lassen Raum für die Schlussantwort.
  • Genau ein zusätzlicher werkzeugloser Syntheseversuch, falls Qwen nach Ende der Recherche trotzdem noch einen Funktionsaufruf formuliert.
  • Home Assistant find_commented_blocks: vollständige auskommentierte Automationseinträge einschließlich ID, Alias und Zeilen in einem Aufruf.
  • MUA r017: gebündelte CA-Suche mit bis zu fünf Namensvarianten.
  • MUA r018: fokussierte Loganalyse mit mehreren focus_terms in einem Aufruf.
  • Evidenzplan im Systemprompt: zuerst ein breiter Aufruf je Domäne, danach nur gezielte Lücken schließen, Pflichtbedingungen früh prüfen und bei deren Scheitern sofort den Kandidaten wechseln.

Browser-Benchmarks

Test Vorher Nachher Bewertung
Auskommentierte HA-Automationen inventarisieren 9 Aufrufe, 90,9 s 1 Aufruf, 26,8 s IDs, Aliase und Zeilen korrekt; sehr gut
Deemix: GitHub + laufender Unraid-Container + MCP-Entwurf zuvor 37 GitHub-Aufrufe und Abbruch 7 Aufrufe, sichtbare Antwort klare Verbesserung; einzelne Betriebsannahmen noch zu optimistisch
Web + GitHub + Unraid: CA-Negativprüfung und Template-Entwurf Kandidat zu spät verworfen, Budgetende 11 Aufrufe, vollständiger Entwurf Schlussantwort vorhanden; XML und Architektur müssen weiterhin fachlich geprüft werden
Drei Domänen: HA-YAML + Unraid-Logs + GitHub-Quelle vorher kein finaler Text am Budgetende 12 Aufrufe, vollständige Evidenzmatrix Finalizer v5 bestanden; Quellenverwechslung wurde transparent als Unsicherheit markiert
Fokussierte Home-Assistant-Logprüfung mehrere Shell-/grep-Aufrufe 1 Inventar + 1 fokussierte Loganalyse, 44,7 s MUA r018 korrekt gewählt; klare Beleggrenzen

Qualitätsbefund

Stark

  • wählt nach der Anpassung die drei korrekten Fachdomänen automatisch;
  • beginnt parallel/breit und liefert belastbare Livewerte;
  • kann aus Werkzeugresultaten strukturierte Evidenzmatrizen und sichere Pläne bauen;
  • verschweigt verbleibende Unsicherheit überwiegend nicht;
  • die HA-Spezialoperation reduziert Laufzeit und Kontextverbrauch drastisch.

Noch nicht auf Frontier-Agent-Niveau

  • bei ähnlichen GitHub-Repositories kann Qwen den falschen Treffer vertiefen, statt zuerst den exakten installierten Upstream zu bestimmen;
  • bei komplexen Containerstacks erzeugt es gelegentlich formal plausible, aber fachlich fragwürdige Unraid-XMLs;
  • ohne gebündelte Logoperation fällt es auf mehrere Shell-/grep-Aufrufe zurück;
  • zwölf Werkzeugaufrufe sind kein Qualitätsbeweis: Die Auswahl und Form der Werkzeuge sind wichtiger als eine möglichst große Zahl.

Empfehlung

Fast bleibt für normale Aufgaben geeignet. Für Änderungen, längere Recherche oder mehrere Systeme gleichzeitig soll das automatische Mehrdomänen-Reasoning greifen; bei besonders kritischer Arbeit kann Thinking manuell auf Hoch gesetzt werden. Ergebnisse, die Installationen, Sicherheit, Geld oder Datenänderungen betreffen, benötigen weiterhin Vorschau, Belegprüfung und Freigabe. Weitere Verbesserungen sollten bevorzugt gebündelte Fachoperationen ergänzen und nicht das globale Aufruflimit erhöhen.

Versionierte Quellen