Use Qwen3-ASR as production speech recognizer
This commit is contained in:
@@ -32,13 +32,14 @@ nicht automatisch ein ungenutzter Rest.
|
||||
| `mike-ai-portainer` | kein Modell; Portainer CE | Optionale Docker-Verwaltungsoberfläche. |
|
||||
| `mike-ai-profile-controller` | kein Modell | Startet und stoppt ausschließlich freigegebene Modellprofile und Spezialworker in einer sicheren Reihenfolge. |
|
||||
| `mike-ai-qwen-cron-test` | kleines Qwen-Testmodell | Gestoppter CPU-/Cron-Worker-Versuch; nicht produktiv eingesetzt. |
|
||||
| `mike-ai-realtime-voice` | kein Modell | Laufende, gesunde WebRTC-Brücke für OpenClaw Talk; verbindet über den privaten WireGuard-Pfad Athena Whisper, OpenClaw-Agent und Qwen3-TTS ohne Profilwechsel. |
|
||||
| `mike-ai-realtime-voice` | kein Modell | Laufende, gesunde WebRTC-Brücke für OpenClaw Talk; verbindet über den privaten WireGuard-Pfad Athena Qwen3-ASR, OpenClaw-Agent und Qwen3-TTS ohne Profilwechsel. |
|
||||
| `mike-ai-qwen3-tts` | `Qwen/Qwen3-TTS-12Hz-1.7B-Base`, Stimme Serena | Hochwertige deutsche Sprachausgabe auf der RTX 3060 im LLM-Betrieb. |
|
||||
| `mike-ai-router` | kein eigenes Modell | Einzige OpenAI-kompatible Modelladresse; koordiniert Profile, Bildaufträge, Sprache und Betriebsarten. |
|
||||
| `mike-ai-stem-separator` | BS-RoFormer Viperx 1297, `htdemucs_ft`, `htdemucs_6s`, `MossFormer2_SE_48K` | Trennt Gesang, Instrumente oder Sprache/Hintergrundgeräusche im exklusiven Separationsmodus. |
|
||||
| `mike-ai-tts-gateway` | kein eigenes Modell | Normalisiert Text, konvertiert Ausgabeformate und stellt Qwen3-TTS sowie natives PCM-Streaming über eine stabile interne API bereit. |
|
||||
| `mike-ai-voice-studio` | `k2-fsa/OmniVoice` 0.2.1 mit Whisper-ASR | Erzeugt Text-to-Speech mit einer Referenzstimme; kein Audio-to-Audio-Voice-Changer. |
|
||||
| `mike-ai-whisper` | Whisper.cpp 1.9.4, `ggml-small` | Lokale deutsche Spracherkennung auf der CPU über `/v1/audio/transcriptions`. |
|
||||
| `mike-ai-qwen-asr` | Qwen3-ASR 0.6B Q8 | CPU-Inferenz für lokale deutsche Spracherkennung. |
|
||||
| `mike-ai-qwen-asr-worker` | kein eigenes Modell | Audio-Adapter für `/v1/audio/transcriptions`; `whisper-1` ist nur ein API-Kompatibilitätsname. |
|
||||
| `mike-ai-wireguard-gateway` | kein Modell | Veröffentlicht Dashboard und Fachoberflächen ausschließlich über den privaten WireGuard-Pfad. |
|
||||
| `mike-ai-xvc-studio` | `chenxie95/X-VC`, GLM-4-Voice-Tokenizer und optional Resemble Enhance | Wandelt eine vorhandene Sprachaufnahme anhand einer Referenzstimme in Audio zu Audio um; gibt das native 16-kHz-Ergebnis und optional eine neural restaurierte 44,1-kHz-Fassung aus. |
|
||||
| `mike-ai-yue2-playground` | Image `mike-ai/yue2:3b-0.1.6` | Vorhandener, gestoppter Playground; in diesem Abgleich nicht funktional getestet. |
|
||||
|
||||
@@ -1,5 +1,14 @@
|
||||
# Geprüfter Live-Stand auf Athena
|
||||
|
||||
Nachtrag vom 25. September 2026: Die produktive Spracherkennung läuft über
|
||||
Qwen3-ASR 0.6B Q8 auf der CPU (`mike-ai-qwen-asr` und
|
||||
`mike-ai-qwen-asr-worker`). Der Router bietet weiterhin `whisper-1` als
|
||||
Kompatibilitätsnamen und zusätzlich `qwen3-asr` an. Beide wurden mit einer
|
||||
M4A-Aufnahme über `/v1/audio/transcriptions` geprüft. Whisper-Container,
|
||||
Images und Modellvolume wurden entfernt. Das aktive Ultra-Profil wurde bei
|
||||
dieser Umstellung nicht gewechselt. Die Angaben zu Whisper weiter unten
|
||||
beschreiben den historischen Stand vom 21. September.
|
||||
|
||||
Nachtrag vom 24. September 2026: Ultra verarbeitet nun Bilder mit einem
|
||||
CPU-seitigen BF16-Vision-Projektor. Der Stand und der Funktionstest sind in
|
||||
[Ultra-Vision mit CPU-Projektor](ULTRA_CPU_VISION_20260924.md) dokumentiert.
|
||||
|
||||
+4
-2
@@ -24,8 +24,10 @@ gesichert. Für eine Neuinstallation ist der im Git dokumentierte Build mit
|
||||
installieren; eine Änderung an OpenClaw-Core-Dateien ist nicht erforderlich.
|
||||
|
||||
Piper-Daten sind kein aktueller Sicherungsbestand. Modellgewichte unter
|
||||
`/data/models` und das reproduzierbare Whisper-Volume gehören nicht zu diesen
|
||||
Backup-Mounts. Ein Backup ausschließlich auf `/data` schützt nicht vor deren Ausfall.
|
||||
`/data/models`, einschließlich Qwen3-ASR unter
|
||||
`/data/models/qwen3-asr-0.6b-q8`, gehören nicht zu diesen Backup-Mounts.
|
||||
Das frühere Whisper-Volume wurde am 25. September 2026 entfernt.
|
||||
Ein Backup ausschließlich auf `/data` schützt nicht vor einem Ausfall der Datenplatte.
|
||||
Das gilt auch für das reproduzierbare EmbeddingGemma-Gewicht unter
|
||||
`/data/models/embeddinggemma`; URL und SHA-256 stehen in
|
||||
`config/install.env.example`, sodass der Installer es erneut laden und prüfen kann.
|
||||
|
||||
Reference in New Issue
Block a user