Synchronize repository with Athena deployment
This commit is contained in:
@@ -0,0 +1,151 @@
|
||||
# FLUX.2 Klein 9B FP8 Beta auf Athena
|
||||
|
||||
Stand: 7. September 2026
|
||||
|
||||
## Zweck und Status
|
||||
|
||||
Der Bildpfad ersetzt testweise FLUX.2 Klein 4B durch das größere
|
||||
FLUX.2-Klein-9B-Modell. Ziel sind bessere Prompttreue, räumliche Beziehungen,
|
||||
Objektkonsistenz und Referenzbild-Bearbeitung. Der Pfad ist technisch
|
||||
funktionsfähig, bleibt aber bis zu weiteren Qualitäts- und Editing-Tests als
|
||||
Beta bezeichnet.
|
||||
|
||||
Der OpenAI-kompatible Modellname lautet:
|
||||
|
||||
```text
|
||||
FLUX.2-klein-9B-fp8-beta
|
||||
```
|
||||
|
||||
## Modellartefakte und Lizenz
|
||||
|
||||
Verwendet werden zwei gepinnte, zugriffsbeschränkte Hugging-Face-Repositories:
|
||||
|
||||
| Zweck | Repository | Revision | Lokaler Pfad |
|
||||
|---|---|---|---|
|
||||
| Pipeline-Komponenten, Qwen3-Textencoder und VAE | `black-forest-labs/FLUX.2-klein-9B` | `92196c8e11f7b6cf2b7493e037d8c5345c559216` | `/data/models/FLUX.2-klein-9B-components` |
|
||||
| FP8-Transformer | `black-forest-labs/FLUX.2-klein-9b-fp8` | `902d9d510b51533e07729f19211414a3648b77d2` | `/data/models/FLUX.2-klein-9B-fp8` |
|
||||
|
||||
FLUX.2 Klein 9B steht unter der FLUX Non-Commercial License. Vor dem Download
|
||||
müssen die Bedingungen beider Repositories im verwendeten Hugging-Face-Konto
|
||||
akzeptiert werden. Ein Token gehört ausschließlich in die durch
|
||||
`HF_TOKEN_FILE` angegebene, für root lesbare Datei; niemals in Git oder
|
||||
`stack.env`.
|
||||
|
||||
## GPU-Aufteilung
|
||||
|
||||
| Phase | RTX 5080, 16 GB | RTX 3060, 12 GB |
|
||||
|---|---|---|
|
||||
| Text-/Sprachbetrieb | aktives Qwen3.8-27B-Profil | Qwen3-TTS; Vision je nach Profil |
|
||||
| Prompt-Encoding | FLUX-Transformer und VAE | Qwen3-8B-Textencoder, NF4 |
|
||||
| Denoising | FLUX-Transformer | Textencoder wird nicht mehr benötigt |
|
||||
| VAE-Decoding | VAE; Transformer zuvor freigegeben | Textencoder zuvor freigegeben |
|
||||
|
||||
Der Profile Controller stoppt vor dem Start des Bild-Workers alle
|
||||
llama.cpp-Profile und den mit `com.mike-ai.tts-worker=qwen3` markierten
|
||||
Qwen3-TTS-Container. Dadurch bleibt genügend VRAM für beide Bildkomponenten.
|
||||
Nach dem Bildauftrag startet er Qwen3-TTS und das zuvor aktive Textprofil
|
||||
wieder. Während des exklusiven GPU-Wechsels ist TTS vorübergehend nicht verfügbar.
|
||||
|
||||
## Aktuelle Grenzen
|
||||
|
||||
- genau 1024 × 1024 Pixel
|
||||
- genau vier Inferenzschritte
|
||||
- Guidance Scale 1,0
|
||||
- ein Bildauftrag gleichzeitig
|
||||
- höchstens vier bereits lokal gespeicherte Referenzbilder
|
||||
- Textencoder-Maximum 128 Token
|
||||
- Bildbearbeitung wird vom Worker angenommen, ist aber noch gesondert
|
||||
Ende-zu-Ende zu qualifizieren
|
||||
|
||||
## Installation und Aktualisierung
|
||||
|
||||
In `/root/mike-ai-install.env` müssen diese Werte gesetzt sein:
|
||||
|
||||
```bash
|
||||
HF_TOKEN_FILE=/root/.cache/huggingface/token
|
||||
FLUX_COMPONENT_DIR=/data/models/FLUX.2-klein-9B-components
|
||||
FLUX_TRANSFORMER_DIR=/data/models/FLUX.2-klein-9B-fp8
|
||||
```
|
||||
|
||||
Anschließend lädt der normale Installer nur die benötigten Komponenten und die
|
||||
gepinnten FP8-Gewichte. Bestehende, vollständige Dateien werden nicht erneut
|
||||
geladen:
|
||||
|
||||
```bash
|
||||
cd /opt/mike-ai/stack
|
||||
sudo ./install.sh --config /root/mike-ai-install.env
|
||||
```
|
||||
|
||||
## Funktionsprobe
|
||||
|
||||
Der Router ist nur über das private Netz erreichbar. Ein minimaler Test lautet:
|
||||
|
||||
```bash
|
||||
curl -fsS http://192.168.1.212:8081/v1/images/generations \
|
||||
-H "Authorization: Bearer $ROUTER_API_KEY" \
|
||||
-H 'Content-Type: application/json' \
|
||||
-d '{
|
||||
"model":"FLUX.2-klein-9B-fp8-beta",
|
||||
"prompt":"A yellow toy excavator on the left and a red toy truck on the right, studio photo",
|
||||
"size":"1024x1024",
|
||||
"steps":4,
|
||||
"guidance":1.0,
|
||||
"seed":9072026
|
||||
}'
|
||||
```
|
||||
|
||||
Danach müssen folgende Zustände wiederhergestellt sein:
|
||||
|
||||
```bash
|
||||
docker ps --format '{{.Names}} {{.Status}}' \
|
||||
--filter name=mike-ai-router \
|
||||
--filter name=mike-ai-qwen3-tts \
|
||||
--filter name=mike-ai-llama
|
||||
docker ps -a --filter name=mike-ai-image-worker \
|
||||
--format '{{.Names}} {{.Status}}'
|
||||
nvidia-smi
|
||||
```
|
||||
|
||||
Erwartet werden ein gesunder Router, gesundes Qwen3-TTS, genau ein gesundes
|
||||
llama.cpp-Profil und ein mit Exit-Code 0 beendeter Bild-Worker.
|
||||
|
||||
## Hermes
|
||||
|
||||
Hermes auf Unraid verwendet einen persistenten Benutzer-Provider
|
||||
`athena-local`. Seine Konfiguration muss auf denselben Modellnamen zeigen:
|
||||
|
||||
```yaml
|
||||
image_gen:
|
||||
provider: athena-local
|
||||
model: FLUX.2-klein-9B-fp8-beta
|
||||
max_parallel_requests: 1
|
||||
```
|
||||
|
||||
Der Provider lebt in Hermes-Appdata und bleibt bei normalen Container-Updates
|
||||
erhalten. Er gehört nicht in die Desktop-App und muss auf weiteren Clients
|
||||
nicht erneut installiert werden. Die versionierte Quellfassung liegt unter
|
||||
[`integrations/hermes-athena-image`](../integrations/hermes-athena-image).
|
||||
|
||||
## Rollback
|
||||
|
||||
Die lokalen 4B-Gewichte und die kurzfristigen Rückfall-Images wurden am
|
||||
8. September 2026 nach erfolgreicher 9B-Abnahme gezielt entfernt. Ein Rollback
|
||||
auf 4B ist deshalb weiterhin reproduzierbar, aber nicht mehr unmittelbar: Das
|
||||
4B-Modell muss erneut geladen und die ältere Stack-Fassung neu gebaut werden.
|
||||
|
||||
Die zugehörige Deployment-Sicherung liegt auf Athena unter:
|
||||
|
||||
```text
|
||||
/data/deploy-backups/20260907-flux9b-beta
|
||||
```
|
||||
|
||||
Die vorherige Hermes-Konfiguration und der alte Provider liegen auf Unraid
|
||||
unter:
|
||||
|
||||
```text
|
||||
/mnt/nvme-storage/appdata/Hermes-Agent/backups/flux9b-beta-20260907
|
||||
```
|
||||
|
||||
Ein Rollback darf nicht blind erfolgen: Zuerst aktives Profil, laufende
|
||||
Anfragen und vorhandene Image-Tags prüfen, dann nur Image-Worker,
|
||||
Profile Controller und Hermes-Provider auf den gesicherten Stand zurücksetzen.
|
||||
@@ -1,19 +1,24 @@
|
||||
# Qwen Beta 1 – GSQ-RCO
|
||||
|
||||
`qwen-beta-1` ist ein zusätzliches, nicht standardmäßig aktives Router-Profil.
|
||||
Die bestehenden Profile und das Standardprofil `qwen-medium` bleiben unverändert.
|
||||
> Historischer Testbericht. Das Beta-1-Profil wurde am 10. September 2026
|
||||
> vollständig aus dem produktiven Router entfernt, weil die kleinere
|
||||
> Quantisierung gegenüber den Q4-Profilen keinen belastbaren Vorteil brachte.
|
||||
|
||||
`qwen-beta-1` war ein zusätzliches, nicht standardmäßig aktives Router-Profil.
|
||||
Der Bericht bleibt erhalten, damit diese Quantisierung nicht versehentlich
|
||||
erneut getestet wird.
|
||||
|
||||
## Laufzeitkonfiguration
|
||||
|
||||
- Modell: Qwen3.8-27B GSQ-RCO IQ3_XXS MTP
|
||||
- Kontext: 192.000 Token
|
||||
- Modell: Qwen3.8-27B GSQ-RCO IQ3_S MTP
|
||||
- Kontext: 112.000 Token als konservativer Startwert
|
||||
- Textmodell und KV-Cache: vollständig RTX 5080
|
||||
- Vision-Projektor: RTX 3060
|
||||
- KV-Quantisierung: Q4_0 für K und V
|
||||
- MTP: 3 Draft-Token
|
||||
- Batch / Micro-Batch: 2048 / 128
|
||||
|
||||
## Gemessene Kontextgrenze
|
||||
## Vorherige IQ3_XXS-Kontextgrenze
|
||||
|
||||
Eine echte Bildanfrage mit einer 2,3-MB-JPEG-Datei wurde zur Bestimmung der
|
||||
VRAM-Grenze verwendet.
|
||||
@@ -24,9 +29,120 @@ VRAM-Grenze verwendet.
|
||||
| 196.608 | bestanden, harte Kante | ca. 9 MiB |
|
||||
| 197.120 | CUDA Out of Memory | ca. 1 MiB vor Abbruch |
|
||||
|
||||
Der produktive Beta-Modus verwendet deshalb 192.000 Token. 196.608 ist nur
|
||||
die gemessene technische Obergrenze und besitzt keine ausreichende Reserve
|
||||
für einen verlässlichen Dauerbetrieb.
|
||||
Diese Werte gelten ausschließlich für die frühere, kleinere
|
||||
`IQ3_XXS-MTP`-Datei. Sie dürfen nicht als Grenze der größeren
|
||||
`IQ3_S-MTP`-Datei interpretiert werden. Das neue Profil startet bei 112.000
|
||||
Token; seine technische und betrieblich sichere Grenze wird neu vermessen.
|
||||
|
||||
Beim erfolgreichen 196.608-Test erreichte die Bildanfrage rund 366 Prompt-
|
||||
Token/s und 85 Ausgabe-Token/s. Das erkannte Bild wurde korrekt beschrieben.
|
||||
|
||||
## Austausch am 08.09.2026
|
||||
|
||||
Die bisherige `IQ3_XXS-MTP`-Datei wurde durch `IQ3_S-MTP` ersetzt. ISTA
|
||||
berichtet für die 3,5-bpw-Variante gegenüber BF16 identische Ergebnisse auf
|
||||
AIME25 und LiveCodeBench v6 sowie 0,51 Punkte Abstand auf GPQA-Diamond. Diese
|
||||
Herstellermessungen rechtfertigen den A/B-Test, ersetzen aber keine lokale
|
||||
Prüfung mit Hermes-, Werkzeug- und Langkontextaufgaben.
|
||||
|
||||
## Lokaler A/B-Test am 08.09.2026
|
||||
|
||||
Beide Dateien liefen mit 112.000 Kontext, Q4_0-K/V-Cache, MTP 3, identischem
|
||||
Sampling und einem 85:15-Layer-Split über RTX 5080 und RTX 3060.
|
||||
|
||||
| Messung | IQ4_XS Pure | GSQ-RCO IQ3_S MTP |
|
||||
|---|---:|---:|
|
||||
| deterministische Kurzaufgaben | 24/25 | 24/25 |
|
||||
| Decode, 512 Token | 65,6 Token/s | 59,3 Token/s |
|
||||
| Prefill, 30 Token | 184,5 Token/s | 251,6 Token/s |
|
||||
|
||||
Beide Modelle machten denselben einzelnen Fehler bei `2^100 modulo 13`. Im
|
||||
lokalen Kurztest war damit kein Qualitätsverlust der neuen Quantisierung
|
||||
messbar. Der kurze Prefill-Wert ist nur ein Laufzeitindikator und kein
|
||||
Langkontext-Benchmark.
|
||||
|
||||
In der produktiven Beta-1-Verteilung liegt das komplette Textmodell auf der
|
||||
RTX 5080 und nur der Vision-Projektor auf der RTX 3060. Dort wurden 89,9
|
||||
Token/s Decode gemessen; nach dem Lauf blieben etwa 1.051 MiB auf der RTX 5080
|
||||
frei. Ein realer Bildtest beschrieb Motiv und sichtbaren Text korrekt. Das
|
||||
Profil war anschließend gesund. Die frühere IQ3_XXS-GGUF wurde erst nach diesen
|
||||
Prüfungen entfernt; die JSON-Ergebnisse liegen auf Athena unter
|
||||
`/data/model-benchmarks/gsq-rco-iq3s-ab-20260908/`.
|
||||
|
||||
## Profilweiter A/B-Härtetest am 08.09.2026
|
||||
|
||||
Ein zweiter Test verglich GSQ-RCO IQ3_S mit den jeweils heute verwendeten
|
||||
Q4-Modellen unter den echten Kontext-, GPU-, MTP- und Batch-Einstellungen der
|
||||
Profile. Medium und Large luden dabei auch den Vision-Projektor auf der RTX
|
||||
3060; der dort bereits laufende TTS-Dienst blieb unangetastet. Alle acht
|
||||
Varianten fanden drei synthetische Nadeln bei 70 Prozent des jeweiligen
|
||||
Kontextfensters.
|
||||
|
||||
| Profil | Q4 kurzer Prefill | IQ3_S kurzer Prefill | Delta | Q4 Decode | IQ3_S Decode | Delta | Q4 Lang-Prefill | IQ3_S Lang-Prefill | Delta | Q4 Lang-Decode | IQ3_S Lang-Decode | Delta |
|
||||
|---|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:|
|
||||
| Fast 76,8K | 938,2 | 860,5 | -8,3 % | 115,3 | 109,2 | -5,2 % | 816,7 | 757,4 | -7,3 % | 74,7 | 76,4 | +2,3 % |
|
||||
| Medium 160K | 1.449,7 | 1.342,3 | -7,4 % | 104,0 | 86,9 | -16,5 % | 948,3 | 897,3 | -5,4 % | 56,3 | 48,9 | -13,1 % |
|
||||
| Large 192K | 1.456,5 | 1.342,6 | -7,8 % | 104,3 | 86,9 | -16,7 % | 849,5 | 808,9 | -4,8 % | 52,2 | 45,5 | -12,8 % |
|
||||
| Ultra 262K | 1.728,3 | 1.288,2 | -25,5 % | 83,8 | 73,5 | -12,3 % | 808,2 | 677,8 | -16,1 % | 33,3 | 32,0 | -4,0 % |
|
||||
|
||||
Alle Geschwindigkeiten sind Token/s. `Fast` vergleicht das produktive
|
||||
IQ4-MIX mit IQ3_S; die übrigen Profile vergleichen IQ4_XS Pure mit IQ3_S.
|
||||
Die langen Prompts enthielten rund 53,8K, 112K, 134,5K beziehungsweise 183,6K
|
||||
synthetische Token.
|
||||
|
||||
Der komplexere Qualitätstest bestand aus neun deutschsprachigen Aufgaben zu
|
||||
Logik, evidenzgebundener Diagnose, nebenläufigem Python, Kapazitätsplanung,
|
||||
Prompt-Injection, Laufzeit- gegenüber Konfigurationszustand und sicherem
|
||||
Adminverhalten sowie einem nativen Tool-Call. Acht Aufgaben waren inhaltlich
|
||||
gleichwertig; beide Modelle hatten beim nebenläufigen Python-Code denselben
|
||||
subtilen Restfehler. Bei der Kapazitätsplanung ermittelten beide intern korrekt,
|
||||
dass die Migration unmöglich ist. Beide erreichten jedoch das 4K-Ausgabelimit:
|
||||
Q4 gab die Schlussfolgerung und fast den ganzen Beweis sichtbar aus, IQ3_S
|
||||
verbrauchte das Limit vollständig im Reasoning und lieferte keinen sichtbaren
|
||||
Antworttext. Beide nativen Tool-Calls waren korrekt.
|
||||
|
||||
Über alle neun Aufgaben benötigte Q4 223,0 Sekunden und IQ3_S 278,9 Sekunden;
|
||||
IQ3_S war damit 25,0 Prozent länger beschäftigt. Zusammen mit der überwiegend
|
||||
niedrigeren Inferenzgeschwindigkeit ist kein profilweiter Vorteil belegt.
|
||||
|
||||
Entscheidung: Die produktiven Q4-Profile werden nicht durch IQ3_S ersetzt und
|
||||
es werden keine vollständigen Q3-Doppelprofile angelegt. `beta1` bleibt als
|
||||
gezielter 112K-Versuch erhalten: Dort passt das gesamte Textmodell auf die RTX
|
||||
5080, während der Projektor auf der RTX 3060 liegt. Dieser besondere
|
||||
Platzierungsvorteil gilt nicht automatisch für die größeren Profile.
|
||||
|
||||
Die vollständigen JSON-Ergebnisse liegen auf Athena unter
|
||||
`/data/model-benchmarks/gsq-rco-iq3s-ab-v2-20260908/`.
|
||||
|
||||
## Nachtest mit maximaler RTX-5080-Belegung am 08.09.2026
|
||||
|
||||
Der vorige Vergleich übernahm absichtlich die produktiven Q4-Tensor-Splits.
|
||||
Dadurch nutzte IQ3_S seinen geringeren Platzbedarf nicht aus. In einem weiteren
|
||||
reinen Geschwindigkeitstest wurde deshalb pro Profil der größtmögliche unter
|
||||
echter Last stabile Anteil auf der RTX 5080 gesucht. TTS blieb auf der RTX 3060
|
||||
geladen. Ein Split galt erst dann als stabil, wenn Modellstart, kurzer Test und
|
||||
ein Prompt mit rund 70 Prozent des Kontextfensters vollständig durchliefen.
|
||||
|
||||
| Profil | stabiler IQ3_S-Split 5080:3060 | kurzer Prefill vs. Q4 | Decode vs. Q4 | Lang-Prefill vs. Q4 | Lang-Decode vs. Q4 |
|
||||
|---|---:|---:|---:|---:|---:|
|
||||
| Medium 160K | 96:4 | +1,1 % | -8,2 % | +2,9 % | -2,8 % |
|
||||
| Large 192K | 96:4 | +0,8 % | -8,3 % | +1,9 % | -2,1 % |
|
||||
| Ultra 262K | 88:12 | -20,1 % | -4,5 % | -12,4 % | +3,2 % |
|
||||
|
||||
Medium lief mit 96:4 stabil. 98:2 ließ sich zwar laden, stürzte jedoch beim
|
||||
ersten langen Prompt ab; 99:1 scheiterte bereits beim Laden. Large lief mit
|
||||
96:4 stabil, während 97:3 beim Laden des MTP-KV-Caches keinen ausreichenden
|
||||
VRAM mehr hatte. Ultra lief mit 88:12 stabil. 92:8 und 90:10 ließen sich laden,
|
||||
stürzten aber beim langen Prompt ab; 94:6 scheiterte bereits an den benötigten
|
||||
Compute-Puffern. Die scheinbar nicht streng monotone Belegung entsteht durch
|
||||
die diskrete Verteilung ganzer Tensoren beziehungsweise Layer und zusätzliche
|
||||
KV-, MTP- und Compute-Puffer.
|
||||
|
||||
Alle drei stabilen Grenzläufe fanden erneut sämtliche drei Nadeln. Das stärkere
|
||||
Ausreizen der RTX 5080 macht IQ3_S bei Medium und Large im Prefill knapp
|
||||
schneller, beseitigt den Decode-Nachteil aber nicht. Bei Ultra steht einem
|
||||
kleinen Vorteil von 3,2 Prozent im langen Decode ein deutlicher
|
||||
Prompt-Verarbeitungsverlust gegenüber. Auch nach optimaler Platzierung ergibt
|
||||
sich daher kein Geschwindigkeitsgrund, die produktiven Q4-Profile zu ersetzen.
|
||||
Die optimierten JSON-Ergebnisse liegen im selben Benchmark-Verzeichnis und
|
||||
tragen das Suffix `opt96-4` beziehungsweise `opt88-12`.
|
||||
|
||||
@@ -0,0 +1,122 @@
|
||||
# Athena-Betriebsmodi
|
||||
|
||||
Athena besitzt sechs gegenseitig exklusive Betriebsmodi:
|
||||
|
||||
- `llm`: ein llama.cpp-Profil und Qwen3-TTS laufen; Spezialdienste sind gestoppt.
|
||||
- `music`: ACE-Step 1.5 XL-SFT läuft; alle LLM-, Bild-, TTS- und Separator-Worker sind gestoppt.
|
||||
- `separation`: BS-RoFormer und Demucs trennen Musikspuren; ClearVoice trennt
|
||||
Sprache von Hintergrundgeräuschen. LLM, Bild, TTS und ACE-Step sind gestoppt.
|
||||
- `voice`: OmniVoice erzeugt Sprache aus Text mit einer gewählten
|
||||
Referenzstimme. LLM, Bild, TTS, ACE-Step und Separator sind gestoppt.
|
||||
- `voicechange`: X-VC überträgt eine vorhandene Sprachaufnahme auf eine
|
||||
Referenzstimme und bewahrt dabei Inhalt und Timing. Alle anderen
|
||||
GPU-Dienste sind gestoppt.
|
||||
- `applio`: Applio stellt RVC-Inferenz, Modellverwaltung und Training bereit.
|
||||
Alle anderen GPU-Dienste sind gestoppt.
|
||||
|
||||
Die Zustandsmaschine lebt im Athena-Router. Das Dashboard und Chat-Clients wie
|
||||
Hermes sind nur Bedienoberflächen derselben API. Der zuletzt aktive LLM-Modus
|
||||
wird persistent gespeichert und beim Verlassen eines Spezialmodus wieder geladen.
|
||||
|
||||
## Bedienung
|
||||
|
||||
Im Athena-Dashboard stehen **LLM-Betrieb**, **Musikstudio**, **Audio trennen**,
|
||||
**Voice Studio**, **X-VC** und **Applio / RVC** bereit. Im Musikmodus werden zwei Oberflächen angeboten:
|
||||
|
||||
- **Original UI · stabil** öffnet die zum laufenden ACE-Step-Image gehörende
|
||||
Gradio-Oberfläche. Sie ist für Cover, Remix und erweiterte Workflows der
|
||||
verbindliche Produktionspfad.
|
||||
- **Community UI · experimentell** öffnet `fspecii/ace-step-ui`. Die
|
||||
CPU-leichte React/Express-Anwendung hält Bibliothek, Playlists und
|
||||
Einstellungen in `/data/music/ace-step-ui`. Ein noch nicht übernommener
|
||||
Upstream-Kompatibilitätsfix für die aktuelle 72-Felder-Gradio-API ist lokal
|
||||
zurückportiert; normale Generierung funktioniert, Cover und Remix gelten bis
|
||||
zu eigenen Ende-zu-Ende-Tests weiterhin als experimentell.
|
||||
|
||||
Die Community-Oberfläche ist im WireGuard-Netz unter
|
||||
`http://192.168.1.212:7861`, die originale Gradio-Oberfläche unter
|
||||
`http://192.168.1.212:7862` erreichbar. Beide Host-Ports bleiben zusätzlich
|
||||
auf `127.0.0.1` gebunden und werden auf der Universitäts-Schnittstelle nicht
|
||||
veröffentlicht. `ace-step-ui` ist reproduzierbar auf Commit
|
||||
`a1fdf91829ec6f7b98844f80e323529cd155dbf2` fixiert und greift intern über das
|
||||
Docker-Netz `mike-ai-music` auf `http://music-worker:7860` zu.
|
||||
|
||||
Im Trennmodus öffnet das Dashboard die private Athena-Oberfläche unter
|
||||
`http://192.168.1.212:8007`. Sie nimmt WAV, FLAC, MP3, M4A und weitere
|
||||
übliche Formate an. Gewählt wird die herauszulösende Quelle: Gesang,
|
||||
Schlagzeug, Bass, Gitarre, Piano, Sonstiges oder gereinigte Sprache. Das ZIP enthält genau diese Zielspur und
|
||||
eine zweite FLAC-Datei mit dem vollständigen Rest ohne die Zielspur. Gesang
|
||||
nutzt BS-RoFormer Viperx 1297, Schlagzeug/Bass `htdemucs_ft` und
|
||||
Gitarre/Piano/Sonstiges experimentell `htdemucs_6s`. „Sonstiges“ ist dessen
|
||||
gemischter `other`-Stem (unter anderem Synthesizer, Streicher, Bläser und Effekte),
|
||||
nicht eine reine Synthesizer-Spur. Sprache nutzt das 48-kHz-Modell
|
||||
`MossFormer2_SE_48K`; der Download enthält `speech.flac` und
|
||||
`hintergrund-ohne-sprache.flac`. Die Musiktrennung basiert auf
|
||||
`audio-separator` 0.47.0. Die ältere API-Auswahl kompletter 2-/4-/6-Stem-Sätze
|
||||
bleibt rückwärtskompatibel.
|
||||
|
||||
Das Voice Studio ist ausschließlich über den privaten WireGuard-Pfad unter
|
||||
`http://192.168.1.212:8008` erreichbar. Referenzstimmen werden unter
|
||||
`/data/voice/studio/profiles` gespeichert. Die Oberfläche verlangt vor dem
|
||||
Speichern eine Bestätigung der Nutzungsberechtigung. OmniVoice gibt
|
||||
unkomprimiertes WAV aus und erzeugt Sprache aus Text; es verarbeitet keine
|
||||
bereits eingesprochene Quellaufnahme.
|
||||
|
||||
Der X-VC Voice Changer ist ausschließlich unter
|
||||
`http://192.168.1.212:8009` erreichbar. Er nimmt eine Quellaufnahme und eine
|
||||
Referenzstimme an. Die Oberfläche behält immer das native 16-kHz-PCM-WAV und
|
||||
erzeugt auf Wunsch zusätzlich mit Resemble Enhance eine neural restaurierte
|
||||
44,1-kHz-Fassung. Diese zweite Datei rekonstruiert fehlende Sprachbandbreite;
|
||||
sie stellt keine im 16-kHz-Signal tatsächlich erhaltenen Originaldetails wieder
|
||||
her und bleibt deshalb direkt mit dem nativen Ergebnis vergleichbar. Die dokumentierte Sprachbasis
|
||||
des verwendeten GLM-4-Voice-Tokenizers ist Chinesisch und Englisch; Deutsch
|
||||
bleibt deshalb bis zur Hörabnahme ein Qualitätstest und kein zugesagter
|
||||
Produktionspfad. X-VC läuft ausschließlich auf der RTX 5080.
|
||||
|
||||
Applio ist unter `http://192.168.1.212:8011` erreichbar. Der RVC-Pfad besitzt
|
||||
eine eigene Modellbibliothek, Inferenz und Training. Hochwertige Inferenz
|
||||
benötigt zwingend ein zuvor importiertes oder trainiertes RVC-Stimmenmodell
|
||||
(`.pth`, optional `.index`). Eine bloße Referenzaufnahme genügt bei Applio
|
||||
nicht. Der Code ist auf Commit
|
||||
`7fa68ec2166ab1331c539704159fa14901e94e5a` fixiert.
|
||||
|
||||
Hermes benötigt dafür kein Plugin. Exakt eingegebene Steuerbefehle werden vom
|
||||
Router lokal beantwortet, auch wenn gerade kein LLM geladen ist:
|
||||
|
||||
```text
|
||||
/athena music
|
||||
/athena stems
|
||||
/athena voice
|
||||
/athena voicechange
|
||||
/athena applio
|
||||
/athena llm
|
||||
/athena status
|
||||
```
|
||||
|
||||
Die HTTP-Schnittstelle verwendet authentifizierte Requests:
|
||||
|
||||
```text
|
||||
GET /mode
|
||||
POST /mode {"mode":"music"}
|
||||
POST /mode {"mode":"separation"}
|
||||
POST /mode {"mode":"voice"}
|
||||
POST /mode {"mode":"voicechange"}
|
||||
POST /mode {"mode":"applio"}
|
||||
POST /mode {"mode":"llm"}
|
||||
```
|
||||
|
||||
Der Wechsel läuft asynchron. Fortschritt und Fehler stehen unter `mode` in
|
||||
`GET /status`. Der Profile-Controller akzeptiert ausschließlich den mit
|
||||
`com.mike-ai.music-worker=acestep` beziehungsweise
|
||||
`com.mike-ai.stem-separator=bs-roformer` oder
|
||||
`com.mike-ai.voice-worker=vevo2` beziehungsweise
|
||||
`com.mike-ai.voice-change-worker=xvc` oder
|
||||
`com.mike-ai.applio-worker=applio` markierten Container; freie
|
||||
Container- oder Docker-Befehle werden nicht entgegengenommen.
|
||||
|
||||
## Wiederanlauf
|
||||
|
||||
Der Router speichert `mode`, `last_profile` und `return_profile` atomar. War
|
||||
beim Router-Neustart ein Spezialmodus aktiv, startet er den passenden Worker erneut. Beim
|
||||
Wechsel zurück wird das gespeicherte LLM-Profil semantisch auf Alias und
|
||||
Kontextfenster geprüft, bevor Chat-Anfragen wieder freigegeben werden.
|
||||
@@ -8,7 +8,6 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
|
||||
|---|---|---:|---:|---|---|---|---:|
|
||||
| fast | `qwen-fast` | 76,800 | 1 | Qwen3.8-27B IQ4 Mix | 5080 only | ja | 2 |
|
||||
| medium | `qwen-medium` | 160,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 85:15 | ja | 3 |
|
||||
| beta1 | `qwen-beta-1` | 192,000 | 1 | Qwen3.8-27B GSQ-RCO IQ3_XXS MTP | 5080 model / 3060 vision | ja | 3 |
|
||||
| large | `qwen-large` | 192,000 | 1 | Qwen3.8-27B IQ4 XS Pure | 86:14 | ja | 3 |
|
||||
| ultra | `qwen-ultra` | 262,144 | 1 | Qwen3.8-27B IQ4 XS Pure | 80:20 | nein | 2 |
|
||||
| uncensored | `qwen-uncensored` | 80,000 | 1 | Qwen3.8-27B Abliterated Q4_K_M | 90:10 | ja | 2 |
|
||||
@@ -17,7 +16,6 @@ Standardprofil: **medium** · globales Ausgabelimit: **8192 Token**
|
||||
|
||||
- **fast**: Schnelles Profil für kurze Chats und zügige Werkzeugaufgaben.
|
||||
- **medium**: Ausgewogenes Standardprofil für Alltag und lange agentische Aufgaben.
|
||||
- **beta1**: Beta 1: schnelles GSQ-RCO-Testprofil mit 192K Kontext und Vision-Projektor auf der RTX 3060.
|
||||
- **large**: Großes Profil für umfangreiche Dokumente und lange technische Arbeiten.
|
||||
- **ultra**: Maximaler Textkontext; bewusst ohne Vision-Projektor.
|
||||
- **uncensored**: Weniger restriktives Spezialprofil; Werkzeugrechte bleiben unverändert.
|
||||
|
||||
@@ -0,0 +1,88 @@
|
||||
# Register getesteter Modelle
|
||||
|
||||
Stand: 9. September 2026
|
||||
|
||||
Dieses Dokument ist die zentrale Sperrliste gegen doppelte Modelltests. Vor
|
||||
jedem Download müssen Repository, Dateiname, Basismodell, Fine-Tune und
|
||||
Quantisierung hier geprüft werden. Unterschiedliche Quantisierungen desselben
|
||||
Basismodells gelten als eigene Kandidaten.
|
||||
|
||||
Statuswerte:
|
||||
|
||||
- **produktiv**: wird von mindestens einem regulären Profil verwendet
|
||||
- **Beta**: bleibt gezielt verfügbar, ersetzt aber nicht den Standard
|
||||
- **verworfen**: getestet und ohne ausreichenden Gesamtvorteil
|
||||
- **ersetzt**: früher genutzt oder getestet, inzwischen abgelöst
|
||||
- **unvollständig**: Artefakt vorbereitet, aber kein belastbarer Abnahmetest
|
||||
|
||||
## Textmodelle auf Athena
|
||||
|
||||
| Datum | Exaktes Modell beziehungsweise Artefakt | Kontext im Test | Ergebnis | Status / Entscheidung | Beleg |
|
||||
|---|---|---:|---|---|---|
|
||||
| 22.08.2026 | `jpetrina/Qwen3.8-27B-IQ4_XS-pure-GGUF` / `qwen3.8-27b-IQ4_XS-pure.gguf` | 160K–262K | beste ausgewogene Q4-Referenz; Langkontext, Tool-Call und Vision geprüft | **produktiv** für Medium, Large und Ultra | `benchmarks/qwen38-final-pre-move-20260822/` |
|
||||
| 22.08.2026 | `vmarcelo/Qwen3.8-27B-MIX_GGUF` / `Qwen3.8-27B-IQ4-MIX.gguf` | 76,8K | schnellstes vollständig auf der RTX 5080 liegendes Q4-Profil | **produktiv** für Fast | `benchmarks/qwen38-final-pre-move-20260822/` |
|
||||
| 22.08.2026 | Qwen3.8-27B NVFP4 `Q4_K_M` mit eingebettetem beziehungsweise separatem MTP | 72K | eingebettete Variante scheiterte beim Laden; Split-MTP lief, bot aber keinen ausreichenden Vorteil | **verworfen** | `benchmarks/qwen38-final-pre-move-20260822/qwen38-final-acceptance-20260822/` |
|
||||
| 22.08.2026 | `Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF` / `Q4_K_M` | 80K | stabiler Spezialpfad mit Vision und MTP2 | **produktiv** für Uncensored | `benchmarks/qwen38-final-pre-move-20260822/qwen38-abliterated-final-20260822/` |
|
||||
| 01.09.2026 | `peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF` / `UD-Q4_K_XL` | 80K–262K | korrekt und teils knapper, bei 160K aber 29–38 % langsamer im Decode als Pure | **verworfen** | [DIRK_QWEN38_AB_20260901.md](DIRK_QWEN38_AB_20260901.md) |
|
||||
| 04.09.2026 | ISTA-DASLab Qwen3.8-27B GSQ-RCO `IQ3_XXS-MTP` | bis 196.608 | sehr platzsparend und bis 196.608 technisch lauffähig; später durch IQ3_S ersetzt | **ersetzt** | [GSQ_RCO_BETA1_20260904.md](GSQ_RCO_BETA1_20260904.md) |
|
||||
| 07.09.2026 | `Jackrong/Qwopus3.8-27B-Flash-GGUF` / `Qwopus3.8-27B-Flash-MTP-IQ4_XS.gguf` | 160K | Recall 3/3; Decode 87,2 statt 105,3 Token/s, Lang-Decode 51,0 statt 56,7 Token/s; kein Gesamtvorteil | **verworfen** | Athena: `/data/benchmarks/qwen38-ab-20260907/` |
|
||||
| 07.09.2026 | `bartowski/Qwen3.8-27B-GGUF` / `Qwen3.8-27B-IQ4_XS.gguf` | 160K | Recall 3/3; Decode 90,4 statt 105,3 Token/s, Lang-Decode 51,9 statt 56,7 Token/s; kein Gesamtvorteil | **verworfen** | Athena: `/data/benchmarks/qwen38-ab-20260907/` |
|
||||
| 08.09.2026 | `ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF` / `IQ3_S-MTP` | 76,8K–262K | Qualität im lokalen Test praktisch gleich, trotz optimierter GPU-Splits überwiegend langsamer als Q4 | **entfernt**; kein Ersatz für Q4 | [GSQ_RCO_BETA1_20260904.md](GSQ_RCO_BETA1_20260904.md) |
|
||||
| 08.09.2026 | `Tiel-Coder-35B-A3B-UD-IQ4_XS.gguf` | 160K vorgesehen | Testcontainer und Gewichte vorhanden gewesen, aber kein versionierter, belastbarer Abnahmebericht | **unvollständig**; nicht als getesteter Sieger behandeln | kein Ergebnisartefakt vorhanden |
|
||||
|
||||
## Externe CPU-Helfermodelle
|
||||
|
||||
Diese Versuche liefen nicht als Athena-Hauptprofil, sind aber relevant für
|
||||
Titelgenerierung und Kontextkompression in Hermes.
|
||||
|
||||
| Datum | Modell | Beobachtung | Entscheidung |
|
||||
|---|---|---|---|
|
||||
| 06.09.2026 | Ollama `qwen3:8b` | ungefähr 8,5–9,2 Token/s auf dem alten Dual-Xeon-Server | technisch brauchbar, aber für synchrone Hermes-Hilfsaufrufe langsam |
|
||||
| 06.09.2026 | Ollama `gemma4:e4b` Q4 | ungefähr 4,7 Token/s auf dem HP EliteDesk, 10,2 auf dem alten Dual-Xeon und 15,1 auf dem neueren Proxmox-Host; mit Thinking liefen Hilfsaufrufe in Hermes in den 30-s-Timeout | nur mit `think:false` sinnvoll; nicht produktiv als Hermes-Auxiliary belegt |
|
||||
|
||||
## Bildmodelle und Restaurierung
|
||||
|
||||
| Datum | Modell | Ergebnis | Status / Entscheidung | Beleg |
|
||||
|---|---|---|---|---|
|
||||
| bis 07.09.2026 | FLUX.2 Klein 4B | funktional, aber schwächere räumliche und motivische Konsistenz | **ersetzt** durch 9B FP8 | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
||||
| 07.09.2026 | FLUX.2 Klein 9B FP8 | bessere Prompttreue; produktiver Zwei-GPU-Pfad, derzeit auf 1024 × 1024 begrenzt | **produktiv als Beta** | [FLUX_9B_BETA.md](FLUX_9B_BETA.md) |
|
||||
| 08.09.2026 | HYPIR-SD2 | glättete oder erfand Details und veränderte kleine Strukturen | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
||||
| 08.09.2026 | SeedVR2 7B FP8 | bewahrte Identität besser als HYPIR, brachte beim realen unscharfen Foto aber kaum nutzbare Details zurück | **verworfen** | [IMAGE_RESTORATION.md](IMAGE_RESTORATION.md) |
|
||||
|
||||
## Sprache
|
||||
|
||||
| Datum | Modell | Ergebnis | Status / Entscheidung |
|
||||
|---|---|---|---|
|
||||
| 05.09.2026 | Coqui XTTS v2 | deutsche Satzzeichen, Enden und Streaming-Chunks erzeugten Halluzinationen und unnatürliche Prosodie | **verworfen und entfernt** |
|
||||
| 05.09.2026 | `Qwen/Qwen3-TTS-12Hz-1.7B-Base` | deutlich natürlichere deutsche Ausgabe ohne die XTTS-Endhalluzinationen | **produktiv** als einziges TTS-Backend |
|
||||
| 06.–08.09.2026 | Whisper.cpp `large-v3-turbo` | lokaler TTS→STT-Rundlauf und OpenClaw-Transkription erfolgreich; später zugunsten des kleineren Laufzeitmodells entfernt | **ersetzt** |
|
||||
| seit 03.09.2026 | Whisper.cpp `ggml-small` | tatsächlich im Compose-Stack und im laufenden Container verwendetes CPU-STT-Modell | **produktiv** |
|
||||
| 09.09.2026 | `RMSnow/Vevo2`, Amphion `26f6883110181f1dbfe95c70a7c7dbaf4de5f42a` | Technik und Geschwindigkeit funktionierten, reale deutsche Sprachwandlung mit kurzer und langer Referenz war jedoch unverständlich, halluzinierend oder musikalisch | **qualitativ verworfen und entfernt**; Ergebnis bleibt hier dokumentiert, Images, Daten und altes Projekt wurden am 09.09. bereinigt |
|
||||
| 09.09.2026 | `k2-fsa/OmniVoice` 0.2.1 | Offizielle Gradio-UI auf RTX 5080 gestartet; Modell plus Whisper-ASR belegen rund 3,7 GiB VRAM. `omnivoice-triton` 0.1.0 ist kompatibel im Image vorhanden, für den ersten Hörtest aber bewusst noch nicht aktiviert | **technischer Starttest bestanden**, Hörabnahme und Basis-vs.-Triton-Messung offen; Gewichte CC BY-NC und daher nur nichtkommerziell einsetzen |
|
||||
| 09.09.2026 | `chenxie95/X-VC`, Code `49df8c591eafc48b096e466d96f9839f9c0dd739`, UI-Basis `d761cd6421e85376b2656dfefd8471d7f35a42be` | Offizielles Beispiel Ende-zu-Ende gewandelt: 5,20 s Audio in 1,07 s (RTF 0,21), gültiges 16-kHz-Mono-PCM-WAV; Modell belegt rund 2,9 GiB auf der RTX 5080. GLM-4-Voice-Tokenizer dokumentiert Chinesisch und Englisch | **technischer Start- und Konvertierungstest bestanden**; deutsche Hörabnahme offen |
|
||||
| 09.09.2026 | Resemble Enhance 0.0.1, Modellrevision `4e3510ce4a8391159f665903544c5150bee7b2cb` | 14,56 s native X-VC-Ausgabe bei 16 kHz wurden auf der RTX 5080 in 3,55 s zu 44,1-kHz-PCM-WAV restauriert. 3,27 % der gemessenen Signalenergie lagen danach oberhalb 8 kHz; damit ist der Pfad keine bloße Neuabtastung. Wegen der alten Upstream-Pins läuft die reine Inferenz mit NumPy 1.26.4/SciPy 1.11.4 auf dem bestehenden Torch-2.8/CUDA-12.8-Unterbau | **technisch produktiv als optionaler A/B-Pfad**; Hörabnahme entscheidet, ob die rekonstruierten Höhen subjektiv besser oder künstlicher klingen |
|
||||
| 09.09.2026 | `Plachtaa/seed-vc` V1, Code `51383efd921027683c89e5348211d93ff12ac2a8` | Technisch vollständig lauffähig: gepinntes CUDA-Image, persistente Gewichte und reale WAV-Konvertierung mit etwa 3,6 GiB VRAM. Im deutschen Hörtest erhielt die Ausgabe jedoch einen deutlich chinesischen Akzent | **qualitativ verworfen und vollständig entfernt**; nicht erneut für deutsche Sprachwandlung einplanen |
|
||||
| 09.09.2026 | `IAHispano/Applio`, Code `7fa68ec2166ab1331c539704159fa14901e94e5a` | Gepinntes CUDA-12.8-fähiges Image auf RTX 5080 gestartet; vollständige Applio/RVC-Oberfläche antwortet und CUDA ist verfügbar. Rund 1,8 GiB Basisgewichte und die Konfiguration wurden persistent ausgelagert. Es ist kein Zielstimmenmodell installiert; Applio kann aus einer Referenzaufnahme allein kein Modell ableiten | **technischer Start- und Persistenztest bestanden**; Konvertierung erst nach Import oder Training einer `.pth`-Stimme möglich |
|
||||
|
||||
## Musikgenerierung
|
||||
|
||||
| Datum | Modell | Test | Ergebnis | Status / Entscheidung | Beleg |
|
||||
|---|---|---|---|---|---|
|
||||
| 08.09.2026 | `ACE-Step/acestep-v15-xl-sft` mit `acestep-5Hz-lm-1.7B`, offizielles ACE-Step-1.5-Image `sha256:95652cd780c78a1b1a7f6f0335530430f0ae53d96c7c12d59f9f39fa23d38567` | 30 s Instrumental, Thinking/LM aktiv, Batch 1, RTX 5080 16 GiB, automatischer CPU-Offload und INT8 Weight-only DiT | erfolgreich in 15,39 s: LM 8,00 s, DiT 7,39 s, MP3 0,82 s; PyTorch meldete maximal 9,38 GiB CUDA-Allokation; kein OOM/CUDA-Fehler | **Beta-Test bestanden**; Klangabnahme und Hermes-/Router-Integration noch offen | Athena: `/data/music/acestep/batch_1788873234/`; [SPECIALIZED_MODEL_ROADMAP.md](SPECIALIZED_MODEL_ROADMAP.md) |
|
||||
|
||||
## Audio-Trennung
|
||||
|
||||
| Datum | Modell | Test | Ergebnis | Status / Entscheidung | Beleg |
|
||||
|---|---|---|---|---|---|
|
||||
| 08.09.2026 | BS-RoFormer Viperx 1297, `model_bs_roformer_ep_317_sdr_12.9755.ckpt`, `audio-separator` 0.47.0 | 20-s-FLAC eines vorhandenen ACE-Step-Titels, RTX 5080, CUDA 12.8, ONNX Runtime GPU 1.22.0 | zwei gültige FLAC-Spuren mit jeweils exakt 20,0 s; Verarbeitung 19 s; Vocal-Datei 1,45 MB, Instrumental-Datei 3,84 MB | **technischer Ende-zu-Ende-Test bestanden**; Hörabnahme durch Nutzer offen | [bs-roformer-vocal-separation](../experiments/bs-roformer-vocal-separation/README.md) |
|
||||
|
||||
## Ablauf für zukünftige Kandidaten
|
||||
|
||||
1. Exakten Hugging-Face-/Ollama-Namen und Dateinamen in diesem Dokument suchen.
|
||||
2. Bei einem Treffer zuerst den vorhandenen Beleg lesen; kein erneuter Download
|
||||
ohne einen konkret neuen Grund wie Runtime, Quantisierung oder Hardware.
|
||||
3. Neue Tests isoliert gegen das aktuelle Produktionsmodell mit identischem
|
||||
Kontext, KV-Cache, MTP, Sampling und Promptset ausführen.
|
||||
4. Unmittelbar danach hier Datum, exaktes Artefakt, Ergebnis, Entscheidung und
|
||||
Pfad zum Detailbericht ergänzen.
|
||||
5. Verworfene Gewichte nach gesichertem Ergebnis wieder löschen.
|
||||
Reference in New Issue
Block a user