Default Athena profiles to one inference slot
This commit is contained in:
+1
-1
@@ -52,7 +52,7 @@ EXPERIMENTAL_GPU_DEVICES=0
|
|||||||
LLAMA_THREADS=6
|
LLAMA_THREADS=6
|
||||||
LLAMA_THREADS_BATCH=6
|
LLAMA_THREADS_BATCH=6
|
||||||
FAST_PARALLEL_SLOTS=1
|
FAST_PARALLEL_SLOTS=1
|
||||||
MEDIUM_PARALLEL_SLOTS=2
|
MEDIUM_PARALLEL_SLOTS=1
|
||||||
LARGE_PARALLEL_SLOTS=1
|
LARGE_PARALLEL_SLOTS=1
|
||||||
ULTRA_PARALLEL_SLOTS=1
|
ULTRA_PARALLEL_SLOTS=1
|
||||||
UNCENSORED_PARALLEL_SLOTS=1
|
UNCENSORED_PARALLEL_SLOTS=1
|
||||||
|
|||||||
@@ -68,8 +68,8 @@ Einstellung liegt auf Athena in `/etc/mike-ai/stack.env`:
|
|||||||
MEDIUM_PARALLEL_SLOTS=1
|
MEDIUM_PARALLEL_SLOTS=1
|
||||||
```
|
```
|
||||||
|
|
||||||
Für einen späteren erneuten Paralleltest wird der Wert auf `2` gesetzt und nur
|
Für einen späteren erneuten Paralleltest genügt es, den Wert auf `2` zu setzen
|
||||||
das betroffene Profil neu erstellt:
|
und ausschließlich das aktuell betroffene Profil neu zu erstellen:
|
||||||
|
|
||||||
```bash
|
```bash
|
||||||
sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=2/' /etc/mike-ai/stack.env
|
sed -i 's/^MEDIUM_PARALLEL_SLOTS=.*/MEDIUM_PARALLEL_SLOTS=2/' /etc/mike-ai/stack.env
|
||||||
@@ -77,13 +77,11 @@ cd /opt/mike-ai/stack
|
|||||||
docker compose --env-file /etc/mike-ai/stack.env up -d --no-deps --force-recreate llama-medium
|
docker compose --env-file /etc/mike-ai/stack.env up -d --no-deps --force-recreate llama-medium
|
||||||
```
|
```
|
||||||
|
|
||||||
Zurück zum stabilen Ein-Slot-Betrieb geht es mit denselben Befehlen und
|
Zurück zum stabilen Ein-Slot-Betrieb geht es mit denselben zwei Befehlen und
|
||||||
`MEDIUM_PARALLEL_SLOTS=1`. `--kv-unified` ist bereits im Compose-Stack gesetzt.
|
`MEDIUM_PARALLEL_SLOTS=1`. `--kv-unified` ist bereits im Compose-Stack gesetzt.
|
||||||
Zwei Slots funktionieren direkt am Router; Hermes verwaltete zwei gleichzeitig
|
Zwei Slots wurden direkt am Router erfolgreich getestet; Hermes verwaltete zwei
|
||||||
aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der Standard,
|
gleichzeitig aktive Chats jedoch nicht zuverlässig. Deshalb bleibt ein Slot der
|
||||||
bis Hermes' Sitzungsfehler behoben ist.
|
Standard, bis Hermes' Sitzungsfehler behoben ist.
|
||||||
|
|
||||||
Router-API: `http://<WireGuard-IP>:8081/v1`
|
|
||||||
|
|
||||||
## Endpunkte
|
## Endpunkte
|
||||||
|
|
||||||
|
|||||||
+1
-1
@@ -186,7 +186,7 @@ services:
|
|||||||
- --ubatch-size
|
- --ubatch-size
|
||||||
- "${MEDIUM_UBATCH_SIZE:-128}"
|
- "${MEDIUM_UBATCH_SIZE:-128}"
|
||||||
- --parallel
|
- --parallel
|
||||||
- "${MEDIUM_PARALLEL_SLOTS:-2}"
|
- "${MEDIUM_PARALLEL_SLOTS:-1}"
|
||||||
- --kv-unified
|
- --kv-unified
|
||||||
- --jinja
|
- --jinja
|
||||||
- --reasoning
|
- --reasoning
|
||||||
|
|||||||
@@ -100,7 +100,7 @@ EXPERIMENTAL_CONTEXT=76800
|
|||||||
LLAMA_THREADS=6
|
LLAMA_THREADS=6
|
||||||
LLAMA_THREADS_BATCH=6
|
LLAMA_THREADS_BATCH=6
|
||||||
FAST_PARALLEL_SLOTS=1
|
FAST_PARALLEL_SLOTS=1
|
||||||
MEDIUM_PARALLEL_SLOTS=2
|
MEDIUM_PARALLEL_SLOTS=1
|
||||||
LARGE_PARALLEL_SLOTS=1
|
LARGE_PARALLEL_SLOTS=1
|
||||||
ULTRA_PARALLEL_SLOTS=1
|
ULTRA_PARALLEL_SLOTS=1
|
||||||
UNCENSORED_PARALLEL_SLOTS=1
|
UNCENSORED_PARALLEL_SLOTS=1
|
||||||
|
|||||||
Reference in New Issue
Block a user