Remove obsolete review model service

This commit is contained in:
Mikei386
2026-09-01 08:54:33 +02:00
parent 548f6643fd
commit 91fbb276bd
4 changed files with 1 additions and 84 deletions
-4
View File
@@ -1,10 +1,6 @@
# Generated as /etc/mike-ai/stack.env by install.sh. Never commit real values. # Generated as /etc/mike-ai/stack.env by install.sh. Never commit real values.
AI_BIND_ADDRESS=10.77.0.2 AI_BIND_ADDRESS=10.77.0.2
MODEL_DIR=/data/models MODEL_DIR=/data/models
REVIEW_MODEL_FILE=qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf
REVIEW_CONTEXT=32768
REVIEW_GPU_DEVICE=1
REVIEW_GPU_LAYERS=0
ROUTER_API_KEY=GENERATED_BY_INSTALLER ROUTER_API_KEY=GENERATED_BY_INSTALLER
CONTROLLER_TOKEN=GENERATED_BY_INSTALLER CONTROLLER_TOKEN=GENERATED_BY_INSTALLER
FLUX_MODEL_DIR=/data/models/FLUX.2-klein-4B FLUX_MODEL_DIR=/data/models/FLUX.2-klein-4B
-73
View File
@@ -32,76 +32,6 @@ x-llama-common: &llama-common
start_period: 30s start_period: 30s
services: services:
# Kleines, dauerhaft geladenes Hilfsmodell fuer Hermes-Hintergrundaufgaben
# (Memory-/Skill-Review). Es laeuft unabhaengig vom wechselnden Hauptmodell
# und kann dessen Prompt-Cache daher nicht mehr
# verdraengen. Athena reserviert die 3060 bereits fuer Qwen und XTTS; der
# robuste Standard ist deshalb CPU/RAM. GPU-Layer koennen spaeter per Env
# zugeschaltet werden, sobald dort garantiert Speicher frei ist.
llama-review:
image: ${LLAMA_IMAGE:-mike-ai/llama.cpp:local}
container_name: mike-ai-llama-review
restart: unless-stopped
gpus: all
ipc: host
read_only: true
tmpfs:
- /tmp:size=512m,mode=1777
volumes:
- "${MODEL_DIR:-/srv/mike-ai/models}:/models:ro"
environment:
NVIDIA_VISIBLE_DEVICES: ${REVIEW_GPU_DEVICE:-1}
NVIDIA_DRIVER_CAPABILITIES: compute,utility
command:
- --model
- "/models/${REVIEW_MODEL_FILE:-qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf}"
- --alias
- qwen-review
- --ctx-size
- "${REVIEW_CONTEXT:-32768}"
- --flash-attn
- "on"
- --cache-type-k
- q4_0
- --cache-type-v
- q4_0
- --cache-prompt
- --threads
- "${LLAMA_THREADS:-6}"
- --threads-batch
- "${LLAMA_THREADS_BATCH:-6}"
- --batch-size
- "${REVIEW_BATCH_SIZE:-512}"
- --ubatch-size
- "${REVIEW_UBATCH_SIZE:-64}"
- --parallel
- "1"
- --kv-unified
- --jinja
- --host
- 0.0.0.0
- --port
- "8080"
- --metrics
- --fit
- "off"
- --n-gpu-layers
- "${REVIEW_GPU_LAYERS:-0}"
- --no-kv-offload
- --no-mmap
- --no-ui
- --temperature
- "0.2"
networks: [inference]
security_opt: ["no-new-privileges:true"]
cap_drop: [ALL]
healthcheck:
test: [CMD, curl, -fsS, "http://127.0.0.1:8080/health"]
interval: 10s
timeout: 5s
retries: 60
start_period: 30s
wireguard-gateway: wireguard-gateway:
build: ./platform/docker/wireguard-gateway build: ./platform/docker/wireguard-gateway
image: mike-ai/wireguard-gateway:local image: mike-ai/wireguard-gateway:local
@@ -634,9 +564,6 @@ services:
ROUTER_STATE_FILE: /var/lib/mike-ai-profile-router/state.json ROUTER_STATE_FILE: /var/lib/mike-ai-profile-router/state.json
ROUTER_MAX_CONCURRENT_REQUESTS: "16" ROUTER_MAX_CONCURRENT_REQUESTS: "16"
UPSTREAM_URL: http://llama-upstream:8080 UPSTREAM_URL: http://llama-upstream:8080
REVIEW_UPSTREAM_URL: http://llama-review:8080
REVIEW_MODEL_NAME: qwen-review
REVIEW_CONTEXT_LENGTH: "${REVIEW_CONTEXT:-32768}"
PROFILE_CONTROL_URL: http://profile-controller:8090 PROFILE_CONTROL_URL: http://profile-controller:8090
PROFILE_CONTROL_TOKEN: "${CONTROLLER_TOKEN:?CONTROLLER_TOKEN is required}" PROFILE_CONTROL_TOKEN: "${CONTROLLER_TOKEN:?CONTROLLER_TOKEN is required}"
SWITCH_TIMEOUT: "600" SWITCH_TIMEOUT: "600"
-6
View File
@@ -4,12 +4,6 @@
AI_HOSTNAME=ki-host AI_HOSTNAME=ki-host
ADMIN_USER=mike ADMIN_USER=mike
MODEL_DIR=/data/models MODEL_DIR=/data/models
REVIEW_MODEL_FILE=qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf
REVIEW_CONTEXT=32768
# Eine einzelne GPU-ID oder stabile NVIDIA-GPU-UUID; auf Athena die RTX 3060.
REVIEW_GPU_DEVICE=1
REVIEW_GPU_LAYERS=0
# Installing a new NVIDIA driver can require one reboot. In that case this # Installing a new NVIDIA driver can require one reboot. In that case this
# installer exits with code 20 (NVIDIA) or 21 (stable NIC rename); rerun the # installer exits with code 20 (NVIDIA) or 21 (stable NIC rename); rerun the
# same command after reboot. # same command after reboot.
+1 -1
View File
@@ -4,7 +4,7 @@ Stand: 31. August 2026
## Produktive llama.cpp-Runtime ## Produktive llama.cpp-Runtime
Alle Textprofile und das Review-Modell verwenden llama.cpp Build 10718, Alle Textprofile verwenden llama.cpp Build 10718,
Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587 Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587
wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest