Remove obsolete review model service
This commit is contained in:
@@ -1,10 +1,6 @@
|
||||
# Generated as /etc/mike-ai/stack.env by install.sh. Never commit real values.
|
||||
AI_BIND_ADDRESS=10.77.0.2
|
||||
MODEL_DIR=/data/models
|
||||
REVIEW_MODEL_FILE=qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf
|
||||
REVIEW_CONTEXT=32768
|
||||
REVIEW_GPU_DEVICE=1
|
||||
REVIEW_GPU_LAYERS=0
|
||||
ROUTER_API_KEY=GENERATED_BY_INSTALLER
|
||||
CONTROLLER_TOKEN=GENERATED_BY_INSTALLER
|
||||
FLUX_MODEL_DIR=/data/models/FLUX.2-klein-4B
|
||||
|
||||
@@ -32,76 +32,6 @@ x-llama-common: &llama-common
|
||||
start_period: 30s
|
||||
|
||||
services:
|
||||
# Kleines, dauerhaft geladenes Hilfsmodell fuer Hermes-Hintergrundaufgaben
|
||||
# (Memory-/Skill-Review). Es laeuft unabhaengig vom wechselnden Hauptmodell
|
||||
# und kann dessen Prompt-Cache daher nicht mehr
|
||||
# verdraengen. Athena reserviert die 3060 bereits fuer Qwen und XTTS; der
|
||||
# robuste Standard ist deshalb CPU/RAM. GPU-Layer koennen spaeter per Env
|
||||
# zugeschaltet werden, sobald dort garantiert Speicher frei ist.
|
||||
llama-review:
|
||||
image: ${LLAMA_IMAGE:-mike-ai/llama.cpp:local}
|
||||
container_name: mike-ai-llama-review
|
||||
restart: unless-stopped
|
||||
gpus: all
|
||||
ipc: host
|
||||
read_only: true
|
||||
tmpfs:
|
||||
- /tmp:size=512m,mode=1777
|
||||
volumes:
|
||||
- "${MODEL_DIR:-/srv/mike-ai/models}:/models:ro"
|
||||
environment:
|
||||
NVIDIA_VISIBLE_DEVICES: ${REVIEW_GPU_DEVICE:-1}
|
||||
NVIDIA_DRIVER_CAPABILITIES: compute,utility
|
||||
command:
|
||||
- --model
|
||||
- "/models/${REVIEW_MODEL_FILE:-qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf}"
|
||||
- --alias
|
||||
- qwen-review
|
||||
- --ctx-size
|
||||
- "${REVIEW_CONTEXT:-32768}"
|
||||
- --flash-attn
|
||||
- "on"
|
||||
- --cache-type-k
|
||||
- q4_0
|
||||
- --cache-type-v
|
||||
- q4_0
|
||||
- --cache-prompt
|
||||
- --threads
|
||||
- "${LLAMA_THREADS:-6}"
|
||||
- --threads-batch
|
||||
- "${LLAMA_THREADS_BATCH:-6}"
|
||||
- --batch-size
|
||||
- "${REVIEW_BATCH_SIZE:-512}"
|
||||
- --ubatch-size
|
||||
- "${REVIEW_UBATCH_SIZE:-64}"
|
||||
- --parallel
|
||||
- "1"
|
||||
- --kv-unified
|
||||
- --jinja
|
||||
- --host
|
||||
- 0.0.0.0
|
||||
- --port
|
||||
- "8080"
|
||||
- --metrics
|
||||
- --fit
|
||||
- "off"
|
||||
- --n-gpu-layers
|
||||
- "${REVIEW_GPU_LAYERS:-0}"
|
||||
- --no-kv-offload
|
||||
- --no-mmap
|
||||
- --no-ui
|
||||
- --temperature
|
||||
- "0.2"
|
||||
networks: [inference]
|
||||
security_opt: ["no-new-privileges:true"]
|
||||
cap_drop: [ALL]
|
||||
healthcheck:
|
||||
test: [CMD, curl, -fsS, "http://127.0.0.1:8080/health"]
|
||||
interval: 10s
|
||||
timeout: 5s
|
||||
retries: 60
|
||||
start_period: 30s
|
||||
|
||||
wireguard-gateway:
|
||||
build: ./platform/docker/wireguard-gateway
|
||||
image: mike-ai/wireguard-gateway:local
|
||||
@@ -634,9 +564,6 @@ services:
|
||||
ROUTER_STATE_FILE: /var/lib/mike-ai-profile-router/state.json
|
||||
ROUTER_MAX_CONCURRENT_REQUESTS: "16"
|
||||
UPSTREAM_URL: http://llama-upstream:8080
|
||||
REVIEW_UPSTREAM_URL: http://llama-review:8080
|
||||
REVIEW_MODEL_NAME: qwen-review
|
||||
REVIEW_CONTEXT_LENGTH: "${REVIEW_CONTEXT:-32768}"
|
||||
PROFILE_CONTROL_URL: http://profile-controller:8090
|
||||
PROFILE_CONTROL_TOKEN: "${CONTROLLER_TOKEN:?CONTROLLER_TOKEN is required}"
|
||||
SWITCH_TIMEOUT: "600"
|
||||
|
||||
@@ -4,12 +4,6 @@
|
||||
AI_HOSTNAME=ki-host
|
||||
ADMIN_USER=mike
|
||||
MODEL_DIR=/data/models
|
||||
REVIEW_MODEL_FILE=qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf
|
||||
REVIEW_CONTEXT=32768
|
||||
# Eine einzelne GPU-ID oder stabile NVIDIA-GPU-UUID; auf Athena die RTX 3060.
|
||||
REVIEW_GPU_DEVICE=1
|
||||
REVIEW_GPU_LAYERS=0
|
||||
|
||||
# Installing a new NVIDIA driver can require one reboot. In that case this
|
||||
# installer exits with code 20 (NVIDIA) or 21 (stable NIC rename); rerun the
|
||||
# same command after reboot.
|
||||
|
||||
@@ -4,7 +4,7 @@ Stand: 31. August 2026
|
||||
|
||||
## Produktive llama.cpp-Runtime
|
||||
|
||||
Alle Textprofile und das Review-Modell verwenden llama.cpp Build 10718,
|
||||
Alle Textprofile verwenden llama.cpp Build 10718,
|
||||
Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587
|
||||
wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den
|
||||
Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest
|
||||
|
||||
Reference in New Issue
Block a user