From 91fbb276bdc6c84ad41210674bf5c0e63583d06b Mon Sep 17 00:00:00 2001 From: Mikei386 <44135113+Mikei386@users.noreply.github.com> Date: Tue, 1 Sep 2026 08:54:33 +0200 Subject: [PATCH] Remove obsolete review model service --- .env.example | 4 -- compose.yaml | 73 ----------------------------------- config/install.env.example | 6 --- docs/CURRENT_RUNTIME_NOTES.md | 2 +- 4 files changed, 1 insertion(+), 84 deletions(-) diff --git a/.env.example b/.env.example index bda9f1f..38f57d1 100644 --- a/.env.example +++ b/.env.example @@ -1,10 +1,6 @@ # Generated as /etc/mike-ai/stack.env by install.sh. Never commit real values. AI_BIND_ADDRESS=10.77.0.2 MODEL_DIR=/data/models -REVIEW_MODEL_FILE=qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf -REVIEW_CONTEXT=32768 -REVIEW_GPU_DEVICE=1 -REVIEW_GPU_LAYERS=0 ROUTER_API_KEY=GENERATED_BY_INSTALLER CONTROLLER_TOKEN=GENERATED_BY_INSTALLER FLUX_MODEL_DIR=/data/models/FLUX.2-klein-4B diff --git a/compose.yaml b/compose.yaml index 5233077..13e05c5 100644 --- a/compose.yaml +++ b/compose.yaml @@ -32,76 +32,6 @@ x-llama-common: &llama-common start_period: 30s services: - # Kleines, dauerhaft geladenes Hilfsmodell fuer Hermes-Hintergrundaufgaben - # (Memory-/Skill-Review). Es laeuft unabhaengig vom wechselnden Hauptmodell - # und kann dessen Prompt-Cache daher nicht mehr - # verdraengen. Athena reserviert die 3060 bereits fuer Qwen und XTTS; der - # robuste Standard ist deshalb CPU/RAM. GPU-Layer koennen spaeter per Env - # zugeschaltet werden, sobald dort garantiert Speicher frei ist. - llama-review: - image: ${LLAMA_IMAGE:-mike-ai/llama.cpp:local} - container_name: mike-ai-llama-review - restart: unless-stopped - gpus: all - ipc: host - read_only: true - tmpfs: - - /tmp:size=512m,mode=1777 - volumes: - - "${MODEL_DIR:-/srv/mike-ai/models}:/models:ro" - environment: - NVIDIA_VISIBLE_DEVICES: ${REVIEW_GPU_DEVICE:-1} - NVIDIA_DRIVER_CAPABILITIES: compute,utility - command: - - --model - - "/models/${REVIEW_MODEL_FILE:-qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf}" - - --alias - - qwen-review - - --ctx-size - - "${REVIEW_CONTEXT:-32768}" - - --flash-attn - - "on" - - --cache-type-k - - q4_0 - - --cache-type-v - - q4_0 - - --cache-prompt - - --threads - - "${LLAMA_THREADS:-6}" - - --threads-batch - - "${LLAMA_THREADS_BATCH:-6}" - - --batch-size - - "${REVIEW_BATCH_SIZE:-512}" - - --ubatch-size - - "${REVIEW_UBATCH_SIZE:-64}" - - --parallel - - "1" - - --kv-unified - - --jinja - - --host - - 0.0.0.0 - - --port - - "8080" - - --metrics - - --fit - - "off" - - --n-gpu-layers - - "${REVIEW_GPU_LAYERS:-0}" - - --no-kv-offload - - --no-mmap - - --no-ui - - --temperature - - "0.2" - networks: [inference] - security_opt: ["no-new-privileges:true"] - cap_drop: [ALL] - healthcheck: - test: [CMD, curl, -fsS, "http://127.0.0.1:8080/health"] - interval: 10s - timeout: 5s - retries: 60 - start_period: 30s - wireguard-gateway: build: ./platform/docker/wireguard-gateway image: mike-ai/wireguard-gateway:local @@ -634,9 +564,6 @@ services: ROUTER_STATE_FILE: /var/lib/mike-ai-profile-router/state.json ROUTER_MAX_CONCURRENT_REQUESTS: "16" UPSTREAM_URL: http://llama-upstream:8080 - REVIEW_UPSTREAM_URL: http://llama-review:8080 - REVIEW_MODEL_NAME: qwen-review - REVIEW_CONTEXT_LENGTH: "${REVIEW_CONTEXT:-32768}" PROFILE_CONTROL_URL: http://profile-controller:8090 PROFILE_CONTROL_TOKEN: "${CONTROLLER_TOKEN:?CONTROLLER_TOKEN is required}" SWITCH_TIMEOUT: "600" diff --git a/config/install.env.example b/config/install.env.example index 27aa3a2..7cf4e89 100644 --- a/config/install.env.example +++ b/config/install.env.example @@ -4,12 +4,6 @@ AI_HOSTNAME=ki-host ADMIN_USER=mike MODEL_DIR=/data/models -REVIEW_MODEL_FILE=qwen3-4b-review/Qwen3-4B-Instruct-2507-Q4_K_M.gguf -REVIEW_CONTEXT=32768 -# Eine einzelne GPU-ID oder stabile NVIDIA-GPU-UUID; auf Athena die RTX 3060. -REVIEW_GPU_DEVICE=1 -REVIEW_GPU_LAYERS=0 - # Installing a new NVIDIA driver can require one reboot. In that case this # installer exits with code 20 (NVIDIA) or 21 (stable NIC rename); rerun the # same command after reboot. diff --git a/docs/CURRENT_RUNTIME_NOTES.md b/docs/CURRENT_RUNTIME_NOTES.md index b59d753..5772834 100644 --- a/docs/CURRENT_RUNTIME_NOTES.md +++ b/docs/CURRENT_RUNTIME_NOTES.md @@ -4,7 +4,7 @@ Stand: 31. August 2026 ## Produktive llama.cpp-Runtime -Alle Textprofile und das Review-Modell verwenden llama.cpp Build 10718, +Alle Textprofile verwenden llama.cpp Build 10718, Commit `41ef91f7c8046087cdfbb276b79bff311ecf1c6d`. Der vorherige Build 10587 wurde nach einem kontrollierten A/B-Test ersetzt. Der Wechsel verbessert den Durchsatz bei großen Werkzeuglisten, ohne im 70K-/120K-Kontext- und Cachetest