Files
AI-Profile-Router/platform/ltx2-studio/README.md
T

74 lines
3.5 KiB
Markdown

# LTX-2 Studio
This specialist profile runs the official LTX Desktop 1.2.7 application in a
browser-accessible private desktop. The image is pinned to the release checksum.
Application data, downloaded models and outputs persist below
`/data/video/ltx-desktop`.
The profile controller starts only the container labelled
`com.mike-ai.video-worker=ltx2`. Starting it stops every LLM, image, speech,
music, voice and 3D GPU worker first. The UI is reachable only through Athena's
WireGuard gateway at `http://192.168.1.212:8015`.
The RTX 5080 has the official minimum of 16 GiB VRAM for LTX Desktop local
generation. Start with LTX Fast, 720p or below and at most about ten seconds.
Model downloads may require accepting Lightricks' model license and signing in
to Hugging Face in the application.
The image installs a narrow `tar` wrapper that ignores uid/gid metadata in the
official first-run Python archive. This keeps `cap_drop: [ALL]` intact while
allowing the archive, whose entries belong to build user 1001, to be extracted.
The backend uses stable port `41955`. Hugging Face OAuth can therefore run in a
normal client browser through a local SSH tunnel to the container instead of
requiring a browser or storing login credentials inside the VNC desktop.
The container port is published only on Athena's `127.0.0.1`; it is not exposed
on Athena's LAN or WireGuard interfaces.
# VNC-Oberfläche
Die Linux-Oberfläche unter noVNC kann im Athena-Dashboard schlafen gelegt und
wieder aufgeweckt werden. Im Schlafzustand sind die Electron-Unterprozesse der
Linux-Oberfläche angehalten. Der Electron-Hauptprozess, das LTX-Backend, laufende
Generierungen und die native macOS-App bleiben aktiv. Der Status wird im
Controller zwischengespeichert, damit die Dashboard-Abfrage keine fortlaufenden
Docker-Exec-Prozesse erzeugt. Beim erneuten Start des LTX-Profils ist die
VNC-Oberfläche zunächst aktiv.
## Lokaler Prompt Enhancer auf der RTX 3060
Der optionale Gemma-4-E2B-Prompt-Enhancer läuft getrennt von der
Videogenerierung auf `cuda:1` (RTX 3060); LTX 2.5 bleibt auf `cuda:0`
(RTX 5080). Das Modell liegt unter `models/gemma-4-E2B-it`, wird nur für einen
Enhance-Aufruf geladen und danach wieder entladen. Gemessen wurden rund
9.97 GiB VRAM und 19 Sekunden für Text sowie 9.95 GiB und 10 Sekunden mit
Referenzbild.
Die vorherige Einzel-GPU-Konfiguration liegt unter
`/opt/mike-ai/rollback/ltx-gemma-e2b-3060-20260914/`. Rückbau:
```sh
/opt/mike-ai/rollback/ltx-gemma-e2b-3060-20260914/rollback.sh
```
## Rollierendes Extend-Fenster
Lokales Extend verarbeitet auf der RTX 5080 höchstens 433 Frames (rund 18
Sekunden bei 24 fps). Sobald Quelle plus Verlängerung größer werden, verwendet
das Backend nur bis zu acht Sekunden vom Anfang oder Ende als Übergangskontext.
Nach der Generierung wird ausschließlich der neue Abschnitt per FFmpeg an die
vollständige Quelle gesetzt. Dadurch kann ein Ergebnis erneut verlängert
werden, ohne dass der GPU-Speicherbedarf mit der gesamten Filmlänge wächst.
Die Oberfläche wird unverändert verwendet: fertigen Clip auswählen, `Extend`
wählen und bis zu zwölf Sekunden ergänzen. Bei zwölf Sekunden reduziert das
Backend den Kontext automatisch auf ungefähr sechs Sekunden. Die abschließende
Zusammensetzung läuft auf der CPU und kann nach der GPU-Generierung noch einige
Sekunden dauern. Der Übergang kann bei sehr langen Ketten allmählich driften;
für einen neuen Szenenabschnitt ist daher ein klarer Prompt sinnvoll.
Rückbau:
```sh
/opt/mike-ai/rollback/ltx-rolling-extend-20260914/rollback.sh
```