Increase llama prompt cache to 24 GiB
This commit is contained in:
+2
-1
@@ -52,7 +52,8 @@ EXPERIMENTAL_GPU_DEVICES=0
|
||||
LLAMA_THREADS=6
|
||||
LLAMA_THREADS_BATCH=6
|
||||
FAST_PARALLEL_SLOTS=1
|
||||
MEDIUM_PARALLEL_SLOTS=2
|
||||
LLAMA_CACHE_RAM_MIB=24576
|
||||
MEDIUM_PARALLEL_SLOTS=1
|
||||
LARGE_PARALLEL_SLOTS=1
|
||||
ULTRA_PARALLEL_SLOTS=1
|
||||
UNCENSORED_PARALLEL_SLOTS=1
|
||||
|
||||
Reference in New Issue
Block a user