# https://huggingface.co/vmarcelo/Qwen3.8-27B-MIX_GGUF/resolve/main/Qwen3.8-27B-IQ4-MIX.gguf?download=true # max context: 70k with n=2, 56k with n=3 speed 44.34, 37k with q8 n=4, speed 43.70 t/s # Note: mtp_recurrent_state_rollback at n=5 costs the same as lower values, always use 5 # ROCm ctx VEC forced: 89088 q5_1, 96512 q5_0, 116480 q4_0, TG speed: 42.35 t/s, PP for 32k: 145.12 t/s # ROCm ctx VEC off : 68352 q5_1, 72704 q5_0, 83200 q4_0, TG speed: 43.90 t/s, PP for 32k: 265.58 t/s # Vulkan: ctx: 93696 q5_1, 101632 q5_0, 122112 q4_0, TG speed: 40.49 t/s, PP for 32k: 179.90 t/s # 1. Set Environment Variables # 2. Run the Server /home/eaman/llama/bin_vulkan/llama-server --device vulkan0 \ -m /home/eaman/.lmstudio/models/vmarcelo/Qwen3.8-27B-IQ4-MIX.gguf \ --host 0.0.0.0 -fa on --load-mode none --jinja --no-log-timestamps \ -ctk q5_0 -ctv q5_0 \ --temp 0.5 --top-k 20 --top-p 0.95 --min-p 0.05 \ --presence-penalty 0.0 --repeat-penalty 1.0 \ -b 1024 -ub 128 --fit-target 60 \ --hip-fa-force-vec on --spec-mtp-cr-depth 1 --spec-draft-adaptive \ --spec-type draft-mtp,ngram-mod --spec-draft-p-min 0.82 --spec-draft-n-max 5 \ --cache-type-k-draft q4_0 --cache-type-v-draft q4_0 \ --spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 8 --spec-ngram-mod-n-max 32 \ --reasoning on --chat-template-kwargs '{"reasoning_effort":"medium"}' --reasoning-budget 8096 --reasoning-budget-message "-- Reasoning budget exceeded, proceed to final answer." \ --ctx-checkpoints 128 --cache-ram 6000 -np 1 -ngl 99 -lv 4 --no-warmup --no-mmproj-offload