亦飞凡 发表于 昨天 16:17

如果你像我一样贫穷,只有 24G 的显存,可以在 unsloth studio 里面这么设置参数(图 1)

如果你像我一样贫穷,只有 24G 的显存,可以在 unsloth studio 里面这么设置参数(图 1),这样可以把默认 70K 的 Context 长度拉到 213K,并且在长程的任务中仍然能够保证到 20+ tok/s,短任务的话 50 tok/s 没问题。

这个配置的思路是腾出更多的显存,所以会默认把 Vision 的能力给关掉,把 KVCache 降为 q4_0(注意别选 iq4_nl ,可能会让 GPU 卡在 0%),并且拉高 GPU 显存预算。

如果你还觉的不过瘾,可以直接把 MTP 关了,此时 -c 可以设置为 262144,也就是把 qwen3.8 的原生的 Context 长度全部吃满,不过大量 context 直接做 prefill 会超时,长程任务不会有这个问题。

搭配上 Hermes 能够自动检测上下文长度,能够及时触发压缩,长程的任务跑不断,这一套东西我已经用了一阵了,写点文档、整理新闻、写写脚本都没有问题。

另外 unsloth studio 本身就是用 llamacpp 做的推理,所以可以通过下面这个命令直接启动,不过我仍然推荐使用 unsloth studio 去 serve,它自带的 monitor 还算是比较好用(图 2)。

llama server \
-m Qwen3.8-27B-UD-Q4_K_XL.gguf \
-c 212992 \
-ngl all \
--parallel 1 \
--flash-attn on \
--cache-type-k q4_0 \
--cache-type-v q4_0 \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
--jinja \
--chat-template-kwargs '{"enable_thinking":true,"preserve_thinking":true}' \
--reasoning-effort medium \
--no-context-shift \
--port 8080


页: [1]
查看完整版本: 如果你像我一样贫穷,只有 24G 的显存,可以在 unsloth studio 里面这么设置参数(图 1)