查看: 7|回复: 0

如果你像我一样贫穷,只有 24G 的显存,可以在 unsloth studio 里面这么设置参数(图 1)

[复制链接]

13

主题

3

回帖

45

积分

新手上路

积分
45
发表于 4 小时前 | 显示全部楼层 |阅读模式
如果你像我一样贫穷,只有 24G 的显存,可以在 unsloth studio 里面这么设置参数(图 1),这样可以把默认 70K 的 Context 长度拉到 213K,并且在长程的任务中仍然能够保证到 20+ tok/s,短任务的话 50 tok/s 没问题。

这个配置的思路是腾出更多的显存,所以会默认把 Vision 的能力给关掉,把 KVCache 降为 q4_0(注意别选 iq4_nl ,可能会让 GPU 卡在 0%),并且拉高 GPU 显存预算。

如果你还觉的不过瘾,可以直接把 MTP 关了,此时 -c 可以设置为 262144,也就是把 qwen3.8 的原生的 Context 长度全部吃满,不过大量 context 直接做 prefill 会超时,长程任务不会有这个问题。

搭配上 Hermes 能够自动检测上下文长度,能够及时触发压缩,长程的任务跑不断,这一套东西我已经用了一阵了,写点文档、整理新闻、写写脚本都没有问题。

另外 unsloth studio 本身就是用 llamacpp 做的推理,所以可以通过下面这个命令直接启动,不过我仍然推荐使用 unsloth studio 去 serve,它自带的 monitor 还算是比较好用(图 2)。

llama server \
  -m Qwen3.8-27B-UD-Q4_K_XL.gguf \
  -c 212992 \
  -ngl all \
  --parallel 1 \
  --flash-attn on \
  --cache-type-k q4_0 \
  --cache-type-v q4_0 \
  --spec-type draft-mtp \
  --spec-draft-n-max 2 \
  --jinja \
  --chat-template-kwargs '{"enable_thinking":true,"preserve_thinking":true}' \
  --reasoning-effort medium \
  --no-context-shift \
  --port 8080


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部