查看: 8|回复: 0

本地跑大模型这事儿,一看几百GB权重加显存门槛,多数人当场就撤了,我以前也这样。

[复制链接]

11

主题

0

回帖

33

积分

新手上路

积分
33
发表于 昨天 23:54 | 显示全部楼层 |阅读模式
本地跑大模型这事儿,一看几百GB权重加显存门槛,多数人当场就撤了,我以前也这样。

colibri直接换了一条路,把显存、内存、硬盘揉成一个整体来调度,权重按需从硬盘流式拽进来,纯C写、零依赖,已经冲到25000+ Star。

1️⃣ 支持的全是前沿MoE,从35B的Qwen3.6到2.8T的Kimi K3,六个家族,一个模型就一个C文件;
2️⃣ 官方演示里744B的GLM-5.2用int4量化在CPU上流式跑起来了,常驻内存压到不到10 GB;
3️⃣ 自带网页仪表盘,19456个专家的路由热度实时刷出来,哪个专家被调就闪一下,看着确实震。
内存够的机器都能拽下来耍耍,亲手摸千亿级模型,跟租API完全是两码事。
🔗 https://github.com/JustVugg/colibri

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部