查看: 7|回复: 0

2.78万亿参数,8GB内存,单颗CPU,这组合够离谱。

[复制链接]

9

主题

0

回帖

27

积分

新手上路

积分
27
发表于 昨天 20:33 | 显示全部楼层 |阅读模式
2.78万亿参数,8GB内存,单颗CPU,这组合够离谱。

kimi-k3-in-c 这个开源项目,愣是用 176KB 的可移植 C99 代码把超大 MoE 带了起来,CUDA、PyTorch、BLAS 一概不用,GPU 也免了。

1️⃣ 896 个专家里,每个 Token 仅激活 16 个
2️⃣ 权重存 NVMe,剩下的按需流式喂进来
3️⃣ 8GB 内存下,吐一个 Token 差不多 26~32 秒
4️⃣ 内存配置怎么变,输出都保持字节级一致
坦白讲,它现在更像极端条件下的技术验证,日常聊天肯定指望不上。
可它偏偏证明了一件事:超大 MoE 模型,并非只能整坨塞进内存。
🔗 https://github.com/FareedKhan-dev/kimi-k3-in-c



本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部