2.78 万亿参数,8GB 内存,单 CPU。 这个组合确实有点离谱。

2.78 万亿参数,8GB 内存,单 CPU。 这个组合确实有点离谱。

开源项目 kimi-k3-in-c,用 176KB 的可移植 C99 代码跑超大 MoE,不依赖 CUDA、PyTorch、BLAS,甚至不需要 GPU。

1️⃣ 896 个专家,每个 Token 只激活 16 个
2️⃣ 模型放 NVMe,剩余权重按需流式加载
3️⃣ 8GB 内存下生成一个 Token 约 26~32 秒
4️⃣ 不同内存配置下,输出结果保持字节级一致
当然,它目前更像一个极限条件下的技术实验,不是拿来日常聊天的。

但它证明了一件挺有意思的事:超大 MoE 模型,不一定非得整套塞进内存。
🔗 https://github.com/FareedKhan-dev/kimi-k3-in-c

分类