kimi-k3-in-c 这个开源项目,愣是用 176KB 的可移植 C99 代码把超大 MoE 带了起来,CUDA、PyTorch、BLAS 一概不用,GPU 也免了。
1️⃣ 896 个专家里,每个 Token 仅激活 16 个
2️⃣ 权重存 NVMe,剩下的按需流式喂进来
3️⃣ 8GB 内存下,吐一个 Token 差不多 26~32 秒
4️⃣ 内存配置怎么变,输出都保持字节级一致
坦白讲,它现在更像极端条件下的技术验证,日常聊天肯定指望不上。
可它偏偏证明了一件事:超大 MoE 模型,并非只能整坨塞进内存。
🔗 https://github.com/FareedKhan-dev/kimi-k3-in-c