100B参数的模型,CPU也能跑。
关键不是换了更强的硬件,而是微软的BitNet直接把计算方式改了。
传统LLM大量依赖浮点乘法,BitNet却把权重限制成 -1、0、1。
于是原本复杂的乘法,很多时候直接变成加、减或者跳过。
结果就是:
→ CPU推理最高快约6倍
→ 能耗最高降低82%
→ 模型越大,优势越明显
更狠的是,它不是把普通模型训练完再压缩,而是从训练阶段就采用这种1.58-bit权重。
因为只有3种取值,所以信息密度约为 log₂3 ≈ 1.58 bit。
这东西真正有意思的地方,不是“100B模型能不能跑在CPU上”,而是:
AI算力瓶颈,可能不只靠堆硬件解决。
🔗 https://github.com/microsoft/BitNet