“大模型一定要大内存”这条规则,正在被重新挑战。

“大模型一定要大内存”这条规则,正在被重新挑战。

Colibrì 做了一件很有意思的事:让拥有 7440 亿参数的 GLM-5.2 MoE 模型,在约 25GB 内存的普通设备上运行。

它没有把整个模型塞进内存,而是利用 MoE 模型“按需激活”的特点:

核心部分常驻内存
大量专家参数放在硬盘中
使用时按需加载和缓存

这样一来,原本需要大型 GPU 集群才能玩的模型,也有机会在个人设备上启动。

当然,代价也很明显:速度会受到硬盘读写影响,最低配置下更适合体验和研究,而不是日常高频使用。

但它最大的意义在于——本地运行超大模型的门槛,正在被一点点降低。
🔗:https://github.com/JustVugg/colibri



分类