Colibrì 做了一件很有意思的事:让拥有 7440 亿参数的 GLM-5.2 MoE 模型,在约 25GB 内存的普通设备上运行。
它没有把整个模型塞进内存,而是利用 MoE 模型“按需激活”的特点:
核心部分常驻内存
大量专家参数放在硬盘中
使用时按需加载和缓存
这样一来,原本需要大型 GPU 集群才能玩的模型,也有机会在个人设备上启动。
当然,代价也很明显:速度会受到硬盘读写影响,最低配置下更适合体验和研究,而不是日常高频使用。
但它最大的意义在于——本地运行超大模型的门槛,正在被一点点降低。
🔗:https://github.com/JustVugg/colibri