FreeToken:让顶级MoE模型在游戏本上“跑”起来

【FreeToken:让顶级MoE模型在游戏本上“跑”起来】FreeToken是一个专为边缘计算设计的推理引擎(FlashML-org/FreeToken),核心目标是在普通游戏本或台式机上驱动290B参数规模的开放权重MoE模型。它通过带宽自适应的CPU与GPU协同执行、全局LRU专家缓存以及语义感知缓存等技术,打破了超大规模模型对数据中心级硬件的依赖。目前已支持DeepSeek-V4-Flash、Qwen3.6等主流模型,并提供与OpenAI兼容的API接口,方便开发者直接接入现有的Agent工作流。长期以来,顶级AI能力被高昂的显存成本锁在云端,FreeToken的出现标志着本地推理从“能跑”向“好用”的跨越。它最精妙的设计在于将异构硬件视为流动的资源池,利用MoE架构天然的稀疏性,用时间换空间,让消费级显卡通过精密的调度也能处理原本需要数张H100才能承载的任务。这不仅是技术上的压榨,更是对数据隐私和算力自主权的重新夺取。当个人开发者能以极低成本在本地运行具备推理能力的模型时,AI应用的爆发点才真正到来。虽然本地运行在极端长文本下仍受物理带宽限制,但这种架构为硬件资源的极致利用提供了一个可落地的范式。




分类