FreeToken:让你的游戏本变身顶级AI工作站
【FreeToken:让你的游戏本变身顶级AI工作站】伯克利与MIT团队发布的FreeToken打破了“大模型必须堆显存”的硬件迷信。它通过带宽自适应的CPU-GPU协同执行和语义感知缓存技术,让普通设备也能流畅运行顶级开源模型:8GB显存的4060笔记本能跑Qwen 3.6 35B,单张5090能驱动284B的DeepSeek-V4-Flash,甚至753B的GLM-5.2也能在单显卡工作站上跑起来。相比Ollama,它的推理速度提升3到4倍,预处理速度更是快了6到30倍,且支持原生权重直接运行。这标志着本地AI从“玩票”转向“生产力”。过去运行大模型常受限于显存容量,而FreeToken将整机视为一个弹性的计算平台,显卡不再是唯一的容器,而是智能的缓存。最关键的突破在于预处理速度的飞跃,这解决了AI智能体在多轮对话中响应迟缓的痛点。当顶级模型不再被锁在云端数据中心,而是成为你电脑里点击即用的免费软件,个人开发者对昂贵API的依赖将迎来真正的解耦。 arxiv.org /abs/2608.16157