大模型回答之前,每段提示词都得先切成 token,上下文越长这一步越耗时,Agent 这类长对话尤其明显。

大模型回答之前,每段提示词都得先切成 token,上下文越长这一步越耗时,Agent 这类长对话尤其明显。

Hugging Face 团队开源的分词库 tokenizers 已经有 11000+ Star,最近还发了 1.0 的候选版,底层大改了一轮。

官方测下来,单线程比旧版 0.23 快 3 到 30 倍,一份 512 字节的英文文档,延迟从 110 微秒降到 7 微秒,内存占用也降了 2.8 倍。

这版把非拉丁语言也当成了性能目标,中文吞吐提升 6.8 倍,印地语、阿姆哈拉语到了十几倍,这点有点意外。

GitHub:http://github.com/huggingface/tokenizers

核心用 Rust 写,Python 和 Node.js 都能直接调。推理和训练拆成了独立模块,线上服务只装推理那部分,体积小不少。

对 CPU 也没有特殊要求,2008 年以后的 x86 机器都能跑,苹果这类 ARM 芯片上也做了专门加速。

自己部署模型服务、在意首个字出来有多快的,可以换上测一测。


分类