Hugging Face 团队开源的分词库 tokenizers 已经有 11000+ Star,最近还发了 1.0 的候选版,底层大改了一轮。
官方测下来,单线程比旧版 0.23 快 3 到 30 倍,一份 512 字节的英文文档,延迟从 110 微秒降到 7 微秒,内存占用也降了 2.8 倍。
这版把非拉丁语言也当成了性能目标,中文吞吐提升 6.8 倍,印地语、阿姆哈拉语到了十几倍,这点有点意外。
GitHub:http://github.com/huggingface/tokenizers
核心用 Rust 写,Python 和 Node.js 都能直接调。推理和训练拆成了独立模块,线上服务只装推理那部分,体积小不少。
对 CPU 也没有特殊要求,2008 年以后的 x86 机器都能跑,苹果这类 ARM 芯片上也做了专门加速。
自己部署模型服务、在意首个字出来有多快的,可以换上测一测。