它的思路很直接:把 TTS 做到足够小。
最小的 heart-nano 只有 294K 参数,模型权重 337KB,最大的也就 2.27M 参数。甚至可以直接跑在大约 $3 的 ESP32-S3 上,不需要云端,也不需要 NPU。
而且浏览器里也能直接跑,WebAssembly 全部在本地完成,不需要把文本上传服务器。
目前有 11 个声音、6 种语言,Python、NPM、Arduino/PlatformIO 都能用。
我觉得这种项目比单纯把模型越做越大更有意思。
以后一个小玩具、一块 MCU,甚至一个网页,可能自己就能直接“开口说话”。
AI 不一定非得塞进云端。
能跑进 337KB 里,才是真的有点东西。
GitHub:https://github.com/Ampixa/sanoTTS
#