最近看到一个挺有意思的 TTS 项目:sanoTTS。

最近看到一个挺有意思的 TTS 项目:sanoTTS。

它的思路很直接:把 TTS 做到足够小。

最小的 heart-nano 只有 294K 参数,模型权重 337KB,最大的也就 2.27M 参数。甚至可以直接跑在大约 $3 的 ESP32-S3 上,不需要云端,也不需要 NPU。

而且浏览器里也能直接跑,WebAssembly 全部在本地完成,不需要把文本上传服务器。

目前有 11 个声音、6 种语言,Python、NPM、Arduino/PlatformIO 都能用。

我觉得这种项目比单纯把模型越做越大更有意思。

以后一个小玩具、一块 MCU,甚至一个网页,可能自己就能直接“开口说话”。

AI 不一定非得塞进云端。

能跑进 337KB 里,才是真的有点东西。

GitHub:https://github.com/Ampixa/sanoTTS

#


分类