Pi 官方开始给 Agent 加“耳朵”了🔥
Earendil Works 自己开源新的插件: pi-voice
支持 Whisper、Qwen3-ASR、Parakeet、Voxtral、SenseVoice 这些本地模型,说完以后直接转成文字进入 Pi
1、本地模型 + 本地语音
比如 Pi 接 Qwen3.8,本地跑模型,再配 pi-voice 的本地 STT。
从你说话,到模型处理,再到操作代码,整个链路都可以不经过第三方语音服务。
对于比较在意隐私、代码不想上传的人,这套组合就很舒服。
2、写代码的时候不用一直停下来敲 Prompt
看到一个 Bug,直接说:
“先检查刚才这个报错,只改后端,跑完测试再告诉我。”
很多这种临时想法,其实语音比打字自然得多,尤其 Agent 本身就在后台跑任务的时候。
3、音频和视频也可以直接变成 Pi 的输入
pi-voice 还有 transcribe_file,会议录音、采访、教程视频都能先本地转成文字,再让 Pi 做总结、提取任务或者继续处理。
后面我会尝试配合 Qwen、DeepSeek 这种本地模 或者 API 模型, 试试 PI 搭上语音本地助手是什么效果?
而且官方还预留了 /voice 这个命令: future voice mode