语音模型这两天扎堆儿出,蚂蚁刚刚开源了一套声纹验证模型:AntSpeaker/MECT,超小、能实时跑

语音模型这两天扎堆儿出,蚂蚁刚刚开源了一套声纹验证模型:AntSpeaker/MECT,超小、能实时跑

可低延时声纹流式推理,在100ms的低延迟下能保持高精度声纹特征提取

有几个典型使用场景
银行、客服热线电话核身,比如“请说一句话验证身份”
App登录、设备唤醒只认主人声音

金融核身、端侧解锁,这是最直接的落点

跟上午那个英伟达的日志模型一样,都主打小、快,一个管谁在何时说、一个管是不是同一人,都是语音管线上的专精组件

MECT是把MoE引入了全监督声纹训练,结果用9.57M的小模型,在VoxCeleb1上追平(平均指标上反超)了5.87亿参数预训练模型才能达到的水平

证明了“专家分工”这套大模型玩法,在声纹验证这种小模型全监督任务上同样奏效

其通过因果重训练,实现了100ms延迟+近离线精度,也就意味着该模型能真正用在实时场景里




分类