查看: 5|回复: 0

语音模型这两天扎堆儿出,蚂蚁刚刚开源了一套声纹验证模型:AntSpeaker/MECT,超小、能实时跑

[复制链接]

10

主题

0

回帖

40

积分

新手上路

积分
40
发表于 昨天 21:53 | 显示全部楼层 |阅读模式
语音模型这两天扎堆儿出,蚂蚁刚刚开源了一套声纹验证模型:AntSpeaker/MECT,超小、能实时跑

可低延时声纹流式推理,在100ms的低延迟下能保持高精度声纹特征提取

有几个典型使用场景
银行、客服热线电话核身,比如“请说一句话验证身份”
App登录、设备唤醒只认主人声音

金融核身、端侧解锁,这是最直接的落点

跟上午那个英伟达的日志模型一样,都主打小、快,一个管谁在何时说、一个管是不是同一人,都是语音管线上的专精组件

MECT是把MoE引入了全监督声纹训练,结果用9.57M的小模型,在VoxCeleb1上追平(平均指标上反超)了5.87亿参数预训练模型才能达到的水平

证明了“专家分工”这套大模型玩法,在声纹验证这种小模型全监督任务上同样奏效

其通过因果重训练,实现了100ms延迟+近离线精度,也就意味着该模型能真正用在实时场景里




本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部