可低延时声纹流式推理,在100ms的低延迟下能保持高精度声纹特征提取
有几个典型使用场景
银行、客服热线电话核身,比如“请说一句话验证身份”
App登录、设备唤醒只认主人声音
金融核身、端侧解锁,这是最直接的落点
跟上午那个英伟达的日志模型一样,都主打小、快,一个管谁在何时说、一个管是不是同一人,都是语音管线上的专精组件
MECT是把MoE引入了全监督声纹训练,结果用9.57M的小模型,在VoxCeleb1上追平(平均指标上反超)了5.87亿参数预训练模型才能达到的水平
证明了“专家分工”这套大模型玩法,在声纹验证这种小模型全监督任务上同样奏效
其通过因果重训练,实现了100ms延迟+近离线精度,也就意味着该模型能真正用在实时场景里