查看: 4|回复: 0

想要既快速又精准地生成音频?AudioX-Turbo 这次给出的答案确实非常直接。

[复制链接]

19

主题

0

回帖

57

积分

注册会员

积分
57
发表于 昨天 23:53 | 显示全部楼层 |阅读模式

想要既快速又精准地生成音频?AudioX-Turbo 这次给出的答案确实非常直接。

它没有采用零散的修补方式,而是重新设计了一个统一的“万物皆可音频”生成框架。无论你输入什么——文本、视频、音频,或是它们的任意组合——它都能输出高质量的声音,无论是超逼真的音效还是旋律优美的音乐,都能轻松应对。

更重要的是,它将速度提升到了一个全新的水平。通过分布匹配蒸馏和对抗蒸馏技术,该模型将传统扩散生成所需的 50 到 200 步大幅压缩至仅需 4 步。在单张 RTX 4090 显卡上,生成 10 秒的音频仅需 0.24 秒,计算量骤降约 25 倍,彻底告别了漫长的等待。

取得如此优异的性能很大程度上归功于其背后名为 IF-caps-Pro 的高质量数据集。该团队采用两阶段标注流程构建了约 920 万个样本,将模糊的文本标签细化为具有精确时间线的“脚本”,使模型能够真正理解复杂指令中的时间和数量关系。

在 AudioCaps 和 MusicCaps 等公开测试集上,仅需 4 个步骤即可生成的 AudioX-Turbo 不仅在音频质量指标上毫不妥协,甚至可以媲美或超越需要 50 到 200 个步骤的教师模型,其指令执行能力更是得到了显著提升。

这波开源浪潮真正拓展了低延迟、高控制应用的无限可能,例如互动戏剧配音、实时游戏引擎音效设计以及 AI 直播伴奏等。

开源代码库:https://github.com/NoizAI/AudioX-Turbo

论文:https://arxiv.org/abs/2606.12555

模型权重:


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部