【Noiz AI、港科大、清华联合发布】AudioX-Turbo统一框架,支持文本、视频、音频等多模态输入生成音频与音乐。采用教师-学生蒸馏范式,基模型AudioX-Base经Distribution Matching Distillation提速至仅4采样步,函数评估次数减少约25倍。构建IF-caps-Pro数据集约920万样本,基准测试显示文本转音频和音乐生成性能领先,同时具备指令跟随能力。代码与数据集已在项目页开放。
该模型显著降低推理成本,有望推动开源音频生成广泛应用。
信源:https://zeyuet.github.io/AudioX-Turbo/
