论文解读|arXiv 2606.07356 DirectAudioEdit:训练免费的音频编辑
研究者首次实现训练免费 + inversion 免费的音频编辑。FAD 降 15.9%,编辑速度提升 64.5%。
DeepLab tag – model
研究者首次实现训练免费 + inversion 免费的音频编辑。FAD 降 15.9%,编辑速度提升 64.5%。
研究者用 FishAudio-S2-Pro + 语言标签 prompt + RL 微调,在 IWSLT 2026 跨语言语音克隆上拿到 SOTA。
arXiv 2606.07229(2026-06-05):涵盖 7 种音频模态、6 级复杂度、2 种粒度、8 种操作类型的 2000 样本评测。当前 SOTA 模型 Exact Match 普遍 <5%,复杂任务 0%。