论文解读|MMAE:2000 样本多任务音频编辑基准,揭示当前模型「几乎全不及格」
本周 arXiv 2606.07229 发布的 MMAE(Massive Multitask Audio Editing Benchmark)是一个给音频生成/编辑领域泼冷水的基准:当前所有 SOTA 模型在复杂任务上 EMR 普遍 < 5%,混合模态任务直接 0%。
MMAE 的设计
7 种音频模态:
- 纯声音 / 纯语音 / 纯音乐 / 声音+语音 / 声音+音乐 / 语音+音乐 / 三者混合
6 级任务复杂度:
- 从”改个音量”到”多跳推理 + 多轮编辑”
2 种粒度 + 8 种操作类型:
- 片段级 vs 全局级
- 替换、删除、插入、风格迁移、混合、混音、效果、降噪
2000 个高质量样本 + 17741 个可验证标准。
评估方法:rubric-based
不像传统”音频相似度”(FAD、KLD),MMAE 用细粒度评分量表:
- 把”自由格式任务”分解为17,741 个可验证子项
- 每个子项独立打分
- 能精确诊断模型在哪一步失败
关键发现
- Exact Match Rate 普遍 < 5%
- 混合模态任务:EMR = 0%(所有 SOTA 模型)
- 即使是 Gemini-Omni、Nano-banana 2 类的多模态强模型,在 MMAE 上也远未达到可靠编辑
- 主要瓶颈:精确执行 + 结构鲁棒性
对音频 AI 团队的启示
- 音频编辑远没到”产品化”程度,不要做 2C 创业方向
- 需要 rubric-based 评测,相似度指标在多模态下失效
- 混合模态是真正未解的难题,差异化机会在这里
代码开源:github.com/ddlBoJack/MMAE