论文解读|MMAE:2000 样本多任务音频编辑基准,揭示当前模型「几乎全不及格」

本周 arXiv 2606.07229 发布的 MMAE(Massive Multitask Audio Editing Benchmark)是一个给音频生成/编辑领域泼冷水的基准:当前所有 SOTA 模型在复杂任务上 EMR 普遍 < 5%,混合模态任务直接 0%。

MMAE 的设计

7 种音频模态:

  • 纯声音 / 纯语音 / 纯音乐 / 声音+语音 / 声音+音乐 / 语音+音乐 / 三者混合

6 级任务复杂度:

  • 从”改个音量”到”多跳推理 + 多轮编辑”

2 种粒度 + 8 种操作类型:

  • 片段级 vs 全局级
  • 替换、删除、插入、风格迁移、混合、混音、效果、降噪

2000 个高质量样本 + 17741 个可验证标准。

评估方法:rubric-based

不像传统”音频相似度”(FAD、KLD),MMAE 用细粒度评分量表

  • 把”自由格式任务”分解为17,741 个可验证子项
  • 每个子项独立打分
  • 能精确诊断模型在哪一步失败

关键发现

  • Exact Match Rate 普遍 < 5%
  • 混合模态任务:EMR = 0%(所有 SOTA 模型)
  • 即使是 Gemini-Omni、Nano-banana 2 类的多模态强模型,在 MMAE 上也远未达到可靠编辑
  • 主要瓶颈:精确执行 + 结构鲁棒性

对音频 AI 团队的启示

  1. 音频编辑远没到”产品化”程度,不要做 2C 创业方向
  2. 需要 rubric-based 评测,相似度指标在多模态下失效
  3. 混合模态是真正未解的难题,差异化机会在这里

代码开源:github.com/ddlBoJack/MMAE

Leave a Comment