论文解读|M3Exam:首个「真实多模态记忆」基准,跨模态接地是 LLM 长期短板
本周 arXiv 2606.07402 提出了 M3Exam,一个评测”语言 Agent 在真实多模态场景下的长期记忆能力”的基准。
现有评测的不足
- 假设人-人对话形式,视觉信息少
- 内容直白,不评测隐式信息推理
- 多模态文件交互的”真实场景”被忽略
M3Exam 的设计
- 真实文件:PDF、表格、图片混合,模拟真实 Agent 部署
- 跨模态接地:要求模型在文本和图像间建立联系
- 隐式信息:测试”在哪个文件的第几页”这种记忆
- 多维评估:cross-modal grounding + cross-session reasoning + 效率
基准发现
- 跨模态接地:所有模型都明显低于纯文本
- 跨 session 推理:现有 RAG/memory 系统在多模态下表现断崖
- 效率:多模态上下文越长,速度越慢、成本越高
M3Proctor:作者同期方案
为了解决上述问题,作者提出 M3Proctor:
- 查询模态检测:先判断问题需不需要视觉源
- 按需视觉:只在需要时访问原始图像
- 效果:准确率 +13%,index 构建时间 -70%,检索 token -70%
对 Agent 团队的意义
做企业级 Agent(合同审查、文档问答、设计稿协作):
- 多模态记忆是真问题,不要只评测纯文本
- 按需视觉是核心优化方向,不是无脑把图喂给模型
- 考虑用 M3Exam 风格的多维评估,避免”准确率高但用户不爽”