论文解读|SWE-Explore:把「代码仓库探索」作为独立能力来评测
SWE-bench 这一年推动编程 Agent 飞速发展,但SWE-Explore(arXiv 2606.07297,2026-06-05)指出了一个被忽略的问题:现有评测只关心「任务解决 vs 没解决」,忽略了「探索能力」作为独立维度。
SWE-Explore 的设计
数据集:
- 848 个 issue,10 种编程语言,203 个开源仓库
- 每个 issue 都有「成功解决该 issue 的 Agent 实际访问过的代码行」作为 ground truth
- 任务:给定仓库 + issue,在固定行数预算(line budget)下返回相关代码行排序
评估三个维度:
- 覆盖度(coverage):ground truth 行被命中的比例
- 排序质量(ranking):ground truth 是不是被排在前面
- 上下文效率(context-efficiency):用多少行预算就达到了覆盖度
关键结论
- 现代 Agent 探索器明显优于经典检索(BM25 / dense retrieval)
- 文件级定位已经够好:现代方法在 file-level 几乎 100% 命中
- 行级覆盖和排序才是分水岭:state-of-the-art Agent 之间的差距主要在这里
- 行预算越紧,差距越大——这意味着生产环境(context window 有限)下,差的 Agent 会被拉开更大
对编程 Agent 团队的意义
做 Agent 框架(Claude Code、Cursor、Codex CLI)的团队要意识到:
- 「想得清楚」 比 「读得多」 更重要。盲目 RAG 整个 repo 不如 agentic search
- 行级排序能力是下一阶段优化的关键,文件级命中已饱和
- 建议在自家评测里加 SWE-Explore-style 子评测,避免只盯 SWE-bench 综合分