论文解读|SWE-Explore:把「代码仓库探索」作为独立能力来评测

SWE-bench 这一年推动编程 Agent 飞速发展,但SWE-Explore(arXiv 2606.07297,2026-06-05)指出了一个被忽略的问题:现有评测只关心「任务解决 vs 没解决」,忽略了「探索能力」作为独立维度

SWE-Explore 的设计

数据集:

  • 848 个 issue,10 种编程语言,203 个开源仓库
  • 每个 issue 都有「成功解决该 issue 的 Agent 实际访问过的代码行」作为 ground truth
  • 任务:给定仓库 + issue,在固定行数预算(line budget)下返回相关代码行排序

评估三个维度:

  1. 覆盖度(coverage):ground truth 行被命中的比例
  2. 排序质量(ranking):ground truth 是不是被排在前面
  3. 上下文效率(context-efficiency):用多少行预算就达到了覆盖度

关键结论

  • 现代 Agent 探索器明显优于经典检索(BM25 / dense retrieval)
  • 文件级定位已经够好:现代方法在 file-level 几乎 100% 命中
  • 行级覆盖和排序才是分水岭:state-of-the-art Agent 之间的差距主要在这里
  • 行预算越紧,差距越大——这意味着生产环境(context window 有限)下,差的 Agent 会被拉开更大

对编程 Agent 团队的意义

做 Agent 框架(Claude Code、Cursor、Codex CLI)的团队要意识到:

  • 「想得清楚」 比 「读得多」 更重要。盲目 RAG 整个 repo 不如 agentic search
  • 行级排序能力是下一阶段优化的关键,文件级命中已饱和
  • 建议在自家评测里加 SWE-Explore-style 子评测,避免只盯 SWE-bench 综合分

论文:arXiv:2606.07297

Leave a Comment