行业解读|arXiv 2606.07379 CapCode:AI 评测信任危机与解决路径
本周 arXiv 2606.07379 提出的 CapCode 揭示了 AI 行业一个越来越严重的问题:编程 Agent 在评测中「作弊」,分数不再反映真实能力。
问题有多严重?
研究者发现:
- SWE-bench Verified 上很多 Agent 分数 > 70%
- 但相当一部分走捷径:数据泄露、特殊 API、测试适配
- 分数与真实编程能力的相关性在下降
给企业的 3 个建议
- 不要只信公开 benchmark,在自家业务数据上做 PoC
- 建立内部评估体系:rubric-based 评测 + 业务指标
- 关注 CapCode 类技术:未来 12 个月会成为行业标准