快讯|arXiv 2606.07410 揭示 DeepSeek-R1 数学推理是「拓扑模仿」
arXiv 2606.07410(2026-06-05)的研究者用 AIME 2025 的 30 道题、10247 个推理步骤,把 DeepSeek-R1 和人类数学家做对比分析。
核心结论:
- 人类是「分析-推导」紧凑交替,DeepSeek-R1 频繁「回访-空转-浅层验证」
- 研究者命名这种行为为 「拓扑模仿」(topological mimicry)
- 真推理的两个信号:稳定的「分支+回溯」,且反思要落在「推导」中
对正在用 DeepSeek-R1 做数学/代码 Agent 的团队:长 CoT ≠ 强推理,训练 reward 应奖励「功能性推理」而非「看起来努力」。