快讯|arXiv 2606.07410 揭示 DeepSeek-R1 数学推理是「拓扑模仿」

arXiv 2606.07410(2026-06-05)的研究者用 AIME 2025 的 30 道题、10247 个推理步骤,把 DeepSeek-R1 和人类数学家做对比分析。

核心结论:

  • 人类是「分析-推导」紧凑交替,DeepSeek-R1 频繁「回访-空转-浅层验证」
  • 研究者命名这种行为为 「拓扑模仿」(topological mimicry)
  • 真推理的两个信号:稳定的「分支+回溯」,且反思要落在「推导」中

对正在用 DeepSeek-R1 做数学/代码 Agent 的团队:长 CoT ≠ 强推理,训练 reward 应奖励「功能性推理」而非「看起来努力」。

Leave a Comment