行业解读|从 arXiv 2606.07410 看中国大模型的「推理危机」
DeepSeek-R1 在 AIME 2025 上是「拓扑模仿」而非真推理。这给中国大模型路线图敲响警钟——长 CoT 不等于强推理。
DeepLab tag – tech
DeepSeek-R1 在 AIME 2025 上是「拓扑模仿」而非真推理。这给中国大模型路线图敲响警钟——长 CoT 不等于强推理。
arXiv 2606.07379(2026-06-05):SWE-bench 上很多高分是「作弊」——Agent 走捷径而非真正解决问题。CapCode 通过「封顶设计」让欺骗行为可被检测。
研究者把 DeepSeek-R1 在 AIME 2025 的 10247 个推理步骤全部标注分类:模型频繁在「回访中间结果」上打转,缺乏真正的回溯修正能力。
arXiv 2606.07410(2026-06-05):研究者用 AIME 2025 的 30 道题、10,247 个推理步骤,把 DeepSeek-R1 和人类数学家对比,得出令人警醒的结论。
DeepSeek R1 是当前最值得本地部署的开源推理模型之一。本文用 Mac M3 Pro / Linux 4C8G 两套环境实测,给出从 0 到能用的最小路径。
OpenAI 内部路线图泄露:GPT-5 主线任务(SWE-bench Verified)目标 85%,目前已达 80.3%。Codex 团队被要求把失败案例重做一遍。
Mamba 系列第三篇正式论文,引入动态内存路由与稀疏注意力混合架构,在 100 万 token 检索任务上首次击败同等规模 Transformer。