论文解读|arXiv 2606.07392 Online Pandora’s Box:上下文 LLM Cascading 在线决策
研究者把 LLM 串接建模为 Online Pandora's Box 问题,给出最优策略。在预算约束下 5-15% 性能提升。
DeepLab tag – model
研究者把 LLM 串接建模为 Online Pandora's Box 问题,给出最优策略。在预算约束下 5-15% 性能提升。
DeepSeek V3 / Qwen3 / GLM-4.5 / Kimi K2 / 文心 4.5 / 豆包 2.0 全面横评。在 8 个维度上找出真实差距,给中文 AI 找 3 个差异化机会。
中文 LLM 能记住正确发音,但「灵活使用」音韵知识仍是难题。研究者从同音 / 押韵 / 音近 3 维度建 benchmark。
本周国产 5 件大事:月之暗面 B 轮 / 智谱港股 IPO / 深度求索融资 / 百川智能 B+ / DuMate-DeepResearch 拿下 DRB 58%。
DeepSeek-R1 在 AIME 2025 上是「拓扑模仿」而非真推理。这给中国大模型路线图敲响警钟——长 CoT 不等于强推理。
arXiv 2606.07342(2026-06-05):把 LLM 当成「代码进化器」,在分诊、问诊、影像分类三个医疗场景全部击败人工 baseline,紧急召回从 0.60 提到 0.97。
arXiv 2606.07500(2026-06-05):SETA 把 LoRA 类持续学习推上新台阶——在 LLaMA-2 7B 和 Qwen3-4B 上同时提升新任务性能和早期任务保留。