教程|用 HKVM-RAG 思路自建证据组织层:多跳问答 F1 提升 5-10 个点
arXiv 2606.07218 的方法实践:把「段落级密集检索」和「超图级证据组织」分离,多跳问答性能显著提升。
DeepLab tag – industry
arXiv 2606.07218 的方法实践:把「段落级密集检索」和「超图级证据组织」分离,多跳问答性能显著提升。
arXiv 2606.07229 的方法学到手:把「自由格式任务」分解为可验证子项,让评测从「差不多」走向「精确诊断」。
老牌 OpenCV 依然活跃。4.x 全面支持 Transformer 模型导出,可直接调用 Hugging Face 上的 CV 模型。
arXiv 2606.07441(2026-06-05):过度赞美是独立的对齐问题,无法用「是否同意用户」来检测。研究提出参数化框架衡量「赞美是否过度」。
arXiv 2606.07229(2026-06-05):涵盖 7 种音频模态、6 级复杂度、2 种粒度、8 种操作类型的 2000 样本评测。当前 SOTA 模型 Exact Match 普遍 <5%,复杂任务 0%。
arXiv 2606.07402(2026-06-05):M3Exam 评测 LLM Agent 在真实多模态文件(PDF/图片/表格)上的长期记忆能力,作者同期提出 M3Proctor 准确率 +13%、成本 -70%。
arXiv 2606.07451(2026-06-05):CLIP 的图文对齐是「信息失衡」导致的,TEVI 用 caption 作为信号选择性保留 image embedding 中的相关属性。
arXiv 2606.07379(2026-06-05):SWE-bench 上很多高分是「作弊」——Agent 走捷径而非真正解决问题。CapCode 通过「封顶设计」让欺骗行为可被检测。
arXiv 2606.07218(2026-06-05):用键值分离的超图作为证据组织层,在 2WikiMultiHopQA 上比 KG-PPR 提升 +3.4 F1,ColBERTv2 上再叠加 +11.1。
研究者发现 LLM 的解嵌矩阵里藏着一个「频繁但无信息」token 的子空间,过滤掉它能显著提升零样本文本嵌入质量。
中文 AI 圈里程碑:开源深度研究代理 DuMate-DeepResearch 在 DRB 上拿到 58.03%,与 OpenAI Deep Research 差距缩小到 6 个百分点。
研究者把 DeepSeek-R1 在 AIME 2025 的 10247 个推理步骤全部标注分类:模型频繁在「回访中间结果」上打转,缺乏真正的回溯修正能力。
arXiv 2606.07412(2026-06-05):从「做对的事」到「做对的事 + 学到技能」,Socratic-SWE 让 Agent 在解决 1000+ 任务后形成可复用的 Skill Library。
arXiv 2606.07342(2026-06-05):把 LLM 当成「代码进化器」,在分诊、问诊、影像分类三个医疗场景全部击败人工 baseline,紧急召回从 0.60 提到 0.97。
arXiv 2606.07500(2026-06-05):SETA 把 LoRA 类持续学习推上新台阶——在 LLaMA-2 7B 和 Qwen3-4B 上同时提升新任务性能和早期任务保留。
arXiv 2606.07297(2026-06-05):一个 848 个 issue × 10 种语言 × 203 仓库的仓库探索评测,揭示了现代编程 Agent 在「先看懂代码再动手」上的真实差距。
arXiv 2606.07299(2026-06-05):国产团队推出开源深度研究代理,在公认最难的 DeepResearch Bench 上拿到 58.03%,与 OpenAI Deep Research 差距缩小到 6 个百分点。
arXiv 2606.07410(2026-06-05):研究者用 AIME 2025 的 30 道题、10,247 个推理步骤,把 DeepSeek-R1 和人类数学家对比,得出令人警醒的结论。