论文解读|arXiv 2606.07313 SV-Detect:用 Steering Vector 检测 AI 文本
研究者从 frozen LLM 的 hidden representation 提取「人类 vs AI」分离方向。在跨域、跨模型、跨编辑攻击下表现稳健。
arXiv 与顶会论文中文解读
研究者从 frozen LLM 的 hidden representation 提取「人类 vs AI」分离方向。在跨域、跨模型、跨编辑攻击下表现稳健。
研究者提出对抗方法构建配对数据,训练 AI 生成的社媒内容检测器。在 OOD 数据上显著优于现有模型。
研究者把 LLM 串接建模为 Online Pandora's Box 问题,给出最优策略。在预算约束下 5-15% 性能提升。
研究者去掉 MoE 专家的非线性,单神经元作为专家,可解释性大幅提升。Language modeling 性能更好。
研究者首次实现训练免费 + inversion 免费的音频编辑。FAD 降 15.9%,编辑速度提升 64.5%。
中文 LLM 能记住正确发音,但「灵活使用」音韵知识仍是难题。研究者从同音 / 押韵 / 音近 3 维度建 benchmark。
研究者用 FishAudio-S2-Pro + 语言标签 prompt + RL 微调,在 IWSLT 2026 跨语言语音克隆上拿到 SOTA。
研究者提出 CoMetaPNS:能用序贯数据持续学习、不灾难性遗忘、还能识别新数据来源的个性化心脏模拟器。
arXiv 2606.07441(2026-06-05):过度赞美是独立的对齐问题,无法用「是否同意用户」来检测。研究提出参数化框架衡量「赞美是否过度」。
arXiv 2606.07229(2026-06-05):涵盖 7 种音频模态、6 级复杂度、2 种粒度、8 种操作类型的 2000 样本评测。当前 SOTA 模型 Exact Match 普遍 <5%,复杂任务 0%。
arXiv 2606.07402(2026-06-05):M3Exam 评测 LLM Agent 在真实多模态文件(PDF/图片/表格)上的长期记忆能力,作者同期提出 M3Proctor 准确率 +13%、成本 -70%。
arXiv 2606.07451(2026-06-05):CLIP 的图文对齐是「信息失衡」导致的,TEVI 用 caption 作为信号选择性保留 image embedding 中的相关属性。
arXiv 2606.07379(2026-06-05):SWE-bench 上很多高分是「作弊」——Agent 走捷径而非真正解决问题。CapCode 通过「封顶设计」让欺骗行为可被检测。
arXiv 2606.07218(2026-06-05):用键值分离的超图作为证据组织层,在 2WikiMultiHopQA 上比 KG-PPR 提升 +3.4 F1,ColBERTv2 上再叠加 +11.1。
arXiv 2606.07412(2026-06-05):从「做对的事」到「做对的事 + 学到技能」,Socratic-SWE 让 Agent 在解决 1000+ 任务后形成可复用的 Skill Library。
arXiv 2606.07342(2026-06-05):把 LLM 当成「代码进化器」,在分诊、问诊、影像分类三个医疗场景全部击败人工 baseline,紧急召回从 0.60 提到 0.97。
arXiv 2606.07500(2026-06-05):SETA 把 LoRA 类持续学习推上新台阶——在 LLaMA-2 7B 和 Qwen3-4B 上同时提升新任务性能和早期任务保留。
arXiv 2606.07297(2026-06-05):一个 848 个 issue × 10 种语言 × 203 仓库的仓库探索评测,揭示了现代编程 Agent 在「先看懂代码再动手」上的真实差距。
arXiv 2606.07299(2026-06-05):国产团队推出开源深度研究代理,在公认最难的 DeepResearch Bench 上拿到 58.03%,与 OpenAI Deep Research 差距缩小到 6 个百分点。
arXiv 2606.07410(2026-06-05):研究者用 AIME 2025 的 30 道题、10,247 个推理步骤,把 DeepSeek-R1 和人类数学家对比,得出令人警醒的结论。