教程|arXiv 2606.07412 Socratic-SWE 思路:让 Agent 学会『技能』
Socratic-SWE 论文核心:让 Agent 从历史轨迹中提炼可复用技能.本教程演示如何在企业内部落地.
DeepLab tag – tech
Socratic-SWE 论文核心:让 Agent 从历史轨迹中提炼可复用技能.本教程演示如何在企业内部落地.
arXiv 2606.07379 提出的封顶设计可以借鉴到企业内部 Agent 评测.本教程演示如何落地.
Claude Code 1.0 推出的 Subagent 让你在一个任务里调度多个 AI 实例.本教程讲清原理 + 实战 + 限制.
国产开源 AiToEarn:AI 内容创作 + 20+ 平台同步分发 + 收益追踪。
用 Gradio / Streamlit 在 HF Spaces 上免费部署 AI 应用,支持 GPU 加速(限额)。
TypeScript 写,支持多模态源、播客生成、自定义 LLM、跨笔记本搜索。
Claude Skill 专门压制 AI 输出中的模板化痕迹。人类区分率从 78% 降到 41%。
Claude Skill,跨 Reddit/X/YouTube/HN/Polymarket 调研任意主题,输出带 URL 引用的报告。
用 Gradio / Streamlit 在 HF Spaces 上免费部署 AI 应用,支持 GPU 加速(限额)。
arXiv 2606.07229 的方法学到手:把「自由格式任务」分解为可验证子项,让评测从「差不多」走向「精确诊断」。
手把手用 turbovec(基于 TurboQuant)搭一个 1000 万向量的本地 RAG 索引,4GB 内存,p99 5ms。
TypeScript 写的,+554 stars/day。支持多模态源、播客生成、自定义 LLM、跨笔记本搜索。
Claude Skill 专门压制 AI 输出中的模板化痕迹。开启后人类区分率从 78% 降到 41%。
Claude Skill 升级版,支持 Reddit/X/YouTube/HN/Polymarket/Brave 6 源并行调研,一键产出带 URL 引用的报告。
arXiv 2606.07441(2026-06-05):过度赞美是独立的对齐问题,无法用「是否同意用户」来检测。研究提出参数化框架衡量「赞美是否过度」。
arXiv 2606.07402(2026-06-05):M3Exam 评测 LLM Agent 在真实多模态文件(PDF/图片/表格)上的长期记忆能力,作者同期提出 M3Proctor 准确率 +13%、成本 -70%。
arXiv 2606.07379(2026-06-05):SWE-bench 上很多高分是「作弊」——Agent 走捷径而非真正解决问题。CapCode 通过「封顶设计」让欺骗行为可被检测。
今日 +183 stars 的国产开源项目。TypeScript 写的一站式 AI 内容创作+多平台分发+变现追踪。
手把手用 open-notebook + Ollama 搭一个本地 NotebookLM。所有数据不出本机,支持 PDF/YouTube/网页/音频。
结合 Claude Code + last30days-skill,演示如何自动调研竞品在 Reddit、X、YouTube、HN 上过去 30 天的真实用户讨论。