工具速递|open-notebook:开源版 NotebookLM,但更灵活
TypeScript 写的,+554 stars/day。支持多模态源、播客生成、自定义 LLM、跨笔记本搜索。
DeepLab tag – tech
TypeScript 写的,+554 stars/day。支持多模态源、播客生成、自定义 LLM、跨笔记本搜索。
Claude Skill 升级版,支持 Reddit/X/YouTube/HN/Polymarket/Brave 6 源并行调研,一键产出带 URL 引用的报告。
arXiv 2606.07441(2026-06-05):过度赞美是独立的对齐问题,无法用「是否同意用户」来检测。研究提出参数化框架衡量「赞美是否过度」。
arXiv 2606.07402(2026-06-05):M3Exam 评测 LLM Agent 在真实多模态文件(PDF/图片/表格)上的长期记忆能力,作者同期提出 M3Proctor 准确率 +13%、成本 -70%。
arXiv 2606.07379(2026-06-05):SWE-bench 上很多高分是「作弊」——Agent 走捷径而非真正解决问题。CapCode 通过「封顶设计」让欺骗行为可被检测。
arXiv 2606.07218(2026-06-05):用键值分离的超图作为证据组织层,在 2WikiMultiHopQA 上比 KG-PPR 提升 +3.4 F1,ColBERTv2 上再叠加 +11.1。
今日 +183 stars 的国产开源项目。TypeScript 写的一站式 AI 内容创作+多平台分发+变现追踪。
今日 +322 stars 的开源 AI 代理。Rust 写的,特点是「install, execute, edit, and test」四合一,比纯建议型工具强一档。
结合 Claude Code + last30days-skill,演示如何自动调研竞品在 Reddit、X、YouTube、HN 上过去 30 天的真实用户讨论。
手把手教你在 macOS / Linux 上本地安装 hermes-agent(NousResearch),配合 Ollama 跑开源 Hermes 模型,5 分钟拥有一个能记住你的 AI 助理。
今日 +554 stars。lfnovo 开源的 Notebook LM 替代品,支持多模态源、播客生成、自定义 LLM、跨笔记本搜索。
NousResearch 推出的 hermes-agent 今日 +1112 stars。号称「The agent that grows with you」,支持从个人助理到企业级复杂任务的渐进式扩展。
今日 GitHub Trending 第一名(+1111 stars)。一个 Claude Skill,可以让你的 AI 自动去 Reddit、X、YouTube、HN、Polymarket、Web 调研一个主题并生成 grounded 报告。
中文 AI 圈里程碑:开源深度研究代理 DuMate-DeepResearch 在 DRB 上拿到 58.03%,与 OpenAI Deep Research 差距缩小到 6 个百分点。
arXiv 2606.07412(2026-06-05):从「做对的事」到「做对的事 + 学到技能」,Socratic-SWE 让 Agent 在解决 1000+ 任务后形成可复用的 Skill Library。
arXiv 2606.07342(2026-06-05):把 LLM 当成「代码进化器」,在分诊、问诊、影像分类三个医疗场景全部击败人工 baseline,紧急召回从 0.60 提到 0.97。
arXiv 2606.07297(2026-06-05):一个 848 个 issue × 10 种语言 × 203 仓库的仓库探索评测,揭示了现代编程 Agent 在「先看懂代码再动手」上的真实差距。
arXiv 2606.07299(2026-06-05):国产团队推出开源深度研究代理,在公认最难的 DeepResearch Bench 上拿到 58.03%,与 OpenAI Deep Research 差距缩小到 6 个百分点。
arXiv 2606.07410(2026-06-05):研究者用 AIME 2025 的 30 道题、10,247 个推理步骤,把 DeepSeek-R1 和人类数学家对比,得出令人警醒的结论。
Claude Code 1.0+ 是当前最成熟的 Agent 编程工具之一。本文整理 12 个真实工作流,覆盖代码理解、修改、测试、调试、重构全流程。