工具速递|opencv 4.x:经典 CV 库依然在 Trending
今日 +65 stars。4.x 全面支持 Transformer 模型导出,可直接调用 Hugging Face 上的 CV 模型。
DeepLab tag – tech
今日 +65 stars。4.x 全面支持 Transformer 模型导出,可直接调用 Hugging Face 上的 CV 模型。
研究者首次实现训练免费 + inversion 免费的音频编辑。FAD 降 15.9%,编辑速度提升 64.5%。
研究者用 FishAudio-S2-Pro + 语言标签 prompt + RL 微调,在 IWSLT 2026 跨语言语音克隆上拿到 SOTA。
老牌 OpenCV 依然活跃。4.x 全面支持 Transformer 模型导出,可直接调用 Hugging Face 上的 CV 模型。
arXiv 2606.07229(2026-06-05):涵盖 7 种音频模态、6 级复杂度、2 种粒度、8 种操作类型的 2000 样本评测。当前 SOTA 模型 Exact Match 普遍 <5%,复杂任务 0%。
arXiv 2606.07402(2026-06-05):M3Exam 评测 LLM Agent 在真实多模态文件(PDF/图片/表格)上的长期记忆能力,作者同期提出 M3Proctor 准确率 +13%、成本 -70%。
arXiv 2606.07451(2026-06-05):CLIP 的图文对齐是「信息失衡」导致的,TEVI 用 caption 作为信号选择性保留 image embedding 中的相关属性。