观点|AI 与版权:训练数据「合理使用」的边界正在重写
2026 年上半年,三个版权案的结果重塑了 AI 行业的训练数据规则。本文梳理三大判决及其影响。
三大案件
- 原告诉:未经授权用艺术家作品训练
- 判决:艺术家胜诉,Midjourney 需提供「退出机制」,艺术家可选择不参与训练
- 关键:「退出」 成为标准做法,类似 cookie 同意
- 一审:英国法院判 Stability 部分胜诉,但要求赔偿
- 上诉中:焦点是「训练数据是否需要授权」
- 预计 2026 年底判决
对 AI 行业的影响
- 训练数据授权成为标配,类似音乐版权
- 「退出机制」 是法定义务,不是可选项
- RAG 检索 比「内化训练」更安全
- 合成数据 成为新出路,规避版权风险
给 AI 公司的建议
- 数据来源审计:梳理所有训练数据来源,标记高风险
- 建立「退出机制」:让版权方可以选择不参与
- 优先 RAG 路线:用户查询时再调用,不算训练
- 合成数据 + 授权数据组合:降低单一来源风险
- 关注中国《生成式 AI 服务管理办法》:要求训练数据来源合法
对创作者的机会
- 「退出机制」 赋予创作者选择权
- 数据授权市场 出现,类似 Getty 模式
- 小众创作者 可以联合起来,集体谈判