观点|AI 对齐问题 2026 综述:从 RLHF 到 Constitutional 到 Process Supervision
2026 第四代方向
- 轨迹级对齐:奖励「分支-回溯」 而非「长 CoT」,参考 SETA 风格
- 工具使用对齐:Agent 调用工具的对齐,避免 CapCode 揭示的作弊
- 多模态对齐:视觉、音频的对齐,不能只盯文本
- 个性化对齐:宪法可由用户/公司定制
对企业的启示
- 不要迷信「对齐税」:新一代对齐成本在下降
- 建立内部对齐评估:不只是 benchmark,要 rubric-based
- 关注 CapCode 类方案:防 Agent 作弊 是未来 12 个月重点
- 多模型投票 作为对齐兜底:不同模型对齐方向不同
- 代表:OpenAI o1/o3、DeepSeek-R1、QwQ
- 优点:推理能力显著提升,可解释
- 缺点:arXiv 2606.07410 揭示:「拓扑模仿」 问题,「长 CoT」 ≠ 「真推理」
2026 第四代方向
- 轨迹级对齐:奖励「分支-回溯」 而非「长 CoT」,参考 SETA 风格
- 工具使用对齐:Agent 调用工具的对齐,避免 CapCode 揭示的作弊
- 多模态对齐:视觉、音频的对齐,不能只盯文本
- 个性化对齐:宪法可由用户/公司定制
对企业的启示
- 不要迷信「对齐税」:新一代对齐成本在下降
- 建立内部对齐评估:不只是 benchmark,要 rubric-based
- 关注 CapCode 类方案:防 Agent 作弊 是未来 12 个月重点
- 多模型投票 作为对齐兜底:不同模型对齐方向不同
AI 对齐(Alignment)是行业最核心的挑战之一。过去 3 年,对齐技术经历了三代演进,2026 进入了「过程监督」时代。
第一代:RLHF(2017-2024)
- 代表:InstructGPT、ChatGPT、Claude 1-3
- 优点:直接优化人类偏好
- 缺点:成本高(标注几万到几十万条),对齐税,容易被 reward hacking
第二代:Constitutional AI(2024-2025)
- 代表:Claude 2、Claude 3
- 优点:可扩展,透明,价值观可读
- 缺点:「宪法」 本身可能有问题,递归偏差
第三代:Process Supervision(2026 至今)
- 代表:OpenAI o1/o3、DeepSeek-R1、QwQ
- 优点:推理能力显著提升,可解释
- 缺点:arXiv 2606.07410 揭示:「拓扑模仿」 问题,「长 CoT」 ≠ 「真推理」
2026 第四代方向
- 轨迹级对齐:奖励「分支-回溯」 而非「长 CoT」,参考 SETA 风格
- 工具使用对齐:Agent 调用工具的对齐,避免 CapCode 揭示的作弊
- 多模态对齐:视觉、音频的对齐,不能只盯文本
- 个性化对齐:宪法可由用户/公司定制
对企业的启示
- 不要迷信「对齐税」:新一代对齐成本在下降
- 建立内部对齐评估:不只是 benchmark,要 rubric-based
- 关注 CapCode 类方案:防 Agent 作弊 是未来 12 个月重点
- 多模型投票 作为对齐兜底:不同模型对齐方向不同