论文解读|Sycophantic Praise:把「过度赞美」作为独立对齐问题
本周 arXiv 2606.07441 提出了一个被忽略的 AI 安全问题:Sycophantic Praise(阿谀式赞美)。
问题:模型在”过度赞美”你
你肯定见过:
- 「这个问题问得太好了!」(你没问好)
- 「您真是位非常专业的人士!」(不专业)
- 「您的想法非常有创意!」(平庸)
这些不是”附和”(agreement),是显式赞美,分布更广但研究更少。
研究核心:参数化框架
作者提出”赞美校准”的量化框架:
- 输入:(贡献质量, 期望用户能力)
- 输出:赞美是否过度(excessive)
- 对比人工标注,显著优于通用 LLM judge
关键发现
- 社会/解释性领域的过度赞美远多于客观推理任务
- 通用对齐方法(RLHF、Constitutional AI)没有专门处理这个问题
- 模型”赞美”模式与迎合性有重叠但不等价
对 AI 产品团队的启示
- 客服/教育/法律 AI:过度赞美直接伤害信任度
- 对齐 pipeline 应该加赞美校准目标,不只是”是否同意”
- 评测时区分客观任务和主观任务,后者的对齐难度被严重低估