论文解读|arXiv 2606.07313 SV-Detect:用 Steering Vector 检测 AI 文本
本周 arXiv 2606.07313 提出的 SV-Detect 用Steering Vector 检测 AI 生成的文本。
问题
AI 文本检测在分布迁移下特别难:- 跨域(训练新闻、测社媒)
- 跨模型(GPT-4 训练,测 Claude)
- 编辑攻击(人类改写 AI 文本)
SV-Detect 的方案
核心:- 用frozen LLM,不训练
- 在每层提取分离人类 vs AI 的方向向量
- 用投影特征 训练轻量分类器
结果
- In-distribution 强表现
- 跨域 跨模型 跨编辑 稳健
- 可解释性 方向对齐可识别风格线索
对企业 AI 团队的启示
- 把假文本检测定位为「表征空间探测」问题
- 使用frozen 模型,零成本 训练
- 建议在内容审核 / 学术诚信 / 反欺诈 集成
- 和 arXiv 2606.07219 对抗式 方法互补