论文解读|arXiv 2606.07313 SV-Detect:用 Steering Vector 检测 AI 文本

本周 arXiv 2606.07313 提出的 SV-DetectSteering Vector 检测 AI 生成的文本。

问题

AI 文本检测在分布迁移下特别难:

  • 跨域(训练新闻、测社媒)
  • 跨模型(GPT-4 训练,测 Claude)
  • 编辑攻击(人类改写 AI 文本)

SV-Detect 的方案

核心

  1. frozen LLM不训练
  2. 每层提取分离人类 vs AI 的方向向量
  3. 投影特征 训练轻量分类器

结果

  • In-distribution 强表现
  • 跨域 跨模型 跨编辑 稳健
  • 可解释性 方向对齐可识别风格线索

对企业 AI 团队的启示

  1. 假文本检测定位为「表征空间探测」问题
  2. 使用frozen 模型零成本 训练
  3. 建议在内容审核 / 学术诚信 / 反欺诈 集成
  4. 和 arXiv 2606.07219 对抗式 方法互补

论文:arXiv:2606.07313

Leave a Comment