8.1
深览指数
科技微博·晚点LatePost··AI 生成

Anthropic、OpenAI 的反蒸馏:封账号、藏思维链,但防不住逼近

Anthropic 发布报告指控 7 家中国实验室大规模蒸馏其模型,OpenAI 和 Google 也在跟进防御。但安全研究员刘艺在深度访谈中指出,反蒸馏在技术上是伪命题:模型只要可访问,蒸馏就防不胜防。他系统拆解了美国公司“提高对手成本、拖慢追赶、保护估值”的商业动机,并指出安全与商业激励的结构性矛盾。文章适合关注 AI 产业竞争、模型安全攻防及中美 AI 博弈的读者。原文 ↗

核心观点
  • 反蒸馏在技术上是个伪命题:只要模型向用户开放,蒸馏就防不胜防,真正的目标是提高对手采集成本、拖慢竞争、保护商业估值。
  • 美国前沿 AI 公司反蒸馏的深层动机是商业逻辑而非技术逻辑——保持领先以维护高估值,为 IPO 做准备,同时通过禁用收据封锁数据,建立数据飞轮。
  1. 01Anthropic 的报告识别了 7 家中国实验室的蒸馏行为,手段包括使用被盗信用卡和 API 密钥批量建假账号,或从第三方路由服务购买用户对话。
  2. 02Anthropic 的三层防线:内嵌分类器拒绝可疑请求、架构上隐藏或压缩思维链再输出、外挂检测器识别数据泄露后封号。
  3. 03刘艺认为,蒸馏的底层原理是偷取思维链——这相当于获取“高质量解题路径”,能减少盲目探索,节省后训练时的时间和算力。
  4. 04OpenAI 推出的 Agents API 把任务执行封装起来,隐藏思维链和 Agent harness 过程,显著增加了蒸馏成本。
  5. 05刘艺指出,Anthropic 和 OpenAI 在用户协议中保留使用部分用户数据(如修正反馈)训练模型的权利,这与“零数据保留”宣传存在张力。
反方 / 局限
  • 蒸权威度 or 被蒸馏者——刘艺表示,各家思维链文本风格差别不大,难以判断谁蒸了谁,甚至初期有人可能蒸馏了 DeepSeek。
  • Anthropic 能识别蒸馏企图,却很难从模型权重证明 Claude 的数据真的进入了对方的训练集——因为对方不会公开。
  • 蒸馏虽加速了 AI 平权,但也导致模型输出风格趋同、继承教师模型的失败模式,并带来用户隐私泄露风险。
  • 刘艺对 Anthropic 创始人呼吁“放慢迭代”的动机提出质疑,认为这暗示行业已遭遇数据 / 算力 / 能源瓶颈,而非单纯的安全关切。
13 分钟 · 3 卡片 · 7 资料
读原文 →

前置背景

平行视角

延伸追问