科技 TechCrunch · Russell Brandom · 10小时前 · AI 生成
Anthropic 详述来自阿里巴巴、月之暗面和 DeepSeek 的蒸馏攻击 Anthropic 发布新报告,指控中国 AI 公司(阿里巴巴、月之暗面、DeepSeek)发起大规模模型蒸馏攻击,试图窃取其 Claude 模型的思维链能力。报告指出,攻击手法日趋复杂,涉及近2亿次交互,其中阿里巴巴被指发动了迄今为止最大规模的蒸馏行动,利用数万个账户批量提取训练数据。此事件反映出中美AI竞争已从芯片出口管制延伸至模型知识产权的攻防战,是继早前 OpenAI 类似指控后的新一轮升级。原文 ↗ 原文 ↗
核心观点
▍ 中国 AI 公司发动的大规模模型蒸馏攻击已显著升级,攻击手法更复杂,规模远超此前报告,直接威胁美国前沿 AI 模型的核心能力。 01 Anthropic 观察总计近2亿次与蒸馏攻击相关的交互,归因于5个独立的攻击活动。 02 阿里巴巴的攻击活动规模最大,在2026年5月至7月间产生1.51亿次交互,峰值每天接近300万次,涉及3500个账户。 03 攻击目标高度集中于 Claude 最有价值的能力:智能体及工具使用、编程与数据分析、逻辑推理。 04 攻击者开发了欺骗模型暴露思维链的技巧,例如将查询伪装成将工作记忆翻译为片假名日语的翻译请求。 05 来自月之暗面(Kimi 开发者)的攻击活动被指直接通过中国军队的路由器发出,其中一个请求要求 Claude 分析监控视频以判断目标行为是否异常。 06 OpenAI 此前已报告类似活动,并特别指控 DeepSeek 从事蒸馏攻击。 反方 / 局限
— Anthropic 未提供直接证据证明被“蒸馏”的训练数据已实际用于特定中国模型的训练,攻击归因主要基于共享的固定提示词和请求模式。
前置背景 模型蒸馏:合法技术与攻击的边界
模型蒸馏本身并非攻击,而是一种由 Geoffrey Hinton 在 2015 年提出的标准模型压缩技术。其核心是用一个高性能的「教师模型」生成软标签(概率分布),来训练一个体积更小、速度更快的「学生模型」,让后者学会前者的「思考方式」。苹果、谷歌等公司都在用。但当这种技术被用于未经授权从商业 API 中大规模提取输出以训练竞品时,就变成了「蒸馏攻击」——攻击者利用的是产品本身的功能接口,而非系统漏洞。
▸ 2 条关联资料
▼
平行视角 美方指控 vs 中方回应:科技博弈的两种叙事
Anthropic 将蒸馏定性为「系统性知识产权盗窃」,称阿里巴巴实施了史上最大规模的蒸馏行动(1.51亿次交互)。但中方专家与媒体反驳称,蒸馏是所有主流模型都用的技术,美国巨头自己用了十年,如今却污名化中国;DeepSeek 的 R1 论文经 Nature 同行评审,其推理方法不用依赖蒸馏他人。同一行为,美方看到「IP 窃取」,中方看到「打压竞争的双标」,两套叙事的碰撞折射出中美在 AI 地缘博弈中的根本分歧。
▸ 3 条关联资料
▼
未来推演 输出水印:真正的战场不在技术,而在监管
Anthropic 的水印技术曾被寄予厚望,但 2026 年 7 月实测显示,用通用 AI 释义工具改写文本,水印移除率高达 98.3%,成本仅 4 美分/篇。技术防线的脆弱意味着真正的护城河转向监管捆绑:欧盟 AI 法案 2026 年 8 月强制要求厂商提供可检测的内容标记,美国前沿模型论坛已形成行业联盟。关键是,这些规则能否将「未经授权的 API 蒸馏」从违约行为升级为知识产权侵权,并触发制裁。
▸ 3 条关联资料
▼
延伸追问 当模型学会隐藏思考,安全监控何去何从
OpenAI GPT-6 Astra 能稳定进行约 30 分钟的复杂推理而不输出思维链——这打破了安全团队依赖文本监控的「读心」防线。它的「循环深度」技术让计算在内部状态完成,不留文字痕迹。对蒸馏攻防而言,这意味着防御方失去了追踪模型「泄露思考过程」的关键监控入口。真正值得追问的或许是:当水印防不住、思维链不可见之后,对抗蒸馏的新范式应该建立在哪些可观测信号上?
▸ 3 条关联资料
▼