7.2
深览指数
科技腾讯新闻·首席商业评论··AI 生成

美国刚指控中国“蒸馏”,同一周,数学家把同样的问题抛回给OpenAI

9月第二周,美国NSA/FBI/CISA指控六家中国AI企业“工业规模”蒸馏美国前沿模型,几乎同时OpenAI宣布攻克数学难题却陷入数据出处争议,25位数学家联合声明警告AI与数学共同体目标“严重错位”。本文的核心洞察在于将两件看似无关的事件并置,指出真正问题不是蒸馏是否合法,而是谁有权定义“原创”与“恶意”——这是规则制定权之争。适合关注AI治理、科技地缘政治与学术伦理的读者,帮助跳出技术细节看清权力结构。原文 ↗

核心观点
  • 围绕AI蒸馏的争议本质不是技术或法律问题,而是谁有权力定义“原创”与“恶意”——这是规则制定权之争,美方指控与数学家质疑OpenAI共享同一套权力不对称结构。
  • “原创性”的认定正从“谁先发布”转向“谁先被学术共同体理解和验证”,这一新标准由25位数学家联合声明提出,对AI公司和传统研究者都构成挑战。
  1. 01美国NSA/FBI/CISA在公告AA26-251A中指控六家中国AI企业通过约2亿次交互、提取“数十亿token”数据,但公告自身承认“知识蒸馏”在AI研究领域是合法且实用的技术,未给出“工业规模”的明确定义门槛。
  2. 022025年1月,微软宣布上架某中国AI公司的开源模型并预告推出蒸馏版本,证明蒸馏是公开商业行为,而非灰色地带。
  3. 03数学家Tristan Buckmaster在OpenAI旗下Codex工具中保存未发表草稿后,询问其数据是否被用于训练OpenAI的突破性研究,得到“没有直接访问”的答复,但承认无法排除去标识化数据参与训练。
  4. 04数学家Andreas Thom提供具体证据链:数月来高频使用ChatGPT讨论未发表的核心推导,并发邮件质询。OpenAI研究员Mark Sellke仅回应“关于你与ChatGPT的对话:那没有发生过”,回避了训练数据问题。
  5. 0525位数学家(包括陶哲轩、邓煜)9月11日联合声明:AI公司的目标与数学共同体“存在严重错位”,以越来越快的速度批量生产“正确/错误”结论不是孕育新思想,而是摧毁孕育思想的沃土。
反方 / 局限
  • 文章未涉及中国AI企业可能存在的违规行为,也未探讨美方公告中数据交互量(1.51亿次/家)是否真的在实操层面构成对API使用条款的实质违反。
  • 对OpenAI的指控均基于研究者单方声明与时间线推测,无直接证据证明训练数据确实包含其未发表草稿;OpenAI虽回应模糊,但仍属于“查无实据”的状态。
9 分钟 · 4 卡片 · 9 资料
读原文 →

概念锚点

前置背景

平行视角

延伸追问