7.7
深览指数
科技TechCrunch·Rebecca Bellan··AI 生成

微软高管称 AI 抓取内容是“人类历史上最大规模的劳动盗窃”,未删减文件揭示

《纽约时报》诉 OpenAI 和微软版权案的未删减文件揭示了核心证据:微软一位顶级高管私下称 AI 训练数据抓取为“盗窃”,OpenAI 内部也承认其产品对出版商构成“生存威胁”。文件详细描述了双方如何通过绕过付费墙、大规模抓取并剥离版权声明来获取训练数据。微软自己的数据还显示,其 Copilot 引擎导致《纽约时报》网站点击率下降了 93%,直接威胁了内容供应商的经济基础。这些新证据直接冲击了 AI 公司以“合理使用”作为法律抗辩的核心论点。原文 ↗

核心观点
  • 新公开的未删减文件提供了之前不为人知的证据,直接削弱了 OpenAI 和微软以“合理使用”作为未经授权使用版权材料训练 AI 的辩护立场,尤其在其行为对原始作品市场造成替代与伤害方面。
  • 微软高管的内部表述与其公开立场形成鲜明对比,公司高层私下承认 AI 培训行为构成“盗窃”,并且 AI 产品(如 Copilot)直接替代了新闻网站的流量来源,形成了威胁内容供应商生存的“厄运循环”。
  1. 01微软应用科学总监 Brent Hecht 在内部演示中将 Copilot 导致《纽约时报》网站点击率下降 93% 的现象描述为“厄运循环”,并承认这在损害模型性能和整个网络生态。
  2. 02OpenAI 的 ChatGPT 主管 Nick Turley 在内部通讯中承认,像 ChatGPT 这样的产品对出版商构成“生存威胁”,并且是“高度替代性”的。
  3. 03微软 CEO 萨提亚·纳德拉在证词中表示,任何付费墙后面的内容都应该获得许可才能用于“接地”或训练,并承认如果他事先知道 OpenAI 抓取了付费内容,他会动用合同权利要求 OpenAI 重新训练模型。
  4. 04文件首次披露,OpenAI 的中期训练数据集包含超过 91,692 份《纽约时报》等原告出版的作品副本;一个源自 Common Crawl 的数据集单独包含超过 200 万份来自 nytimes.com 的文档。
  5. 05为了最大化抓取效果,OpenAI 员工曾策划绕过《纽约时报》付费墙的方案,研究员 Nick Ryder 向总裁 Greg Brockman 告知了“绕过 NYT 付费墙的 hack”,Brockman 回复“不错”。
  6. 06OpenAI 和微软还被指刻意从训练数据中剥离版权和作者信息,研究人员“不希望模型输出”“版权声明”给用户。
反方 / 局限
  • 尽管有这些新证据,美国法院此前普遍倾向于支持 AI 公司关于训练属于“合理使用”的论点;特朗普政府近期也提交了支持 OpenAI 的非授权使用版权材料的简报。该案的最终法律界定仍存在重大不确定性。
  • 本文指出,很多新信息来自《纽约时报》自身的陈述,而非完全解封的原始证据文件;引用的内部言论也缺乏完整的原始语境,可能影响对其真实意图的准确解读。
13 分钟 · 5 卡片 · 8 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问