7.9
深览指数
科技虎嗅·AppSo··AI 生成

重生之我在 Anthropic 做耗材

本文以拟人化书籍的视角切入,揭露了 Anthropic(AI 公司 Claude 的开发商)名为「Project Panama」的大规模实体书破坏性扫描计划。文章详细拆解了该计划的动因(效率与成本)、流程(裁切、扫描、建立永久数字资料库)以及引发的法律争议,并指出一个反直觉的结论:销毁纸书反而帮助 Anthropic 在版权诉讼中主张「一对一格式转换」,免于因复制行为受罚。文章不仅呈现了一个关于 AI 训练数据采集的纪实案例,更引发了对「信息永生」与「物理载体消亡」之间悖论的思考,适合对 AI 产业运作逻辑、版权法前沿案例及技术伦理感兴趣的深度读者。原文 ↗

核心观点
  • AI 公司训练模型所需的高质量数据,正在催生一种将实体书籍视为一次性耗材的「破坏性扫描」产业,其核心逻辑并非单纯的信息保存,而是追求极致的效率与成本控制,并意外地为此类行为创造了有利的法律辩护策略。
  1. 01Anthropic 启动了名为「Project Panama」的计划,目标是「破坏性扫描世界上所有的书」,并为此聘请了前 Google Books 项目负责人 Tom Turvey,投入数千万美元从二手市场大量采购书籍。
  2. 02破坏性扫描的具体操作是使用液压裁切机切掉书脊,然后将平整的散页送入高速馈纸扫描仪,这种方式相比使用 V 型托架,显著提升了速度和降低了成本,使处理 50 万至 200 万本书的六个月计划成为可能。
  3. 03被扫描的书籍并非全部用于训练。它们首先进入一个名为「中央研究资料库」的永久性数字档案库,工程师会根据语言、主题等维度挑选子集用于特定模型训练,许多被销毁的书籍最终可能从未被任何模型阅读过。
  4. 04在作者 Andrea Bartz 等人提起的版权诉讼中,法官认为模型训练属于「高度转换性」的合理使用,而更关键的是,销毁纸书的行为被法院视为合法的「一对一格式转换」,因为数字副本替换了纸质副本,并未增加市场上的副本总数。
  5. 05Anthropic 最终被判罚 15 亿美元,原因并非破坏性扫描,而是从盗版网站(如 Books3、LibGen)下载了超过 700 万本电子书,这些行为无法获得合理使用的保护。
  6. 06Project Panama 之后,市场上出现了专门为 AI 公司提供大宗实体书采购的产业链,如 ISBNdb 等公司,他们强调 2022 年以前的书籍因未受 AI 生成内容污染,是更「干净」的训练数据。
反方 / 局限
  • 文章暗示了作者立场的张力:一方面对书籍的物理毁灭感到惋惜,另一方面也承认这种高效率的数字化是 AI 产业发展的现实需求。文章并未为 Anthropic 的行为辩护,但揭示了其行为在法律和商业逻辑上的自洽性。
11 分钟 · 4 卡片 · 7 资料
读原文 →

概念锚点

平行视角

未来推演

延伸追问