6.7
深览指数
科技虎嗅·技术领导力©··AI 生成

全球AI公司,疯狂抢购旧书

文章揭示AI公司为获取高质量人类训练数据,正批量购买旧书扫描后销毁,主要瞄准2022年之前出版的纯人类文本。核心论据是互联网AI生成内容已超50%,用AI数据训练AI会导致"模型塌缩"(质量断崖下降)。作者指出高质量人类文本资源将在2026-2032年耗尽,并认为数据瓶颈可能终结本轮AI浪潮,引发新一轮停滞期。适合关注AI产业瓶颈、训练数据供应链、大模型未来走向的读者。原文 ↗

核心观点
  • AI公司批量购买旧书扫描销毁,是为了获取2022年之前未被AI污染的高质量人类文本,以训练下一代模型,避免"模型塌缩"(模型质量断崖下降)。
  • 高质量人类文本资源预计在2026-2032年耗尽,数据瓶颈可能终结本轮AI浪潮,导致AI领域重新进入漫长停滞期。
  1. 01数据中间商ISBNdb手握超1.11亿本图书目录,已转型为AI公司提供旧书批发服务,套餐从1000本到100万本不等,明码标价并签保密协议。
  2. 02Anthropic的"巴拿马计划"已累计处理200万册实体书,操盘手汤姆·特维是Google Books项目老兵,流程为液压切割书脊、高速扫描、纸质销毁。
  3. 032025年联邦法院判定:合法购得的书籍,拆书扫描训练AI算合理使用(具有变革性);但Anthropic因从盗版网站LibGen下载盗版电子书,被判赔1.5亿美元。
  4. 04行业统计显示,2025年后互联网新内容中AI生成比例已超50%,全球网站访问请求中AI/爬虫占比已超一半。
  5. 05被大量收购的书籍多为冷门书:地方志、小城镇史料、已消亡学科老专著、小语种文献、自费出版战争回忆录、印量极小论文集,因其绝版且商业价值低,适合批量收购销毁。
反方 / 局限
  • 学界正在尝试合成数据生成、多模态数据补充等方法延缓模型塌缩,但作者认为这些手段并未从根本上解决高质量人类数据耗尽的问题。
  • 文章未讨论AI公司可能转向私有领域数据(如企业文档、医疗记录、专业数据库)作为替代方案,也未评估非文本数据(如视频、音频)的训练价值。
7 分钟 · 5 卡片 · 8 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问