7.7
深览指数
科技虎嗅·小智的互联网观察··AI 生成
旧书又开始值钱了
文章指出,随着生成式 AI 对训练数据的需求达到极限,互联网上高质量、未被 AI 污染的数据已近枯竭,导致出版行业状况逆转——2022 年前出版的冷门旧书因能提供纯净、连续、结构化的语言信号,且包含稀有信息,正成为 AI 模型训练公司高价收购的新目标。文章从出版业困境、AI 数据饥渴、旧书的生产链优势和数据坍塌风险等角度,论证了旧书价值的重新发现。适合对 AI 技术现实、数据产业和出版行业交叉领域感兴趣的读者阅读。原文 ↗
核心观点
- ▍2022 年前出版的冷门旧书,因未经 AI 污染且经过专业生产链筛选,在 AI 训练数据枯竭的当下,价值被重新发现,成为模型训练公司高价收购的新目标。
- 01出版行业整体下行,头部出版社如机械工业出版社日子不好过,员工年终奖从晚发到不发,集团开始改制。
- 02AI 时代出一本书需 3 个月,但一个热门应用(如 OpenClaw)从爆火到无人问津可能不到 3 个月,人类学习主流方式正从阅读转向 AI 交互。
- 03生成式 AI 流行后,互联网上由人类产生的海量文本数据被迅速消耗,模型团队面临“没有活人感”的过拟合问题,需要寻找未受 AI 污染的数据。
- 04纸质旧书经过作者、编辑、校对、出版社等专业生产链检验,提供了比随机网页更密集、连续、结构化的语言信号,对模型训练有价值。
- 05冷门旧书(如地方铁路志、九十年代软件手册)因读者少,反而可能提供模型从未见过的术语和事实,稀有信息价值凸显。
- 06Nature 2024 年关于模型坍塌的研究表明,模型递归学习生成数据时,最早丢失的是低概率事件和少见表达,保留原始数据可减轻退化。
- 07西班牙书商发现买家愿为冷门加泰罗尼亚语书籍支付高额运费;A÷(推测为 Anthropic)曾花费数百万美元购买纸质书用于扫描,并在和解中支付超过 15 亿美元,但因合法购买用于训练被法院认可。
反方 / 局限
- — 文章承认旧书“不能保证内容正确,也不能保证写得好”,且“出版业也出过无数烂书”,其平均质量优势是相对的。
- — 虽然旧书排除 AI 污染,但互联网上未被 AI 改造的旧网页也很多,同样充满营销软文和错误信息,旧书的“纯净”优势并非绝对。
5 分钟 · 4 卡片 · 9 资料
读原文 →