科技 人人都是产品经理 · 李逸和 · 2小时前 · AI 生成
Claude当真是焚书坑儒吗? 文章指出,Anthropic 拆解纸质书训练 AI 引发争议,但核心问题并非“毁书”,而是 AI 训练正从依赖“数据数量”转向“数据质量”。作者梳理了从纸质书到 AI 能力的五步数据加工链,并认为未来 AI 竞争的关键壁垒在于独家、高质量数据,而非模型参数。最后,文章提出普通人也可通过整理个人知识、经验和技能,形成自身的数据资产,让 AI 更好地理解与协助自己。原文 ↗ 原文 ↗
核心观点
▍ AI 竞争正从模型能力转向高质量数据,独家数据将成为未来AI公司的核心壁垒。 01 Anthropic 因购买并破坏式扫描纸质书用于训练 AI 而引发争议,此举被类比为“焚书坑儒”。 02 互联网上存在大量重复、错误、低质量内容,AI 学习低质量数据可能仅是对混乱信息进行重组,而非增强理解能力。 03 书籍、论文等经过长期研究和审核,蕴含逻辑、经验和认知体系,是高质量数据的代表。 04 从纸质书到 AI 能力需经过数据收集、数字化、清洗、模型训练和能力形成五个步骤。 05 模型架构和算力差距正在被拉平,但医院病例、企业经验等无法公开获取的独家数据,将成为新的竞争壁垒。 06 普通人可通过整理个人记忆、专业知识和操作技能(Skills)形成个人知识库,让不同 AI 都能理解自己。 07 作者将个人记忆和技能整理成 Markdown 文档,可跨平台使用,避免因账号被封导致数据丢失。 反方 / 局限
— 文章未提及反对或质疑“独家数据壁垒”的观点,也未讨论数据隐私、版权或数据垄断等潜在风险。
前置背景 「巴拿马计划」全貌
Anthropic 的「焚书」并非临时起意,而是一项代号「巴拿马计划」的工业化工程。公司挖来谷歌图书项目前负责人,目标定为「破坏性扫描世界上所有书籍」。操作流程已经标准化:通过二手书商批量采购 2022 年前出版的旧书,液压机切掉书脊,高速扫描仪过一遍,纸张送进碎纸机回收,最后连存储扫描副本的硬盘也要专业销毁。据法庭文件,供应商预估处理量为 50 万到 200 万册。内部文件还备注了「我们不希望外界知道我们在做这件事」。
▸ 3 条关联资料
▼
平行视角 同一笔账,两种叙事
硅谷把 Anthropic 拆书视为「用成本换质量」的合理商业决策,法院也认定合法购书后破坏性扫描属于合理使用。但另一方看到了不同的账单:书商因百万本量级订单周销量暴涨 5 倍,原作者拿不到一分钱授权费;绝版珍本书退出流通后市面实体存量永久减少,部分知识从此只存在于 Anthropic 私有的数据库里。15 亿美元和解金针对的是盗版囤积行为,买书销毁训练本身被判合法——这条法律路径反而成了 AI 公司绕开版权付费的「安全通道」。
▸ 2 条关联资料
▼
未来推演 「数据耗竭」倒逼的下一战
Epoch AI 研究预测,高质量语言数据存量将在 2026 年耗尽。Anthropic 抢购旧书只是这场危机的第一个信号。当下能看到的关键变量是三条路径在赛跑:一是「洗垃圾」——卡内基梅隆大学用 4B 参数小模型把低质量网络数据改写成训练素材,数据效率提升 2-3 倍;二是「造独家」——医院病历、企业业务记录等私有数据成为新一代护城河;三是「生新数据」——AI 合成数据与物理仿真。拐点不在某家公司的计划里,而在 2026 年数据正式告罄后,谁能跑通其中一条路径。
▸ 3 条关联资料
▼
延伸追问 知识应该属于谁?
「焚书」事件真正值得追问的不是 Anthropic 是否合法,而是一个更根本的问题:人类几千年来积累的知识——从绝版古籍到专业教材——在被 AI 学习后,应该继续留在公共领域,还是变成少数公司的私有资产?现有法律只回答了「合法不合法」,没回答「合理不合理」。当一本书被拆解后,它的内容进入模型、输出答案,但公众再也无法访问原始文本,这是否构成一种新型的「知识剥夺」?这个问题没有标准答案,但值得每个深度读者自己想清楚立场。
▸ 2 条关联资料
▼