7.2
深览指数
科技虎嗅·爱范儿··AI 生成

全世界最强的AI,都在“抄”这群普通人的作业

本文以维基百科超级编辑 Steven Pruitt 的故事为引子,揭示了 AI 大模型赖以成功的知识地基——由无数普通志愿者无偿维护的开放知识库。文章核心观点是:AI 的能力并非仅来自算法和算力,更依赖于维基百科等公共协作项目提供的高质量、结构化数据。作者进而提出一个关键警示:AI 正在单向消耗开放的公共知识,将开放知识封装进封闭的商业模型,同时削弱了人们抵达知识源和验证信息的能力,导致知识生产的公共基础设施面临萎缩风险。文章适合关注 AI 产业伦理、知识公共性、信息生态变迁的读者,尤其适合那些对 AI 技术宣传持审慎态度、关心技术背后社会代价的人。原文 ↗

核心观点
  • AI 大模型的能力并非仅来自算法、芯片和算力,其底层依赖的是由维基百科志愿者等普通人无偿维护的、高度结构化的公共知识库。
  • AI 正在将开放知识单向封装进封闭的商业模型,不仅消耗了公共知识基础设施,还削弱了人们抵达知识源、验证信息的能力,可能导致知识生产的公共土壤贫瘠化。
  1. 01维基百科超级编辑 Steven Pruitt 编辑了超过 600 万次,创建了 3 万多篇词条,作为志愿者未获利。他代表了约 1% 的活跃编辑者完成了约 77% 的编辑工作。
  2. 02维基百科已成为 AI 的“海马体”,为机器提供稳定的公共记忆。多家公司如 Amazon、Meta、Microsoft、Mistral AI 和 Perplexity 都在使用 Wikimedia Enterprise 服务。
  3. 03AI 公司的爬虫正在消耗维基百科的带宽,自 2024 年 1 月以来多媒体内容带宽增长了 50%,且至少 65% 的核心数据中心流量来自机器人。
  4. 042025 年部分月份,维基百科的人类浏览量同比下降约 8%,基金会认为生成式 AI 和社交平台正在改变人们获取信息的方式,导致读者不再直接访问维基百科。
  5. 05奠定现代机器视觉基础的 ImageNet,其首批 320 万张图片、5247 个语义类别,依靠的是 Amazon Mechanical Turk 上普通人的逐一分类和核验。
反方 / 局限
  • 作者指出,维基百科本身也会犯错,会引发编辑争执,但其核心价值在于错误可追溯——每一次修改都有记录,争议有讨论页,判断可被要求补充来源,这与 AI 模型的黑箱特性形成对比。
  • 文章隐含但未充分展开的盲点:维基百科的编辑规则和社区共识本身也可能存在系统性偏见,不一定能完全代表“公共知识”的公正性,Pruitt 本人也承认需要为“被遗忘的人”争取位置。
15 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问