7.7
深览指数
科技人人都是产品经理·深流研究所··AI 生成

AI巨头正在争夺人类的错题本

文章核心指出,AI竞争的下一阶段关键不再是单纯堆砌算力和模型参数,而是争夺“数据飞轮”——即能持续产生高质量用户纠偏反馈的真实工作流场景(如编程和办公)。Anthropic 凭借 Claude Code/Cowork 率先构建飞轮,ARR 飙升至 470 亿美元,迫使 OpenAI 调整战略。作者拆解了驱动飞轮的核心系统“Harness”,它负责从用户行为日志中提炼训练信号,并指出模型能力与产品体验之间存在非线性关系,后发者(如腾讯 WorkBuddy)可通过抢占工作流、打磨 Harness 实现超车。适合关注 AI 产业趋势、商业模式和产品战略的深度读者。原文 ↗

核心观点
  • AI 竞争的下一个核心战场不再是模型参数竞赛,而是构建“数据飞轮”:通过进入高价值工作流(编程、办公),让用户在付费使用产品的同时,持续产生修正模型错误的高质量反馈信号,从而驱动模型自我进化。
  • 模型能力与产品体验之间并非线性关系,驱动飞轮的关键在于一套复杂的“Harness”系统,它负责拆解任务、捕捉反馈、修正错误,其成熟度构成后发者难以短期复制的护城河。
  1. 01Anthropic 的 Claude Code 在 SWE-bench 上达到 93.9%,驱动其 ARR 从年初的 140 亿美元涨至 470 亿美元,企业市场份额达 34.4%,反超 OpenAI。
  2. 02Anthropic 随后将同套打法推至办公场景,推出 Claude Cowork,接管表格、文档和企业流程,与 OpenAI 的“Work”标签直接竞争。
  3. 03作者指出,Scaling Laws 开始出现裂痕,高质量公开语料趋于枯竭,而真实工作流中产生的“过程数据”(如用户如何修改代码、调整表格)比成品数据更具训练价值。
  4. 04腾讯的办公智能体 WorkBuddy 在自研模型(混元)无明显优势时先跑入真实场景,2026年3月 PC 端月访问量达 885 万,成为中国同类产品日活第一。
  5. 05混元模型 Hy3 更新后,基于 WorkBuddy 的真实反馈进行训练,任务成功率从 72% 升至 90%,总调用量较上一代增长 68 倍。
  6. 06马斯克斥资 600 亿美元收购代码编辑器 Cursor,接入了 Grok,利用数万亿 Token 的 Cursor 数据(包含开发者操作过程)训练出 Grok 4.5,在 SWE-bench Pro 上达到 64.7%。
反方 / 局限
  • 作者承认,办公场景缺乏代码场景那样“编译是否通过”的清晰对错信号,反馈信号更模糊、延迟(如用户三天后才发现公式引用错误),Harness 提炼数据的难度更高。
  • 文章暗示,即使构建了飞轮,也只有经过用户授权、隐私处理和质量验证的反馈才能进入模型训练,存在合规与数据质量瓶颈。
  • Anthropic 的成功路径高度依赖“编程”这一特定场景,该场景的反馈信号纯度(高对错数)是其他场景难以复制的,其模式的普适性有待验证。
12 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问