8.1
深览指数
科技腾讯新闻·硅星人Pro··AI 生成

谷歌首席科学家:数据搬运比计算贵1000倍,大模型推理该换芯片了

Jeff Dean 在 YC 2026 年演讲中提出核心判断:AI 推理的数据搬运能耗是计算的 1000 倍,因此推理硬件的专用化(而非通用 GPU)是下一波效率提升的关键。他同时指出,AI 代理已能运行数周处理复杂任务,创业者应寻找大模型成功率仅 0-1% 的领域,而非 20% 的领域,因为后者很快会被通用模型覆盖。文章还分享了其团队用 agent 做性能优化、以及从“不可靠晶体管”思想实验看未来硬件路径的思考。适合关注 AI 基础设施、芯片架构和创业方向的高技术水位读者。原文 ↗

核心观点
  • 数据搬运的能耗是计算本身的 1000 倍,这一物理约束决定了推理硬件必须走向专用化(如更低精度、更少数据搬运),而非继续依赖通用 GPU 或 TPU。
  • 创业者应寻找大模型完全失效(成功率 0-1%)的领域,而非部分胜任(20%)的领域,因为后者很快会被通用模型覆盖。
  1. 01Jeff Dean 以 TPU 起源为例:2013 年估算若每个 Google 用户每天使用 3 分钟语音识别,服务器集群需翻倍,于是专门为低精度线性代数设计的 TPU 能效比 CPU/GPU 高 30-80 倍。
  2. 02Jeff Dean 与 Sanjay 团队用 agent 系统自动执行性能优化流程:测基准、改代码、重测、迭代,并将《Performance Hints》文档(30 页)喂给模型后,模型在推理代码性能问题上的能力显著提升。
  3. 03Google 内部用多 agent 系统搜索解法空间:多个 agent 尝试不同方法,再由另一个 agent 评估路径优劣,保留有效路径,以解决长链 agent 在 10 次交互后容易跑偏的问题。
  4. 04AlphaFold 是高度专用的模型,在蛋白质折叠领域极其成功,表明专用模型在特定领域可超越通用模型。
  5. 05Jeff Dean 提出一个思想实验:若晶体管每日出错 20 次而非百万年一次,信号传输可采用冗余路径,类似大脑的分布式信号传递方式,可能催生全新的硬件设计范式。
  6. 06十年前,Jeff Dean 同事用神经网络模拟器替代昂贵的密度泛函理论模拟器,计算速度提升 30 万倍,精度几乎不降,证明了“学习型验证模型”能重新定义实验循环。
反方 / 局限
  • 主持人指出 agent 在 30-50 步后容易跑偏,Jeff Dean 承认这源于模型对非分布内任务的脆弱性,并建议通过 skill 和搜索式多 agent 系统来缓解,但未给出根本性解决方案。
  • Jeff Dean 提醒,通用模型能力增长迅速,创业者需判断自身方向是否会在 6-12 个月内被通用模型覆盖,但未给出具体的判断框架或可量化的筛选标准。
31 分钟 · 5 卡片 · 11 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问