7.6
深览指数
科技虎嗅·五源资本··AI 生成
为什么今天造大模型的人,一半在学物理
文章提出一个核心观点:物理训练赋予AI研究者一种特定的“品味”,而非简单的智力优势。这种品味包括偏好第一性原理、最小模型、以及对涌现和普适规律的信念,恰好与当前大模型研发中“理论指导实验、实验校准理论”的工作范式高度契合。文章通过分析Anthropic、xAI核心成员的背景,以及Scaling Laws、扩散模型等具体案例,论证了物理思维如何成为AI创新者的“默认入口”,并指出其带来的“局外人自由”和跨学科视角是产生基础性突破的关键。适合对AI技术演化、产业人才结构以及跨学科方法论感兴趣的深度读者。原文 ↗
核心观点
- ▍物理训练赋予AI研究者的不是更强的智力,而是一种特定的品味——偏好第一性原理、最小模型、对涌现和普适规律的信念;这套品味恰好与今天做AI的方法论高度重合。
- ▍大模型研发介于理论科学和实验科学之间,其工作方式(用有效理论指导实验、再用实验回校理论)与物理三百年来的范式高度一致,这是物理学家在AI领域表现出色的根本原因。
- 01Anthropic CEO Dario Amodei(斯坦福物理学士、普林斯顿生物物理博士)和首席科学家Jared Kaplan(哈佛物理博士)是物理背景领军者的代表。
- 02Scaling Laws的发现过程(在不同规模上实验,拟合幂律,外推预测)本质上是物理式的经验科学,如同开普勒从第谷的数据中拟合行星轨道。
- 03扩散模型直接借用了非平衡热力学的骨架,Hopfield网络和玻尔兹曼机的数学和名称都直接来源于物理。
- 04何恺明团队做物理世界模型GeoPT时,因身边缺乏合适人选,直到找到有物理研究背景的合作者才得以推进,表明跨学科思维在顶级CS团队中也是稀缺品。
- 05物理背景的姚顺宇在转行AI后,因没有这个领域的师承和门派成见,反而更敢提出“幼稚但根本”的问题,并直接对流行做法提出批评。
- 062024年诺贝尔物理学奖授予了神经网络奠基人Hopfield和Hinton,同年化学奖一半授予了物理与数学出身的AlphaFold负责人John Jumper,从学科根上盖章了物理的贡献。
反方 / 局限
- — 文章承认“物理出身更强”的论断存在幸存者偏差,因为深度学习领域的半壁江山(如LeCun、Bengio、Sutskever、Karpathy)恰恰是非物理背景。
- — 物理是一个强筛选学科,先天吸引了大量数学能力极强的人,因此看到的“物理训练”之功,可能只是“能力选择”的体现。
- — 文章指出,数学背景的研究者系统性地聚集在理论的极端(如学习理论、可证明的泛化),而非“造出前沿模型”,他们的工作在现代AI中往往需要“戴上物理的帽子”才真正有效。
9 分钟 · 3 卡片 · 6 资料
读原文 →