6.8
深览指数
科技人人都是产品经理·深思圈··AI 生成

斯坦福新开了一门课,专门讲 AI 怎么自我进化

本文基于斯坦福CS329A课程《自我改进的AI Agent》的公开录像,系统梳理了AI从Scaling Law碰壁到推理时扩展、从思维链偶然发现到RLHF价值注入、再到AI Agent与自我改进闭环的关键演进脉络。作者是AI产品深度观察者,文章不是技术新闻,而是对底层逻辑的解读:每个重大进步背后都有新的反馈机制被激活。适合已对LLM有基础认知、想理解AI Agent技术方向与局限的读者,提供的信息密度超过一般科普文章。原文 ↗

核心观点
  • AI的每一次重大进步背后,都有一个新的反馈机制被激活:从损失函数对参数/数据的反馈,到人类偏好反馈,再到验证器对推理过程的反馈,最终走向模型自我生成的反馈闭环。
  1. 01Scaling Law从2018年持续到2024年左右,BERT (3.4亿参数) → GPT-2 (15亿) → GPT-3 (1750亿) → PaLM (5400亿) → GPT-4 (万亿级),但2024年起单靠堆参数开始边际收益递减。
  2. 02Chain-of-Thought能力是偶然发现的:在给模型的示例中加入解题中间过程,足够大的模型就能学会内化推理框架,并迁移到新问题;小模型即使给再多推理示例也不会。
  3. 03RLHF通过人类偏好训练奖励模型,再引导原始模型生成更符合人类期望的内容,这是ChatGPT能被普通人用起来的核心原因,而不仅仅是模型大小。
  4. 04Large Language Monkeys实验:让比GPT-4o小很多的模型对同一问题回答一万次,其正确答案覆盖率反而超过GPT-4o的单次回答,验证了推理时扩展的可行性。
  5. 05OpenAI o1展示的数据:推理时算力与pass@1准确率在对数坐标下呈线性关系,未出现明显天花板,形成与训练Scaling Law同构的推理时扩展规律。
  6. 06AI Agent的核心区别在于:有目标、主动规划、与环境互动、根据反馈调整,直至目标达成,而非单轮问答。
  7. 07Coding Agent目前最接近真实可用,因为代码的对错可被客观验证(unit test),形成'生成代码→生成测试→验证→修改'的自我改进闭环。
反方 / 局限
  • 作者承认,自我改进循环的关键前提是可靠的验证机制;若模型生成的数据含错误且被用于训练下一版,错误会被放大而非纠正。在代码和数学领域相对好处理,但在开放领域风险真实存在。
  • 作者指出,verifier(验证器)是AI Agent能否真正落地的关键瓶颈。在非代码/数学领域,如报告质量、营销文案效果,缺少客观验证机制,AI Agent目前主要起辅助作用,而非替代。
15 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

技术原理

平行视角

延伸追问