7.8
深览指数
科技智东西··AI 生成
智谱唐杰突发长文曝RSI进展:Agent优化10万卡集群吞吐暴涨200%,AI造AI还远吗?
智谱创始人唐杰发布长文,详述其 Infra Agent 在超过10万卡国产芯片集群上,通过“稠密反馈”闭环,仅用不到两周将 GLM-5.3 Flash 推理服务的吞吐量提升至初始的3倍。文章的核心贡献在于提出了将稀疏的端到端性能指标转化为细粒度、可归因的局部反馈(算子级、系统行为级)的方法论,使模型能够参与自身推理系统的优化。这为理解“递归自我改进(RSI)”提供了一个具体的、工程化的实践案例,适合关注大模型基础设施、国产芯片生态及 AI 自我进化路径的从业者阅读。原文 ↗
核心观点
- ▍智谱通过在10万卡国产芯片集群上,利用GLM-5.3驱动的Infra Agent,构建了从端到端指标到可归因局部反馈的“稠密反馈”闭环,实现了生产级推理系统的快速自优化,迈出了递归自我改进(RSI)的具体实践第一步。
- 01Infra Agent 参与的优化闭环在不到两周内,将端到端吞吐提升至初始基线的3倍,硬件利用效率与单Token成本均达到主流NVIDIA GPU的相当水平。
- 02通过算子级对比,Agent 发现并修复了 KDA 算子上下文并行(CP)路径因默认使用 TF32 计算导致长上下文下精度累积误差的缺陷。
- 03工程师为 Agent 定义了隔离测试场景(如单独Prefill、Prefill + KV Transfer),Agent 通过性能差距超过20%的反馈,定位到 DeepEP intranode 路径因未能释放 Python GIL 而阻塞了 Mooncake Transfer 调度。
- 04Agent 从 SGLang、Flash Linear Attention 等存量 Kernel 代码中提炼出“优化骨架”,并应用到自身推理系统的 KDA Decode 算子上,通过合并分块与消除重复计算,获得了1.71倍的性能提升。
- 05智谱在超过10万卡国产芯片组成的集群上部署了生产级推理服务,GLM-5.3-Flash 上线一周成为 OpenCode 与 OpenRouter 双平台调用量最大的模型,6天 token 调用量超过62万亿。
反方 / 局限
- — 作者明确指出“我们还没有走到递归自我改进”,选择目标、设定边界、判断风险仍然是人的工作,且“在相当长的时间里,这条线应当由人来守”。
- — 文章承认“稠密反馈”的构建仍依赖工程师定义目标与系统边界、构建反馈环境及审核关键修改,Agent 目前仍是在一个预设的、结构化的工程闭环内执行优化。
23 分钟 · 3 卡片 · 6 资料
读原文 →