7.7
深览指数
科技量子位··AI 生成
刚刚,唐杰发布智谱RSI首个成果
清华大学教授、智谱创始人唐杰分享了递归自我改进(RSI)的早期工程案例:由GLM-5.3驱动的Infra Agent,在超10万张国产芯片集群上,从零构建并优化了一套生产级推理系统,在不到两周内将端到端吞吐提升至初始基线的3.2倍。文章详细拆解了Agent通过“稠密反馈”机制自主解决算子精度、并发瓶颈及性能优化的过程,指出RSI的实现不仅依赖模型能力,更需要将系统反馈转化为Agent可执行的工程闭环。文章适合关注AI前沿、基础设施智能化及AI自我进化路径的深度技术读者阅读。原文 ↗
核心观点
- ▍递归自我改进(RSI)的早期形态已经出现:GLM-5.3驱动的Infra Agent在真实生产环境中参与了自身推理系统的构建与优化,形成“模型优化系统,系统承载模型”的闭环。
- ▍决定Infra Agent工程效果的关键,不只是一流的代码生成与推理能力,更在于系统能否持续提供‘稠密反馈’——即局部、及时、可客观验证的工程信号的闭环。
- 01在超过10万张国产芯片组成的集群上,GLM-5.3驱动的Infra Agent从零参与搭建并优化了一套生产级推理系统,端到端吞吐在不到两周内提升至初始基线的3.2倍。
- 02Agent通过精度反馈定位并修复了KDA算子上下文并行(CP)路径中因默认TF32计算导致的累积误差,修复方法是指定`input_precision="tf32x3"`以组合出更高精度。
- 03Agent通过性能约束的反馈定位了KV Transfer场景中Python GIL导致的并发阻塞问题:DeepEP v1.2.1的`intranode_dispatch`和`intranode_combine`未显式释放GIL,导致同一进程内的Mooncake Transfer线程被阻塞;修复后性能差距从超过20%压到1%以内。
- 04在KDA Decode算子上,Agent从存量Kernel中学习优化经验,将沿V维度分块的重复计算合并到同一线程块,取得了1.71倍的单算子性能提升。
- 05GLM-5.3-Flash以匿名模型“Ox-Alpha”上线一周成为OpenCode与OpenRouter双平台调用量最大的模型,6天token调用量超过62万亿。
- 06技术栈融合了针对线性注意力和LM Head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合精度缓存量化以及Layer Split等技术。
- 07工程师定义了优化目标与系统边界,构建了Agent可直接使用的反馈环境,并审核涉及系统架构和关键风险的修改;Agent负责分析、假设和修改,实验环境提供分层、及时且可验证的反馈。
反方 / 局限
- — 作者明确指出,这距离真正意义上“AI完全自主设计并训练自己的继任者”还很远,选择目标、设定边界、判断风险目前依然由人类工程师负责,智谱自身也明确强调还没有实现RSI。
19 分钟 · 3 卡片 · 5 资料
读原文 →