7.4
深览指数
科技腾讯新闻·爱范儿··AI 生成
智谱首个RSI成果发布,10万国产卡用GLM造GLM
智谱宣布其GLM-5.3-Flash模型在10万张国产AI加速器集群上完成部署,并使端到端推理性能提升3.2倍。关键在于,此轮优化工作很大部分由GLM-5.3自身驱动的Infra Agent完成,包括定位精度问题、优化Kernel性能。这被视为递归自我改进(RSI)的早期形态,即模型开始参与优化承载自身运行的底层系统。对于关注AI Agent能力边界、国产算力落地以及AI基础设施演进的读者,本文提供了具体的技术细节与实验案例。原文 ↗
核心观点
- ▍智谱GLM-5.3-Flash在国产算力集群上的优化过程中,模型自身驱动的Infra Agent发挥了关键作用,标志着AI参与优化自身系统(即递归自我改进RSI)的早期形态已经出现。
- 01GLM-5.3-Flash部署在超10万颗国产AI加速器集群上,两周内完成从首次运行到承载全部生产流量的过程。
- 02通过Infra Agent的辅助,系统端到端吞吐能力相比初始版本提升了3.2倍,硬件利用率和单Token成本接近主流NVIDIA GPU平台。
- 03在KDA的上下文并行路径中,Agent发现了TF32计算在序列长度增加时的舍入误差累积问题,相关修复已合并到Flash Linear Attention项目PR #1180。
- 04Agent将KV Transfer与DeepEP调度之间的传输开销从超过30%降低到1%以下,原因是找到了Python GIL未及时释放的问题。
- 05Agent通过重新组织计算结构,优化了一个Decode Kernel,使其性能提升1.71倍,思路来自于学习SGLang、Flash Linear Attention和DeepGEMM等项目的代码。
- 06该模型曾以匿名名Ox-Alpha在OpenCode和OpenRouter平台运行,六天内处理超过62万亿Token,成为使用量最高的模型之一。
- 07核心优化方案包括:ReplaySSM(以计算换内存)、节点内张量并行降压、混合精度缓存以及EPD分离式架构。
反方 / 局限
- — 作者明确指出,此次实验距离真正意义上的递归自我改进(RSI)仍很远。人类工程师仍需设定目标、搭建反馈环境并审核高风险修改,Agent更像是在执行局部优化任务。
- — Infra Agent的能力瓶颈在于‘诊断而非编码’,例如当系统反馈“吞吐下降20%”时,Agent难以判断是哪一层出了问题以及下一步应如何验证,仍需要‘dense feedback’机制来模拟工程师的经验判断。
智谱AI唐杰GLM-5.3-FlashInfra Agent递归自我改进 (RSI)EPD分离式架构KDADeepEPSGLangFlash Linear AttentionOpenCodeOpenRouter
7 分钟 · 4 卡片 · 10 资料
读原文 →