7.1
深览指数
科技微博·量子位··AI 生成
国产RSI模型交卷!Flash模型靠它反打旗舰
云知声推出U2-Flash,这是一款基于后训练闭环与稀疏MoE架构的模型,以约10B激活参数实现代码与Agent任务性能大幅超越前代旗舰,打破Flash模型「更快更省但能力打折」的行业惯例。文章通过多个工程实测案例展示其自主任务生成、异步Agent RL与多教师蒸馏等核心技术细节,并指出该模型已显露RSI L3级别特征。适合关注AI模型架构演进、国产替代技术落地及递归自我改进(RSI)前沿的深度读者阅读。原文 ↗
核心观点
- ▍U2-Flash 通过后训练闭环(自主任务生成、异步Agent RL、多教师蒸馏)实现高智能密度:激活10B参数,性能反超前代旗舰U2,打破Flash模型「更快更省但能力打折」的行业惯例。
- 01U2-Flash 采用稀疏MoE架构,总参数约266B,单次推理只激活约10B(不到4%)。
- 02相比U2,U2-Flash 生成速度提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗降低20-30%。
- 03DeepSWE v1.1 从U2的32分冲到64.6分(翻倍);TerminalBench 3.0从2.7分飙到24.3分(9倍);SWE-Bench Pro从51.1分升至61.6分。
- 04后训练闭环包含:自主任务生成(已构建近10万道SWE任务);异步Agent RL(单位时间有效训练轨迹提升约60%);多教师在线策略蒸馏(达到同等能力训练步数减少约55%)。
- 05实测案例:U2-Flash 7分6秒找出虚构项目中的三个隐蔽Bug;3分32秒从错误README中自救并完成修复;8分36秒处理14份四格式文件并交付正确文档。
- 06U2-Flash 在国产算力平台上吞吐、时延、并发和集群扩展效率持续提升,部分场景已接近NVIDIA GPU方案。
反方 / 局限
- — 文章承认RSI概念尚无行业统一标准,OpenAI和Anthropic的定义存在差异;U2-Flash仍运行在人工设定的沙盒与规则内(L3级别),并非完全的自我改进。
云知声U2-FlashRSI (递归自我改进)稀疏MoEAgent RL (强化学习)多教师蒸馏DeepSWESWE-BenchTerminalBench上海交通大学清华大学上海AI LabAnthropicOpenAII.J. GoodVernor Vinge
12 分钟 · 5 卡片 · 15 资料
读原文 →