7.8
深览指数
科技微博·机器之心Pro··AI 生成
当「变大」不再是唯一的路,又一国产模型开源了
本文深度解读了心洲科技旗下 Mind Lab 开源的 Macaron-V1 模型,其核心路线是「持续学习」与「群体智能」,区别于主流单纯扩大模型规模。文章详细拆解了其 Mixture-of-LoRA (MoL) 架构、在千亿参数基座 (GLM-5.2) 上通过挂载多个 1B 参数的 LoRA 专家实现能力超越,并论证了 LoRA 从「廉价替代品」转变为「持久本地状态」的理念。文章还介绍了支撑该路线的核心基础设施 MinT 与 MindForge,以及解决长上下文强化学习训练难题的 LongStraw 技术。适合对 AI 前沿技术路线、大模型架构创新及工程实践有深度兴趣的读者。原文 ↗
核心观点
- ▍Macaron-V1 的核心技术路线是「持续学习」与「群体智能」,即在强大基座上通过可插拔、可协作的 LoRA 模块实现模型在部署后的持续成长,而非单纯追求模型规模扩大。
- 01Macaron-V1 基于 744B 参数的 GLM-5.2 基座,搭载四个 1B 参数的 LoRA 专家 (Chat/Agent/Coding/GenUI),形成了 748B 总参数的 Venti 版本。
- 02在 UI4A 基准测试上,Macaron-V1 以 87.7 的成绩大幅领先 Claude Opus 4.8。
- 03Mind Lab 的实验表明,在相近的 RL 预算下,大先验加小规模 LoRA 更新 (32B 模型,0.07B 可训练参数,增益 20.61%) 超越全量强化学习在小模型 (1.5B 模型,1.5B 可训练参数,增益 8.33%) 上的表现。
- 04群体智能实验显示,从相同基座出发,使用 198 个不同 adapter 投票,准确率 (48.67%) 高于单一 adapter 重复采样 (43.78%),证明不同学习轨迹产生了互补性。
- 05Mind Lab 构建了基础设施 MinT 和训练框架 MindForge,前者支持百万规模的 Adapter 目录,后者通过 RSI 闭环实现模型与 Harness 的协同训练。
- 06LongStraw 技术解决了长上下文强化学习训练难题,在 32×H20 上实现了 GLM-5.2 在全部 78 层上对 2,097,152 个位置的完整反向传播。
反方 / 局限
- — 作者承认「经验智能机器」仍是一个长期目标,存在几个核心问题:反馈延迟模糊难以归因、模型自我反思可能错误归因、学习效率不够高、持续更新的稳定性问题。
心洲科技 Mind LabMacaron-V1GLM-5.2Mixture-of-LoRA (MoL)持续学习群体智能LoRAMinTMindForgeLongStrawRSI (Recursive Self-Improvement)Richard SuttonDavid SilverThinking Machines Lab
15 分钟 · 3 卡片 · 8 资料
读原文 →