7.7
深览指数
科技腾讯新闻·硅星人Pro··AI 生成

Macaron V1:站在 GLM-5.2 肩膀上教 GLM-5.2 做人

Mind Lab 在 GLM-5.2 基座上仅训练 4B 参数的 LoRA 模块(0.53%),就使 Macaron V1-Venti 在 12 项评测中全面超越原始模型,其中 7 项同时超过 GPT-5.5 和 Claude Opus 4.8。文章通过实测展示了模型在 UI4A、前端代码和本地 Blender 操作上的任务完成度,详细拆解了 MoL(Mixture-of-LoRA)架构和后训练系统工程。适合关注模型后训练、Agent 持续学习、LoRA 前沿应用的技术读者与产品决策者。原文 ↗

核心观点
  • LoRA 后训练可以成为前沿模型的正式组成部分,而非全参数训练的平替;在强大基座模型(如 GLM-5.2)上,仅 0.53% 的参数更新就能带来稳定且可观的性能提升。
  • 模型发布后的持续学习能力(通过轻量参数更新将经验写进参数)正在成为新的竞争层,Mind Lab 和 Thinking Machines Lab 从不同路径验证了这一点。
  1. 01Macaron V1-Venti 由 744B 基座参数(GLM-5.2)和 4 组各约 1B 的 LoRA 专家模块组成,仅训练 0.53% 的参数。
  2. 02在 12 项评测中,Venti 全面超越原始 GLM-5.2,其中 7 项同时超过 GPT-5.5 和 Claude Opus 4.8,包括 TerminalBench 2.1、PinchBench 等。
  3. 03LoRA 更擅长改变模型调用已有能力的方式(如稳定化操作),而非补充基座的短板;在 SWE Atlas QnA 中仅提高 0.6 分,说明其能力边界。
  4. 04Mind Lab 构建了整套后训练系统:MinT(管理训练/评测/服务/回滚)、LongStraw(百万 token 级长上下文 RL)、R3(对齐 MoE 专家路由)、MindForge(将 Agent Harness 带入强化学习)。
  5. 05实测中,Venti 能完成将文字群聊转化为 UI4A 交互小品、生成包含完整订位流程的餐厅官网、在 Blender 中渲染潜艇并持续操作近 40 分钟。
反方 / 局限
  • 文章承认 LoRA 无法补齐基座模型的短板,在需要深度推理的跨文件代码测试中提升有限,并且 LoRA 训练的实际工程复杂度并不低(744B 模型仍需完整运行)。
  • 实测中,模型生成的菜单将含北非粗麦粉的菜品误标为“无麸质”,说明在交付前未完成文本自检。
  • 文章未讨论与全参数后训练(如 Thinking Machines Lab 的 Tinker)的横向对比,也未提及 LoRA 训练可能引入的灾难性遗忘风险。
12 分钟 · 4 卡片 · 10 资料
读原文 →

前置背景

技术原理

未来推演

延伸追问