7.9
深览指数
科技人人都是产品经理·花叔··AI 生成

200万上下文、外挂四大专家:Macaron V1把LoRA玩成了正式架构

本文深度评测了 Mind Lab 基于 GLM-5.2 基座进行后训练的 Macaron V1 模型。作者认为其核心创新在于将通常用于省成本的 LoRA 技术,提升为一种'持久本地状态'的正式架构,通过挂载四个 1B 的小型专家模型 (L0-L3) 分别处理聊天、任务、编程和界面生成,旨在构建一个'越用越懂你'的个人模型。文章通过大量真实测试(如喂入 4580 条个人动态、复杂编程任务、Agent 自主修复开源仓库 bug)验证了其 200 万长上下文能力、编程实力(约等于 Claude Opus 4.8)以及独特的 UI4A 实时渲染能力。适合对模型架构创新、个人化 AI 代理、以及国产模型差异化路线感兴趣的深度读者。原文 ↗

核心观点
  • Macaron V1 的核心创新在于将 LoRA 从一次性的微调手艺,升格为一种'持久本地状态'的正式架构,旨在通过多个小型、可插拔的专家模型,构建一个'越用越懂你'的个人模型,而非追求通用 SOTA 排名。
  • 作者认为,在基座模型足够强大的前提下,个人助理场景需要的不是更聪明的通用模型,而是 '一组合身的专才',并辅以能跨会话积累工具和用户偏好的机制。
  1. 01Macaron V1 基于 744B 参数的 GLM-5.2 基座,基座参数完全冻结,仅训练挂载其上的四个 1B LoRA 专家模型(L0 聊天,L1 任务执行,L2 编程,L3 UI生成),并通过路由机制(MoL)分配任务。
  2. 02实际测试中,向模型一次性输入 4580 条、65 万字的个人即刻动态,模型能准确定位到最早关于某产品的动态(2024年11月4日),并能纠正作者故意编造的记忆,展现出强大的长上下文理解和事实性。
  3. 03在复杂的编程任务中(纯代码构建可交互的故宫金顶汉字瀑布),Macaron V1 的表现被作者评价为'低于 Kimi K3,约等于 Claude Opus 4.8,高于 Qwen3.8'。
  4. 04在 Agent 能力测试中,Macaron V1 在接到修复开源仓库 bug 的指令后,没有直接修改代码,而是先复现问题,发现 bug 在上游已被修复,随后做出了最小改动(完善文档),并自动 commit, push 和留言,体现了'先验证再动手'的判断力。
  5. 05模型具备独特的 UI4A (UI for Agents) 能力,能在对话流中实时渲染出可交互的界面组件,如一个可拖拽色相滑杆的补光灯控制台或一个呼吸灯番茄钟。
  6. 06Mind Lab 拥有一套完整的 LoRA 管理和训练基础设施,包括百万级 LoRA 目录的 MinT 平台,以及将长上下文(210万 token)引入强化学习训练的 LongStraw 系统。
反方 / 局限
  • 作者承认,在复杂视觉编排任务上,Macaron V1 与 Kimi K3 相比仍有差距。
  • 在复杂任务上,Macaron V1 的思考链很长,单轮问答响应速度慢,不适合作为需要秒回的快模型使用,更适合放入 Agent 环境'干活'。
  • 文章核心是作者的个人体验评测,其结论(如'约等于 Claude Opus 4.8')基于作者设计的特定测试集,并非行业公认的标准化 Benchmark 结果,可能存在主观性。
13 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问