7.9
深览指数
科技人人都是产品经理·花叔··AI 生成
200万上下文、外挂四大专家:Macaron V1把LoRA玩成了正式架构
本文深度评测了 Mind Lab 基于 GLM-5.2 基座进行后训练的 Macaron V1 模型。作者认为其核心创新在于将通常用于省成本的 LoRA 技术,提升为一种'持久本地状态'的正式架构,通过挂载四个 1B 的小型专家模型 (L0-L3) 分别处理聊天、任务、编程和界面生成,旨在构建一个'越用越懂你'的个人模型。文章通过大量真实测试(如喂入 4580 条个人动态、复杂编程任务、Agent 自主修复开源仓库 bug)验证了其 200 万长上下文能力、编程实力(约等于 Claude Opus 4.8)以及独特的 UI4A 实时渲染能力。适合对模型架构创新、个人化 AI 代理、以及国产模型差异化路线感兴趣的深度读者。原文 ↗
核心观点
- ▍Macaron V1 的核心创新在于将 LoRA 从一次性的微调手艺,升格为一种'持久本地状态'的正式架构,旨在通过多个小型、可插拔的专家模型,构建一个'越用越懂你'的个人模型,而非追求通用 SOTA 排名。
- ▍作者认为,在基座模型足够强大的前提下,个人助理场景需要的不是更聪明的通用模型,而是 '一组合身的专才',并辅以能跨会话积累工具和用户偏好的机制。
- 01Macaron V1 基于 744B 参数的 GLM-5.2 基座,基座参数完全冻结,仅训练挂载其上的四个 1B LoRA 专家模型(L0 聊天,L1 任务执行,L2 编程,L3 UI生成),并通过路由机制(MoL)分配任务。
- 02实际测试中,向模型一次性输入 4580 条、65 万字的个人即刻动态,模型能准确定位到最早关于某产品的动态(2024年11月4日),并能纠正作者故意编造的记忆,展现出强大的长上下文理解和事实性。
- 03在复杂的编程任务中(纯代码构建可交互的故宫金顶汉字瀑布),Macaron V1 的表现被作者评价为'低于 Kimi K3,约等于 Claude Opus 4.8,高于 Qwen3.8'。
- 04在 Agent 能力测试中,Macaron V1 在接到修复开源仓库 bug 的指令后,没有直接修改代码,而是先复现问题,发现 bug 在上游已被修复,随后做出了最小改动(完善文档),并自动 commit, push 和留言,体现了'先验证再动手'的判断力。
- 05模型具备独特的 UI4A (UI for Agents) 能力,能在对话流中实时渲染出可交互的界面组件,如一个可拖拽色相滑杆的补光灯控制台或一个呼吸灯番茄钟。
- 06Mind Lab 拥有一套完整的 LoRA 管理和训练基础设施,包括百万级 LoRA 目录的 MinT 平台,以及将长上下文(210万 token)引入强化学习训练的 LongStraw 系统。
反方 / 局限
- — 作者承认,在复杂视觉编排任务上,Macaron V1 与 Kimi K3 相比仍有差距。
- — 在复杂任务上,Macaron V1 的思考链很长,单轮问答响应速度慢,不适合作为需要秒回的快模型使用,更适合放入 Agent 环境'干活'。
- — 文章核心是作者的个人体验评测,其结论(如'约等于 Claude Opus 4.8')基于作者设计的特定测试集,并非行业公认的标准化 Benchmark 结果,可能存在主观性。
Mind LabMacaron V1LoRAGLM-5.2Kimi K3Claude Opus 4.8Qwen3.8MOE (Mixture of Experts)MoL (Mixture of LoRA)MinTUI4ALongStrawFable 5GPT-5.6
13 分钟 · 4 卡片 · 11 资料
读原文 →