7.5
深览指数
产品人人都是产品经理·赛博禅心··AI 生成

马卡龙的下注:把模型后训练,做成企业服务

Mind Lab 发布模型后训练与推理平台 Mint Recursive,将其内部用于训练 Macaron V1.1 的 MinT 系统开放为企业托管服务。文章核心论点是,企业未来需要能持续迭代、符合自身业务标准的模型版本,而围绕该需求的高效低成本后训练将是一项持续性服务。文章详细披露了 Macaron V1.1 以 GLM-5.3 为基座、训练四个 2B LoRA 专家的技术实践,包括利用数据-训练-评测-部署闭环自动化流程进行模型自迭代的具体案例。适合对 LLM 工程化落地、后训练成本优化及 AI 平台产品化感兴趣的读者。原文 ↗

核心观点
  • ▍企业需要自身业务标准、能持续更新的模型版本,围绕模型训练、部署和迭代将成为一项持续性服务,而非一次性工程。
  • ▍提供这种服务的关键在于将模型后训练的成本降下来,通过共享常驻基座、隔离 LoRA 任务(如 MinT 系统)来最大化算力利用率。
  1. 01Mind Lab 的 MinT 系统在 64 张 H800 上运行万亿参数模型 LoRA 强化学习,解决跨 GPU 分片、通信和显存隔离问题。
  2. 02在相同资源配置下,使用 MinT 系统,三个独立的 Qwen3-4B 强化学习任务从串行改为共享并发,总完成时间从 3081 秒下降到 1736 秒,峰值显存不变。
  3. 03Macaron V1.1 模型以 744B 的 GLM-5.3 为基座,训练了四个 2B 参数的 LoRA 专家(分别针对 Chat、Agent、Coding 和生成式 UI),最终模型尺寸为 752B。
  4. 04Macaron V1.1 的训练构建了一个自迭代管线:π₀ →〔观测 → 归因 → 干预 → 验证〕ⁿ → πₙ,即模型分析自身表现,针对能力缺口合成数据并发起训练。
  5. 05在发票核对任务中,模型通过回看执行轨迹,将失败归因为“写入前缺少与 Slack 更正的核对”,然后团队生成示范数据训练,V1.1 最终成功找到更正并更新了记录。
  6. 06在 60 题的 UI4A 任务评测中,GLM-5.3 首次交付成功 43 题,Macaron V1.1 成功 58 题,显示出在给定任务范围内的首次交付表现改善。
  7. 07新发布的 Mint Recursive 平台将内部训练、评测、部署链路打包成托管服务,支持 GLM、Qwen、DeepSeek 等开源基座,以及 SFT、RL、全参训练和 LoRA。
  8. 08企业在 Mint Recursive 上可以拥有自己的任务数据、评测标准和基座上的 LoRA 版本,通过不断轮训将业务经验沉淀进模型。
反方 / 局限
  • — 作者指出,Macaron V1.1 在 60 题 UI4A 评测上的表现提升,主要验证了在给定任务和标准内首次交付能力的改善,但真实新任务能否持续带来下一版能力尚需验证。
  • — 文章全文为产品发布与案例复盘,未提及该平台在竞品(如 Hugging Face AutoTrain、Modal)面前的差异化壁垒、客户大规模采用后的实际成本,以及对不同行业(如非 AI 原生企业)的适用门槛。
7 分钟 · 3 卡片 · 5 资料
读原文 →

概念锚点

前置背景

延伸追问