8.2
深览指数
科技量子位··AI 生成

7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开

北京中关村学院7名博士生,在一台拥有几百个Agent的「AI团队」协助下,仅用3个月从零训练并开源了一个7B大模型ZGCM-1。文章详细记述了从数据清洗、架构选择、训练排查到Agent研发自主性评级的完整工程过程,揭示了技术报告常省略的失败细节与工程实战发现。适合想了解大模型训练完整链路、对AI4AI研发范式感兴趣的研究者或工程师阅读,可获取大量一手实践经验与开源资源。原文 ↗

核心观点
  • 7名博士生借助几百个Agent组成的AI研发团队,可在3个月内以较低成本从零训练出一个7B大模型,验证了「AI4AI」范式的工程可行性。
  • 开源不仅释放最终模型,更将各阶段权重、中间checkpoint、训练代码、数据配方与完整日志开放,使研究者能追溯能力形成过程。
  1. 01ZGCM-1在14项推理评测中与同规模模型(如Qwen3-8B)表现相近,在部分数学推理和搜索评测中能与Qwen3-235B-A22B、GLM-5.1等更大模型比较。
  2. 02训练过程中遇到loss持续下降但模型能力退步的现象,最终追溯到底层数据分片和shuffle环节的比例波动问题。
  3. 03团队建立了ACE原子能力评测体系,将能力拆分为18类、183项,用2503个探针进行快速诊断,一轮评测约2-3分钟。
  4. 04采用局部注意力与全局注意力结合架构,在256K上下文下相较于全注意力方案获得约3.94倍的吞吐提升,KV Cache占用降至约六分之一。
  5. 05结合Muon和FP8优化训练效率,在16K预训练中达到相同loss的效率比标准BF16/AdamW基线提高了约4.2倍。
  6. 06SFT阶段更严格的质量筛选使样本减少约44.9%,整体评测反而提升;长思维链数据比例过高会损害指令遵循。
  7. 07团队利用自研ZGent平台,将会议讨论、决策和调试经验沉淀为共享上下文与可复用Skill,新加入的Agent可继承此前经验。
反方 / 局限
  • 团队对Agent在11类研发任务中的自主性评级显示:实验监控与部署达L4(自主规划执行),但模型架构与学习算法设计仍在L2(辅助实现已有方案),关键研究方向仍需人类主导。
  • Agent团队并不能自动避免所有工程坑,数据shuffle比例波动导致模型退步的问题仍依赖人类排查才能定位。
  • 7B阶段积累的方法是否适用于400B、500B规模,尚待验证;Agent能承接多少新工作也是开放问题。
12 分钟 · 5 卡片 · 10 资料
读原文 →

前置背景

技术原理

平行视角

未来推演

延伸追问