7.8
深览指数
科技腾讯新闻·平凡AI··AI 生成

为什么DeepSeek-V4-Flash-0731的后训练性能突飞猛进?

本文分析DeepSeek V4-Flash-0731版本后训练性能大幅提升的原因,核心观点是:能力暴涨并非单纯来自模型权重更新,而是由新成立的Harness团队(核心人物崔添翼)及其构建的底层Agent系统驱动。文章拆解了量化交易背景与Agent能力的底层相似性,并详细介绍了V4独特的后训练流程(领域专家独立训练+多教师在线策略蒸馏),以及大规模沙箱环境(DSec)对Agent能力涌现的关键作用。适合对LLM训练细节、Agent系统构建、以及AI前沿技术有深入了解兴趣的读者。原文 ↗

核心观点
  • DeepSeek V4-Flash-0731的性能突飞猛进,并非单纯来自模型权重更新,而是由新成立的Harness团队(核心人物崔添翼)及其构建的Agent系统协同工作带来的结果。
  1. 01崔添翼的背景是量化交易(Jane Street近9年,联合创办TSY Capital),而非传统大模型研究员。其量化系统经验(高可靠性、低延迟、多步骤决策)与Agent能力高度对应。
  2. 02DeepSeek V4的后训练分为两个阶段:一是领域专家独立训练(SFT+GRPO),二是多教师在线策略蒸馏(On-Policy Distillation),后者让模型学习专家行为分布而非简单答案。
  3. 03DeepSeek为Agent后训练搭建了专用沙箱系统DSec,可管理数十万个并发沙箱实例,支持函数调用、容器、虚拟机等环境,让模型通过大量失败轨迹学习。
  4. 04V4-Flash-0731的模型卡明确提到,公开的Agent测试使用了尚未发布的DeepSeek Harness(minimal模式)和最大推理强度,成绩是模型+系统协同的结果。
  5. 05崔添翼于2026年3月加入DeepSeek,7月成立Harness团队并疯狂招人,时间线与V4 Preview(4月)到Flash正式版(7月)的性能提升吻合。
反方 / 局限
  • 文章承认,目前没有公开证据证明崔添翼主导了0731版本的模型训练,其作用更像是“重要变量之一”,而非唯一原因。
  • 作者预测V4 Pro可能接近甚至超越Claude Opus 4.8和Fable 5,但缺乏足够数据支撑,且Fable 5对标存在不确定性。
10 分钟 · 5 卡片 · 14 资料
读原文 →

前置背景

技术原理

应用场景

未来推演

延伸追问