7.8
深览指数
科技腾讯新闻·平凡AI··AI 生成
为什么DeepSeek-V4-Flash-0731的后训练性能突飞猛进?
本文分析DeepSeek V4-Flash-0731版本后训练性能大幅提升的原因,核心观点是:能力暴涨并非单纯来自模型权重更新,而是由新成立的Harness团队(核心人物崔添翼)及其构建的底层Agent系统驱动。文章拆解了量化交易背景与Agent能力的底层相似性,并详细介绍了V4独特的后训练流程(领域专家独立训练+多教师在线策略蒸馏),以及大规模沙箱环境(DSec)对Agent能力涌现的关键作用。适合对LLM训练细节、Agent系统构建、以及AI前沿技术有深入了解兴趣的读者。原文 ↗
核心观点
- ▍DeepSeek V4-Flash-0731的性能突飞猛进,并非单纯来自模型权重更新,而是由新成立的Harness团队(核心人物崔添翼)及其构建的Agent系统协同工作带来的结果。
- 01崔添翼的背景是量化交易(Jane Street近9年,联合创办TSY Capital),而非传统大模型研究员。其量化系统经验(高可靠性、低延迟、多步骤决策)与Agent能力高度对应。
- 02DeepSeek V4的后训练分为两个阶段:一是领域专家独立训练(SFT+GRPO),二是多教师在线策略蒸馏(On-Policy Distillation),后者让模型学习专家行为分布而非简单答案。
- 03DeepSeek为Agent后训练搭建了专用沙箱系统DSec,可管理数十万个并发沙箱实例,支持函数调用、容器、虚拟机等环境,让模型通过大量失败轨迹学习。
- 04V4-Flash-0731的模型卡明确提到,公开的Agent测试使用了尚未发布的DeepSeek Harness(minimal模式)和最大推理强度,成绩是模型+系统协同的结果。
- 05崔添翼于2026年3月加入DeepSeek,7月成立Harness团队并疯狂招人,时间线与V4 Preview(4月)到Flash正式版(7月)的性能提升吻合。
反方 / 局限
- — 文章承认,目前没有公开证据证明崔添翼主导了0731版本的模型训练,其作用更像是“重要变量之一”,而非唯一原因。
- — 作者预测V4 Pro可能接近甚至超越Claude Opus 4.8和Fable 5,但缺乏足够数据支撑,且Fable 5对标存在不确定性。
崔添翼 (Tianyi Cui)DeepSeek HarnessDeepSeek V4-Flash-0731DeepSeek Elastic Compute (DSec)Jane StreetTSY CapitalGRPOSFTOn-Policy DistillationGLM-5.2Claude Opus 4.8Fable 5
10 分钟 · 5 卡片 · 14 资料
读原文 →