7.1
深览指数
科技虎嗅·宋思杭··AI 生成
DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽
DeepSeek于7月31日更新V4-Flash模型的API正式版,但并未改变模型架构或扩大参数规模,而是通过重新后训练大幅提升其Agent能力,尤其是Code Agent。文章指出,这标志着DeepSeek的战略转向:在大模型进入Agent阶段后,竞争焦点从预训练参数规模转向后训练、推理框架和系统效率。V4-Flash作为更便宜、更快的‘生产模型’,被定位为承接高频、长链条Agent任务的主力,而非追求能力上限的V4-Pro。文章也提醒,当前Agent成绩依赖DeepSeek内部测试集和未公开的Harness框架,真实性价比尚需独立验证。适合关注大模型产业趋势、Agent技术路线选择及模型产品化策略的读者。原文 ↗
核心观点
- ▍DeepSeek的V4-Flash更新显示,在大模型进入Agent阶段后,竞争焦点从预训练参数规模转向后训练、推理框架和系统效率,而非一味堆砌参数。
- ▍DeepSeek战略上明确区分了V4-Pro(能力上限模型)和V4-Flash(生产模型),后者凭借更低的成本和更快的速度,更适合承担高频、长链条的Agent任务。
- 01V4-Flash拥有284B总参数,每次激活13B参数;V4-Pro拥有1.6万亿总参数,每次激活49B参数。V4-Flash在100万Token上下文下,单Token推理计算量约为V3.2的10%,KV Cache约为V3.2的7%。
- 02V4-Flash后训练后,在Terminal Bench 2.1上达到82.7,在NL2Repo上达到54.2,在DeepSWE上达到54.4,在Toolathlon Verified上达到70.3,DeepSeek称这些结果已大幅超过V4-Pro预览版。
- 03V4-Flash API定价为每百万Token(未命中缓存)输入1元、输出2元;V4-Pro分别为3元和6元。V4-Flash并发限制为2500,Pro为500。
- 04更新引入了对Responses API的原生支持和Codex适配,并在测试Code Agent任务时使用了尚未正式发布的DeepSeek Harness minimal mode。
- 05梁文锋曾在内部表示,‘模型应该放在相同成本下比较;在现阶段,Coding Agent的优先级高于其他垂直Agent’。
- 06V4-Flash-0731并未改变模型架构和参数规模,仅重新进行了一次后训练,但Agent能力出现明显变化。
反方 / 局限
- — DeepSeek公布的Agent成绩大多使用Max reasoning effort完成,更高的思考强度可能意味着更长的推理过程和更多Token消耗,单价优势可能被更长的任务轨迹部分抵消。
- — 部分Agent成绩来自DeepSeek内部测试集,且DeepSeek Harness尚未公开,外界无法在相同环境下复现,真实进步幅度需等待独立评测验证。
- — 文章指出,真正有价值的对比(如完成同一Agent任务时各模型的Token消耗、时间和重试次数),DeepSeek尚未给出答案。
DeepSeek梁文锋V4-FlashV4-ProAgentCode AgentMoE模型Responses APICodexDeepSeek HarnessTerminal BenchNL2RepoDeepSWEToolathlon后训练强化学习
7 分钟 · 5 卡片 · 11 资料
读原文 →