6.5
深览指数
热点智搜··AI 生成

DeepSeek-V4-Flash正式版跑分逼近GPT-5.6

DeepSeek-V4-Flash正式版在不改变架构的前提下,通过纯后训练优化将Agent能力大幅提升,多项跑分逼近GPT-5.6 Luna。文章核心信息是:这波升级并非底层技术突破,而是在成本优势下针对特定场景(Agent、代码生成)的定向优化,性价比极高但适用范围明确。适合关注AI模型竞争动态、成本敏感型开发者或产品决策者阅读。原文 ↗

核心观点
  • DeepSeek-V4-Flash的跑分提升全部来自后训练优化,而非模型架构或参数规模的改变,其本质是算法层面的定向增强,而非通用智能的质变。
  1. 01在Artificial Analysis智能指数中,DeepSeek-V4-Flash获得50分,仅比GPT-5.6 Luna低1分,较前代提升10分。
  2. 02Terminal Bench 2.1得分82.7,超越GLM 5.2,9项官方Agent基准全面反超自家V4-Pro预览版。
  3. 03Frontend Code Arena得分1586,位列开放类别第3,较预览版提升154分。
  4. 04模型结构、尺寸(284B总参/13B激活)与4月预览版完全一致,未做底层改动。
  5. 05API定价输入1元/输出2元/百万Token,结合约98%的缓存命中折扣,单任务成本比GPT-5.6 Luna低约60%。
反方 / 局限
  • 文章的跑分对比主要聚焦于Agent和代码生成等特定下游任务,对于通用语言理解、复杂推理、多模态等领域的表现未提及,这意味着其“逼近GPT-5.6”的结论可能不适用于其他场景。
2 分钟 · 4 卡片 · 12 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问