热点智搜··AI 生成
DeepSeek-V4-Flash正式版跑分逼近GPT-5.6
DeepSeek-V4-Flash正式版在不改变架构的前提下,通过纯后训练优化将Agent能力大幅提升,多项跑分逼近GPT-5.6 Luna。文章核心信息是:这波升级并非底层技术突破,而是在成本优势下针对特定场景(Agent、代码生成)的定向优化,性价比极高但适用范围明确。适合关注AI模型竞争动态、成本敏感型开发者或产品决策者阅读。原文 ↗原文 ↗
核心观点
- ▍DeepSeek-V4-Flash的跑分提升全部来自后训练优化,而非模型架构或参数规模的改变,其本质是算法层面的定向增强,而非通用智能的质变。
- 01在Artificial Analysis智能指数中,DeepSeek-V4-Flash获得50分,仅比GPT-5.6 Luna低1分,较前代提升10分。
- 02Terminal Bench 2.1得分82.7,超越GLM 5.2,9项官方Agent基准全面反超自家V4-Pro预览版。
- 03Frontend Code Arena得分1586,位列开放类别第3,较预览版提升154分。
- 04模型结构、尺寸(284B总参/13B激活)与4月预览版完全一致,未做底层改动。
- 05API定价输入1元/输出2元/百万Token,结合约98%的缓存命中折扣,单任务成本比GPT-5.6 Luna低约60%。
反方 / 局限
- — 文章的跑分对比主要聚焦于Agent和代码生成等特定下游任务,对于通用语言理解、复杂推理、多模态等领域的表现未提及,这意味着其“逼近GPT-5.6”的结论可能不适用于其他场景。
前置背景
平行视角
未来推演
延伸追问