5.0
深览指数
科技微博·机器之心Pro··AI 生成
DeepSeek-V4-Flash正式版来了!
DeepSeek 于 7 月 31 日发布 V4-Flash 正式版 API,多项 Agent 基准测试成绩大幅超越前代 V4-Pro-Preview,逼近 Opus 4.8。该版本为 284B 参数的 Flash 版,价格仅为 Claude 的 1/90,被视为对 OpenAI 降价的回应。文章主要通报了模型能力提升的 Benchmark 数据,并预告了 V4-Pro 版本即将到来。适合关注大模型前沿动态、评估模型选型的技术从业者快速了解最新进展。原文 ↗
核心观点
- ▍DeepSeek-V4-Flash 正式版 API 已经上线,其 Agent 能力大幅提升,在多项基准测试中表现逼近 Opus 4.8,且价格仅为后者的 1/90,性价比极高。
- 01在 Terminal Bench 2.1 上,模型得分 82.7;在 NL2Repo 和 DeepSWE 上,分别取得 54.2 和 54.4 分。
- 02面向网络安全任务的 Cybergym 得分为 76.7,工具调用基准 Toolathlon Verified 达到 70.3。
- 03在 Agent Last Exam 和 Automation Bench Public 上,模型分别取得 25.2 和 25.1 分。
- 04在全栈开发基准 DSBench-FullStack 与 DSBench-Hard 上,得分分别达到 68.7 和 59.6。
- 05新版本原生支持 Responses API,并已针对 Codex 进行优化。
反方 / 局限
- — 文章仅引用 Benchmark 数据,未提及模型在真实复杂场景下的表现、潜在的安全或偏见问题,也未说明与 Opus 4.8 的对比是否在相同条件下进行。
DeepSeekDeepSeek-V4-FlashOpus 4.8ClaudeOpenAILunaTerraTerminal Bench 2.1NL2RepoDeepSWECybergymToolathlon VerifiedAgent Last ExamAutomation Bench PublicDSBench-FullStackDSBench-HardCodex机器之心Pro
3 分钟 · 3 卡片 · 8 资料
读原文 →