7.5
深览指数
科技腾讯新闻·凤凰网··AI 生成
DeepSeek-V4-Flash正式版来了,新能力浮出水面,性价比之王开战
DeepSeek 发布 V4-Flash 正式版 API,其 Agent 能力在多项基准测试中逼近甚至超越三个月前的 V4-Pro 预览版。文章指出,一个仅 130 亿激活参数的轻量模型通过后训练优化,即可在 Agent 任务上达到接近旗舰级 490 亿参数模型的效果,暗示模型规模并非决定 Agent 能力的唯一因素,训练方法和数据质量权重正在上升。作者认为,DeepSeek 正借高性价比的 Flash 模型切入 Agent 应用市场,并通过原生支持 OpenAI 的 Responses API 格式和适配 Codex,在生态层面与 OpenAI 展开正面竞争。适合关注大模型技术路线、Agent 应用落地和 AI 行业竞争格局的读者阅读。原文 ↗
核心观点
- ▍DeepSeek 正通过后训练优化,将轻量级模型 V4-Flash 的 Agent 能力大幅提升至接近旗舰级 V4-Pro 的水平,意图以性价比优势切入 Agent 应用市场,并挑战 OpenAI 的生态地位。
- 01V4-Flash 正式版在 Terminal Bench 2.1 上得分 82.7,而 V4-Pro 预览版在 Terminal Bench 2.0 上得分为 67.9,尽管测试集版本不同,但 Flash 的 Agent 能力已逼近 Pro 水平。
- 02V4-Flash 总参数 2840 亿,激活参数仅 130 亿;V4-Pro 总参数 1.6 万亿,激活参数 490 亿,两者规模相差一个数量级。
- 03DeepSeek 官方表示 V4-Flash-0731 仅重新进行了后训练,模型结构和尺寸与预览版一致,暗示后训练技术的杠杆效应显著。
- 04DeepSeek 正式版 V4-Flash 原生支持 OpenAI 的 Responses API 格式,并针对性适配了 Codex,旨在降低开发者从 OpenAI 生态迁移的成本。
- 05DeepSeek 刚完成首轮 500 亿元外部融资,投后估值约 520 亿美元,并计划开展新一轮融资,投前估值已升至 710 亿美元。
- 06DeepSeek 创始人梁文锋将 AGI 实现路径比作爬楼梯,认为 Agent 之后必须解决持续学习问题,而工程落点在于自研的 Agent Harness。
反方 / 局限
- — 作者指出,V4-Flash 与 V4-Pro 的 Agent 基准测试并非同一版本(2.1 vs 2.0),直接对比并不完全公平,这为 Flash 的 Agent 能力提升幅度留有余地。
- — 高估值虽然体现了市场认可,但也意味着高预期和高压力,文章隐含了 DeepSeek 在商业化落地和与 OpenAI、Anthropic 等巨头竞争中面临的不确定性。
DeepSeek梁文锋崔添翼OpenAIAnthropicResponses APICodexAgent HarnessTerminal BenchNL2RepoCybergymToolathlonDSBenchGLMQwen腾讯宁德时代京东Jane Street
9 分钟 · 4 卡片 · 12 资料
读原文 →