6.3
深览指数
科技腾讯新闻·差评XPIN··AI 生成
DeepSeek的这次小更新,原来藏着两个大招
DeepSeek发布V4 Flash正式版,以284B总参数、仅13B激活参数的轻量级模型,在多项基准测试上接近Claude Opus 5、GPT-5.6 Sol等顶级旗舰,且价格极低(2元/百万token)。文章核心分析两个关键因素:一是后训练(尤其是GRPO强化学习)带来的能力跃升,二是DeepSeek即将推出的Agent工具「DeepSeek Harness」,后者可能比模型本身更新更具战略意义。适合关注AI模型能力边界、成本结构与Agent生态的技术决策者和投资者阅读。原文 ↗
核心观点
- ▍DeepSeek V4 Flash正式版通过高质量后训练和Agent工具,将轻量级Flash模型的能力提升至接近全球顶级旗舰模型水平,且价格极低,重新定义了AI模型性价比的「斩杀线」。
- ▍DeepSeek Harness(Agent工具)的推出,可能比单独更新模型更关键,因为它代表了AI能力提升的新阶梯——从思维链到Agent的范式转移。
- 01V4 Flash总参数284B,激活参数仅13B,在多项基准测试上追平或接近Claude Opus 5、GPT-5.6 Sol等顶级模型。
- 02价格仅为2元/百万输出token,且有缓存命中优惠,作者周末使用1亿token仅花费5元。
- 03后训练是预览版到正式版性能差距最大的原因,官方承认这一点;DeepSeek R1论文显示,通过GRPO强化学习,V3模型在AIME 2024测试集上的正确率从15.6%飙升至71%。
- 04DeepSeek Harness是一个未发布的Agent工具,用于增强模型在复杂任务中的表现,类似于Claude Code、Codex、OpenClaw等工具。
- 05多伦多大学2024年研究显示,同一大模型在不同Agent工具中完成问题的概率可相差数倍。
反方 / 局限
- — 作者未深入讨论DeepSeek Harness的具体实现细节、对比基准或与其他Agent工具的差异化优势,分析停留在推测层面。
- — 文章未提及V4 Flash在哪些具体任务(如推理、创意生成、多模态)上仍与顶级模型存在差距,也未讨论后训练强化对模型鲁棒性和安全性的潜在影响。
DeepSeekDeepSeek V4 FlashDeepSeek HarnessGRPOClaude Opus 5GPT-5.6 SolKimi K3Claude CodeCodexOpenClaw
10 分钟 · 4 卡片 · 11 资料
读原文 →