科技Bestblogs·郑廷旭··AI 生成
实测 DeepSeek V4 正式版:3 块钱干完 5 件事,AI「智价比」之战开打了
通过实测 DeepSeek V4-Flash 模型在五项复杂任务(数据分析、游戏开发、物理模拟、仪表盘设计、GitHub 开源项目周报)中的表现,验证了其每百万 token 仅 1-2 元的超低价格下,代码与工具调用能力已大幅提升。文章指出,随着 OpenAI 等对手也大幅降价,大模型竞争正从“拼参数规模”转向“拼智价比”,低成本高效模型将推动 AI Agent 真正落地。作者给出了具体的 token 消耗和费用数据,适合关注 AI 应用落地、模型选型及成本控制的从业者阅读。原文 ↗原文 ↗
核心观点
- ▍顶级大模型的竞争正从单纯比拼能力,转向争夺「智价比」——以更低成本提供足够好的能力,而非单纯追求参数规模或极致性能。
- ▍低成本高效模型(如 DeepSeek V4-Flash)将推动 AI Agent 时代的到来,使 AI 能够长时间运行、反复试错,承担以前因成本过高而难以落地的复杂工作。
- 01DeepSeek V4-Flash API 价格维持每百万 token 输入 1 元、输出 2 元,而 OpenAI 近期将 GPT-5.6 Luna 价格下调约 80%。
- 02V4-Flash 在 Terminal Bench 得分从 61.8 提升至 82.7,DeepSWE 得分从 7.3 提升至 54.4,表明后训练显著提升了代码与工具使用能力。
- 03五项实际任务(数据分析报告生成、打砖块游戏、三体轨道模拟、科幻控制舱仪表盘、基于 GitHub API 的 AI 项目周报)共消耗约 3422 万 token,总花费仅 2.85 元。
- 04模型结构未变,仅靠后训练(数据质量、强化学习等手段)提升能力,印证了「韬定律」——竞争正从规模扩张转向效率优化。
反方 / 局限
- — 文章未提及模型在复杂推理、长上下文一致性、多轮对话等非代码类任务上的表现,测试任务类型偏向工程与创意编程,可能无法代表通用场景的智价比。
- — 作者未讨论 DeepSeek 模型在海外访问的稳定性、延迟、合规性等问题,这些因素在实际 Agent 落地中同样关键。
概念锚点
前置背景
平行视角
未来推演
延伸追问