8.0
深览指数
产品虎嗅·夕小瑶科技说©··AI 生成

DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵

作者对DeepSeek V4.1 Flash内测版进行了深度实测,共投入约3亿token完成14组任务,并与V4 Flash版本进行对比。结果显示,V4.1在原生多模态视觉理解、前端渲染、代码生成速度上有明显提升,但在处理复杂长任务时更倾向于开启多Agent协作,导致总Token消耗和花费反而比前代更高(约贵36%),且长上下文能力存在前后不一致的问题。文章适合对AI大模型能力边界、成本结构和实际应用开发有兴趣的从业者阅读。原文 ↗

核心观点
  • DeepSeek V4.1 Flash在原生多模态视觉理解(看图、画图、视觉推理)上进步显著,但复杂任务中倾向开启多Agent协作,导致Token消耗和总花费反而高于前代V4 Flash。
  1. 01V4.1能直接解释图片内容(如识别海报上的「黄牛」和「OX」),而V4 Flash需要先跑OCR和工具分析,耗时200秒到751秒不等。
  2. 02V4.1在画图任务中加入了自检和迭代纠错(如嫌鹈鹕像天鹅、小熊头太小),但最终画面仍存在遮挡和接触问题。
  3. 03在「星光邮局」游戏任务中,V4.1正确还原了角色颜色和关卡布局,V4 Flash则错误地做成了7x7网格,角色变为橙衣小人。
  4. 04在「孪生素数星系图」任务中,两个模型计算出的58980对素数结果均正确,但V4.1能成功渲染螺旋星系并定位,V4 Flash页面画布为空。
  5. 0514组并发任务初期,V4.1的吐字速度约为284 Token/s,接近V4 Flash(97 Token/s)的3倍。
  6. 06在「星光邮局」和网文写作等复杂任务中,V4.1共开启了37个子Agent,导致总Token消耗(游戏+小说超1亿Token)和花费(61.96元 vs 45.47元,贵36%)显著增加。
  7. 07V4.1生成的十万字网文出现将扫地遍数记乱、A股回测报告中摘要与图表数据不一致(年化15.1% vs 17.8%)等前后对不上的问题。
反方 / 局限
  • V4.1在复杂任务中更倾向多Agent协作带来了更高的Token消耗和成本开销,多Agent产生的交接和返工(如字数核对错误)并未显著提升交付效率。
  • 尽管V4.1吐字速度更快,但在需要工具验证的任务中(如关卡搜索),等待时间反而更长,导致整体交付时间不一定更快。
  • 官方内测问卷直接询问「能否全面替换线上V4 Pro」,暗示V4.1 Flash在定位和能力上仍存在不确定性。
18 分钟 · 4 卡片 · 11 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问