8.0
深览指数
产品虎嗅·夕小瑶科技说©··AI 生成
DeepSeek V4.1 Flash实测,花3亿token,14组任务,居然比上代贵
作者对DeepSeek V4.1 Flash内测版进行了深度实测,共投入约3亿token完成14组任务,并与V4 Flash版本进行对比。结果显示,V4.1在原生多模态视觉理解、前端渲染、代码生成速度上有明显提升,但在处理复杂长任务时更倾向于开启多Agent协作,导致总Token消耗和花费反而比前代更高(约贵36%),且长上下文能力存在前后不一致的问题。文章适合对AI大模型能力边界、成本结构和实际应用开发有兴趣的从业者阅读。原文 ↗
核心观点
- ▍DeepSeek V4.1 Flash在原生多模态视觉理解(看图、画图、视觉推理)上进步显著,但复杂任务中倾向开启多Agent协作,导致Token消耗和总花费反而高于前代V4 Flash。
- 01V4.1能直接解释图片内容(如识别海报上的「黄牛」和「OX」),而V4 Flash需要先跑OCR和工具分析,耗时200秒到751秒不等。
- 02V4.1在画图任务中加入了自检和迭代纠错(如嫌鹈鹕像天鹅、小熊头太小),但最终画面仍存在遮挡和接触问题。
- 03在「星光邮局」游戏任务中,V4.1正确还原了角色颜色和关卡布局,V4 Flash则错误地做成了7x7网格,角色变为橙衣小人。
- 04在「孪生素数星系图」任务中,两个模型计算出的58980对素数结果均正确,但V4.1能成功渲染螺旋星系并定位,V4 Flash页面画布为空。
- 0514组并发任务初期,V4.1的吐字速度约为284 Token/s,接近V4 Flash(97 Token/s)的3倍。
- 06在「星光邮局」和网文写作等复杂任务中,V4.1共开启了37个子Agent,导致总Token消耗(游戏+小说超1亿Token)和花费(61.96元 vs 45.47元,贵36%)显著增加。
- 07V4.1生成的十万字网文出现将扫地遍数记乱、A股回测报告中摘要与图表数据不一致(年化15.1% vs 17.8%)等前后对不上的问题。
反方 / 局限
- — V4.1在复杂任务中更倾向多Agent协作带来了更高的Token消耗和成本开销,多Agent产生的交接和返工(如字数核对错误)并未显著提升交付效率。
- — 尽管V4.1吐字速度更快,但在需要工具验证的任务中(如关卡搜索),等待时间反而更长,导致整体交付时间不一定更快。
- — 官方内测问卷直接询问「能否全面替换线上V4 Pro」,暗示V4.1 Flash在定位和能力上仍存在不确定性。
DeepSeekDeepSeek V4.1 FlashDeepSeek V4 FlashDeepSeek V4 Prodeepseek harness原生多模态子AgentToken辞旧迎新(公众号)丸美小沐
18 分钟 · 4 卡片 · 11 资料
读原文 →