6.5
深览指数
热点智搜··AI 生成

DeepSeek V4-Flash通过架构创新压低AI成本

DeepSeek 发布 V4-Flash 正式版,以“百万 Token 1 元”的极致性价比和 Agent 能力的大幅跃升引发关注。文章重点剖析了其背后的两项关键创新:一是首创的 Engram 架构,通过将静态知识存入廉价 CPU 内存来降低对昂贵 HBM 显存的依赖;二是联合北大推出的 DSpark 纯软件推理加速框架。此外,文章也提及了依托乌兰察布廉价清洁能源的物理基建优势,以及 MIT 开源协议带来的生态普惠效应。对于关注 AI 产业成本结构、技术路线竞争和开源生态的读者,本文提供了从架构到落地的一手信息。原文 ↗

核心观点
  • DeepSeek V4-Flash 通过架构与基建层面的双重创新,大幅降低了 AI 推理成本,其“百万 Token 1 元”的定价直接击穿了海外大模型的价格泡沫,可能重塑全球 AI 成本结构。
  1. 01V4-Flash 运行成本不到 Anthropic 旗舰模型的百分之一,API 输入价格仅为 1 元/百万 Token,是全球知名 AI 模型中成本最低的一款。
  2. 02首创 Engram 架构,将静态知识存入便宜的 CPU 内存,让昂贵的 HBM 显存专注计算,实现了“用白菜价内存干黄金价显存活”的效果。
  3. 03联合北大发布 DSpark 推理加速框架,通过纯软件优化,单用户生成速度最高提升 85%,整体吞吐量翻 4 倍,且不牺牲生成质量。
  4. 04在乌兰察布布局新机房,利用当地廉价且过剩的清洁能源,从物理层面大幅压降算力成本。
  5. 05在终端操作、代码工程、自动化任务等 Agent 基准测试中,V4-Flash 得分远超 V4-Pro 预览版,部分指标逼近海外闭源旗舰模型。
  6. 06采用宽松的 MIT 协议完全开源,支持本地私有化部署,帮助开发者规避数据法规风险并摆脱闭源厂商锁定。
反方 / 局限
  • 文章虽提及“海外套壳”争议,但并未深入展开反方观点,例如对 Engram 架构在训练与推理效率平衡上的具体挑战、DSpark 框架在特定复杂任务上的实际表现局限,以及依靠特定地区廉价能源模式的长期可复制性等问题均未讨论。
2 分钟 · 5 卡片 · 15 资料
读原文 →

前置背景

技术原理

平行视角

未来推演

延伸追问