热点 智搜 · 8小时前 · AI 生成
DeepSeekV4正式版推迟至7月底发布 DeepSeek V4 正式版发布推迟至 7 月底,目前正进行灰度测试。文章核心信息包括:V4 采用 1.6 万亿参数的 MoE 架构,性能接近 Claude Opus 4.8 和 GPT-5.6 Sol 级别;首创“峰谷计费”定价策略,高峰时段 API 价格翻倍;发布首日即适配华为昇腾、寒武纪等八大国产芯片,推动“国芯国模”自主可控。其与刚发布的 Kimi K3(2.8 万亿参数)形成正面竞争,加速大模型赛道从参数比拼转向成本效率与场景适配的较量。适合关注 AI 产业竞争格局、国产算力生态及大模型商业化的读者。原文 ↗ 原文 ↗
核心观点
▍ DeepSeek V4 正式版延期至 7 月底发布,其核心竞争策略是“技术流性价比”,通过峰谷计费和国产算力适配,以极低调用门槛吸引中小开发者,与 Kimi K3 形成正面竞争,推动行业从参数比拼转向成本效率与场景适配的综合较量。 01 V4 采用 1.6 万亿参数 MoE 架构,配备 100 万 Token 上下文窗口,性能接近 Claude Opus 4.8,编码能力直追 GPT-5.6 Sol。 02 V4 首发日即适配华为昇腾、寒武纪、海光、摩尔线程、沐曦、昆仑芯、阿里平头哥、天数智芯等八大国产芯片,标志着“国芯国模”深度绑定。 03 首创“峰谷计费”策略,高峰时段(09:00-12:00、14:00-18:00)API 价格翻倍,低峰期维持现价;V4 Flash 版百万输出 Token 谷时成本仅 0.28 美元,为海外主流模型的几十分之一。 04 产品分为 Flash(轻量化)和 Pro(高性能)两个版本,灰度测试中开发者可通过思维链(CoT)第一人称代词("I'm" 或 "I'll" vs "Let me")判断是否接入了 V4 GA 版。 05 Kimi K3 拥有 2.8 万亿参数,主打长文本与极致编程性能,在多项国际评测中反超海外闭源模型,与 V4 形成直接竞争。 06 V4 的 Agent 自动化能力大幅增强,3D 图像和 SVG 图形生成质量提升,能独立生成复杂 3D 模拟游戏 Demo。 反方 / 局限
— 文章未提及 V4 在非推理任务(如创意写作、多轮对话)上的表现,也未对比 Kimi K3 在长文本、编程之外的能力短板,竞争分析可能偏重单一维度。 — 峰谷计费策略可能增加中小开发者在高峰时段的使用成本,且该策略对算力调度效率的实际效果尚未有数据支撑。
前置背景 DeepSeek V3 到 V4 的跃迁
V4 的 1.6 万亿参数并非凭空而来。其前代 V3 于 2024 年 12 月发布,仅用 6710 亿参数(370 亿激活)和 557 万美元训练成本就撼动了全球 AI 格局,开源权重登顶性能榜首。V4 将参数规模翻倍至 1.6T,同时引入 100 万 token 上下文和独创的峰谷定价,本质上是在 V3 已验证的「极致性价比」路线上,向更大规模和更精细商业化的一次关键跃迁。
▸ 3 条关联资料
▼
技术原理 MoE 架构:1.6T 参数背后的效率秘密
V4 采用混合专家(MoE)架构,将模型拆分为多个「专家」子网络,通过门控网络为每个输入 token 动态选择最相关的少数专家进行计算。这让它在拥有 1.6 万亿总参数的同时,实际激活参数仅 49B(激活率 3.1%),大幅降低了推理成本。但 MoE 并非完美,它面临「通信墙」——跨设备数据搬运消耗了 40% 的推理延迟,以及专家负载不均等固有瓶颈,仍需要通信库和芯片架构的协同优化。
▸ 3 条关联资料
▼
平行视角 Kimi K3 正面硬刚 V4:路线之争
V4 的正式版迟至,恰逢月之暗面 Kimi K3 于 7 月 16 日发布(2.8 万亿参数,前端编程盲测全球第一)。两者形成鲜明对比:K3 走「最强性能」路线,定价也更为大胆(输出 100 元/百万 Token);V4 则死磕「性价比」,Flash 版本谷时输出仅 0.28 美元,并推出行业首创的峰谷计费。这场对决加速了大模型赛道从「参数规模比拼」转向「成本效率与场景适配」的综合较量。
▸ 3 条关联资料
▼
未来推演 峰谷定价背后:算力供需的真实信号
V4 将高峰时段 API 价格翻倍,看似是简单的定价创新,实则暴露了 AI 产业最尖锐的底层矛盾:因 Agent 等应用爆发,Token 需求呈指数级增长,而算力供给是线性的,供需失衡已到必须用价格杠杆调节的地步。这一信号预示着,未来大模型竞争的关键变量不再是模型参数,而是「每瓦 Token 吞吐量」——谁能以最低成本持续生产最多高质量 Token,谁才能在平价化浪潮中占据先机。
▸ 3 条关联资料
▼
延伸追问 国产芯片「Day0 适配」能走多远?
V4 发布首日即跑通八大国产芯片,这不仅是技术适配,更是「国芯国模」从口号走向落地的里程碑。关键问题在于:这种「Day0 适配」目前主要依赖智源 FlagOS 等统一软件栈,在训练侧(尤其是万卡级集群)的迁移成本依然很高,约 30% 的小众 CUDA 算子无对应原生实现。当推理需求超越训练时,国产芯片性价比优势凸显,但生态碎片化仍是最大短板。
▸ 3 条关联资料
▼