7.7
深览指数
科技人人都是产品经理·Z Finance··AI 生成

腾讯Hy3正式版上线,姚顺雨半年交卷

腾讯混元Hy3正式版于7月6日上线,延续295B参数(21B激活)的MoE架构,上下文窗口维持在256K,不走万亿参数和超长文本竞赛。模型在信息检索(BrowseComp 84.2分)和Agent执行(ClawEval 68.5分,SkillsBench 55.3分)上表现突出,数学推理(MathArena Apex 38.7分)和MCP工具调用(MCP Atlas 79.1分)仍是短板。文章核心贡献在于:首次系统披露了姚顺雨入主后“实用主义AI”路线下的技术取舍与组织博弈,揭示了腾讯内部联邦制(WXG与集团)在AI战略上的隐性竞争。适合关注中国大模型技术路线、互联网大厂组织博弈的读者。原文 ↗

核心观点
  • 腾讯Hy3不走万亿参数和超长文本竞赛,选择了295B参数、256K窗口的“务实”路线,核心逻辑是压榨既有容量性能极限,追求单字智能密度和极致性价比。
  • 姚顺雨的“实用主义AI”理念——认为AI上半场(开发新方法击败基准测试)已失效,下半场转向“真实世界效用问题”——是Hy3全系列技术决策的底层逻辑。
  1. 01Hy3正式版在12项评测维度上全部实现正向增长,其中MathArena Apex从Preview版的12.8分跃升至38.7分(+207%),SkillsBench从29.1分升至55.3分(+90%),体现了后训练阶段的“饱和式补短”策略。
  2. 02在信息检索维度,Hy3的BrowseComp得分84.2分,仅差GPT-5.5的84.4分0.2分;AA-LCR得分73.4分,与GLM-5.2并列。
  3. 03在Agent执行维度,ClawEval得分68.5分,仅次于Claude Opus 4.8(72.1分),超过DeepSeek V4 Pro(62.4分)和Qwen 3.7 Max(65.2分)。
  4. 04Hy3在编程Agent任务中展现出“审美功底”,能生成UI设计、图标渲染、视觉建模等拔尖水平的代码,但主动发挥倾向强,对需求模糊的用户友好,对硬核工程约束不够克制。
  5. 05Hy3的定价策略极具攻击性:输入1元/百万tokens,输出4元/百万tokens,缓存命中仅0.25元,约为智谱高阶模型或Qwen3-Max同级竞品的几分之一。
  6. 06Hy3在长文本总结、文献检索等优势场景下,通过缩减30%的步数与工具调用数实现物理Token瘦身,与低单价形成双重红利;但在跨平台Agent协作或硬核代码重构场景中,易陷入“Token黑洞”,抵消单价优势。
反方 / 局限
  • 数学推理是Hy3最大的能力缺口:MathArena Apex 38.7分与GPT-5.5的85.4分差距悬殊,且Hy3在处理复杂数学问题时Token消耗量大,计算资源受限时能力会折损。
  • MCP工具调用(MCP Atlas 79.1分)在参与评测的6个主流模型中排名末位,低于Claude Opus 4.8(84.1分)、GLM-5.2(82.6分)及Seed-2.1 Pro(80.6分),在跨多工具协作的复杂工作流中容错能力仍有不足。
  • 256K上下文窗口在面对超长源码库、批量大跨度历史卷宗等场景时直接失去入场券,技术劣势明显;但作者认为这是追求性价比的刻意取舍。
  • Hy3在指令遵循任务上的Token消耗比同尺寸的DeepSeek-V4 Flash骤增50%-150%,意味着“性价比”在特定场景下可能不成立。
  • 文章暗示了腾讯内部的“联邦制”困境:WXG(微信事业群)在2026年年会上曾公开表达希望自己训练大模型,其模型能力在低调爬坡,与集团中央技术团队形成路径交叉和资源暗战。
12 分钟 · 4 卡片 · 7 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问