7.2
深览指数
科技虎嗅·夕小瑶科技说©··AI 生成

实测5款国产世界模型,看清“生成世界”走到了哪一步

本文对蚂蚁LingBot、阿里HappyOyster、腾讯混元、爱诗以及Zing五款已开放实测的国产世界模型进行了横向评测。核心结论是:目前产品形态差异巨大,Zing和蚂蚁LingBot功能最完整,兼具漫游、导演与联合控制能力,最接近“实时交互世界”;阿里HappyOyster导演能力突出但模式分离。评测从输入还原度、运动一致性、物理合理性、漫游控制、导演能力、联合控制和响应速度七个维度展开,发现各家均有明显短板,如LingBot特效感过强、爱诗叙事易失控。作者认为当前阶段类似GPT-3刚出时,“能走进去”但体验粗糙,距离真正的AI交互世界还有距离。适合对AI前沿应用(尤其是游戏、影视预演)感兴趣的技术从业者和产品经理阅读。原文 ↗

核心观点
  • 当前国产世界模型的核心能力远未成熟,但已从概念演示进入可上手体验阶段,其关键价值不在于生成更长的视频,而在于提供实时交互、可无限续演的世界,这使其更像GPT-3初期的“能力已成立、体验待打磨”状态。
  • 五款产品技术路线差异巨大,功能完整度是区分层级的关键:Zing和LingBot兼具“漫游”、“导演”与“联合控制”三种能力,最接近理想世界模型;HappyOyster、爱诗R1、腾讯混元则各自侧重某一方向。
  1. 01在“输入还原度”测试中,Zing、HappyOyster、LingBot均能较好地沿用参考图主体与构图;但爱诗R1将背对镜头的主角改为正脸特写,完全脱离原图;腾讯混元的图生场景入口直接拒收含人像的图片。
  2. 02在“物理合理性”测试中,面对“海啸来袭”指令,Zing的水浪从海面涌向栈桥,符合物理直觉;LingBot则先在船顶上生成水幕,海面却相对平静。面对“天亮”指令,Zing的天空呈现渐变亮度,而LingBot变化不明显。
  3. 03在“联合控制”测试中,Zing能让角色一边移动一边发射光束攻击紫龙,光束、角色与目标的相对位置清晰;LingBot同样能执行攻击指令,但大幅蓝色光环和火焰特效经常遮挡角色动作,更像“播放特效”而非“交互体验”。
  4. 04在“导演能力”测试中,HappyOyster的叙事最为出色,其导演模式能将“小猫走一路开一路花”分解为猫爪特写、花开、全景等多个镜头,且角色会抬头看蝴蝶,动作连锁反应清晰;爱诗R1则因不断加入新元素导致叙事主线丢失。
  5. 05在成本方面,Zing宣称自部署推理成本为0.06元/分钟,10分钟成本不足1元;蚂蚁LingBot约2美元;阿里HappyOyster约10.4美元(含建世界费用),差距达一个数量级。
反方 / 局限
  • 作者承认‘联合控制’能力测试只能证明移动与事件能在画面中同时发生,但无法证明伤害计算、碰撞检测或技能规则能持续有效,这些是构成真正游戏体验的关键。
  • 评测发现LingBot的模型存在严重的‘特效感过强’问题,倾向于将指令转化为大幅视觉效果而非空间交互,如将“蓝色蝴蝶”变成角色背上长出的翅膀,或将“攻击”变为遮挡屏幕的光斑,这偏离了“生成世界”的核心目标。
  • 文章未讨论的一个关键局限是:所有模型的交互窗口都极度有限(2-3分钟级的交互),且对Open World的定义远不统一,因此这些评测结论在更长的持续时间或更复杂的场景下是否成立尚存疑问。
24 分钟 · 4 卡片 · 8 资料
读原文 →

前置背景

平行视角

未来推演

延伸追问