4.5
深览指数
科技微博·量子位··AI 生成

3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界

文章介绍了一家名为Om AI联汇的具身智能初创公司,宣称其端侧原生VLX模型在3B参数规模下,多项指标超越英伟达、谷歌等巨头的同类模型。文章将此举类比为AWS开启云计算时代,强调其“端侧原生”而非“端侧部署”的技术路线,核心观点是物理AI的未来在于适应端侧环境的原生架构,而非堆砌云端大模型参数。文章内容为一篇典型的公司融资与产品发布PR软文,信息密度高,但立场单一,缺乏对端侧原生路线局限性和反方观点的讨论。原文 ↗

核心观点
  • 物理AI的未来在于“端侧原生”模型,其架构设计从诞生起就针对端侧算力、延迟和功耗,而非先训练大模型再压缩部署。
  • Om AI联汇的VLX-Seek 1.5模型(3B和10B参数版本)在多个评测中,性能优于英伟达LocateAnything等更大参数规模的模型,证明了端侧原生架构的“以小搏大”效率。
  1. 01VLX-Seek 1.5采用流式多模态架构,处理视频流而非静态图片,其“Flow(注意力)-Seek(推理)-Go(执行)”的三层心智链路在物理世界更高效。
  2. 02在通用检测任务LVIS Mean指标上,VLX-Seek 1.5-3B(57.5)比LocateAnything-3B(50.7)提升13.4%。
  3. 03在无人机视角场景RefDrone测试中,VLX-Seek 1.5-3B的F1指标(73.2)比LocateAnything-3B(52.3)提升40%。
  4. 04在目标幻觉评测中,VLX-Seek 1.5-3B的FP/GT(18)远低于LocateAnything-3B(71.3),表明其能更有效减少错误目标判断。
  5. 05Om AI联汇已完成数亿元融资,由前海母基金领投,资本开始为“端侧原生”范式定价。
  6. 06公司已推出“一脑多形”智能体平台OmAgent,以及面向视障用户的AI视觉中枢Homer AI,旨在构建端侧智能生态。
反方 / 局限
  • 文章仅以自述的评测数据来证明模型优越性,未提供第三方独立评测结果,且对“端侧原生”路线在复杂场景下的泛化能力、训练数据成本、与云端模型协同等潜在局限未作讨论。
  • 文章将自身与AWS和Kubernetes类比,逻辑上存在跳跃,缺乏对自身如何定义行业标准、如何构建真正开放生态的具体论证,更像是一种营销叙事。
10 分钟 · 3 卡片 · 7 资料
读原文 →

前置背景

平行视角

延伸追问