7.1
深览指数
科技微博·量子位··AI 生成

ECCV上,顶尖学者们开始研究如何让AI做生意了

2026年ECCV计算机视觉顶会上,钛动科技牵头举办了MARS2 Workshop,这是该届唯一聚焦Agentic Commerce(智能体商业)的研讨会。文章系统介绍了MARS2多模态AI挑战赛的赛题设计、冠军方案技术细节(如证据链工程、跨模态对齐),并揭示了当前多模态AI的能力边界:看懂广告内容已可行,但精准定位关键帧和理解复杂营销意图仍有难度。文章还详细铺垫了钛动科技从出海营销业务、自研钛极大模型(Tec-Chi)到营销多智能体平台Navos的商业闭环,解释其为何能在学术界设置议题。适合关注AI产业落地、多模态技术前沿、及AI Agent商业化的从业者阅读。原文 ↗

核心观点
  • 多模态AI的下一个关键挑战不再是单纯的感知(看懂内容),而是理解复杂场景中的意图与因果,并转化为可靠行动(System 2推理),Agentic Commerce是这一方向的典型落地场景。
  1. 01ECCV 2026上,钛动科技牵头的MARS2 Workshop是唯一一个由中国科技公司举办的Agentic Commerce方向Workshop,邀请了牛津大学Yarin Gal、MIT Paul Pu Liang等顶学者。
  2. 02MARS2多模态AI挑战赛基于钛动真实商业数据集M-CAR(3108支广告视频,覆盖30+语言),设三条赛道:MAC(整体理解)、VTG(关键帧定位)、MDC(营销意图推理)。
  3. 03竞赛中MAC赛道冠军分数为86.67,而VTG和MDC赛道冠军分数分别为62.27和63.53,显示从理解到定位再到推理的难度阶梯,多模态AI在长时序推理和商业意图解读上仍有明显短板。
  4. 04VTG赛道的消融实验表明,补充跨模态音频时间线可使定位精度提升16.7分,而参数量从4B扩展至8B反而下降0.2分,强调了信息对齐比单纯增加参数更有效。
  5. 05冠军方案采用“Proposer-Critic双模型验证”和“从粗到细两阶段定位”的“证据链工程”方法,核心是让AI基于带时间戳的证据回答问题,再通过独立模型验证一致性以抑制幻觉。
  6. 06钛动科技自研的钛极大模型(Tec-Chi)在2026年SuperCLUE-Mkt营销大模型评测中(85.82分)及SuperCLUE-AdsVU出海营销视频理解测评中(86.43分)均位列前茅。
  7. 07钛动科技发布的营销多智能体平台Navos,通过整合多种模型和工具,在实际业务中帮助某出海品牌在ChatGPT Ads测试中将ROI提升至2.5倍。招股书显示2025年前三季度其AI营销解决方案收入达1.16亿美元,同比增长68.5%。
反方 / 局限
  • 文章承认,当前模型在需要跨越多个片段梳理时序关系、追溯前因后果并作出商业判断时,表现会明显下滑,离真正参与商业决策还有距离。
  • 文章未讨论AI Agent在商业场景中可能引发的伦理问题(如操纵用户消费决策、偏见放大)或监管挑战,也未涉及该方案在非营销领域(如金融、医疗)的泛化性问题。
12 分钟 · 5 卡片 · 9 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问