6.8
深览指数
科技人人都是产品经理·东哥说AI··AI 生成
你还没开口,AI就先开口了:京东这个开源模型,学会“该说话时才说话”
本文介绍京东开源的实时视频交互模型 JoyAI-VL-Interaction,其核心创新在于从“轮次制”问答转向“主动交互”:模型能持续观察画面,自行判断何时该说话、沉默或委托任务,实现监控预警、实时翻译等场景下的主动响应。文章详细拆解了交互模型的技术架构(AdaCodec 预测式编码、可插拔语音模块)和训练数据(400 万条逐秒标注),并提供了与豆包、Gemini 的对比评测结果。适合对 AI 产品形态、开源模型落地、具身智能感兴趣的读者。原文 ↗
核心观点
- ▍现有多模态大模型的“轮次制”设计(用户问一句、模型答一句)是其在实时、主动响应场景下表现不佳的根本原因,而京东开源的 JoyAI-VL-Interaction 模型通过将“交互能力”直接训练进模型,实现了基于视觉的主动决策与响应。
- 01JoyAI-VL-Interaction 是一个 8B 参数规模的视觉优先模型,每秒自行判断“说话、沉默、委托”三种动作,而非依赖外部调度程序。
- 02模型在 58 个真实事件驱动场景的对比评测中,对豆包总胜率 77.6%,对 Gemini 为 87.9%,在监控预警、实时翻译、实时计数等时间敏感任务上领先优势明显。
- 03技术架构上,模型采用预测式视频编码器 AdaCodec,在画面变化不显著时使用极低码率,从而支持长时间实时运行;语音模块作为可插拔的输入输出,职责单一。
- 04训练数据包含 400 多万条逐秒标注的片段,每一条标注了“该说话/该沉默/该委托”的时机,并经过强化学习精调。
- 05开源内容包含完整的四件套:8B 模型权重、训练方法、400 万条训练数据、可直接部署的整套系统(基于 vLLM 推理框架)。
反方 / 局限
- — 作者坦诚指出,在开放聊天、个人风格、长尾知识等通用对话场景上,8B 小模型远不及豆包和 Gemini 背后的大模型,因此其优势仅限于“实时在场、视觉触发主动性、时间感知”等自身定义的交互模型优势区。
7 分钟 · 3 卡片 · 6 资料
读原文 →