7.1
深览指数
科技腾讯新闻·AGIHunt··AI 生成
刚刚,谷歌发布第一个开源的原生多模态Embedding模型
谷歌发布了首个开源的原生多模态 Embedding 模型 EmbeddingGemma 2,仅 740M 参数,支持文本、代码、图片、视频、音频五种模态的混合检索,可在手机端运行。在代码检索任务上,它比上一代提升了近 10 个百分点,性能接近甚至超越部分更大规模的专用模型。与友商对比,其多模态单项分数不及通义千问的对应模型,但强调超小体积和 Apache 2.0 开源协议带来的端侧部署优势。文章还通过详细技术参数、跑分对比和四个 demo,论证了该模型在本地 RAG、视频搜索等场景的落地可能。适合对多模态检索、端侧 AI、开源大模型进展感兴趣的技术决策者阅读。原文 ↗
核心观点
- ▍谷歌发布 EmbeddingGemma 2,是首个同时支持文本、代码、图片、视频、音频五种模态的开源 Embedding 模型,且 740M 的全模态参数可在手机上运行,为端侧多模态搜索与 RAG 提供了新的基础模型选项。
- 01模型结构由三部分组成:文本主干 270M、视觉编码器 170M、音频编码器 300M,可选择性加载,纯文本模式下仅需 270M 参数。
- 02支持 Matryoshka 表示学习,768 维向量可截断至 512、256、128 维,存储最大可降至原来的六分之一,截断至 256 维基本不掉分。
- 03官方警告不要使用 float16 精度运行,激活值会超出 float16 范围导致 NaN 或不报错的性能劣化,应使用 bfloat16 或 float32。
- 04在代码检索评测 MTEB 代码 v1 上得分 78.68,对比上一代的 68.76 提升近 10 分。在 270M 纯文本部分,性能压过 Qwen3-Embedding-0.6B(0.6B),与 pplx-embed-v1(4B)相当。
- 05与同类模型对比,其 MTEB 多语言分数(61.36)低于 Qwen3-Embedding-0.6B(64.33)和 Qwen3-VL-Embedding-2B(63.87);MMEB-V2 总分(59.01)低于 Qwen3-VL-Embedding-2B(73.2)。
- 06该模型采用 Apache 2.0 协议开源,权重可在 Hugging Face 和 Kaggle 下载,Hugging Face transformers、vLLM、Ollama 等主流工具链均已支持。
反方 / 局限
- — 在纯文本和多模态的综合评分上,EmbeddingGemma 2 低于规模更大的 Qwen3-VL-Embedding 系列(如 MMEB-V2 分数落后 14 分),说明在计算资源充足的服务器场景,其性能优势不突出。
- — 上下文长度仅为 8K token,与千问模型的 32K 相比存在明显差距,在需要长文档或长视频检索的任务中可能受限。
- — 文章未提及该模型在训练数据、偏见、可信度方面的信息,作为开源模型发布时,这些因素对实际选型同样关键。
EmbeddingGemma 2Sundar PichaiGoogle DeepMindHugging FaceApache 2.0Matryoshka 表示学习MTEBMMEBQwen3-EmbeddingQwen3-VL-Embeddingtext-embedding-3-smallOpenAIGemma 4Pixel 11 ProGoogle AI Edge Gallery
14 分钟 · 5 卡片 · 12 资料
读原文 →