Google把原本只擅长文字嵌入的EmbeddingGemma,升级成支持多模态理解的EmbeddingGemma 2:参数规模达到740M,能把文字、程序代码、图片、视频以及音频都转成可比较的向量,从而实现“以内容找内容”。更关键的是,它允许开发者把模型直接装到手机、笔电等终端运行,用户在本地就能做语义检索,很多情况下不必把资料上传到云端处理。
所谓“嵌入模型”,核心思路是把不同类型的信息映射到同一套向量空间:内容语义越接近,向量就越相似。过去做检索常依赖关键词或固定标签;现在用户可以直接输入一句话去找相近画面。比如你描述“狗在草地追球”,系统不需要视频里出现同样文字,也能通过嵌入向量匹配找到可能对应的镜头。
EmbeddingGemma 2把输入能力从第一代的2K词元提升到8K词元,单一模态下最长可处理约5.5分钟音频、29张图片或58个视频画面;如果把文字、图片、视频和音频混合输入,仍会共享这8K词元预算。输出的嵌入向量默认是768维,但开发者可按需求缩减到512/256/128维:维度越低,本机端存储向量库所需空间越小。Google也给出性能取舍提示——降到256维通常能较好保留检索效果,而128维更适合以纯文本索引为主的场景。
在资源占用方面,它采用“分开载入”的设计:当只处理文字与代码时,并不需要同时加载图片、音频等分支。以Pixel 11 Pro的量化测试为例,只载入文字模型相关配置大约使用191MB活动内存;若加载完整多模态能力,约为567MB。对体感而言,这意味着开发者更容易把强检索能力塞进端侧应用。
代码检索也同步增强:Google测试显示,EmbeddingGemma 2在MTEB Code程式码嵌入任务上从68.76分提升到78.68分,可用于在本地代码库中找功能相近的实现,或让开发代理在需要时更快定位相关资料。
模型基于Gemma 4架构,并采用Apache 2.0授权;目前可从Hugging Face与Kaggle获取,同时提供MediaPipe和LiteRT等工具,方便把模型部署到移动设备、浏览器与个人电脑端。对于想做“隐私本地化+多模态搜索”的团队来说,这次升级非常有冲击力。