Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.096 — 2026-10-08
NEWS 2 信源 约 1 分钟

EmbeddingGemma 2把多模态检索塞进端侧

Google 推出开放轻量模型,让文字、图像和音视频可在设备本地互相检索。

IMAGE — Google DeepMind Blog

想在手机里用一句话找出某段视频,或从几小时录音中定位相关内容,过去往往要把资料交给云端处理。Google 推出的 EmbeddingGemma 2,试图把这件事留在设备本地完成。它是一款拥有 7.4 亿参数的多模态 embedding(嵌入)模型:把文字、代码、图片、视频和音频变成可比较的数字坐标,让不同格式的相关内容能互相匹配。

它的实用之处在于可以按需“拆装”。纯文字任务最低只需 2.7 亿参数;需要处理图像或音频时,再加入相应编码器。Google 称,模型量化后在 Pixel 11 Pro 上运行,纯文字权重最低占用约 191MB 活跃内存,完整多模态版本约 567MB。它还能把默认 768 维的嵌入缩短到 128 维,官方称可将本地向量数据库和内存占用最多压缩至六分之一。

EmbeddingGemma 2 采用 Apache 2.0 许可,为本地搜索和 RAG(先找资料、再让生成模型据此回答)提供了开放选项。数据无需离开手机或电脑,也能离线工作;开放权重还降低了服务商停掉模型后被迫重算全部资料的风险。不过,性能与内存数字目前来自 Google 自述,实际体验仍取决于设备和任务。


供稿材料 SOURCES — 2

← 返回 2026-10-08 · 科技板块