手机里存着几千张照片,真正想找的时候,却只记得一句话:
“那张海边日落,有个人站在画面左边。”
拍摄日期忘了,文件名更不记得。只能打开相册,一屏一屏往回翻。
如果搜索框能听懂这段描述,很多被我们“存下来”的资料,才算真正能用起来。
2026年10月6日,Google发布了EmbeddingGemma 2:一个7.4亿参数的多模态嵌入模型,可以把文字、图片、音频和视频映射到统一的向量空间,为设备本地的语义搜索提供能力。来源:Google发布公告
上面的日落描述是场景举例,具体检索效果仍需实测。
一、两个官方演示,把用途讲明白了
Google在 AI Edge Gallery 中展示了两个应用。
第一个:搜索本地照片和视频。
Instant Media Search 支持通过文字或图片发起检索,根据内容的语义相似度返回结果。
第二个:定位视频里的具体片段。
Video Moments Finder 为视频画面和音频片段建立索引,再根据查询返回匹配的时间位置。寻找“有人吹生日蜡烛”的场景,就是官方给出的示例之一。来源:Google AI Edge开发者博客
对经常整理素材的人,这个用途很直观:
一段长视频里,自己需要的可能只有十几秒。能够直接跳到相关位置,就有机会减少反复拖动进度条的时间。
以上是官方演示,本文没有进行真机测试。
二、手机为什么能根据一句话找图片?
可以把“嵌入”理解为:把内容转换成一组便于比较的数字。
EmbeddingGemma 2输出的是向量。文字描述、照片、音频等进入同一个表示空间后,应用就可以计算它们之间的相似程度,用于检索、分类或聚类。来源:官方模型卡
整个过程可以简化成:
本地素材 → 生成向量 → 建立索引 → 输入描述 → 比较相似度 → 返回文件或视频时间位置。
因此,做应用时需要同时考虑模型、索引和结果展示。
如果还想让系统读完资料后组织答案,则需要另外接入生成模型。
三、7.4亿参数,给开发者留下了哪些空间?
这个模型采用模块化设计:
| 组成 | 参数量 |
|---|---|
| 文本部分 | 2.7亿 |
| 视觉编码器 | 1.7亿 |
| 音频编码器 | 3亿 |
| 合计 | 7.4亿 |
开发者可以按任务加载需要的模块。
它还支持缩短输出向量来节省存储,但官方提醒:128维更适合纯文本任务,多模态质量会明显下降,需要根据自己的数据验证。来源:官方模型卡
小模型的价值,要放进完整应用里看。
照片数量、视频长度、索引大小以及手机硬件,都会影响实际体验。参数量只是评估的起点。
四、“离线搜索”,需要先完成准备
想离线使用,需要先取得模型,并为本地资料建立索引。Google展示的媒体检索方案会把向量存入本地数据库,再执行相似度搜索。来源:Google AI Edge开发者博客
这意味着,开发者需要把几个细节做好:
- 首次导入资料时,让用户知道索引进度。
- 新增或删除文件后,同步更新索引。
- 清晰展示相关结果,方便用户快速核对。
- 如果主打本地处理,要检查整个应用的数据流是否都留在设备上。
这些产品细节,会直接决定用户是否愿意继续用。
五、给开发者的一个小项目思路
可以从一个范围很小的“本地素材搜索器”开始。
选择一个照片文件夹,建立索引,再准备20条自己真实会搜索的描述,检查目标图片能否出现在前几条结果里。
这样更容易发现问题:
描述过于模糊?索引遗漏?还是模型对某些内容理解不足?
跑通之后,再考虑加入视频时间定位、录音检索,或把检索结果交给生成模型,组成自己的本地知识助手。
先让一个真实的查找任务变得好用,这个项目就有了价值。
写在最后
AI应用还有一个很具体的机会:帮助我们重新找到已经保存的东西。
相册里的照片、硬盘上的视频、听过却想不起位置的录音,都可能成为这类工具的入口。
EmbeddingGemma 2提供了一个值得开发者试验的组件。最终能不能留住用户,要看它在真实资料里找得准不准、等得久不久、操作是否省事。
如果只能选一个,你最想让AI帮你找照片、找视频片段,还是找录音中的某句话?