谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜
8045点击    2026-10-08 12:14

10月6日,谷歌开源EmbeddingGemma 2,把一个能搜图、看视频、听声音的搜索引擎,塞进了一个内存不到600MB的小模型!


文字、代码、图片、视频、音频,都能用一句话一起搜了,这在谷歌的开源模型里还是第一次。


740M参数,手机、笔记本、浏览器都能离线跑。


谷歌CEO Sundar Pichai也亲自下场安利:这是谷歌首个原生多模态开源嵌入模型。


它的一大突破,是让手机也能在本地搜图片、视频和声音。演示中,只要输入一句「鸟在唱歌」,鸟的照片和鸟叫录音就能一起找到。


谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜


发布一个多小时后,Hugging Face的Victor M就让它在浏览器里跑了起来。


他在搜索框里敲下「birds singing」(鸟在唱歌),屏幕上的格子立刻重新排序:排到最前面的,既有鸟的照片,也有显示着波形的鸟叫录音。


整个查询只用了22毫秒,不走服务器,也没调任何API。


谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜


谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜

应用接入它后,你就能让AI帮你找手机里的照片、录音和视频,不必先把文件上传到云端。


文字、图片、声音

能互相搜了


Embedding这东西,普通用户平时看不见,但很多AI搜索和RAG问答,背后都靠它找资料。


它干的活,是把一段内容变成一串数字,相当于在一个巨大的空间里,给每段内容安排一个坐标。意思越接近,坐标就越靠近。


搜索时,系统再去找与问题最接近的那些内容。


上一代EmbeddingGemma只处理文字。要搜图片和声音,往往还得接上其他模型,或先把它们转成文字。


EmbeddingGemma 2把这些内容放进了同一个768维空间。


比如,猫的照片、「cat」这个词和猫叫声,就能在这个空间里按语义关联起来。


谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜


于是,你可以用一句话搜图片、搜视频,也可以用一段语音,找到视频里对应的片段。


它还能把文字、图片和视频放在一起,让你一次搜到包含这些内容的整条信息。


谷歌在模型卡里举了个例子。


一双跑鞋的商品页,包含文字介绍、两张细节图,以及鞋子在湿滑岩石上的防滑测试视频。


模型能把这组内容转成一个向量,用来匹配「适合越野跑的防水鞋」这样的搜索。


一次能处理的内容也更多了。8K上下文窗口,是上一代的4倍。


只输入单一类型的内容时,最多能容纳约5.5分钟音频、29张图片,或58帧视频。它还支持100多种语言。


谷歌把它和几个同量级的模型放在一起比了一轮,差距最大的是看图和看视频。


谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜


谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜

EmbeddingGemma 2在图像和视频检索上,明显领先Jina v5 Omni-Nano。


在谷歌公布的测试中,EmbeddingGemma 2的图像检索得分为57.3,比它参数量大三成的Jina v5 Omni-Nano只有31.6。


视频检索也拉开了差距:50.7分对31.2分,领先近20分。


在多语言文本测试上,它和上一代基本持平。


567MB

手机自己当搜索引擎


这么多本事,全装在740M参数里。


其中文本部分占270M,视觉编码器170M,音频编码器300M,可以按需加载。只搜文字,就加载270M;要搜图片,再加上视觉部分,总共440M。


在谷歌的Pixel 11 Pro测试中,量化后的纯文本模型,内存占用最低约191MB,完整多模态模型约567MB。


它还支持给搜索索引「瘦身」:用更少的数字记录每段内容的含义,占用的存储空间就能减少三分之二。


在谷歌的多语言文本检索测试中,得分只下降了不到1分。


谷歌自己做了几个应用打样:


AI Edge Gallery里的Instant Media Search,能让你在相册里按意思搜照片。


Video Moments Finder更直观,说一句话,就能定位视频里对应的片段。


另一个应用Foresight,则把它与Gemma 4搭配起来,在Mac上离线检索文件和会议记录。


开发者这边,llama.cpp已经提供支持,Unsloth也放出了量化版,方便把模型部署到本地。


据Mac应用Nativ公布的实测,在M5 Max上,8-bit量化版生成的向量,与原版的余弦相似度达到0.9997,文本嵌入速度达到每秒817条。


谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜


土耳其开发者Avenox的测试,更贴近日常。


他的笔记大多用英文写,提问却习惯用土耳其语。以前靠关键词匹配,两边的词对不上,相关笔记就可能搜不到。


他让Claude花一个小时搭了个测试台,选出40条笔记,再分别换个说法,用土耳其语提问,看正确笔记能不能进入前18个候选。


据他公布的结果,关键词匹配的命中比例只有15%;换上EmbeddingGemma 2,升到了97%。


他又拿30条平时随手输入、带有错别字的真实消息测试。模型找到的相关笔记数量,是关键词匹配的两倍。每次查询约50毫秒,全程在本地运行。


还有人玩得更野。


开发者Nick Lo把它装进一块Nano开发板。


输入一句话,模型只需约15毫秒,就能把这句话转成用于搜索的一串数字。找到对应图片后,再交给一块ESP32-S3单片机,把图像逐行画出来。


谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜


Coding Agent找代码

也能在本地搜了


除了多模态,代码检索也有明显提升。


在代码检索基准MTEB Code上,它从上一代的68.76分涨到78.68分,一口气涨了近10分,谷歌称,这一成绩在同尺寸模型中领先。


这对写代码的Agent很实用。


Claude Code、Codex这类工具干活之前,都要先在整个代码库里找到相关的那几段。


有了270M的纯文本版,开发者就能在本地为代码库建立索引,再用大白话查找相关代码。建索引和检索这两步,都可以留在本地。


AI搜索

搬进了你的手机


今年3月,谷歌在云端发过多模态的Gemini Embedding 2,通过API调用,按用量付费。


半年多后,谷歌又把多模态检索带进了一个能在手机上运行的开源小模型。照片、录音和视频,也有了留在本地检索的选项。


谷歌给出的一个用法,是把它与Gemma 4搭配,做离线、隐私优先的RAG。


一个负责找资料,一个负责根据资料回答,检索和问答都能在设备上完成。


过去,要用AI搜索照片、视频和录音,很多时候得把内容交给云端处理。


现在,这种检索能力只要几百MB,就有机会装进每个人的口袋。


参考资料:

https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2

https://huggingface.co/google/embeddinggemma-2

https://ai.google.dev/gemma/docs/embeddinggemma


文章来自于"新智元",作者 "摩西 元宇"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

3
AI搜索

【开源免费】MindSearch是一个模仿人类思考方式的AI搜索引擎框架,其性能可与 Perplexity和ChatGPT-Web相媲美。

项目地址:https://github.com/InternLM/MindSearch

在线使用:https://mindsearch.openxlab.org.cn/


【开源免费】Morphic是一个由AI驱动的搜索引擎。该项目开源免费,搜索结果包含文本,图片,视频等各种AI搜索所需要的必备功能。相对于其他开源AI搜索项目,测试搜索结果最好。

项目地址:https://github.com/miurla/morphic/tree/main

在线使用:https://www.morphic.sh/