好好好,谷歌也来加入办公智能体混战,而且强调多模型调用的它连竞争对手Claude都给安排上了!
今天凌晨,Google Cloud发布了一篇名为《Welcome to Gemini at Work 2026: Introducing the Gemini agent》的长文,由Google Cloud CEO Thomas Kurian亲自署名,集中介绍了Gemini在企业Agent领域的一系列更新。
其中最重磅的当属全新发布的Gemini Agent。
按照谷歌的设想,这将是一个覆盖各类工作任务、能够长期运行的通用办公Agent。
它可以帮你查资料、写邮件、做PPT、分析数据、编写和运行代码,还能跨应用调用工具,自行规划任务,必要时召集多个子Agent一起干活。

而且还有两个特别值得注意的地方。
一是它可以拥有自己的企业身份,成为一名有邮箱、有日历、有独立账号的AI同事。
二是它能够根据任务自动选择底层模型,甚至调用Anthropic家的Claude。
好家伙,谷歌连自家Gemini都不一定非用不可了?
更有意思的是,这次发布的种种功能,怎么看都有点冲着最近热闹起来的办公Agent市场来的意思。
小扎听了大概会有如下内心OS:
歌,你不卷你那笨蛋Gemini模型,一扭头冲着我来了????

谷歌给它定下的工作原则是酱婶儿的:
You give it objectives, not instructions.
给它目标,而非逐步指令。
也就是想让Gemini agent帮忙干活,不用一步步告诉它先做什么、后做什么。
只需要交代最终想要的结果,剩下的交给它自己安排。

其核心能力包括统一入口、云端持久运行、跨平台调用、多Agent协作、事件触发和定时任务等。

文中举的例子是让它帮忙完成一份市场分析报告。
它可以自己搜索和整理资料、分析相关数据,在Google Sheets中建立财务模型,再调用Google Slides生成一份演示文稿。
整个过程中,它能够根据任务需要选择工具、调用不同应用,最后把完成的工作交还给你。
你可能会满脑子问号——类似的跨应用操作,不算啥新鲜事儿啊,你干啥呢?
网友对此也是不看好的居多,官宣推文下面随手一截画风black pink:

但,这次谷歌发布Gemini Agent强调的是试图把各种工作能力都集中到一个Agent身上。
在Gemini Agent大框架下,谷歌还提出了Coworker Agent,直译过来就是“同事智能体”。
谷歌现在允许企业为Gemini创建一个长期存在、具有明确工作职责的身份,让它像团队中的其他成员一样参与日常协作。
而且AI同事配置了独立的Google Workspace账号、企业邮箱、日历、Google Drive存储空间……还能出现在公司的通讯录里。
首先上手门槛约等于无,其次创建完成后,团队成员便可以像对待普通同事一样,邀请它加入Google Chat群聊,或者在文档中@它。
AI同事用的是自己的身份,执行操作会留下自己的记录,方便企业管理和追踪它究竟做了什么。
到这一步,看起来还是很normal。。。

比较不一样的是,除开独立身份,Gemini Agent获得了一套更完整的记忆机制。
按照官方介绍,它一共拥有四种记忆。
第一种是会话记忆(Session Memory)。
主要用于保存当前任务的上下文。
即使一个任务持续好几天,Gemini Agent也能记住已经完成了哪些步骤,接下来还有哪些工作。
第二种是语义记忆(Semantic Memory)。
Gemini Agent会从阅读过的文档、与人的交流以及同其他Agent的协作中积累知识,并将其组织成结构化知识库。
例如,记住公司有哪些产品、团队成员分别负责什么、某个业务术语在公司内部具体指什么。
第三种是程序性记忆(Procedural Memory)。
主要用于记录一项工作应该如何完成。
比如,某类报告需要哪些数据、按照什么流程分析、最终以什么格式交付。
这里还有个细节,Gemini Agent甚至可以自己编写Skills,把工作过程中学到的方法保存下来,供后续任务使用。
第四种是情景记忆(Episodic Memory)。
用于记录过去完成过哪些工作,以及相应的执行经历。
四种记忆结合起来,Gemini Agent就有机会逐渐熟悉用户的工作习惯、公司业务和团队协作方式。
比如第一次让它做项目周报,可能需要解释报告结构、数据来源和工作流程。
等到第二次、第三次,它就可以沿用此前积累的知识和方法,减少用户重新交代的内容。
谷歌还专门用了一个比喻,说“Gemini会像新员工一样,在正式开展工作前,逐渐熟悉你、你的工具和团队”。
好嘛。
这下连入职培训都能自己做了。

唯一的问题是,这员工好像不会主动离职(此处送上一个微笑脸.jpg)。
此外,这玩意儿可以自己挑选干活用的大模型。
谷歌这次明确表示,Gemini Agent的底层模型可以单独选择。
现阶段,它可以在Google自家的Gemini系列,以及Anthropic的Claude系列模型之间进行动态选择,未来还计划支持更多闭源和开源模型。

至于具体用哪个,Gemini会根据任务要求,在效果、速度和成本之间做选择。
对于比较简单的工作,可以使用成本较低的模型;面对复杂任务,则可以调用能力更强的模型。
一个项目中也可以组合多个模型完成不同环节。
谷歌将这套能力称为多模型编排,并配套提供Smart Routing自动路由能力。
值得注意的是,谷歌还强调了一点——
底层模型可以变化,但Agent积累的上下文、Skills和企业数据可以保留下来。
主要就是让它不必每次从零开始理解工作,而能延续之前的任务、知识和工作方式。
这意味着,即便未来模型能力排名发生变化,企业也可以调整底层模型,而无需将已经建立起来的工作流程全部推倒重来。
谷歌这次入场,时间点还挺微妙。
就在9月29日,OpenAI刚刚发布了能够7×24小时工作的Dots。
再往前,Meta也推出了个人AI Agent Muse。
如今谷歌带着Gemini agent加入战局,三家巨头算是在Agent这件事上碰头了。

咱一起来回顾一下另外两家是啥路子。
Meta的Muse更偏向个人生活场景,可以帮用户购物、预订旅行、发邮件,甚至完成支付。
比如看中一件商品,Muse可以帮忙找货、比较选项、操作网站,最终完成购买。
相比企业内部复杂的工作流程,Muse更关注个人日常生活中那些琐碎、耗时间的事情。
这与Meta已有的社交产品和庞大用户群体也有关系。
让普通用户习惯把购物、出行等需求交给AI,显然也是Meta希望抓住的机会。

OpenAI的Dots与Gemini Agent的共同点就更多了。
Dots拥有独立的云端电脑,支持7×24小时运行,能够记住用户的长期目标和工作习惯,还可以连接超过4000个应用。
比如开发者收到新的用户反馈,Dots可以主动分析问题、修改代码,并准备PR供人审查。
对于内容创作者,它也可以在新的采访记录到来后,整理素材、制作内容草稿。
不过,Dots目前更强调围绕用户个人持续工作。
它会逐渐了解用户的偏好、目标和判断标准,主动寻找可以推进的事项。
OpenAI也在探索面向企业岗位的专业Dots,让Agent拥有独立身份和职责,不过这部分目前主要处于早期企业试点阶段。
相比之下,谷歌此次重点展示的,是让Agent进一步进入企业已有的组织和办公体系。
Gemini Agent可以利用Gmail、Docs、Sheets、Calendar等应用中的业务上下文,理解员工正在做什么。
企业还能创建有独立邮箱、日历、账号和权限的Coworker agent,让它以自己的身份参与团队协作。
同时,谷歌还把模型选择、企业数据连接、安全审计和成本控制放进这套体系。
甚至连竞争对手Claude,都可以成为Gemini agent完成任务时调用的底层模型。
这么看下来,三家的侧重点就比较清楚了。
BTW,谷歌的长文中还发布了其它相关内容,感兴趣的小伙伴可移步自行查看,啾咪~
【谷歌原文】
https://cloud.google.com/blog/products/ai-machine-learning/welcome-to-gemini-at-work-2026/
文章来自于"量子位",作者 "衡宇"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT