文章摘要
当前海外办公智能体赛道竞争升温,谷歌推出面向企业场景的长期通用办公智能体Gemini Agent,正式入局该赛道。该产品可配置带独立办公身份的AI同事,拥有四层记忆体系能自主熟悉业务,核心亮点是可根据任务自动调度多类底层大模型,甚至能调用竞品Anthropic的Claude,主打一站式整合全场景办公能力。

近期海外办公智能体赛道竞争愈发激烈,谷歌正式加入这场混战,推出了全新的Gemini Agent。这款产品的最大亮点在于支持多模型调用,甚至可以直接调用竞争对手Anthropic的Claude系列模型。

此次更新由谷歌云CEO亲自署名发布,官方围绕Gemini在企业级Agent领域的多项升级进行了详细介绍,其中最受关注的无疑是全新的Gemini Agent。

按照谷歌的规划,Gemini Agent是一款可长期运行的通用办公智能体,能够覆盖绝大多数日常工作任务:从资料检索、邮件撰写、PPT制作、数据分析、代码编写运行,到跨应用工具调用、自主任务规划,甚至可以在需要时调度多个子Agent协同完成复杂工作。

这款智能体有两个格外值得关注的核心特性。第一,它可以拥有专属的企业身份,拥有独立的企业邮箱、日历、存储空间与账号,甚至能被加入公司通讯录,成为团队中真正的AI同事;第二,它能够根据任务需求自动选择底层大模型,无需局限于谷歌自家的Gemini系列。

谷歌为Gemini Agent定下的核心工作逻辑是“只给目标,而非逐步指令”,用户只需要交代最终想要达成的结果,无需详细说明每一步操作步骤,剩余的任务规划与执行都将由Agent自主完成。

它的核心能力涵盖统一交互入口、云端持久运行、跨平台应用调用、多Agent协同协作、事件触发与定时任务等多个维度。官方还举例展示了其工作流程:当用户委托其完成一份市场分析报告时,Gemini Agent可以自动搜索整理相关资料、在表格工具中搭建财务模型,再调用演示文稿工具生成完整的汇报文件,全程无需人工干预步骤细节。

不少观点认为这类跨应用操作并非新鲜功能,但此次谷歌的重点在于将全场景办公能力整合到单一Agent框架中,打造真正的一站式办公助手。

在Gemini Agent的大框架下,谷歌还推出了Coworker Agent,也就是同事智能体。企业可以为这个智能体配置长期稳定的工作职责与专属身份,让它像团队普通成员一样参与日常协作。

企业创建的AI同事拥有独立的云办公工具账号,团队成员可以像邀请真人同事一样,将其加入聊天群聊,或是在文档中直接@它发起协作,所有操作都会留下专属的执行记录,方便企业进行管理与审计。

相较于普通的办公助手,Gemini Agent最大的不同在于其完整的四层记忆体系,这让它可以像新员工一样逐步熟悉团队与业务流程。

第一种是会话记忆,用于保存当前任务的上下文信息,即使任务持续多日,Agent也能清晰记录已完成的步骤与待推进的工作;第二种是语义记忆,Agent会从阅读过的文档、与团队的交流以及与其他Agent的协作中积累知识,并整理成结构化的内部知识库,比如记住公司的产品线、团队成员的分工、内部专用的业务术语等;第三种是程序性记忆,用于记录完成特定工作的标准流程,例如某类报告需要采集哪些数据、遵循怎样的分析逻辑、最终需要以何种格式交付,甚至Agent还可以自主编写专属的工作技能模块,将执行过程中总结的方法保存下来,供后续同类任务复用;第四种是情景记忆,用于记录过往完成的所有工作任务与对应的执行经历。

举个简单的例子,第一次让Agent制作项目周报时,可能需要详细解释报告结构、数据来源与制作流程,但经过几次复用后,Agent就能自动沿用之前积累的知识与流程,大幅减少用户需要重复交代的内容。正如官方比喻的那样,Gemini Agent会像新入职的员工一样,在正式开展工作前逐步熟悉用户、常用工具与团队协作方式,甚至连“入职培训”都可以自主完成。

唯一的趣味细节或许是,这位“AI员工”似乎不会主动提出离职。

除了身份与记忆体系,Gemini Agent的另一大核心优势是灵活的多模型编排能力。谷歌明确表示,Agent的底层大模型可以独立选择,现阶段支持在自家Gemini系列与Anthropic的Claude系列之间动态切换,未来还计划支持更多闭源与开源模型。

Agent会根据具体任务的需求,在模型效果、响应速度与使用成本之间进行综合权衡:简单的日常任务可以选择成本更低的模型,复杂的专业任务则调用能力更强的模型,甚至可以在同一个项目中组合多个模型完成不同环节的工作。谷歌将这套能力称为多模型编排,并配套了Smart Routing自动路由功能来实现智能调度。

值得注意的是,即使底层模型发生更换,Agent积累的会话上下文、自定义技能与企业业务数据都可以完整保留,这意味着企业无需因为模型能力排名变化而重新搭建整套工作流程,大幅降低了后续的迁移成本。

此次谷歌入局的时间点恰好处于办公智能体赛道的爆发期:就在不久前,OpenAI刚刚发布了支持7×24小时运行的Dots智能体,而更早之前Meta也推出了面向个人场景的AI Agent Muse。

我们可以对比一下三家巨头的产品定位差异:Meta的Muse更侧重个人生活场景,可以帮助用户完成购物比价、旅行预订、邮件发送甚至支付操作,这类定位与其成熟的社交产品生态与庞大的个人用户群体高度匹配,核心目标是让普通用户习惯将日常琐碎事务交给AI处理;OpenAI的Dots则拥有独立的云端运行环境,同样支持7×24小时工作,能够记住用户的长期目标与个人习惯,可连接超过4000款应用,例如自动分析开发者收到的用户反馈、修改代码并准备提交PR,或是为内容创作者整理采访素材、生成内容草稿,目前Dots更侧重围绕个人用户持续服务,企业级的专业身份版本还处于早期试点阶段。

相比之下,谷歌此次推出的Gemini Agent更侧重深度融入企业已有的办公组织体系,它可以直接利用云办公工具中的业务上下文,精准理解员工当前的工作进度与需求。企业可以轻松创建拥有独立身份与权限的Coworker Agent,让其以正式成员的身份参与团队协作,同时这套体系还集成了模型选择、企业数据连接、安全审计与成本控制等多项企业级管理功能,甚至可以直接调用竞争对手的Claude模型来完成特定任务。

除了Gemini Agent本身,谷歌此次还同步推出了多项配套升级:Gemini全面接入企业云办公工具实现跨应用办公,开放了技能、工具与企业连接器接口,推出了面向数据分析、金融与法律领域的专业智能体,同时进一步增强了Agent的安全治理与成本控制能力。

以上内容不代表本平台立场,仅供读者参考