谷歌云发布Gemini办公Agent,支持调用Claude

2026年10月8日,谷歌云在Gemini at Work 2026大会上正式发布Gemini办公Agent,定位“通用工作智能体”。它支持调用Gemini与Anthropic Claude双模型,拥有独立企业身份、四种记忆类型,可自主运行数小时至数天,目前已面向部分企业客户开启私密预览。

一、这不是又一个聊天机器人:从“问什么答什么”到“你给目标,它交结果”
过去两年,企业级AI工具的主流形态是聊天框——你问它答。但真正的办公场景不是问答,而是执行。一份市场分析报告需要跨应用搜集数据、建立模型、生成演示文稿;一次跨部门会议需要确认参会人、协调时间、发送邀请——这些从来不是“回答一个问题”能解决的。
谷歌云此次发布的Gemini办公Agent,核心设计理念正是围绕这个痛点展开的。它不再等着用户给一步步指令,而是接受一个目标,自己规划路径、调用工具、完成任务。
用一个具体例子来说明这个差别:你告诉传统AI助手“帮我查一下Q3销售数据”,它给你一段文字。你告诉Gemini办公Agent“帮我把Q3销售数据做成一份给管理层的汇报PPT”,它会自己去Google Sheets取数、做分析、生成图表、调用Slides排版,最后交给你一份可以直接用的演示文稿。
这个转变看起来不大,但在实际使用中的体验差异是根本性的。它意味着你从一个“操作者”变成了一个“委托者”。你不需要知道数据存在哪里、用什么工具分析、怎么排版。你只需要知道你想要什么。
1.1 “给目标,不给指令”背后的产品哲学
谷歌云CEO Thomas Kurian在发布中反复强调一个表述:“You give it objectives, not instructions.” 这句话是整个产品设计的灵魂。
从产品哲学的角度看,这代表了一种对AI办公工具的重新定义。过去几年,行业内一直在争论“AI是增强人的工具还是替代人的工具”。Gemini办公Agent给出了一种新的回答:它既不是简单的工具,也不是完全的替代者,而是一个你可以委派工作、但最终成果由你审核的协作者。
谷歌产品团队在设计时做了一个关键选择:不是把所有功能堆在聊天框里,而是让Agent融入员工已有的工作流。在Gmail里写邮件时,如果收到的邮件包含一个可以委派的任务,系统会识别出来并提供一个一键转交的按钮。你不需要跳出当前工作界面去使用一个单独的AI应用。
这种“隐入工作流”的设计思路,在产品层面意味着更低的采用门槛,但也意味着更高的技术整合要求。
1.2 发布节奏与市场背景
值得一提的是发布时机。就在Gemini办公Agent发布的前几天,微软更新了Copilot的多智能体自动化能力,OpenAI上线了常驻型dots agents,Anthropic则刚刚宣布Claude原生集成Google Docs和Sheets。这个时间窗口的密集动作说明一件事:AI办公Agent已经从一个概念验证阶段进入了“谁能先让企业真正用起来”的实战阶段。
谷歌云在这场竞赛中的位置比较微妙。它有接近90%的《财富》100强企业客户基础,Gemini月活跃用户超过10亿。但客户基础不等于Agent采用率。很多企业已经在用Gemini做问答和文档辅助,但要让它们把核心工作流交给一个Agent,需要跨越的信任门槛远高于功能门槛。
二、Gemini办公Agent到底能做什么:六个核心能力拆解
Gemini办公Agent的能力架构可以拆解为六个层面,从基础的任务执行到高级的多Agent协作,构成了一个递进的体系。
2.1 跨应用任务执行:从单一界面到全平台覆盖
Gemini办公Agent的操作范围覆盖了Google Workspace的全部核心应用——Gmail、Drive、Docs、Sheets、Slides、Chat和Calendar。更重要的是,它不局限在谷歌生态内部。通过API和连接器,它可以接入Microsoft 365、Slack、Jira、Confluence、Git、BigQuery、Databricks、Postgres和Snowflake等服务。
这意味着一个员工可以在Slack里发起请求,Agent去BigQuery取数据,在Google Sheets里建模,最后通过Microsoft Teams把结果发给同事。跨平台操作在技术上并不新鲜,但Gemini办公Agent的差异在于:它把跨平台调用做成了默认能力,而不是需要额外配置的集成选项。
2.2 持久化云端运行:任务可以跨天、跨设备
一个容易被忽视但影响深远的能力是“云端持久运行”。Agent在云端执行任务,用户可以在任何设备上启动一个任务,合上电脑,第二天在手机上查看结果。
这对于需要长时间运行的任务至关重要。比如一份涉及大量数据源的市场研究报告,传统AI工具需要用户在同一个会话中等待。而Gemini办公Agent会持续推进——它可以运行数小时甚至数天,在完成任务后主动通知用户。
2.3 事件触发与定时任务
Agent不需要总是由人来启动。Gemini办公Agent支持基于事件触发和定时计划自动执行任务。比如每天早晨自动汇总隔夜的客户反馈、每周五下午自动生成项目周报、当某个监控指标超过阈值时自动发起排查流程。
这个能力把Agent从“被动响应”推进到了“主动执行”的层面。它意味着Agent可以承担一部分日常运营中重复性、规律性的工作,不需要每次都由人来触发。
2.4 “同事Agent”:拥有独立企业身份的数字员工
这是Gemini办公Agent最具差异化的能力之一。企业可以创建一个“同事Agent”,赋予它独立的Google Workspace账号、企业邮箱、日历、Drive存储空间,甚至让它出现在公司的通讯录中。
在实际协作中,团队成员可以像对待普通同事一样邀请它加入Google Chat群聊,或者在文档中@它来请求协助。Agent用自己的身份执行操作,留下独立的审计记录,方便企业追踪它做了什么、访问了什么数据。
这个设计的深层含义是:Agent不再是一个“工具”,而是一个可以被纳入组织结构管理的“实体”。它有身份、有权限、有职责范围,也有完整的行为记录。
2.5 多Agent协作:复杂任务的分工与并行
当任务复杂度超过单个Agent的处理能力时,Gemini办公Agent可以召集多个子Agent协同工作。这些子Agent可以并行执行不同的子任务,也可以按顺序传递中间结果。
比如一个涉及市场调研、财务分析和竞品对比的综合报告,Agent可以同时启动三个子Agent分别处理不同模块,最后汇总成一份完整的报告。这种架构在技术上的挑战在于Agent之间的协调和一致性保证——如何确保不同子Agent使用相同的上下文和数据源,避免信息不一致。
2.6 行业专业化版本
谷歌云还推出了面向金融服务和法律行业的专业化版本,目前处于预览阶段。金融服务版本整合了FactSet和LSEG的数据源,提供超过50项专业能力。法律版本则集成了NetDocuments和iManage等文档管理平台。
政府、医疗和零售行业的版本也在规划中。这个策略的逻辑是:通用Agent能力固然重要,但企业客户真正愿意付费的往往是那些深度理解行业规则和工作流的专业化版本。
三、模型路由:谷歌为什么主动把竞争对手请进来
Gemini办公Agent最引人注目的技术决策,是它支持调用Anthropic的Claude模型。
3.1 Smart Routing机制如何工作
Agent内置了一个“智能路由”(Smart Routing)能力。每收到一个任务,系统会评估任务的性质,然后自动选择最适合的底层模型——可能是Gemini系列,也可能是Claude系列。选择的标准是在质量和成本之间找到最优平衡点。
用户也可以手动指定模型。但对于大多数企业用户来说,默认的自动路由更实用——他们不需要了解哪个模型擅长代码、哪个模型擅长长文本分析,系统会处理好这件事。
谷歌表示未来还计划支持更多闭源和开源模型。这个表述暗示Agent的模型层设计是开放的,不绑定在任何一个模型供应商上。
3.2 “把竞争对手请进来”的战略逻辑
一家公司主动在自家产品里集成竞争对手的模型,这在商业史上并不常见。但放在AI Agent的语境下,这个决策的逻辑是清晰的。
首先,企业客户对模型选择的态度正在变化。超过75%的企业已经在生产环境中采用了多AI供应商策略。它们不希望被锁定在单一模型上。如果Gemini办公Agent只支持Gemini模型,企业客户在评估时会把它视为“又一个谷歌工具”,而不是一个“通用工作平台”。
其次,不同模型在不同任务上确实存在能力差异。Gemini在长上下文处理上有优势——其百万级token上下文窗口在业内经过了最多实战检验,定价也显著低于Claude Opus系列。而Claude在需要深度推理和工具调用的任务上表现突出——在启用工具的HLE基准测试中,Claude达到53.1%,略高于Gemini的51.4%。
把这些差异暴露给路由系统,让系统根据任务自动匹配,对用户来说是最优解。
更深层地看,这个决策传递了一个信号:谷歌云正在把Gemini办公Agent定位为“企业AI工作入口”,而不是“Gemini模型的展示窗口”。入口的价值在于连接,不在于绑定。
四、四种记忆:Agent如何记住“你是谁”和“工作怎么做”
Gemini办公Agent的记忆系统设计,是决定它能否从“一次性工具”变成“长期协作者”的关键技术。
4.1 四种记忆类型的设计意图
Agent拥有四种类型的记忆,每种解决不同层面的问题。
会话记忆保存当前任务的上下文。一个任务可能持续好几天,Agent需要记住已经完成了哪些步骤、下一步该做什么。没有这个能力,长时间运行的任务就无法实现。
语义记忆是从文档、对话和Agent协作中积累的结构化知识库。它记录的是“事实性知识”——公司有哪些产品、团队成员各自负责什么、某个业务术语在内部的具体含义。这类似于一个持续更新的企业知识图谱。
程序性记忆记录的是“事情怎么做”。比如某类报告需要从哪些数据源取数、按照什么流程分析、最终以什么格式交付。这本质上是把企业的工作流程和方法论编码进了Agent的认知系统。
情景记忆是对历史任务的记录。Agent可以回溯它之前完成过哪些工作、采用了什么方法、结果如何。这为持续改进提供了基础。
4.2 记忆系统对企业落地的实际影响
四种记忆的组合意味着:一个使用Gemini办公Agent的企业,它的Agent会随着使用时间增长而变得更“懂行”。新员工需要数月才能熟悉的内部流程和业务知识,Agent可以在较短时间内通过程序性记忆和语义记忆的积累获得。
但这也带来一个治理层面的问题:Agent积累的知识如何管理?如果Agent的核心成员离职,它积累的程序性记忆是否可以转移?如果企业的业务流程发生变化,旧的程序性记忆如何更新?
这些问题目前谷歌还没有给出完整的答案。但从架构设计上看,记忆系统是企业级Agent从“能用”走向“好用”必须跨越的技术门槛。
五、技术底座:Agent Platform的架构逻辑
Gemini办公Agent运行在Gemini Enterprise Agent Platform之上,这个平台的技术架构决定了Agent的能力边界和治理水平。
5.1 四层开发体系
平台提供四个递进的开发层级,从低代码到全代码覆盖不同技术能力的团队。
Agent Studio是最低门槛的入口,提供可视化界面来设计Agent的推理循环和工作流。业务团队可以在不写代码的情况下构建Agent。
Managed Agents API面向技术团队,提供配置驱动的REST API。开发者定义Agent的行为、技能和工具,Google Cloud负责运行环境的管理。每个Agent在自己的沙盒中运行,预置了技能、MCP服务器和工具。
Antigravity 2.0和Agent Development Kit面向需要深度定制的开发者,提供代码优先的开发体验。
所有层级共享同一个A2A协议和运行时环境,意味着在最底层构建的Agent可以被上层调用为子Agent,架构可以无缝扩展。
5.2 企业级治理能力
平台内置了Agent Identity、Agent Gateway和Model Armor等安全组件。Agent Identity为每个Agent分配唯一的加密身份,建立完整的审计轨迹。Agent Gateway统一管理Agent舰队,执行运行时策略并防范安全威胁。
Thales的AI Security Fabric已经与Gemini Enterprise集成,提供用户、Agent、模型和工具之间交互的实时安全防护与治理,覆盖数据访问控制、不当行为拦截和合规支持。
这些治理能力对于金融、医疗等强监管行业的企业客户来说,往往比功能本身更能决定采购决策。
六、竞争格局:三足鼎立还是双雄争霸?
2026年的AI办公Agent市场已经形成了清晰的竞争格局。谷歌、微软和OpenAI各自沿着不同的路径推进。
6.1 三条路线的差异
微软Copilot的根基在Microsoft Graph——邮件、Teams、SharePoint、OneDrive和日历构成的数据层。如果你的企业80%的数据在Microsoft 365中,Copilot的表现通常会优于其他工具,因为它的数据接地(grounding)天然更强。
Gemini办公Agent的根基在Google Workspace和Google Cloud。它在Docs、Sheets和Gmail中的表现最自然,长上下文处理能力是它的技术优势。
OpenAI的dots agents走的是另一条路——更偏向独立的Agent能力,依赖API连接而非原生集成。这种方式灵活性更高,但企业部署时的集成成本也更大。
从企业采购的角度看,选择哪个Agent很大程度上取决于“你的数据在哪里”。这不是技术优劣的问题,而是生态适配的问题。
6.2 横向对比:三大办公Agent能力矩阵
| 对比维度 | Gemini办公Agent | Microsoft 365 Copilot | OpenAI dots agents |
|---|---|---|---|
| 底层模型支持 | Gemini + Claude双模型,未来扩展 | 主要依赖OpenAI模型 | OpenAI自有模型 |
| 持久化运行 | 支持,可运行数天 | 有限支持 | 支持常驻运行 |
| 独立企业身份 | 有,含邮箱/日历/通讯录 | 无独立身份 | 无独立身份 |
| 记忆类型 | 四种(会话/语义/程序/情景) | 基于Graph的上下文记忆 | 会话级记忆 |
| 原生集成生态 | Workspace + Cloud + M365 + Slack | Microsoft 365 + Teams | API连接为主 |
| 行业专业化版本 | 金融/法律/政府/医疗/零售 | 金融/医疗等 | 未明确 |
| 模型路由能力 | Smart Routing自动选择 | 单一模型 | 单一模型 |
| 企业治理组件 | Agent Identity/Gateway/Model Armor | Purview合规体系 | 企业级API管控 |
| 开放模型策略 | 支持第三方和开源模型 | 有限 | 有限 |
这张表格揭示了一个有趣的格局:三家产品在“基础能力”上的差距正在缩小,但在“治理深度”和“生态开放性”上的差异在拉大。Gemini办公Agent在模型开放性和身份系统上的设计更激进,而Copilot在合规体系上的积累更深。
七、战略逻辑:谷歌在布一局什么棋
7.1 从工具到入口:抢占企业AI的“第一接触点”
Gemini办公Agent的战略意义不在于它是一个更好的AI工具,而在于它试图成为企业AI的“第一接触点”。
在传统软件时代,操作系统的价值在于它是用户接触所有应用的入口。在企业AI时代,谁成为员工日常工作中第一个想到的AI入口,谁就掌握了分发权。
谷歌云CEO Thomas Kurian在发布中强调的核心叙事是“单一入口”——不需要在多个Agent之间切换,一个Agent处理所有类型的工作任务。这个定位如果成立,Gemini办公Agent就不再是一个“工具”,而是一个“平台”。
7.2 为什么“开放模型”是更聪明的商业决策
从商业角度看,支持Claude模型的选择可能看起来是在让渡价值——用户用Gemini办公Agent调用Claude,谷歌得到什么?
答案在于:Agent层的价值不在模型调用本身,而在于编排、记忆、身份和治理。即使底层用的是Claude模型,任务规划、工具选择、记忆管理、权限控制这些核心能力仍然由谷歌的平台提供。谷歌赚的是“平台层”的价值,而不是“模型层”的差价。
更重要的是,企业客户选择Agent平台时的决策逻辑与选择模型不同。模型选择可以随时切换——今天用Gemini,明天用Claude。但Agent平台一旦部署,迁移成本极高——记忆数据、工作流配置、权限体系、审计记录都绑定在平台上。所以“开放模型”实际上降低了企业采用Agent平台的心理门槛,而Agent平台本身则形成了更强的锁定效应。
八、企业落地的真实挑战:三个需要正视的问题
功能列表再漂亮,企业落地时面对的是一系列现实约束。
8.1 信任鸿沟:员工愿意把多少工作交给AI?
FDM CCS Insight的调研数据显示了一个值得关注的矛盾:88%的生成式AI用户报告任务完成速度更快,但超过三分之二的员工表示,他们目前只会让Agent准备材料供审核、推荐操作方案,或者要求Agent在每一步操作前获得批准。
这意味着,即使技术能力已经支持Agent自主完成任务,员工在心理上还没有准备好完全放手。Agent的“自主程度”在实际部署中需要是一个可调节的梯度,而不是一个“全有或全无”的选项。
8.2 成本透明度:Token消耗的经济学
Agent自主运行数小时甚至数天,产生的token消耗远高于传统的对话式AI使用模式。如果一个Agent连续运行三天来完成一份研究报告,它的token消耗可能相当于数千次对话查询。
谷歌为企业提供了项目级别的支出阈值配置,Agent在达到限制后会自动暂停操作。但企业需要建立新的成本管理思维——从“按人头订阅”转向“按工作负载计费”。这对习惯了SaaS订阅模式的企业IT部门来说是一个不小的转变。
8.3 从“个人效率工具”到“组织基础设施”的跨越
大多数企业引入AI的起点是个人效率提升——某个人用AI写邮件、做总结。但Agent的完整价值需要组织级别的部署才能释放。
这需要企业重新思考几个基础问题:Agent的权限边界如何定义?Agent执行的操作如何纳入现有的合规审计体系?Agent积累的组织知识归属于谁?Agent与人类员工的协作流程如何设计?
这些不是技术问题,而是组织设计问题。技术能力已经跑在了组织准备度的前面。
九、独立判断:办公Agent赛道的三个关键变量
基于对Gemini办公Agent的深入分析,我认为未来12个月内,这个赛道的竞争将围绕三个变量展开。
变量一:记忆系统的实际有效性。 四种记忆的设计理念很好,但实际使用中,Agent能否准确区分“应该记住的”和“应该忘记的”?语义记忆的积累速度和准确度如何?这些需要真实用户数据来验证。
变量二:身份系统的治理成熟度。 “同事Agent”有独立身份、权限和审计记录,这在理念上解决了Agent治理的核心问题。但在实际操作中,企业如何管理几十个甚至上百个Agent的身份和权限?是否需要一个新的“Agent管理平台”来管理这些Agent?
变量三:跨生态集成的深度。 当前支持M365和Slack是“能用”级别,但深度集成(比如在Teams中像原生Agent一样响应)需要更紧密的合作伙伴关系。谷歌和微软在这方面的合作空间有限,可能成为Gemini办公Agent在企业混合办公环境中的一个结构性限制。
十、FAQ:关于Gemini办公Agent的高频问题
Q1:Gemini办公Agent现在能用了吗?
目前处于私密预览阶段。谷歌表示将很快面向符合条件的Workspace客户广泛开放,支持部分Business和Enterprise套餐。具体的定价和全面可用日期尚未公布。
Q2:它真的会调用Claude吗?还是只是宣传噱头?
是真实功能。Agent的Smart Routing机制会根据任务性质自动在Gemini和Claude之间选择,用户也可以手动指定。谷歌表示未来还计划支持更多第三方和开源模型。
Q3:Agent的独立邮箱和日历会不会造成管理混乱?
谷歌的设计是每个“同事Agent”拥有独立身份和有限的权限范围——只限于团队选择向它开放的信息,不会继承整个组织的访问权限。Agent的操作会留下独立审计记录,方便管理追踪。
Q4:如果Agent执行了错误的操作,谁来负责?
这是一个行业性的治理问题。目前的技术方案是通过Agent Identity和Agent Gateway提供完整的操作审计轨迹,高风险操作可以配置人工审批节点。但责任归属的法律框架仍在演进中。
Q5:企业数据会被用来训练谷歌的模型吗?
谷歌明确表示不会用企业数据训练模型。Agent运行在隔离的沙盒环境中,数据加密和访问控制是平台的基础能力。
Q6:它和直接使用Gemini有什么区别?
最大的区别在于“自主性”和“持续性”。Gemini是一个对话式AI,你问它答;Gemini办公Agent是一个执行型AI,你给目标它完成。前者需要你全程参与,后者可以在你离开后继续工作。
Q7:中小企业适合使用吗?
从能力设计上看没有规模限制,但成本模型需要评估。Agent的按工作负载计费模式对大企业更友好,中小企业可能需要从具体的、高价值的使用场景开始试点。
Q8:它支持中文吗?
Gemini系列模型对中文的支持是完善的,Agent的交互界面预计也会支持多语言。但具体的本地化程度和中文工作流适配情况需要等正式发布后验证。
Q9:如果同时用Microsoft 365和Google Workspace,Agent能跨两个生态工作吗?
可以。Gemini办公Agent支持连接Microsoft 365服务,能够在Slack和Teams中运行。但深度集成程度可能不如各自生态的原生Agent。
Q10:Agent运行过程中我能看到它在做什么吗?
可以。在“任务收件箱”中,用户可以查看Agent的推理过程、分派的子任务、调用的技能和代码执行情况,以及整体任务进度。这个透明度对于建立用户信任很重要。

