文章摘要
字节近期推出飞书加持的全流程办公智能体产品“豆包工作”,这是面向生产力场景的办公Agent,整合了C端交互生成优势与B端协作能力,可自主拆解完成多类全流程办公任务。经实测,其组织协作场景优势突出,符合企业安全合规要求,新用户可免费获得30天订阅权限。

据行业观察近期消息,近日相关企业正式推出了面向生产力场景的Agent产品与品牌“豆包工作”,该产品可围绕用户目标自主拆解任务、调用工具,并持续推进复杂工作流程。

当前用户可通过豆包工作官网下载该产品,也可在最新版豆包电脑客户端直接切换使用,完成登录或升级后,即可免费获得30天订阅权限,能够覆盖日常办公的基本使用需求。

当前AI办公赛道竞争激烈,从通用大模型产品到各类垂直Agent工具,都在争夺“助力职场办公”的市场。而此次该产品的推出思路颇具特色,它将C端产品积累的自然交互能力与多模态生成优势,和B端协作工具的组织协作、文档沉淀及权限体系深度整合,打造出了可完成文档撰写、PPT制作、图文视频生成、网页搭建、电脑操作、群聊与项目信息解读的全流程办公Agent。

为了验证这款产品的实际能力,测试团队围绕“个人办公提效”和“组织协作”两大核心场景,对豆包工作电脑版进行了为期48小时的深度实测。经过48小时的深度体验,测试团队得出结论:豆包工作堪称可承接端到端任务的数字员工,尤其是在组织协作场景中,依托企业级协作工具的上下文能力,它展现出了通用Agent难以比拟的优势。

一站式完成报告撰写、网页搭建、项目对齐等办公任务,仅需一句话指令即可实现。

一、个人办公全场景提效:从文档到网页一站式完成

第一组测试围绕最贴近真实职场的办公流程展开:先对AI办公行业展开深度研究,覆盖2026年最新行业动态,再将研究成果整理为正式文档,最终生成可直接用于汇报的PPT演示材料。

在行业研究环节,豆包工作调用内置的行业研究技能模块,自主搭建了完整的研究框架,涵盖行业规模测算、产业链利润分布、全球及国内竞争格局、技术发展动向、政策环境分析以及未来趋势研判等多个维度。

最终,豆包工作生成了一篇约2.5万字的协作文档,引用了47条可溯源的参考资料,报告结构完整、逻辑清晰,搭配大量第三方数据与佐证材料,具备较高的参考价值。

在PPT制作环节,豆包工作的完成度同样出色,它会根据文档内容自动匹配适配的演示风格,逐页生成14页幻灯片,每一页都包含明确的标题、原生数据表格、来源标注以及演讲者备注内容。

无论是撰写行业研究文档还是制作PPT,豆包工作都不会一次性直接生成成品,而是会自动进行校验,排查文字溢出、格式乱码等问题,最终交付几乎零错误的版本,测试人员仅需对细节进行小幅调整即可完成交付。

此外,测试团队还体验了豆包工作的实时协作编辑能力。该产品提供侧边工作台,任务执行过程与最终产物可在同一界面实时展示,用户可以随时提出调整需求,也可以直接框选产物的任意局部,下达针对性的修改指令。

这种交互体验与Vibe Coding理念相似,用户无需从头完整描述需求,只需对着已生成的成品边查看边调整,实时预览修改效果,直到达到满意的状态。

测试团队在之前生成的行业研究PPT上继续测试,比如选中其中一部分内容,要求豆包工作将该部分信息转换为流程图。随后豆包工作自动执行编辑操作,确认无误后更新文件,并将修改后的结果实时展示在右侧的文档界面中。

在编程类任务中,豆包工作可统筹调用多种不同模型,直接生成图文并茂的网页等数字化成果。测试团队要求豆包工作搭建一个大理旅游规划网站,该产品首先根据需求调用模型生成Banner、场景插图、美食特写等图像素材,同时输出结构化的文案内容,最终组装为兼具美观与实用性的HTML网页。

进一步测试中,测试团队要求豆包工作调用视频模型生成动态背景视频,并嵌入网页首屏。整个开发过程耗时约5分钟,测试团队无需处理任何细节,即可快速获得兼具功能性与审美性的成品网页。

二、深度打通协作生态:读懂企业全量工作上下文

此前的测试更多聚焦个人办公提效,但职场中绝大多数任务并非单人独立完成:项目信息分散在群聊与文档中,进度需要跨团队同步,决策依赖历史协作记录,最终成果需要在组织内共享流转,通用Agent在这类场景中往往难以发挥作用。

豆包工作与主流协作工具生态的深度打通,正是为了解决这类痛点。用户使用协作工具账号登录后,豆包工作可在权限范围内完整继承企业知识与工作上下文,群聊记录、协作文档、会议纪要、日程安排等平台内天然沉淀的数据,都可作为其执行任务的输入依据。

测试团队以某展会报道项目为样本场景展开实测,当豆包工作收到“统计当前群内项目推进进度”的指令时,它可通过企业知识检索引擎进行语义解析,自动判定这是一项跨来源的复盘类任务;若未直接检索到相关信息,它将自动切换至即时通讯工具链,通过群名模糊搜索定位目标群聊,拉取消息流并从中识别出项目计划文档与选题排期表的链接。

随后,豆包工作通过文档读取接口将项目计划文档转换为结构化内容,同时对多维表格依次完成URL解析、数据表枚举、全量记录拉取,获取了每篇报道的实际进度与状态字段。

获取相关数据后,测试团队顺势要求其“将统计结果整理为项目周报并保存至协作文档”,豆包工作直接复用此前获取的结构化数据,进入文档创建流程,按照“整体概览、进度明细、负责人负载、风险建议”的标准结构生成正文内容,保存完成后返回了可分享的文档链接。

周报中显示前方记者的稿件进度为零,测试团队要求豆包工作提醒相关负责人跟进进度,它基于此前检索到的截稿时间、文章内容与负责人信息,自动@对应负责人并附上具体事项,这条催办消息完全依托上下文生成,具备明确的针对性。

豆包工作的可复用性依托其Skill机制,企业搜索、协作文档读写、多维表格查询、即时通讯操作等能力均被封装为标准化Skill,每个Skill包含触发规则、执行流程等完整信息。企业还可上传自定义Skill,将成熟的工作经验转化为组织共享的资产,比如测试团队就将“选题排期统计”这一高频流程沉淀为专属Skill,方便团队成员即插即用。

当Agent进入企业内部系统时,安全是核心底线。豆包工作搭建了严格的安全防护体系,覆盖设备接入管控、权限设置、额度管控、数据加密与操作审计等多个环节,其核心设计是严格继承平台既有的权限体系:用户仅可在本人权限范围内读取数据与使用工具。

在操作层面,设备接入管控可确保仅授权设备可执行Agent任务;额度管控可防止资源滥用;数据加密保障数据传输与存储的安全性;操作审计则可让每一次Agent调用与修改操作都可追溯。依托上述设计,豆包工作满足了企业级合规要求,成为国内首批通过办公智能体能力与云端基准测试双项认证的办公智能体。

三、赋予Agent实体操作能力:本地与远程办公全覆盖

要成为一款合格的办公Agent,豆包工作还需具备出色的Computer Use能力,能够像人类一样识别屏幕内容、操控鼠标、点击按钮、输入文字,直接操作浏览器与本地电脑。目前,豆包工作主要通过视觉GUI交互与CLI命令行两种方式实现该能力,覆盖三种使用形态:本地电脑操作、云电脑虚拟桌面以及手机远程操控电脑。

在实际职场场景中,适合通过Computer Use能力提效的场景十分广泛,典型场景可分为四类:一是报销、表单录入等流程固定、重复度高的重复性操作;二是无API接口的老旧后台系统,可通过视觉交互充当通用操作接口;三是盯盘、批量处理等耗时较长的任务,可交由云电脑持续运行;四是通勤等外出场景,可通过手机下发指令,远程操控电脑完成任务。

例如,日常工作中测试团队经常需要裁剪会场照片,保留屏幕上的PPT内容,裁掉周围无关的人员与杂乱背景。手动逐张框选、裁剪数十张照片,既耗费精力又浪费时间。测试团队将照片放入指定文件夹,并向豆包工作说明基本的裁剪要求。执行过程中,豆包工作会针对每张图片重新识别屏幕内容,实现自适应裁剪,而非使用固定坐标进行硬裁剪。

虽然GUI方式的执行速度不算特别快,但优势在于无需人工干预,测试团队抽查了部分结果,发现PPT内容均得到完整保留。这种方式比固定脚本更灵活,即使原图拍摄角度存在偏差也不会出现裁剪错误。

针对繁重且耗时较长的任务,豆包工作可切换至云电脑模式,在独立虚拟桌面中运行任务,本地设备不受影响,即使本地设备关机,云端任务仍可持续执行。手机远程操控功能也十分实用,在通勤路上向豆包工作下发查找文件并解压的任务,到达公司时文件已处理完成。

如果说Computer Use能力为豆包工作装上了实体操作的双手,那么Skill机制、跨系统连接器与协作伙伴功能,则为其配备了专属工具与协作团队。测试团队此前已体验过豆包工作的各类Skill,而连接器功能可打通协作工具、办公软件、第三方平台等各类系统,让AI可更轻松地跨系统执行任务,获取不同生态的数据与能力。

协作伙伴功能支持多个专业Agent组队协作,例如可通过调研员Agent、分析师Agent与撰稿人Agent分工配合,共同完成一份行业研究报告。例如,通过企业微信连接器,可实现跨生态的文件传输等协作工作。将上述各项能力组合后,可发挥更大的价值:一个可连接数据、加载技能、操控电脑、支持伙伴协作的Agent,已经能够成为可独立交付完整成果的数字员工。

四、结语:数字员工加速走进企业办公场景

随着AI办公赛道竞争加剧,判断一款生产力Agent是否成熟的标准也在悄然变化:能否理解上下文、调用工具、跨系统协作,并持续交付可落地的成果,已经成为比单次生成效果更重要的衡量指标。用这一标准衡量豆包工作,其表现已经相当完整。

当然,本次实测并未覆盖所有场景,豆包工作在复杂任务中的稳定性、企业大规模落地的适配性,仍需时间进一步验证。随着技能生态的持续丰富与企业上下文的不断沉淀,这款数字员工或许会比预期更快地走进企业办公现场。

以上内容不代表本平台立场,仅供读者参考