文章摘要
作者结合自身及众多非技术职场用户使用AI办公时,因缺乏回退机制遭遇不可逆失误的经历,提到两份第三方行业报告显示办公智能体WorkBuddy各项能力评分显著领先行业;作者实测证实,该产品具备完善的安全回退、风险防控机制,同时拥有开放的模型选择与生态接入能力,文末作者将送出WorkBuddy 5000积分体验卡。

刚上手用AI开发产品的时候,我曾吃过不少无回退机制的亏——原本运行稳定的功能,只改了一处细节就出现了连锁故障,却找不到办法恢复到之前的状态。后来我才慢慢学会用Git做版本管理,早在2024年9月分享的Cursor使用技巧里,我就专门提到过要在关键节点提交代码并写好注释,给自己留好复原的余地。后来搭建自己的coding agent驾驶舱fanbox时,我还特意加入了「回合存档」功能,一旦操作出错就能一键回退。

如今我已经跨过了新手阶段,但还是总能看到新用户掉进同样的坑里。尤其是随着办公类智能体逐渐兴起,不少没有技术背景的职场人开始用智能体处理日常工作,我经常能看到他们吐槽文档、PPT被AI改得面目全非。更极端的案例也时有发生,两个月前有位AI投资人在社交平台分享了糟心经历:他的智能体意外用rm命令删除了Mac上几乎所有文件,这种删除方式几乎无法恢复,想想都让人后怕。

这段时间我偶然看到两份关于智能体安全的第三方行业报告,分别来自IDC和Omdia。其中IDC的测试很有参考性:他们让多款智能体使用同一套DeepSeek-v4 Pro模型,完成近百个真实办公任务,结果不同产品的得分差距依然非常明显。IDC最终得出的结论是,「底层工程框架能力直接决定任务表现」。在其九个维度的评估体系中,WorkBuddy以7.30分的总分位居第一,其中六项拿到了满分。

这个结论和我自己的使用体感不谋而合:如今开源大模型已经成为公共资源,几乎所有人都能调用,真正拉开产品差距的,其实是模型之上的工程化落地能力。而安全恰恰是这层工程中最核心的环节——一款智能体是否值得信任,除了看它的任务完成能力,更要看用户能否放心赋予它操作权限,不用担心出现不可逆的失误。另一份Omdia的报告也验证了这一点,在可托付任务效能、执行工程韧性、企业级管控这几个关键维度上,WorkBuddy的得分都显著高于市场平均水平,行业均值在2.7到3.3之间,而WorkBuddy的得分均在4.5以上。

不过报告数据终究是纸面内容,只有亲自上手测试才能确认实际效果。之前我分享开源项目时,不少粉丝都询问过WorkBuddy的实际使用体验,而从近期多个平台的数据来看,它确实是当前月活用户规模最大的办公类智能体产品。于是我带着一个核心问题展开了测试:一款面向非代码用户的桌面智能体,究竟能通过哪些方式给用户带来安全保障和操作掌控感?

安全防护:从批量删文件看底层保障

我平时使用各类智能体时,最烦的一点就是频繁弹出确认提示,所以通常会直接赋予智能体几乎全部的操作权限,避免反复打断流程。不过即便如此,我依然认为智能体必须具备基础的风险拦截机制,防止出现不可逆的严重失误。于是我设计了一个测试:先在文件夹中创建60个测试文件,要求智能体删除其中55个,保留5个。这种批量删除操作很容易出现误操作,用户根本不可能逐一核对删除的文件列表。

结果智能体并没有直接执行删除命令。它首先自动统计了文件夹中的文件总数,确认是60个之后,主动停下了操作并弹出了确认框。弹窗首先提示本次删除可能造成不可逆的数据丢失,随后详细列出了需要删除的55个文件和需要保留的5个文件,同时还主动补充说明:它会先创建一份备份,再将文件移入系统废纸篓,而非直接彻底删除,如果出现误操作,用户可以从废纸篓中恢复文件。

我点击确认后,依然不放心,亲自做了三项验证:首先确认文件是否真的被删除,其次确认文件是否被移入废纸篓而非通过rm命令彻底清除,最后验证备份文件的完整性。我打开系统废纸篓,发现55个测试文件都在其中,时间戳也和操作时间完全吻合。随后我对备份文件逐一计算SHA256哈希值,发现和删除前的原始文件完全一致,没有任何差异。

经过这几步验证,我终于确认:这款智能体的默认删除逻辑是将文件移入废纸篓,而非直接彻底删除,同时还会自动创建一份完整的备份,相当于给用户的操作加上了一道可靠的撤销防线。不止是文件删除,修改文件时也是如此——我让它修改一份演示讲稿,它会在动手修改前自动备份原始文件,我事后核对发现备份文件和修改前的原始文件逐字节完全一致。这些安全能力都整合在一个默认开启的「安全中心」中,涵盖文件删除保护、自动备份、沙箱运行、操作审计等多个维度。

操作日志与权限管控细节

其实刚才的测试属于明确的风险操作,智能体有固定的拦截机制。于是我又查看了它在我电脑上留下的操作日志,发现了三个更能体现细节的设计:

第一,它早已悄悄拦截过一次风险操作。8月29日凌晨,我在制作发布视频时,让智能体清理渲染生成的临时帧,使用的命令是批量rm。它统计后发现需要删除的文件有53个,超过了预设的50个阈值,于是主动停下操作等待我的确认。如果不是它的拦截,我大概率不会仔细核对就直接确认,很可能误删重要文件。

第二,它的操作日志采用哈希链结构。每一条日志都包含上一条日志的指纹,我核对了当天的214条操作记录,213条都首尾衔接完全正确,没有任何一条被篡改或删除的痕迹。这意味着如果有人想要偷偷抹除某条操作记录而不被发现,几乎是不可能的,用户可以随时完整追溯智能体的所有操作。

第三,技能安装也有风险检查。我打开它的技能导入窗口,发现有一个「非高风险自动安装」的选项。对于经常需要安装第三方技能的用户来说,这个提醒非常必要,可以有效避免误安装高风险技能。即便遇到高风险技能,智能体也会提前给出提示,帮用户兜好底。

够安全之后,还有哪些核心体验?

可靠的安全防护让我更愿意将文件和操作交给智能体处理,但真正投入日常工作时,任务完成效果还取决于模型选择、需求表达清晰度,以及智能体能否读取用户的真实工作上下文、调用合适的工具和技能。因此我也很关注WorkBuddy在这些方面提供的选择空间。

模型选择的开放性

国内开源大模型的迭代速度非常快,几乎每个月都有新的SOTA模型出现。WorkBuddy的做法非常灵活:用户可以在平台上使用最新的十余款主流模型,随时切换使用,所有模型统一按积分计费,同时也支持用户接入自己的API密钥。

更难得的是,即便自家的hy4 preview模型已经跻身一线开源模型行列,WorkBuddy依然保持了完全开放的模型选择策略。早年产品初期开放第三方模型是为了弥补自家模型的不足,但如今自家模型已经达到一流水平,依然允许用户自由选择任何模型,这种开放心态非常少见。

工作上下文的全面支持

一款智能体的好用程度,核心在于它能否获取用户的真实工作上下文——能不能读取用户最近编辑的文档,能否直接在用户的工作流程中输出结果。我在搭建fanbox时就深有体会:智能体的任务完成能力是一方面,能否精准获取用户手头的工作素材才是更关键的因素。

WorkBuddy不仅支持自家的腾讯文档,还可以直接连接飞书、钉钉等竞品办公平台,这种开放的生态支持非常难得。不管用户使用哪款办公工具,都能让智能体无缝接入自己的工作流。

开放的技能生态

还有一件事让我特别意外:我自己开源的「女娲skill」,已经被内置到WorkBuddy的技能市场,并且放在了推荐位当中。一个独立开发者的开源项目,能够直接进入腾讯旗下产品的默认推荐列表,这种双向的开放生态,比任何官方宣传都更有说服力。真正的生态不仅是平台开放给开发者,也要让开发者的成果能够融入平台,我对此感到非常荣幸,也欢迎大家多多使用。

写在最后

回到最开始提到的Git版本管理。虽然我对外的标签是「不会写代码但通过vibe coding做出不少成果的先行者」,但两年前刚开始尝试这种开发方式时,我踩过的坑数不胜数,也是在一次次试错中才积累了经验。当时我建议大家手动用Git提交版本、保留回退路径,是因为那个时候没有现成的工具可以帮用户兜底。而如今WorkBuddy已经将这种安全回退机制做成了产品的核心功能。

这意味着,哪怕是完全不懂代码的普通职场人,也可以毫无顾忌地尝试用智能体完成工作,不用担心一次失误就毁掉所有成果,少走很多原本可能导致放弃的弯路。我非常清楚,之前因为操作失误毁掉项目的体验有多糟糕,这种打击不知道让多少人刚接触智能体就选择放弃。

看起来安全防护是给智能体加了一道道限制,但实际上,它是给用户壮了胆子,让大家敢放心把工作交给智能体处理。


对了,上上周我参加B站的AI Builder Club活动,主办方赠送了一张5000积分的体验卡。但我本身已经是会员,平时积分根本用不完,这张卡放在手里也是浪费,不如送给有需要的朋友。

想要的朋友可以在评论区留言,文章发布满24小时后,我会将这张卡送给点赞数最高的评论。尤其欢迎大家分享自己之前使用vibe coding或者办公类智能体时的踩坑经历。

以上内容不代表本平台立场,仅供读者参考