AI代理已成趋势,非程序员高效工作正当时

不少读者在看到上期专栏建议新手至少投入100美元获取充足AI额度时,都带着疑惑发问:免费的AI聊天工具已经够用,为何要花钱?
不过过去一个月里,其实没必要急着花高价买套餐——不少厂商掀起了促销热潮。国内相关协作工具上线后推出限时免费活动;海外方面,主流AI厂商推出新的工作类产品后,多次通过临时调整规则重置付费用户额度,原本低价的套餐就能享受到此前高档位的服务;不少模型厂商也提升了旗下协作工具的使用额度。如今这些短期促销大多已经结束,但厂商们的核心目标和上期专栏的建议其实一致:让更多非程序员群体能够上手使用AI Agent。
近期几乎所有主流模型厂商都推出了带有“Work”后缀的AI工具,背后的逻辑不难理解:编程Agent已经从行业趋势变成了现实——如今你使用的新软件或是功能更新,大概率都是由AI Agent开发完成的。我们都知道,编程Agent不仅能完成代码编写,还能覆盖大量白领日常工作场景。但让非程序员直接使用编程Agent,哪怕我们鼓励大家学习相关技能,多数人还是会觉得有门槛、不习惯。而“Work”类产品,正是厂商给出的解决方案。
率先推出这类产品的是Anthropic,今年1月其Claude Code团队发布了Cowork,本质上是给Claude Code优化了界面,试图隐藏那些看起来更偏向程序员的操作细节。各家厂商的思路大同小异,只是最终的产品体验质量参差不齐。
不过这个新品类目前面临不少困境。我近期关注了相关产品负责人的访谈,发现他们每次都会被问到两个重复的问题:这类协作工具和普通AI聊天有什么区别?和专业编程Agent又有什么不同?这说明不少用户确实存在认知困惑——熟悉编程Agent的用户会觉得,“Work”类产品能做的事编程Agent都能完成,更像是简化版的低阶工具;而从未接触过Agent的用户则会觉得它和普通聊天工具差别不大。更关键的是,这类产品并没有真正抹平使用门槛:当Agent运行卡壳时,用户仍需要介入协助,工具偶尔会弹出需要确认执行的代码命令,而这类操作对多数非技术背景的用户来说依然属于程序员的专属领域。正如我之前提到的,使用Agent的最大门槛从来不是对AI的理解,而是对电脑操作的熟悉程度,“Work”类产品并没有真正解决这个问题。
因此,尽管程序员群体几乎人手一个Agent,但“Work”类产品的普及度依然很低。尽管Anthropic的一份报告认为,理论上大部分白领的工作任务都可以由AI执行,“Work”类产品今天的普及度还很低。ChatGPT Work和Codex两个产品加在一起刚刚突破一千万周活,和ChatGPT本体还有量级差距;前阵子咨询机构发布了一份行业报告,国内某协作工具以每月约两千万次的“交互数量”位居前列,不拿大家都懂的活跃用户量出来说,反而要发明一个新指标,可见真实数字并不讨喜。
今年的专栏我很少讨论具体产品,因为不管是哪个Agent产品,质量有高有低,模型有好有坏,但思路几乎都完全一致,都是“Agent”,没有太大必要区分。说到底,不管用“Work”还是编程Agent,这些Agent和我日常用的AI聊天到底有什么区别?区别确实没有那么大,如今成熟的AI聊天产品往往也带一点Agent执行能力,这也要怪模型厂商们从来没有认真设计过旗下各个产品的定位——相关负责人也曾提到,快速发布牺牲了一致性和简洁性。但从今往后你大致可以这么理解,聊天大概率停留在口头上,Agent是替你把事情做完。
上期我举了Agent帮我修音箱的例子,就有读者留言问,为什么聊天不能做这个事情?聊天确实可以帮上忙,如果我用聊天,它需要教我如何动手诊断问题、根据我提供的信息给出猜测、给出可能的解决方案并教我如何执行,再把结果贴回来供它判断……Agent则可以自主诊断问题、尝试不同的修复方案、验证是否修好,最终帮我把音箱重新连上了网,几乎是全自动的。效率的差别,显而易见。现在我的Agent已经承担了相当一部分电脑维护相关的工作。
不谈专业工作,公司人最通用的工作无非是读报告、沟通、汇报、协调、进度确认、写文档、资料整理……在聊天中完成这些工作当然也可以,但今天大部分的Agent都有电脑客户端,能直接读写你电脑上的文件:要它改什么,不用先“上传”给它;改完的成果,也不用你复制粘贴回去。看起来只是省了几步,但放进一次次迭代里,你和AI协作的摩擦几乎降到了零。即使你的文档本来就存在云端,Agent对它们的操作也会比一般的聊天更充分。
当摩擦消失,Agent又可以单次运行更长的时间,你会发现AI在这些日常任务中能做的也比你想象得多。还是拿写方案举例子,在聊天中写方案,大家都掌握了各种prompt写作技巧,本质上是人在给AI喂上下文——你得自己把资料收集齐、需求列清楚,可能还得附上模板和过往方案。如果你给了Agent充分的权限,这些东西Agent都可以自己去找,只在不清楚时来问你。拿我常写的产品需求文档来说,我向Agent描述大致想做什么功能,达到什么目标,按我教它的工作方法,它会去找公司本季度的OKRs,判断是否匹配;再自动搜索相关的用户反馈、分析产品数据,判断优先级;它会阅读产品过往的文档和代码,保证新功能的设计和已有功能一致。遇到不清楚的,它直接问我。Agent也会不断质疑我的思路在逻辑上站不站得住,最后再把文档写进文档仓库,再把其他相关文档一并更新,确保处处一致。
这样一份文档从头到尾反映的完全是我的想法,它只是帮我做完了那些机械性工作。这样一来,我可以专注在功能本身的构思上,做那些AI难以做出的非共识决策。
更极致的例子是我的会议纪要。5月那期我写过我怎么“教”它,它到底做了什么呢?今天所有的会议录音产品都能一键生成纪要,但我需要写纪要的这个AI“懂”业务:一个团队周会,每周做的事是核对目标、讨论障碍、做决策、跟进每个人负责的事,会议记录就是要把这些信息、决策呈现出来:录音里的人名、术语、公司内的专有名词,它得认识;我们的目标是什么、完成情况如何、这次的决策和之前的是否一致,它得知道。靠着积累下来的“技能”,它跑一次一般要几十分钟,多的时候一次要花掉数十美元的Token,因为它要读的东西实在太多。现在,连周会的会前准备也是它做的:检查上周计划的完成情况、更新目标进度,必要时提醒团队成员来补充。
这些占据公司人时间最多的“为了工作的工作”,都可以考虑让Agent拿走。上进的人们常常抱怨:“一天全在开会‘对齐’,正事一点没干”,Agent可以兢兢业业地把这些拿走。就拿一款早期的Agent工具来说,可能大多数人已经忘了它了,但我依然让它每天帮我汇总所有我关心的新闻。还是一样,由于很多聊天产品也有一些Agent能力,所以中间没有一个清晰的界限,但调动的工具、上下文、算力、收费方式都有区别,量变形成了质变,最终感受的变化就是:到底是谁在干活?上期我写过,过去是我掌勺,AI打下手;现在,掌勺的变成了AI,我更像那个在旁边指指点点的老师傅。
当然,也有不少在我们看来很容易做的事情,今天的Agent反而做不了。比如,它擅长的仍是通过接口去操作电脑,所以很多人类做起来很方便的事情,由于它没有接口,就要麻烦得多;另一些则是人为障碍,比如无法操作微信——这和我们1月讨论相关手机端工具时的境遇类似。再重复一次,只要一件事能完全在电脑上完成,都值得交给Agent试试,上期我说过,先挑重复次数多、最花你的时间、相对简单,对你又最重要的事——其实,你可以把你的待办清单贴给Agent,让它自己挑事情。
尽可能让Agent代替自己的工作——今天已经是一个合适的时机。收益很明显,学习难度也不高。把能交的都交出去之后,剩下的是什么?我想,人类在工作中不可取代、应该保留的,无非是感受、判断和欲望——尤其是最后一点。今年Agent的发展让我觉得,这一天指日可待,但又迟迟未到。如果这一天真的到来,这个专栏也就可以停止了。
最后提醒一下,使用这些产品的时候都务必注重安全,这也是为什么今天还是需要一些计算机的基础知识才能用好这些产品。说来也是讽刺,早期某款流行Agent工具刚推出的时候大家都说不要装在自己的主力电脑上,但实际上,今天大家电脑上安装的这些Agent,并没有比那款工具安全太多。这其实也是最初像云端运行工具的原因,只是看起来历史再次证明,人们喜欢便利性远远大于安全性。


