文章摘要
作者针对节日微信祝福处理繁琐、个人微信因封闭性无开放接口难以自动化操作的问题,找到合规方案让GPT-6突破微信限制,一个下午完成50条专属祝福发送、70条收件祝福回复,所有内容经作者审核确认,该尝试既体现大模型能力进步,也为私人AI助理落地探索了方向。

中秋假期结束后,我在朋友圈分享了自己用AI处理节日社交的经历:给50位核心骨干送出了专属祝福,同时回复了70多条收到的节日问候,全程只用了一个下午。不少朋友留言询问细节,这让我意识到,这次尝试比年初那次给611位同事批量拜年更有代表性——毕竟微信作为日常社交的核心阵地,其封闭性一直是自动化操作的最大障碍。

年初那次借助飞书开放API完成的批量拜年,我们只用了4分钟就发送完611条消息,相关的分享也获得了不少关注。但换到微信,这套方案根本行不通,因为个人微信没有开放的消息发送接口,连读取聊天记录都做不到。时隔半年,我们终于找到了绕过壁垒的方法,让AI真正介入了我的微信操作流程。

这次的操作和年初完全不同:AI会在电脑上自主查找联系人、查看聊天记录、向我确认对方背景、写好专属祝福供我审核,只有在我确认发送后才会真正发出。靠着GPT-6的持续运行,我们用一个下午完成了所有的祝福发送和回复,累计处理了一百多条消息,全程没有中断出错。

有位同事收到祝福后回复:“感谢老板的认可,感动老板的文艺。”这句话让我很有感触:文案的文艺感或许来自AI的辅助,但这份来自同事的认可,却是完全属于我的。

节日微信的社交困境

相信很多人都有过类似的体验:每到中秋、春节这类节日,打开微信就会被几十上百条祝福消息刷屏,其中有同事、合作伙伴、老朋友,也有许久未联系的旧识。

别人认真发来的祝福,我们总不能置之不理,但一条条手动回复又根本忙不过来。随便回一句“同乐同乐”,自己都觉得敷衍;想要认真写一段走心的话,打到第十条就会耗尽耐心。

更尴尬的是反向的情况:心里惦记着一些人,想要在节日里送上专属问候,却因为消息太多、工作太忙而错过时机,等想起来的时候,节日已经过去了。

我的微信联系人有一万人,多年积累的工作、合作和私人关系都在这里。节日本是表达心意的好机会,结果却变成了还不完的人情债。这次中秋,我就是想让AI帮我还清这笔“人情债”。

微信操作的三重壁垒

和飞书、钉钉这类带有开放办公接口的工具不同,微信的封闭性是出了名的。想要让程序介入微信操作,至少要面对三道难以逾越的墙:

第一重是没有官方接口。企业微信和公众号都有开放API,但个人微信没有留给外部程序的办事窗口,想要通过代码批量发送消息,连正门都找不到。

第二重是本地聊天记录加密。即使你能在电脑上看到微信聊天窗口,保存在本地的聊天记录也是加密的,你自己都无法直接读取,更别说让程序调取了。

第三重是屏幕读取限制。这也是这次尝试中最意外的障碍:系统自带的截图工具无法捕获微信主窗口,截出来的画面一片空白,即使换用其他界面读取方式,也只能拿到几个窗口按钮,完全看不到聊天正文。

没有接口、读不了记录、看不到屏幕,外部程序想要触碰微信,基本被三条路彻底堵死了。

微信的边界选择

其实我能理解微信的封闭策略。作为覆盖十几亿人的社交网络,一旦对自动化工具开放权限,最先涌入的不会是真诚的节日祝福,而是营销号、群发机器人和诈骗脚本。这种封闭性,本质上是在保护用户和平台的生态。

但站在用户的角度,这种保护却带来了另一种困扰:我自己的社交关系、聊天记录和人脉资源,却只能靠手动操作来整理。节日里想要给重要的人写几句真心话,或是把收到的祝福认真回复,都要一个个搜索、点开、翻记录、打字,在AI已经能写代码、管日程的今天,我们在微信里做的还是十年前的手工活。

生态保护得越好,用户的手就越累。这不是谁对谁错的问题,而是一个真实存在的矛盾。这次我就是想看看,能不能在不破坏平台规则的前提下,让AI帮我分担这些繁琐的手工操作。

AI如何突破微信的限制

这次我们使用的是GPT-6,运行在Codex的Agent工作环境中,可以调用电脑操作工具和本地脚本,算是之前“三万”助理的一次升级尝试。

最先卡住的就是屏幕读取的壁垒。AI看不到界面,后续的所有操作都无从谈起。它试了好几种常规方法,都被微信的防护机制挡了回来。

最后它自己摸索出了一条巧妙的路径:调用微信自带的截图功能。微信只会防范外部工具的截图,不会限制自身的截图功能,AI通过调起微信自带的截图工具,像人一样框选区域、查看画面,再配合系统的窗口捕获逻辑,终于拿到了可读的界面内容。这套方法跑通后,我们把它存成了固定技能,后续可以直接复用。

这个过程最让我惊讶的是,它没有解密聊天记录、没有破解协议,也没有使用任何灰色接口,只是像普通人一样打开微信、截图、查看、点击,用最符合平台规则的方式完成了操作。而且全程使用我的个人账号,发送的内容也经过我的确认,和那些无差别群发的机器人完全不同。

看清画面只是第一步

即使拿到了界面画面,实际操作中依然有很多细节需要处理。比如搜索联系人时,结果里可能同时混有联系人、群聊和历史记录,有些人还会有多个微信账号,AI必须准确选中目标对象,打开聊天窗口后还要核对身份,不能仅凭名字相似就发送消息。

还有一个很容易出错的细节:截图时看到的搜索结果浮层,退出截图后就会自动收起,按照之前的坐标点击,很可能点到完全无关的内容。AI必须能识别界面状态的变化,重新发起搜索再继续操作。

发送消息的过程同样充满细节:把文字放进输入框后要核对内容,发送后要检查消息气泡和发送状态,完成一个联系人的操作后还要留下记录,避免中断恢复后出现重复发送的问题。

这些事情对人来说根本不用过脑子,但对AI来说,每一步都需要完整的逻辑闭环,稍有不慎就会出错。

给同事:一人一段,我点头才发

给同事发送祝福时,我们定下了一个核心原则:让每一个人收到的祝福都独一无二。

我给AI指定了一个包含公司中层和高管的工作群,它就按照名单逐一处理:找到目标联系人后,先向我询问对方的当前职责、过往经历和我对他的期待。我把这些细节讲清楚后,AI会帮我整理成完整的祝福文案,发给我审核确认,只有在我回复“发”之后,它才会真正发送消息。发送完成后还会自动核对状态、存档,再继续处理下一个联系人。

我的描述通常都很口语化:比如提到跟着我十几年的老部下,当年主动请缨去新城市建立研发中心,现在负责AI业务,我希望他能敢想敢拼,再焕发一次战斗力;还有从基础岗位成长起来的“大管家”,我最想感谢他的踏实勤勉;还有年轻同事,他们在幕后付出了很多心血,我也想在节日里表达认可。

有时我会中途补充细节:比如我们平时怎么称呼对方,或是纠正语音识别转错的人名。AI需要把这些零散的信息整理成通顺的祝福,区分哪些内容适合放在节日问候里,哪些需要省略。

真正的个性化从来不是换几个形容词,而是记住对方的专属故事和相处习惯。这些细节只有我自己清楚,所以需要我来提供真实的经历和判断,AI只负责组织语言、操作软件和保存记录。

整个过程中,我只需要回答AI的提问、审核文案、确认发送,不用坐在电脑前全程值守。一个下午就完成了五十条专属祝福的发送,要是靠我自己手动操作,可能需要好几天,还很容易被其他事情打断。这次节省下来的不只是时间,还有最耗精力的情绪和注意力。

收到的祝福:一条一条,都回了

给同事发送完祝福后,我又让AI处理了另一件事:回复我收到的70多条中秋祝福。这件事放在以前,我根本无力完成。

节日期间收到的祝福太多,很多都只能搁置,事后回想起来总是觉得过意不去——毕竟对方特意发来消息,我却连一句像样的回复都没有。这次AI逐一打开聊天窗口,先阅读对方发来的内容,再结合我们之前的聊天记录,针对每个人的情况写出专属回复。

给合作伙伴的回复里会带上我们正在推进的项目,给老朋友的回复语气会更随意,对方写了一大段真心话的,回复也不会只敷衍几个字。这些回复我完全放手让AI自主完成,它能准确识别对方的身份、聊天内容和我们的关系亲密度,把那些以前“回不过来、没法回”的祝福,都变成了针对性的回复。

放在以前,光是回复这些祝福就能耗掉大半天的精力,现在我只需要把这件事交给AI,不用守在电脑前等待。

AI写的祝福,有没有诚意

很多人都会有一个疑问:由AI帮忙写的祝福,到底有没有诚意?

如果只是让AI凭空生成五十条通用的中秋祝福,那写出来的肯定都是漂亮的套话,很难让人感动。但这次的情况完全不同:每个同事背后的故事都是我亲自讲述的,我记得他们的付出、了解他们的压力、对他们的未来有明确的期待,我逐条审核过所有文案,确认内容说到了心坎里才让AI发送。

至于文案最终是我亲手敲出来的,还是由AI组织语言,真的有那么重要吗?那位回复“感动老板的文艺”的同事,其实在祝福里我提到了他在关键时刻主动为公司扛起责任的经历,这正是我真心想要感谢他的地方。这条回复至少让我看到,他接收到了这份认可。

发送完所有祝福后,我在朋友圈记录了当时的感受:接近一半的同事回复说被打动了。我还特意补充说明,这些祝福不是我一个字一个字敲出来的,但确实是我一点一点讲述的心意。大家都表示理解,依然觉得很感动。

这其实回答了最直接的质疑:即使对方知道是AI帮忙写的,依然会被打动吗?至少这次的结果给出了肯定的答案。大家真正在意的,是自己的付出有没有被看见,是我的心意里有没有包含他们。

所以那条朋友圈最后我写了两句话:AI只是工具,和键盘没有区别。键盘帮我们把想法打出来,AI则帮我们整理思路、完成操作。一段话有没有意义,取决于我们到底想对这个人说什么。

很多人心里都有真实的感情,却因为忙碌或是不擅长表达,一直没能说出口。现在AI降低了表达的成本,让这些心意终于有机会送到对方手里。

大半年过去,模型到底进步在哪

拿年初的飞书拜年经历对比,就能清楚看到大模型的进步。年初那次,我们定下了一条铁律:所有批量操作必须通过脚本执行,不能让大模型自主完成,因为当时的模型经常会出现任务中断、忘记进度的问题,有时还会谎报完成状态。

那次的流程是,模型负责写文案和脚本,真正执行操作的是脚本程序,靠着飞书的开放API按顺序完成发送,模型更像是一个会写代码的秘书。但这次在微信场景下,因为没有开放接口,无法把所有操作甩给脚本,每一步都需要模型自主监控和执行。

我感受最深的进步有三点:

第一,也是进步最大的,是长程任务中的电脑操作能力。AI操作电脑本质上是一个完整的闭环:先截图获取画面,再识别画面中的文字、按钮和联系人,判断当前所处的界面和任务进度,规划下一步操作,最后执行点击或输入动作,再回到截图环节确认结果。业内把这个过程叫做Computer Use,也就是电脑操作能力。

能够把这个闭环连续运行数小时、完成数千次操作不出错,就是现在大家最看重的长程任务能力。半年前让AI操作电脑,通常两三步就会停下来,或是点错位置、忘记进度,所以我们才会定下脚本执行的铁律。但这次,AI处理了五十位同事和七十多条祝福,累计数千次操作没有出现一次错误。

中途我们还被打断过:我临时修改要求、电脑锁屏、暂停任务,重启后AI依然能准确恢复进度,记住哪些联系人已经审核、哪些已经发送、哪些还没处理。从“两三步就停”到“数千步不错”,这是半年来最直观的进步。

第二,能够在刻意设置的门槛中自主找到通路。微信防范系统截图,AI试了常规方法都失败后,自己想到调用微信自带的截图功能,绕过了外部工具的限制。年初在飞书场景下,AI也会调整策略,但那都是在规则清晰的接口范围内;而这次,它是在一个完全封闭、专门防范机器的环境里,摸索出了一条符合人类使用习惯的通路。

第三,对人类语言和上下文的理解能力大幅提升。年初处理25位骨干的背景时,我需要挨个整理好资料喂给AI,但这次我想到哪说到哪,中途还会补充昵称、纠正识别错误,AI都能结合上下文自动理解,不需要我反复重复信息。回复收到的祝福时,更是完全依靠AI自主读取上下文,判断对方身份、聊天内容和合适的语气。

用一句话总结变化:年初时模型只负责写脚本,脚本才是真正的执行者;这次模型直接上手操作,连续运行数小时,脚本反而成了它的辅助工具。

模型聪明只是一半

想要让AI真正融入日常工作,光有聪明的模型还不够,还要看Agent能不能长期稳定使用。

我在过程中反复给AI提要求:在我审核当前联系人时,提前准备下一个人的资料,不要干等;复用已经打开的聊天窗口,不要每次都重新搜索;把解决过的问题存成技能,不要每次都从头研究。

电脑操作和模型推理都会消耗资源,如果每次处理联系人都重新加载全部历史、反复截取相同的画面,再聪明的模型也会变慢变贵。所以我们的优化方向是:把常规的查找和去重交给本地程序,模型只负责理解新信息、做判断和组织语言,用过的方法直接复用,不需要重复处理。

原来需要我守在电脑前手动完成的工作,现在只需要我提供背景、做最终判断,剩下的都可以交给Agent处理。

比祝福更值得期待的长期价值

以前过完节日,发送完祝福就结束了,下次节日还要从头回忆每个人的情况。这次我特意要求AI把我讲述的所有背景信息都保存下来:称呼、职责、共同经历、我确认过的细节、本次沟通的状态,慢慢形成专属的本地联系人档案。

微信的聊天记录是加密的,我自己都无法直接读取,但我讲给AI的这些故事,都存在我自己的本地档案里。这就是我想要打造的微信助手的起点。

一万人的联系人列表,不需要一次性变成浩大的整理工程。每次和一个人沟通时,多了解一点、多记住一点,每用一次,下一次就会更省力。下一个节日,我想发的人不会再忘记;收到的祝福,也不会再被搁置。

以后准备去一个城市出差时,可以先找出有相关背景、适合约见的人;遇到业务问题时,可以快速找到有相关经验的合作伙伴;到了重要的日子,能根据已经确认的专属经历,写出真正合适的问候。

我越来越觉得,私人AI助理的价值,就是在这样的持续使用中慢慢积累出来的。它会慢慢了解我的工作习惯、表达风格,纠正过的称呼不用再重复提醒,讲过的故事下次沟通时可以直接调取。

年初的611条飞书祝福,让我看到AI助理可以完成一个标准化的批量项目;这次中秋的五十条祝福和七十条回复,让我看到AI已经开始走进我的日常:那些没有接口、专门防范机器的软件,那些零散繁琐的操作,那些只有我自己才知道的关系和故事。

平台的壁垒依然存在,但AI已经学会像人一样,从正门走进去。我讲出一个人的故事,AI帮我整理成合适的文字,经过我的确认后送到对方手里。那些我放在心里的人,终于有更多机会知道:我一直记着他们。

以上内容不代表本平台立场,仅供读者参考