文章摘要
本文梳理了2022年ChatGPT上线后近四年间人工智能的进化历程:AI应用形态从依托聊天框的内容生成,逐步迭代为可独立承接完整任务的AI Agent,发展出工具调用、长任务管理、多Agent分工等能力;底层开发工具链也同步优化,甚至可由AI参与改造,目前已形成配套的Agent运行体系,明确人类负责目标设定、权限把控与结果验收。

从ChatGPT在2022年11月30日正式上线,到2026年9月的不到四年时间里,人工智能的应用形态已经经历了数次颠覆性的进化。我们最初只能通过聊天框与AI交互,生成内容后再手动整理到实际工作场景中;如今,AI已经能够独立承接完整任务,甚至参与改造支撑自身运行的底层工具链。

AI应用形态的演进脉络

初始阶段:从问答到提示词工程

ChatGPT推出初期,人们的AI协作模式围绕单一聊天窗口展开:提出问题、补充背景、反复追问,再将生成的回答复制到真正的工作场景中。写文章需要手动整理素材,写代码需要自行运行调试,提示词工程成为最容易上手的技巧,人们开始研究如何为AI设定角色、提供示例、限定输出格式,让生成的内容更准确。此时AI负责生成内容,人类则负责完成后续的落地工作。

2023-2024:连接外部世界的初步尝试

2023年,开发者开始为AI模型接入外部资料和工具。相关框架将模型调用、知识检索和程序执行串联起来,检索增强生成技术让AI可以参考外部知识库回答问题,工具调用能力则让AI能够借助软件完成实际操作。早期项目让AI能够自主生成任务、调用工具并根据结果调整下一步动作。

到2024年,如何组织这些操作流程成为更实际的需求。可视化工作流工具将查询、提取、生成和系统更新步骤串联起来,为循环执行、状态保存和人工介入提供了更精细的控制方案。此时的协作模式开始结合预设流程与AI自主判断:固定步骤由程序执行,需要理解和选择的环节交给AI处理,关键节点再由人类确认。

同年,AI与软件的连接方式进一步扩展。Anthropic开放了电脑操作能力测试,让模型可以通过截图、鼠标和键盘操作图形界面;随后发布的统一协议,为AI应用连接外部工具和数据提供了标准。浏览器Agent、桌面助手和工具生态的早期雏形,都源自这一阶段的探索。

2025:把完整任务交给AI Agent

进入2025年,模型能力和部署条件的变化让更多创新尝试成为可能。持续发展的开源与开放权重模型为开发者提供了自行部署和改造的选择,小型模型也让个人设备能够承担更多AI任务。配合量化技术和本地部署工具,AI开始成为可以下载、配置、替换和组合的个人计算能力,不再局限于云端服务。

软件开发领域的任务交接最为明显。编程工具将代码补全体验升级到读取仓库、跨文件修改、运行命令和执行测试的阶段,终端编程Agent的公开实现让开发者能够研究和调整模型、工具与本地执行环境的连接方式。人们对AI的需求也从“帮我写一个函数”,转变为“把这个功能做完,跑通测试,再提交修改”。

浏览器方向的探索也在同期推进。开源项目将模型与浏览器自动化连接,为开发者提供网页读取、点击、输入和多步操作能力;相关产品展示了直接接受用户委托、操作网页的体验,将浏览器操作、代码执行和文件处理整合成面向用户的完整任务。到下半年,助手工具直接集成到浏览器中,让用户正在浏览的页面同时成为AI理解任务的上下文和执行操作的现场,浏览器逐渐从“资料查询入口”转变为“人与AI共同工作的环境”。

2025下半年:长任务需要系统化运行机制

当AI开始承接长任务后,新的问题逐渐显现:如何跟踪模型读过的资料、试过的方法、当前的进度和下一步的需求?随着工具输出和历史记录不断积累,单纯增加提示词或延长对话已经无法解决这些问题。上下文工程成为更突出的工程议题,关注如何检索相关信息、压缩历史记录、保留工作状态,让AI在每一步执行中只获取真正需要的内容。

协作经验也开始从对话中沉淀下来,相关文档为项目背景、开发约束和测试命令提供固定入口,工具则将操作步骤、脚本和参考资料组织成可按需加载的能力包。一次成功任务中的有效方法,可以被保留下来供后续任务使用,也可以分享给其他兼容的AI Agent。

但信息组织只是长任务的一部分,环境初始化、中断接续、步骤检查都需要系统层面的支持。相关讨论通过初始化、分步执行、进度记录和验证机制维持工作连续性,工程关注点从“模型应该看到什么”进一步扩展到“整项工作如何持续运行”。同期出现的精简可扩展实现思路,将多模型接入、Agent执行循环和会话管理拆分为可复用组件,让模型之外的运行机制成为可以独立研究、改造和复用的软件。

2026年初:工具、技能与助手组成完整工作系统

2026年初,相关工具为技能提供了目录、排行、发现和安装入口,让经验分享逐渐形成类似软件分发的流程:开发者发布技能,使用者选择并安装到自己的AI Agent中,再根据项目需求调整。开源项目将自部署个人助手带入更广泛的视野,让人们可以通过熟悉的聊天软件为助手分配任务,连接资料、工具和日常事务。

桌面应用将多Agent并行任务、独立工作区和结果审查整合到同一个界面,开发者可以同时推进多项工作,分别检查修改、处理冲突和接收结果。内部产品实验则进一步展示了工程实践的价值,工程师将更多精力投入环境设计、架构约束、测试和反馈,让AI Agent的工作能够被引导、检查和修正。此前分散处理的上下文、工具、验证和纠错问题,开始被纳入同一套运行体系中考虑。

2026年春夏:AI开始操作电脑并自我验证

2026年3月,模型层面原生支持电脑操作能力,桌面应用也加入了电脑操作功能,最初面向macOS平台。AI可以观察屏幕、点击和输入,使用浏览器之外的桌面软件,处理那些没有合适API的应用,编程Agent的执行范围从代码文件和终端延伸到真实的软件界面。

这一变化直接影响了开发流程:修改代码后,AI可以启动应用、操作界面、观察效果,再根据发现的问题继续调整;一些只有实际点击、输入和页面切换才能暴露的问题,也能进入AI的检查范围。写代码、运行程序、操作界面、验证结果开始连成更完整的工作过程,AI交付的成果也多了一层实际使用的反馈。

围绕AI Agent的命令行工具也在扩展,将浏览器操作封装为CLI工具,让AI能够通过页面快照找到目标、点击、填表、截图和检查。不同的行动入口各有适用场景,AI能否完成工作越来越取决于它能否找到合适的工具并正确理解返回结果。

专业方法也被整理为可安装的技能,将需求澄清、测试驱动开发、故障诊断和架构改进带入AI工作流,提供设计评审、可访问性检查、视觉打磨和交互优化方面的指导。配合浏览器和电脑操作,一次开发任务可以从明确需求开始,依次实现功能、运行测试、检查界面,最后根据反馈修正。随着这些能力被反复使用,项目中逐渐形成面向AI Agent的工作约定,相关文件可以与代码一起提交、审查和更新,让团队积累的方法留在项目中。

2026下半年:多Agent分工与能力组合

到2026年中后期,长期运行和多Agent协作已经有了更具体的工具形态。相关工具将持久记忆、技能积累、定时任务和子Agent委派组合起来,管理多个编程Agent的终端会话,显示工作状态并协调任务交接。

相关助手产品强调拥有独立计算环境、能够持续工作的AI同事,围绕个人偏好、日常事务和长期目标展开,将工作延伸到多次对话之间:用户关闭应用后任务仍可继续推进,需要授权时再返回询问,资料、偏好和进度可以保留为下一次工作的起点。

模型本身也开始承担更精细的分工,专注分类、路由、评分等快速判断,直接返回程序可用的结构化结果;轻量化编码器模型则通过一次前向计算输出选择、评分和概率,支持多语言和本地部署。复杂任务可以交给通用模型,请求分流、工具选择等高频判断则有了轻量化的选择,本地AI的用途也从聊天和编程扩展到软件内部的决策环节。

相关运行框架将模型、工具、技能、沙箱和调度纳入同一套系统,复用成熟组件让开发者不必每次都从头搭建整个AI Agent。新系统与既有项目的联系落实为可检查的依赖和代码复用,成熟组件可以被重新组织,大幅降低开发成本。

底层工具链的进化

与AI Agent的能力扩展并行,底层开发工具链也在发生深刻变化:包管理器、编译器、构建工具和运行时通过原生实现提高性能、降低资源开销,这些改进也成为自动化开发的重要基础。

2024-2025:让开发工具跑得更快

2024年,相关工具用Rust实现Python包安装与依赖解析,随后扩展到项目、环境和工具管理,为需要频繁准备执行环境的AI Agent减少了环境搭建步骤,更适合将一次任务所需的依赖与操作封装起来。

2025年,微软公布TypeScript原生迁移计划,将编译器和语言服务移植到Go,大型项目加载更快,错误反馈更及时,AI修改代码后可以更快得知改动是否破坏类型约束。编译器的性能开始直接影响“修改-检查-修正”的工作循环速度。

2026上半年:工具主动向AI Agent提供反馈

2026年3月,相关构建工具整合到Rust实现的工具链中,除了构建提速,还加入了与AI Agent直接相关的功能:将浏览器控制台日志和错误转发到开发服务器终端,并在检测到编程AI时自动启用。过去留在浏览器中的运行时错误,开始进入AI能够读取的命令输出,工具既负责执行,也开始提供下一步修复所需的证据。

这一变化与浏览器操作、终端工具和桌面应用的功能恰好衔接。AI可以通过浏览器或电脑操作发现界面问题,通过终端读取运行错误,再用类型检查和测试验证修改。构建、诊断和测试速度越快,AI就越有条件在交付前多做几轮检查,改变了完成可靠修改所需的等待与操作成本。

2026年夏季:AI参与改造底层工具

相关工具的迁移过程成为典型案例,团队先制定迁移规则和生命周期映射,小范围试跑后再扩大规模;实现、审查和修复由不同上下文中的AI Agent分别承担,通过多个独立工作区并行推进,再用编译错误和既有测试持续反馈。人类负责检查过程、识别反复出现的问题并调整生成代码的工作流,将工程流程落实为可持续运行的方案。

测试通过后的优化工作仍在继续,正式采用新实现的版本记录了持续的模糊测试、内存检查和兼容性验证。这个案例展示了大规模并行可以加快迁移,但兼容性和稳定性仍需通过实际验证逐步建立。

2026下半年:从单工具提速到统一仓库工作方式

相关包管理器以Rust重写实现,尽量延续已有命令、配置和锁文件格式,开始处理AI Agent执行环境中的具体问题,减少因权限和文件系统边界造成的重复复制。后续版本尝试在同一个工作区管理多语言依赖,并组织安装、构建与测试流程,让跨语言仓库拥有更统一的准备、执行与验证入口,让人类、AI Agent和CI系统可以沿用同一套工作规则。

综合来看,底层工具链的变化包括核心计算转向更高效的实现、环境和依赖管理更加统一、错误反馈更容易被程序读取、构建与测试更适合反复执行。这些改进为AI Agent铺路,让它更容易准备环境、调用能力、获得反馈并以更低开销重复验证。模型决定能提出什么方案,工具链决定方案能多快落地,整体运行框架决定整个过程如何持续、受控地推进,开发基础设施与AI Agent的能力正在相互推动。

结语

短短四年间,我们与AI的协作模式已经完成了多次迭代:从最初学习如何向AI清晰提问,到如今需要搭建完整的运行体系来管理多Agent的协作任务。三类工程的关注范围不断扩大,我们交给AI的工作也从单一的内容生成,延伸到完整的任务执行和结果验证。

这些变化同时明确了人类的责任:确定任务目标、允许操作的系统范围、需要人工介入的场景,以及如何证明工作确实完成。AI能生成代码,仍需要测试验证;能操作电脑,仍需要明确权限边界;能连续运行,仍需要留下可检查的过程。

Agent运行体系的核心框架

随着AI从回答问题走向执行任务,工程设计的范围也从单次提示,扩展到信息组织和整个执行过程:

  • 提示词工程:明确任务的目标、约束、示例和输出要求,帮助AI准确理解需求
  • 上下文工程:按需检索相关资料、压缩历史对话、保留任务状态,确保AI在执行过程中只获取必要的信息
  • Harness工程:建立持续、可控、可验证的执行机制,统筹工具调用、环境管理、状态跟踪、权限控制和失败恢复,在关键节点引入人工确认

三者相互配合,关注范围也有交叉。任务越长、涉及的系统越多,就越需要将信息组织、执行控制和结果验证一起纳入设计。

相关协议和工具分别补充了工具连接、经验复用和跨Agent协作能力:统一协议规范工具与数据的接入,减少重复适配;技能框架将操作方法、脚本和参考资料组织为可复用、按需加载的能力;跨Agent通信协议支持不同AI之间的通信、任务委派与状态交换。

在执行与评测层,相关项目提供桌面操作工具、本地或云端沙箱,以及操作轨迹记录和任务评测能力,让AI获得实际工作的环境,执行过程可以追溯,任务结果可以依据预先定义的成功条件进行检查。

模型提供理解与判断,工具完成实际操作,运行体系管理状态、约束执行并支持纠错,人类负责目标、授权和验收标准。AI Agent能否可靠地完成任务,既取决于模型能力,也取决于整套系统如何组织执行、验证结果。

开源社区也在持续深挖本地部署的性能空间,相关项目围绕主流模型优化原生推理,结合量化、专家权重缓存和按需加载,扩大个人电脑和工作站能够运行的模型范围;另一些项目则为特定硬件构建原生推理实现,通过流式加载、计算复用等方式,在内存占用、生成速度与质量之间提供更灵活的取舍,将本地部署扩展到音视频创作。模型持续进步,社区则继续打磨推理引擎、内存管理和硬件适配,让更多能力在个人设备上真正落地。

以上内容不代表本平台立场,仅供读者参考