文章摘要

9月中旬,行业内关于AI发展节奏的讨论引发广泛关注。Anthropic首席执行官公开呼吁放缓AI能力升级速度,指出递归自我改进(RSI)可能带来超出人类可控范围的风险,这一观点随即得到多家头部企业的响应。这场讨论让原本停留在技术层面的RSI概念,正式进入产业落地的务实议题中。

对于已经开始应用AI代理(Agent)的企业来说,最迫切的问题不再是基础模型的通用能力升级,而是如何让AI从自身业务场景中持续学习并迭代——工厂的验收标准、软件的操作流程、任务失败后的人工修正,这些一线业务经验本应成为AI优化的核心依据,但此前却很难直接转化为模型的能力提升。企业需要一套完整的流程,将这些零散的业务经验整理、评估为训练数据,通过持续训练迭代模型,再通过新一轮业务任务验证改进效果,打通AI能力与业务落地的最后一公里。

专业场景的AI适配实践

某智能电视服务商与相关团队的合作,是专业场景适配的典型案例。用户仅需语音指令想看某部剧集,AI代理需要完成从打开视频应用、定位搜索入口、输入片名、筛选结果,到跳过广告、处理弹窗直至成功播放的全流程操作。不同于通用模型可以识别屏幕按钮,这类场景需要精准掌握特定应用的页面交互逻辑,比如不同页面的焦点定位、按键路径选择,甚至需要适配应用界面的动态变化。

在该项目中,电视服务商提供真实的业务环境与任务数据,相关团队则负责训练动作执行模型,让AI代理逐步学会识别页面焦点、定位目标元素、规划正确的按键路径,并与需求理解、任务规划模块协同工作。经过后训练的40亿参数动作模型,在安卓电视测试环境中实现了99.6%的焦点识别准确率,整套跨页面搜播系统的成功率超过90%。

另一个典型案例来自电子工程领域。一家电子设计服务商面临的痛点是,人工绘制的元器件符号图需要转换为软件可解析的结构化描述,才能用于后续的工程编辑。通用模型虽然可以理解符号的大致形态,但很难精准匹配企业特定的输出格式、电气规则,比如箭头方向、引脚定义、比例尺寸等细节,哪怕是一个箭头方向错误,都会导致后续工程流程受阻。

相关团队针对该场景训练了专用转换模型,将企业的符号样本、输出规范与电气规则纳入后训练流程,再将生成的结构化描述还原为可视化图形进行逐项校验。阶段性验证数据显示,该模型的渲染重叠度(IoU)从最初的0.2提升至0.65,虽然细小组件和引脚位置仍有优化空间,但专业业务规则已经可以直接融入模型的学习过程,无需依赖工程师的人工检查。

构建业务经验到AI能力的闭环

以电视场景为例,当应用界面更新后,比如播放默认切换为全屏,原有的AI代理操作路径就会失效,需要重新适配新的交互逻辑。相关团队搭建的持续学习系统,会记录每一次任务的截图、按键操作、执行结果与规划路径,将成功案例、错误操作及修正后的流程整理为训练数据。经过筛选、标注与验证后,这些数据会被用于模型的新一轮训练,新版本模型再投入业务场景中验证效果,形成完整的迭代闭环。

这套被称为持续学习飞轮的机制,并非简单地将所有运行日志直接送入训练。一次任务失败后,需要先区分是焦点识别错误、目标定位偏差还是路径选择失误,将不同类型的问题对应到相应的训练环节,才能让失败经验真正转化为有效优化依据。即便是通用模型升级,也需要基于已有的业务数据重新验证适配性,确保新模型可以适应更新后的业务流程。

不同团队的技术路线各有侧重,比如Salesforce在今年7月提出的自我改进Agent方案,重点在于不改变模型权重的前提下优化提示词、工具与工作流;而相关团队则选择通过模型后训练,将业务反馈直接转化为模型自身的能力更新,两种路径都需要解决“如何验证改进有效性”的核心问题。

除了基于业务数据的模型迭代,相关团队还探索了更高效的资源分配方案。他们研发的独立模块可以让小模型通过后训练学会判断何时需要调用大模型,在实际推理过程中,请求首先由小模型处理,仅在需要更高精度能力时才交接给大模型。在五项数学推理测试中,该方案的平均准确率达到64.04%,比单独使用大模型提升了6.36个百分点,同时将推理成本降低了20.4%,实现了准确率与成本的平衡。

商业价值与落地模式

对于企业来说,是否值得投入持续学习的核心在于投入产出比。以工业质检场景为例,误判合格产品为缺陷会增加人工复检成本,而通过AI模型优化将误报率从23%降至8%,可以直接为企业节省大量的人力与时间成本。企业可以结合检测量、单次复检耗时与人力成本,清晰评估这类改善的价值,并与训练维护费用进行对比。

公开信息显示,在明确ROI的大型企业场景中,单客户的年度付费规模可达百万至千万元人民币级别,这证明持续学习已经拥有明确的商业需求,而非仅停留在技术讨论层面。相关团队提供了两种合作模式:客户可以使用自主维护训练流程与奖励机制的训练平台,按算力、存储等资源付费;也可以直接使用完整的持续学习服务,由团队负责奖励设计与更新维护,按包含训练资源与服务价值的用量单元计价。两种模式均支持持续迭代,区别仅在于服务边界的划分。

打造可复用的企业级服务平台

如果每接入一个新客户都需要重新组建算法团队投入开发,持续学习业务就会沦为人力密集型的项目生意。不同行业的业务场景差异巨大,电视交互与电子工程的验收标准完全不同,直接复用客户的模型规则无法保证适配效果。因此,相关团队的核心目标是复用将业务经验转化为AI能力的方法与工具,而非直接复用单个客户的模型。

首次进入一个新场景时,团队需要理解数据格式、任务目标与评价基准,再适配训练反馈;但其中通用的数据处理、奖励方法、训练节点与评估流程,可以沉淀为标准化产品模块,用于后续相似场景的接入。据介绍,在通用产品团队的支持下,仅两名负责需求适配的工程师,就可以支撑十余家企业客户的落地,这种分工模式将现场适配与通用产品建设分离,让通用产品可以服务多个项目,大幅降低了新客户的接入成本。

客户自身也会积累宝贵的业务经验,除了更新后的模型,任务轨迹、奖励定义、评价标准、训练配置与历史版本,都可以成为后续迭代的基础。相关团队强调,平台不会绑定特定的基础模型厂商,也不会直接包揽客户的应用场景,而是为不同模型与业务提供持续学习能力,让企业可以自主选择更合适的基础模型,同时保留已有的业务判断与训练经验。

从现有实践来看,专业场景的后训练优化、业务反馈的回流迭代、清晰的商业付费模式与可复用的平台架构,共同构成了产业级RSI的早期落地路径。接下来,更长期的客户使用验证将进一步检验这套机制的可靠性:更新能否持续产生业务价值、相似场景接入的专家投入能否持续下降、自动化程度提升后效果是否依然稳定。

相关团队的长期愿景,是让每一个AI代理都拥有自进化能力。眼下,这条路径已经清晰可见:将客户的业务经验融入模型能力,同时将服务客户的经验沉淀为平台能力,让下一轮改进无需从零开始,让每一次交付都可以复用已有积累,最终让持续学习成为企业可以长期依赖的核心能力,也让基础设施服务商可以实现规模化的长期生意。

以上内容不代表本平台立场,仅供读者参考