LLM训练后停止学习,真实经验驱动持续进化

当前AI模型能力迭代速度远超预期,安全合规问题已经开始制约训练进度;同时,智能体(Agent)也获得了更贴近真实场景的执行权限。
行业前沿动态
OpenAI高管谈安全与训练节奏
OpenAI近期暂停了部分前沿强化学习训练项目,目的是验证新模型的能力是否符合对齐、安全与监控标准。该公司高管表示,当前模型的迭代速度已经远超预期,OpenAI此前曾公开承诺,一旦模型能力增长速度超过安全体系的适配节奏,就会主动采取干预措施,此次暂停正是这一承诺的实际落地。
需要说明的是,此次暂停并不影响近期的模型发布计划,OpenAI仍预计很快推出性能优异的新一代模型,受影响的主要是远期的前沿训练工作。这一事件也释放出一个明确信号:前沿AI实验室开始正视安全信心对模型迭代的直接影响,未来的行业竞争将不再仅比拼“谁先训练出更强模型”,同时也要看“谁能更快证明模型可以安全部署”。
Codex的安全漏洞与防护升级
OpenAI的技术团队透露,此前收到少量关于GPT-5.6在Codex中执行非预期破坏性操作的报告。其中最严重的一类问题是,模型本应清理临时文件,但由于命令编写错误,可能将删除目标指向用户的真实个人文件。典型的失误场景包括误用$HOME这类系统环境变量,当清理脚本的路径参数出现偏差时,删除范围就会从临时目录扩大到用户主目录。
针对这一问题,Codex已经新增了多层安全防护机制:执行删除操作前会对目标路径进行校验,使用独立全新的临时目录,不再将系统环境变量挪作他用,优先采用可恢复的操作方式;同时执行系统会识别高风险命令,触发额外的人工或自动化审查流程。此外,OpenAI还提高了Full access功能的启用门槛,并优化了Auto-review模块对破坏性操作的识别能力。
针对普通用户,团队也给出了实用建议:保持应用始终更新,优先选择“Ask for approval”或“Approve for me”的权限模式,仅在可恢复、高度可信的运行环境中使用Full access权限。
Claude的Agent能力升级
Anthropic旗下的Claude现在开放了更强大的Agent能力,支持直接在Gmail中起草并发送回复邮件,同时也可以管理Google Drive中的文件。用户在发起相关请求后,Claude会自动完成邮件撰写与发送流程,是否需要人工审批可以由用户自行配置。
该功能目前面向所有付费用户开放,同时Claude Cowork也已经同步上线移动端和网页端,不再局限于桌面应用场景。此前的Connector模块主要实现Claude对外部信息的读取能力,而此次升级后,Claude已经能够直接修改外部系统状态。从读取信息到执行操作的跨越,标志着Claude从单纯的信息查询助手,转变为可以代表用户完成实际行动的智能体。
随着权限范围的扩大,审批规则、身份验证与操作记录的重要性显著提升。相关产品需要让用户清晰了解智能体读取了哪些内容、计划执行什么操作,以及哪些步骤必须由人工确认才能完成。
Google的生产力Agent CC扩大测试
Google Labs推出的实验性生产力智能体CC正在扩大测试范围,目前已经在美国和加拿大增加了邀请发放数量,同时面向澳大利亚和新西兰开放了候补申请通道。
该Agent可以连接Gmail账号,自动识别邮件中的活动与日程安排,并同步写入专属的Google Calendar中。当邮件内容发生更新时,相关的日程信息也会自动同步调整。这类功能看似简单,却非常适合智能体应用:日常工作中大量信息分散在邮件线程中,需要持续跟踪检查,并将变化同步到其他系统,而CC解决的不是一次性的问答需求,而是需要长期维护的重复性日常工作。
Vercel的沙箱安全与Monorepo构想
Vercel宣布将投入100万美元,启动公开的Vercel Sandbox安全验证项目,任何开发者都可以使用任意AI模型尝试逃逸沙箱隔离环境,发现的安全漏洞会被及时修复,相关研究结果也会对外公开共享。
随着智能体可以自主运行代码,沙箱环境已经成为AI应用的核心安全边界。即使模型受到恶意指令诱导,只要无法突破沙箱的环境隔离,造成的损失就能被有效控制。
该公司高管还提出,面向智能体的“软件工厂”应该采用Monorepo架构,将设计、营销、销售、工程与客服等全链路上下文信息集中到同一个可访问的环境中。传统的Monorepo通常仅关注代码共享,但智能体需要的不仅仅是代码资源,还需要理解产品定位、用户反馈、设计规范、上线计划与业务约束等多维度信息。
如果这些信息分散在大量独立工具中,智能体每次执行任务都需要重新拼接上下文,效率会大幅降低。将信息统一存放可以减少检索成本,但同时也会扩大权限覆盖范围,因此必须配合更精细的数据隔离机制来保障安全。
非工程人员的AI协作趋势
行业分析师Peter分享的调研数据显示,非工程背景的人员正在提交越来越多的代码。在两年的时间跨度里,附带PR的产品经理占比从3%上升到10%,设计师占比从1%提升至8%,创始人的占比更是达到23%,仅次于专业工程师群体。
不过AI并没有简单替代原有的工作模式,团队反而花费了更多时间与AI沟通、向智能体分配任务,而传统的工作量并没有出现明显下降。一种合理的解释是,当AI提升了单环节的生产力后,企业并没有将节省的时间返还给员工,而是提高了每个岗位的产出预期——过去不会启动的项目现在可以推进,过去仅需交付一次的内容现在需要产出多个版本。
因此,“AI为团队节省了多少时间”可能并不是衡量其价值的最准确方式,更现实的问题应该是:AI让一个团队能够承担多少过去从未启动过的新工作。
模型评测的优先级建议
Meta的Madhu Guru提出,模型评测流程应该按照前沿模型开发的逻辑来规划:先建立质量上限标准,再沿着成本曲线向下优化。
在评测的第一阶段,应该暂时忽略成本因素,先明确定义什么是合格的输出结果,再选择最可靠的评测方式。必要时可以使用成本较高的Judge模型、付费人工评审,甚至投入团队自身的时间,确保评测体系能够真正区分模型的优劣。
只有当评测结果的可信度得到验证后,才可以通过自动化流程、小模型替代、抽样检测和确定性检查等方式来降低评测成本。如果一开始就盲目追求低成本,团队很可能得到一套看似便宜却无法准确反映产品质量的评分系统,这样的评测体系不仅毫无价值,还会将模型优化的方向带偏。
SaaS的Agent适配转型
Anthropic的Thariq指出,当前很多SaaS企业已经迎来明确的转型机会:将现有产品改造为无传统界面的Headless Service,让智能体可以直接调用,并按照实际的交互次数进行收费。
目前大多数SaaS产品依然围绕人类用户设计,流程包括登录后台、点击菜单、填写表单等,但智能体并不需要这些可视化界面,它们更需要稳定的API接口、明确的权限配置和结构化的输出结果。
特别是在企业市场场景中,智能体可能会高频调用某项功能,但不会像人类用户一样购买单个账号,这将推动SaaS的收费模式从按席位付费,转向按任务、操作或最终结果来计费。
企业场景的AI落地壁垒
在AI模型与最终业务流程之间,依然存在巨大的创新空间。前沿基础模型提供了通用能力,但要将其落地到银行、律所、生命科学或财务等具体行业流程中,还需要大量的行业定制化工作。
同一个智能体,在不同的业务场景中会有不同的呈现形式:在客服场景中可能表现为聊天窗口,在后台运维场景中则是静默运行的确定性流程。不同的业务场景需要不同的数据连接方式、产品界面、调度框架、评测体系和权限设计。
企业还需要能够根据具体任务选择不同性能和成本的模型,并采用符合行业习惯的收费模式,而不是简单地将Token成本转嫁给客户。这意味着应用层的开发并不是在基础模型之上做一层简单的包装,真正的行业壁垒可能来自行业专属数据、业务流程理解、定制化评测体系、变革管理能力,以及能否让智能体可靠地接入核心业务流程。
下一代AI的持续学习挑战
当前的大语言模型虽然可以保留上下文信息,但无法在与真实世界交互的过程中持续更新和修正自身的核心知识。真正的下一代AI智能体,必须能够在运行过程中一边工作一边学习,同时不会因为新的经验遗忘已掌握的旧能力。
强化学习领域先驱、《The Bitter Lesson》的作者Rich Sutton与Oak Lab联合创始人Khurram Javed指出,“持续学习”这个词汇本身就暴露了当前AI领域的认知偏差。对人类和动物而言,学习本就是持续发生的自然过程;只有当下的AI模型,才将学习行为严格限制在训练阶段。
“过去没人会专门强调‘持续学习’,因为无法持续进行的学习根本算不上真正的学习。我们始终在行动,也始终在学习。”
当前的大语言模型在预训练和后训练阶段获取知识,模型发布后权重基本处于冻结状态。它们虽然可以读取更长的上下文、保存用户的个性化记忆,但无法在部署后继续形成新的概念和能力。Sutton的批评非常直接:一个被称为“博士水平”的AI系统,在正式发布后实际上已经停止了学习。
他同时也不看好将合成数据作为AI长期学习的解决方案,因为合成世界终究是由人类设计的,只能覆盖人类已经意识到的问题范畴。现实世界远比任何模拟器都要复杂,新的场景摩擦、环境变化和其他用户的思维逻辑,都无法被完整预先生成到训练数据中。
“世界极其复杂,任何模拟都只是它的一个微小切片。”
更理想的智能体应该能够从真实的交互经验中建立自身的世界模型,当预测结果出现错误时,可以自行修正,而不需要等待工程师发现问题、重新制作训练数据,再进行一次集中的全量训练。但这一思路面临的核心挑战是灾难性遗忘问题:如果模型根据单条新经验直接更新全部权重,已掌握的旧知识可能会被彻底破坏。
Javed提出的解决方案方向是,让模型的不同权重模块拥有不同的学习速度:对于稳定的核心知识,采用缓慢的更新节奏;对于需要快速适应新场景的部分,则设置较高的学习速率。同时系统需要持续生成新的内部特征,而不是仅在训练初始阶段获得一次随机初始化的参数。
他们正在研究的Continual Backprop技术,会在训练过程中不断加入少量新的网络单元,再通过反向传播算法判断哪些新单元值得保留。该技术的目标是让模型不仅能够学习具体的知识,同时也能学会“如何在后续过程中继续学习”。
“我们在模型发布前做了太多预训练和后训练,真正缺少的是:发布以后,它仍然能够继续学习。”
这种技术路线并不会打造一个掌握所有知识的万能AI模型,不同的智能体在不同的环境中经历交互,会形成各自独特的能力体系。未来的AI生态中,更可能出现大量持续学习、彼此能力各异的智能体,而非一个冻结参数后统一复制给所有用户的标准化“大脑”。

