AI时代Eval的演进:从适配人到定义值得改变的状态

在AI技术快速渗透的当下,我们影响世界的方式正在经历深刻的变革,其中一个关键角色——Eval的定位也在沿着价值循环不断向右移动,从最初适配人类的认知局限,到最终转向定义真正值得被优化的世界状态。
长久以来,人类通过吸收背景信息,转化为恰当的行动,最终推动特定状态发生改变,完整的流程可以概括为:背景信息 → 人类认知 → 执行行动 → 状态改变。
当AI模型介入后,这个流程被拉长,变成了背景信息 → AI模型 → 人类认知 → AI模型 → 执行行动 → 状态改变。在这个阶段,AI早期的主流应用场景集中在调研报告生成、办公套件辅助、网站搭建等领域,这些工具主要覆盖了流程的前半段:背景信息 → AI模型 → 人类认知。由于人类获取背景信息的带宽有限,我们会需要更易读的报告、更美观的演示幻灯片、更炫酷的前端界面来承接模型输出,这就催生了Eval角色:它处于AI模型和人类之间,核心目标是理解并适配人类的认知局限,让模型的输出更容易被理解、信任和使用。
不过这些被当作最终交付物的内容,本质上都只是中间载体,它们本身并不会直接改变世界的状态,只是作为背景信息的传递桥梁,帮助其他决策主体找到正确的行动方向。
随着智能体开始真正执行真实的行动,Eval的位置也随之移动,从模型与人类之间,转向了模型与行动之间。这个阶段的Eval需要校验智能体在执行环境中的行动是否合规:比如是否正确调用了工具、是否完成了既定任务、失败后能否自动恢复、是否严格遵守了预设边界。此时Eval需要关注的不再只是人类的认知缺陷,而是执行环境本身的不足:比如环境信息不完整、工具可能出现故障、反馈信号稀疏、规则与边界并非总是清晰明确。
无论是早期适配人类的Eval,还是这一阶段校验行动的Eval,都有一个共同的局限:它们无法直接观测到明确可量化的目标状态,只能通过构建代理指标来间接拟合真实的状态变化。
真正理想的价值创造流程,应该回归到最简洁的链路:背景信息 → AI模型 → 执行行动 → 状态改变。相比人类,AI模型天生具备高带宽、高并发、低延迟的优势,这会让整个循环比纯人类参与的阶段效率更高。从长期来看,我们的发展目标是让AI足够强大,能够将人类从执行这个循环的过程中解放出来。
当人类不再需要介入这个执行循环时,大量的工作量都会被节省:我们不再需要为了让报告更易读而调整格式,也不再需要为了美观制作精美的幻灯片或网页来承载背景信息。此时Eval也会继续沿着流程向右移动,最终只剩下一个核心问题:什么样的世界状态值得被改变?
一旦选定了值得优化的目标状态,它往往比中间产物更容易被观测和量化。此时真正的挑战不再是“如何评估效果”,而是“应该评估什么”;不再是构建更精准的代理指标,而是找到真正值得投入资源优化的世界状态。未来会是一个人人都扮演Eval角色的时代,我们需要通过定义目标状态的演进方向,来持续维护人类的核心价值。
那么这些值得被改变的状态究竟会是什么?或许是更长的健康寿命、更低的清洁能源成本、更快的科学研究迭代、成功登陆火星,或是更丰富多元的艺术创作?这一切都值得我们持续探索。

