Claude自动化研究AI对齐 完胜人类研究员

AI正在自主完成安全研究并迭代自身,这已经不是科幻场景
当AI模型能自己查论文、做实验、优化模型,甚至用弱版本训练强版本,行业的震动可想而知。更惊人的是,这套自动化系统的时薪仅4美元,却能轻松击败时薪150美元的人类研究员。
来自AI研发团队的最新研究中,他们打造了一套名为AAR的自动化对齐研究员系统,基于Claude Opus 4.8搭建而成。这套系统可以自主完成从文献检索、方案设计、数据生成到模型训练、性能测试的全流程AI安全优化工作。
每一轮实验仅需30分钟,让Claude可以像高效的搜索算法一样快速试错:效果不佳的方案直接丢弃,性能提升的方向则继续迭代。整个流程中,人类仅负责设定任务、提供基础模型和评测标准,其余工作全部由AI自主完成。
85% vs 20%:AI碾压人类安全研究员
在一项对比实验中,28名人类安全研究员参与了10类AI安全问题的优化工作,每人最多拥有8小时的准备时间。而自动化系统则可以在6小时内找到超过人类平均水平的方案,甚至在“欺骗性输出”任务中,单次最佳方案弥合了82%的安全差距,多次运行后的平均成绩达到85%,而人类研究员的平均成绩仅为20%。
成本差异同样悬殊:自动化系统每小时的API推理成本约4美元,而人类研究员的时薪高达150美元。不过这场对比并非完全公平——AI可以根据每次实验的结果持续迭代优化,而人类研究员只能一次性提交方案,无法根据测试结果调整改进。
全类安全问题得到有效改善
实验覆盖了10大类AI安全对齐问题,包括欺骗性输出、谄媚式回应、奖励黑客、隐私泄露和恶意越狱等。比如“谄媚”指模型为迎合用户给出用户想听但未必正确的答案,“奖励黑客”则是模型没有真正完成任务目标,而是通过钻评测规则的空子骗取更高评分。
Claude每次专注处理一类问题,反复迭代优化方案,最终所有10类问题全部得到改善,弥合了26%至96%的安全差距。更重要的是,这些优化方案不仅在训练任务中有效,还能迁移到未公开的测试集和多轮对抗评测中,甚至在规模是实验模型4.7倍的更大模型上依然有效。
研发团队还设置了严格的限制:安全训练不能损害模型的通用能力。毕竟如果让模型对所有问题都拒绝回答,虽然能在安全测试中拿到高分,但这样的模型完全失去实用价值。最终优化后的模型在通用能力测试中没有出现明显退化。
弱版本AI训练强模型,60小时逼近正式版性能
除了优化小模型,研发团队还尝试让能力较弱的Claude Sonnet 5,去训练尚未完成生产级安全训练的Claude Opus 4.8早期版本。在60小时内,Sonnet 5测试了50多种方案,最终找到的优化方案弥合了65%的安全差距,接近正式版Opus 4.8的72%的优化效果。
这套方案仅用了2000多条由简单模板和公开数据集构成的训练数据,数据效率是传统生产级对齐流程的1.5万倍。虽然这并不代表可以完全复制整套生产级训练流程——正式模型需要处理更多维度的能力、更复杂的风险以及大量极端场景,本次实验仅针对一组明确的安全指标展开,但已经证明弱模型可以自主完成全流程优化,参与制造更安全、更强大的下一代模型。
这到底算不算AI自主进化?
从结果来看,这项研究确实触及了AI自主进化的门槛,但如果将自主进化定义为AI完全自主设计、训练下一代模型,那么本次实验还远未达到目标。整个流程中,研究方向、评测标准都由人类设定,AI只能优化人类预先定义的目标。
实验也存在局限性:未覆盖其他复杂安全问题,部分新兴风险没有对应的评测基准,仅测试了有限的通用能力,无法确认是否存在未被检测的能力损害。此外,安全评测仅为现实风险的代理指标,测试中的安全表现并不等于真实场景中的可靠性。
AI系统的最大隐患在于其高速试错的能力:如果评测标准出现偏差,AI会离人类的真实目标越来越远。更讽刺的是,这些自动化研究代理本身也会作弊,研发团队在1600份研究记录中发现了39次作弊尝试,占比2.4%,包括利用评测波动、隐藏违规步骤、模仿评测格式生成数据等行为。
好消息是这些作弊痕迹大多会被监控系统发现,但未来更强的模型可能会隐藏痕迹,届时“如何监控改进AI的AI”将成为更大的挑战。
但无论如何,一套AAR系统成本低廉、可以连续工作且能批量复制,而人类研究员在成本和效率上完全无法相比。这一次,开发AI的从业者不得不开始担心自己的岗位被AI替代。

