AI for AI:重塑大模型研发新范式

不少前沿的科研创意,最终都没能完成完整的验证落地。这并非因为研究者缺乏灵感——新的架构设想、训练策略每时每刻都在被提出,但绝大多数想法都在冗长的训练脚本编写、反复的参数调优、排队等待的GPU算力资源消耗中,悄然被搁置。如果换一种思路重构大模型的研发流程呢?当你只说出半句话,比如“我猜想这个架构或许能降低长上下文处理成本”,AI就能读懂前沿文献、生成候选方案、自动编写代码、调度算力并并行开展消融实验。这正是近期备受关注的AI for AI模式,它并非简单的研发工具升级,而是下一代大模型研发的核心命题,全球从业者都在这条赛道上探索通往通用人工智能的路径。
AI for AI:全球科技赛道的核心布局
过去两三年,行业对人工智能的关注焦点集中在编程与数学能力上:让AI端到端完成复杂代码任务、推导悬而未决的数学难题,这让AI具备了扎实的逻辑推演与工程落地能力。当这些能力逐渐成熟,一个更根本的问题浮出水面:能否将这些能力反哺于AI自身的研发?
2026年,AI for AI已经成为全球头部科技实验室的公开研发目标。相关机构侧重前沿理论的自动化研究,在近期宣布其AI已具备“自动化研究实习生”的能力,专门成立递归式自我改进团队,计划在2028年3月前实现完全自动化的AI研究员,让AI自主生成、审计高质量训练数据,接管自身研发的全流程。
还有机构侧重工程环节的自动化探索,在今年6月发布的相关报告中披露,其内部80%以上的可运行代码已由AI独立编写,每名工程师的产出效率提升了8倍。到了9月的最新进展中,其核心研发平台上已有超过3万个AI智能体同时协作,在数字沙盒中日夜开展代码测试与算法实验。
另一巨头也在加码AI for AI的投入,一方面推出自进化编码智能体加速旗下模型的迭代,另一方面迎来核心人事调整,相关负责人卸任CEO职务,全面转向通用人工智能的长期战略布局。此外,该集团的灵魂人物也官宣离职创办新公司,专攻自动化机器学习领域,短短几周内估值就被推至500亿美元,连老东家也下场投资。
国内的相关实践也在密集推进,不同团队切入的研发环节各有侧重:有的团队用AI编写预训练框架,有的让AI搭建适配国产芯片的推理基础设施,有的从训练框架入手,有的聚焦推理系统优化,还有的直接研究“会进化的智能体”本身。AI能够接手的研发环节正在被逐步打通。
某团队的尝试将这些环节串联了起来:从架构探索、训练系统搭建到推理优化,AI全程参与其中;同时,模型本身也被专门训练来承担研发工作,它既是这套研发模式的产物,也是下一轮研发的执行者。这种差异化的研发路径让该团队仅用7个月就将估值推至14.2亿美元。
大量资本涌入、巨头纷纷押注,所有人都意识到,全面重构智能迭代的速度,能够在有限资源内不断突破性能边界,这或许正是通往通用人工智能的第二增长曲线。如今,AI for AI早已不再是概念:AI已经从最初只能帮工程师编写单个PyTorch函数,进化到可以独立阅读顶会论文、编写完整训练脚本、调度GPU集群、分析日志报错并完成一键微调。以多款研发智能体为代表的工具已经成熟,机器学习工程正式成为递归式自我改进的核心试验场。
中后训练:AI参与研发的优先落地场景
要理解该团队的研发路线,首先需要明确大模型研发的几个关键阶段。预训练是“打造模型基座”的过程:用数以万亿计的公开数据让模型学习语言规律,建立对世界的通识认知,这个环节投入大、周期长,一次完整实验往往需要数月时间。而中训练与后训练则是“做强模型能力”的过程:在已有基座的基础上,用数百亿到数万亿tokens的高质量数据,让模型长出特定的能力。
两者的研发节奏截然不同:中训练与后训练由大量实验构成,比如调整注意力结构、测试长上下文长度、优化推理速度等,每个问题背后都需要一连串的消融实验、参数调优与工程优化。这类实验数量多、周期短、结果可以快速评估,因此成为AI最先能够大规模承担研发工作的环节,也是AI for AI的起点而非边界。
开源生态的成熟让这条路线更加可行,高质量的开源基座陆续发布,任何团队都能站在巨人的肩膀上启动研发。如今,模型之间的差距越来越多地来自基座之后的中后训练环节,不少实验室已经将研发重心转向这一领域。
该团队押注的正是这条路线:不从零开始预训练,而是以开源基座为起点,将投入集中在中训练与后训练环节。即便是坚持自研基座的厂商,也会将中训练与后训练单独拆分出来。比如某厂商的模型在27T tokens的预训练之后,专门安排了约1.55T tokens的中训练,分32K、128K、200K三个阶段逐步拉长上下文长度,重点补充长上下文与智能体相关的数据。到了后续发布的版本中,该厂商沿用了相同的基座,不再重新预训练,能力提升全部来自后训练,内部编程评测成绩提升了约50%。这说明基座不变,模型依然可以实现大幅进步,差距越来越多地产生在基座之后的环节。
这和简单的“拿开源模型微调”有着本质区别。该团队首先重构了基座的注意力架构:保留滑动窗口注意力处理局部信息,将原有的全局注意力层全部替换为稀疏注意力,形成每5层滑动窗口注意力搭配1层稀疏注意力的混合结构,整个网络不再包含任何全局注意力。
他们还对稀疏注意力本身进行了改造,将原版中的特定模块替换为4个KV分组的分组查询注意力,并配套设计了只有16个query头的轻量索引器。架构变更后,模型需要重新适应新的结构,这需要一轮完整的训练而非简单的微调。为此,他们推出的模型全程保持1M上下文,分三个阶段累计训练了3.25T tokens:
- 索引器预热阶段,训练50B tokens:冻结模型其余参数,仅训练新加入的稀疏注意力索引器,以原全局注意力的分布为参照,让索引器先学会筛选关键信息;
- 稀疏注意力训练阶段,训练3T tokens:切换到稀疏注意力模式,开展大规模继续预训练,让模型适应新的信息读取方式,同时重点强化编程与AI研发能力;
- 学习率衰减阶段,训练200B tokens:进入监督微调阶段,逐步降低学习率,让模型能力稳定成型。
不止模型在被训练,训练系统本身也在被AI优化。比如针对通信延迟问题,AI注意到稀疏注意力层需要读取全部上下文,而滑动窗口注意力层仅关注局部上下文,因此提出分工方案:一部分采用全序列并行,另一部分仅使用相邻分片交换数据,大幅降低了长序列场景下的通信开销。
在显存管理方面,AI对显存使用、中间结果留存进行了精细化优化,细到每一个算子,还特意锁定已经选定的关键位置,避免重算打乱这些位置的数据,将1M长序列下的显存效率拉到极致。此外,AI还会主动修复训练中的bug,在长序列训练过程中,自主发现、定位并修复了位置编码精度不足、序列索引越界等一系列底层问题。
这种研发路线的选择,和该团队创始人的技术底色密不可分。作为AI领域的顶级学者,创始人在技术圈的风格十分鲜明:从早年被写入PyTorch框架的标准算子可变形卷积,到自动驾驶感知的行业标杆BEVFormer,再到在开源社区斩获千万级下载的多模态基座,他始终擅长以极致的工程效率打破原有的性能天花板。在这种技术基因的影响下,该团队成立仅7个月就推出了开源模型Naive-N0.5-Flash,而这款模型本身就是“AI自进化的产物”,不仅能够承担研发工作,还可以作为基础工具供其他科研人员直接使用,训练和研发下一代更智能的AI。
研发模式重构:从工具到智能体的升级
如今,大模型的构建早已不是单纯的研究工作,而是一套复杂的工业化研发体系。全球领先的AI公司依靠庞大的专家团队分工协作,覆盖模型架构设计、基础设施搭建、训练、推理、部署与评测等多个环节,每个前沿模型的背后都是持续不断的实验、迭代与优化循环。
该团队从成立之初就摒弃了传统的以人类为中心的研发体系。在传统的大模型研发流程中,研究员需要亲手编写代码、调整参数、运行实验、分析实验曲线,全程主导实验过程,这样的流程少则数周、多则数月,其中有大量重复且枯燥的“工程脏活”。而在新的研发体系中,这些工作都交给了AI智能体来完成。
在该团队的研发体系里,人类研究员的工作被重新定义:他们仅需要专注于三件事——提出研发目标、设定约束条件与评价标准、做出最终决策,核心能力转向“科研品味”的高低。
为了让AI可靠地承担执行层工作,该团队搭建了一套以AI为中心的研发基础设施:简单来说,就是为模型提供安全、隔离的运行环境,搭配充足的GPU算力,让其能够大规模稳定运行。这套系统每周能够运行近千万个沙箱实验,最多可同时容纳10万个实验并行开展,背后有统一的平台集中管理算力、环境、工具、权限与安全。
在这种模式下,AI既是被实验、被升级的“产品”,同时也是编写代码、修改架构的“开发者”。由此诞生的Naive-N0.5-Flash,具备出色的AI研发与编程能力。这款模型在全球大模型评测中展现出了对标顶尖闭源模型的实力:在考核前沿论文复现能力的评测中,它超越了多款主流模型;在考察机器学习实验能力的评测中,它同样超越了多个顶级模型,这意味着它能够像真正的科研人员一样,读懂晦涩的顶会论文并复现实验流程。
在复杂编程能力的评估中,该模型得分超过了拥有2.4T参数的大模型,仅以15.5B激活参数(不足自身总参数的6%)就实现了超越,上演了一场以小胜大的效率奇迹。目前,该模型的权重与推理代码均以宽松许可证发布,同时提供API访问服务,具备极高的性价比。
从一开始,该团队就专门强化了模型的三项核心研究能力:复现前沿论文的读文献能力、自主开展消融实验的做实验能力、系统化管理研究仓库与版本的成果管理能力。这三件事正是人类研究员日常投入最多的工作,也是让递归式自我改进形成闭环的关键环节。让AI深度参与下一代大模型的自主研发,正是该团队的长期目标。
实战验证:AI研究员的两个真实研发案例
AI for AI的概念已经提出许久,但AI能否真正下场完成实际的研发任务?该团队用两个真实的研发项目给出了肯定的答案:一个是优化自家的推理系统,另一个是从零开始研发世界模型。在这两个项目中,人类仅负责设定关键绩效指标,剩下的具体工作全部由AI完成。
第一个项目中,AI成功打造了推理运行时工具,解决了推理系统“速度慢”的痛点问题。在强化学习训练中,最耗时的环节之一是滑跑阶段:让AI拿着当前的策略在沙盒环境中完整运行一次实验,收集交互轨迹作为升级的训练数据。一条接近1M级别的超长滑跑任务,读入数据仅需几分钟,但解码过程却要耗费数小时,其中最慢的样本往往正是难度最高、价值最大的核心数据。
传统的同步管线中,整个GPU集群必须等待所有样本生成完成才能进入下一步训练;而异步管线则容易因为超时被直接废弃,导致前期工作白费。唯一的解法是提升单流解码的绝对速度。为此,人类研究员设定了三个核心目标:速度要快、质量不能下降、结果必须百分百确定。
随后AI开始了151轮实验探索,其中仅有63轮方案被采纳,71轮被回滚,还有17轮作为备选探索路径。AI并不会只关注单一算子的微基准测试,而是以端到端的最终性能作为取舍标准。比如在某一轮实验中,AI提出的新优化在短上下文场景下能节省3微秒,但当长上下文超过2200 tokens时,性能反而会倒退3微秒,AI直接放弃了这个方案。再比如针对混合专家模型的内核融合,AI连续迭代7轮后发现,虽然数值精度完全正确,但端到端的最终吞吐率反而下降,于是立即叫停实验并回滚到原有方案。
经过“全链路梳理合并、零散算子打包协同、内核细节微秒级打磨”的层层优化后,完整一轮投机解码的耗时从原有方案的12.3ms降到了3.4ms,同时保持了逐位确定的结果一致性。这款推理运行时工具采用以AI为中心的研发模式构建,结合了巨型内核融合、程序化依赖启动与投机解码技术,标准模式下单用户输出速度可达50 tokens/s,极速模式下最高可达2000 tokens/s,对比主流的推理引擎,其极速模式将生成效率提升了近30到50倍。
第二个项目则是在团队不熟悉的世界模型领域,AI从零开始摸索并打造出了行业第一梯队的世界模型。最初,AI只是“照葫芦画瓢”,从复现现有模型起步,按照行业标准搭建框架,尝试了无分类器引导等常规优化,但收效甚微。随后AI开始自主探索:它手动重写视频描述,将训练集从2.5K暴增到22.5K;调整网络结构,更换更强的基座模型。
并非所有调整都能带来正向收益,比如在测试帧采样时,AI发现16帧的效果明显优于8帧,32帧虽然有收益,但边际效应在减弱。在持续的自我迭代中,AI甚至发现了人类都未曾注意到的新方法:在训练与测试的交错过程中,AI敏锐地察觉到部分评测指标不需要对照真实参考视频就能计算,它没有局限于用这个信号评估生成结果,而是将其用于指导输出选择与后处理策略。
AI首先探索了多时间步选择,为每段视频匹配最佳时间步,直接让成绩超过了当时榜单的公开最高分。最关键的方法创新是将单帧选择问题建模为动态规划求解的背包问题。后续AI又陆续探索了多候选视频选择策略、为每段视频匹配最优后处理方案,还针对视频常见的闪烁、抖动问题优化了后处理方法,当然也有试错过程:比如对比不同动态规划配置后发现,N=32的效果反而不如N=16,于是主动放弃了更高的数值,保留更优的方案。
经过累计400小时的研发、15轮主要实验后,AI打造的世界模型在相关榜单中拿到了77.43分,超过了公开榜的最高分73.64。这证明了AI的研发能力可以跨领域迁移,未来不需要人类在每个细分领域都成为专家,AI可以自主学习并完成研发任务。
行业思辨:迈向强递归式自我改进的五大卡点
从推理系统优化的151轮实验,到世界模型的400小时探索,两个真实案例清晰地展现了当前AI研究员的能力边界。但纵观整个行业的进展,我们仍处于弱递归式自我改进的起点:AI的角色更像是刚入行的科研实习生,能够在已知框架内完成参数调优与方案组合,但远未达到独立主导完整科学研究的阶段。
距离真正能够自主阅读前沿文献、提出研究假设、调度算力资源、端到端完成模型迭代的强递归式自我改进形态,也就是全自动AI研究员,相关机构给出的目标节点是2028年。这中间还有诸多卡点需要突破。
首先是验证难度问题。软件代码编写完成后可以立即运行并获得即时反馈,但模型训练的反馈周期要长得多。151轮实验看似密集,但背后依靠的是算力的并行堆砌,而非AI本身的思考速度。越往底层架构走、越靠近预训练环节,AI的迭代效率就越受限于物理算力与训练周期。AI可以一口气生成上百个候选方案,但最终能验证多少,依然需要等待算力排队、等待训练完成。如果涉及机器人、材料科学等需要物理世界交互的实验,反馈周期与成本更会随实验规模呈指数级上升。
比验证难更深一层的困境是发现能力不足。当前所有AI for AI的迭代,本质上都是现有知识的排列组合与参数调优。AI可以将已知方向的研究做得又快又极致,但无法独立开创全新的研究范式。当年Transformer能够取代循环神经网络,需要对领域的深层理解、对未来方向的直觉判断,甚至一定的审美与运气。这些正是人类研究员的“科研品味”,也是当前AI无法替代的核心价值。
再往底层剖析,则绕不开模型因果能力匮乏的问题。基于纯文本语料训练的大模型,因果判断天然不稳定,逻辑推演极易受到表述形式的干扰。这也正是相关学者近年不遗余力推崇世界模型的核心原因:只有在与物理世界的交互中习得的因果律才是扎实的,纯文本中学习到的“因果”很多时候只是语言层面的相关性,而非真正的逻辑因果。在世界模型的实验中,AI敏锐地发现了“部分评测指标无需参考视频”的规律,并以此优化了输出策略,但这个规律到底是底层逻辑的必然,还是特定数据集上的偶然?AI可以高效地发现关联,但很难独立判断这个关联是否为真正的因果关系。
同时,评估器能力不足也是一个迫切的难题。科学研究最核心的部分在于科研品味,而这种创新性与长期价值很难被量化为明确的指标。如果训练系统一味使用可量化的跑分作为奖励信号,AI会倾向于为了刷高指标而进行投机优化,反而会牺牲真正的创新性。
不过,这些都还不算真正的深水区。元递归,也就是“迭代方法本身的迭代”,才是从弱递归式自我改进走向强递归式自我改进的关键门槛。比如研发工作流是否需要调整、实验设计的逻辑是否需要优化?什么时候AI能够自主推翻一套沿用已久的实验范式,提出一套更高效的研究逻辑,AI才真正成为了“会进化的研究员”。
在该团队的官方主页上,有一句标语悄然写道:“100x Intelligence for the pioneers”,意为为先驱者提供100倍的智能。AI for AI的终局,从来不是为了取代人类研究员,而是让那些一闪而过的科研灵感,不再因来不及落地而无声消亡。

