BigBang-V1:AI递归自提升,100%合成数据驱动科学突破

当前AI领域最受关注的前沿方向之一,便是递归自我改进(Recursive Self-Improving,简称RSI)——让AI自主参与迭代自身的模型架构、训练算法、数据体系乃至研发流程。这一概念正吸引全球顶级研究者入局,比如知名AI学者Jeff Dean离职创办的Discovery Loop,以及AlphaGo缔造者David Silver带领的团队,都在探索AI自动化科学研究的路径。
当RSI成为行业共识,一个核心矛盾随之浮现:模型能力越强,能够为其出题、解题、验证的人类专家就越少,高质量训练数据的生产瓶颈愈发凸显。针对这一难题,一支由上海交大人工智能学院、深势科技、上海算法创新研究院组成的中国团队给出了系统性解决方案。
该团队推出的BigBang-V1,是全球首个基于原生RSI机制训练的基座大模型。在训练全程中,出题、解题、验证全流程由AI自主把控,通过可验证的前沿任务持续生成自演进的高质量合成数据,无需人类逐题参与数据生产。目前该模型已开源,配套技术报告也同步公开。
BigBang-V1参数规模为35B,推理时仅激活约3B参数,同时支持262K的超长上下文窗口。其后续训练数据100%由AI自主合成,且全部以科学前沿任务为核心构建。在长程搜索、代码生成、科学研究、AI研究等多个基准评测中,该模型拿下了同尺寸35B模型中的10项第一;在FrontierScience Research、PaperBench等高难度科研任务上,其表现甚至超过了参数规模达1T级的DeepSeek V4 Pro Preview。
基准测试成绩之外,BigBang-V1在复杂实际任务中的表现更能体现其解决问题的能力。在转座子定位这项高难度生物信息学任务中,模型需要在全基因组测序数据中定位47bp的转座子插入位点,同时严格遵守RefSeq染色体命名和1-based坐标约定。BigBang-V1没有通过猜测确定坐标,而是利用转座子与染色体之间的连接证据构建约束映射,将每个junction对应到具体坐标,最终将断点精准锁定在4144431,每一步推导都有可追溯的证据支撑。
在LBCS论文复现任务中,该模型展现出了极强的自我纠错能力。任务要求将LBCS论文复现为可运行的代码仓库,BigBang-V1在通读论文后并未直接提交结果,而是在冒烟测试阶段发现自己的实现违反了论文核心主张:样本量被固定,核心集无法收缩。它通过推算扰动规模发现无法越过触发阈值,连续否决了三个候选修复方案,最终将连续扰动改为二进制掩码翻转,彻底解决了问题。第二轮测试中,它又发现梯度项从计算图中脱离,主动恢复了梯度流,最终复现评分达到0.7657,在全部485个评分点中通过了331个。
值得注意的是,以科研任务为核心构建的训练数据,并未让BigBang-V1局限于科学领域的垂直能力。在BrowseComp基准测试中其得分达到76.5,在SWE-Bench Pro中拿到54.2,能力增益成功迁移到长程搜索、软件工程、代码开发等通用场景。
我们对该模型进行了实际测试:让其盘点8月第一周的AI圈大事,它先后进行了二十多轮检索、翻阅了十余个信息来源,先定位候选事件,再逐条打开信源交叉验证,最后还通过一手页面核对了所有事件的发布日期,最终输出的结论全部基于真实可访问的来源。我们还让其编写一个太空射击小游戏,生成的代码流畅完整,击中目标后会触发粒子爆炸特效,左上角还同步展示了分数、生命值和等级等游戏UI元素。
尽管RSI概念热度极高,但当前业界的探索大多仍停留在概念层面,真正跑通完整落地闭环的案例寥寥无几。目前主流的尝试主要分为两类:一类只是为模型套上工具调用外壳,仅优化了模型的调用方式,底层训练管线并未发生本质改变,未能触及RSI的核心;另一类则是用大模型对生成的数据进行打分筛选,但这套评判标准由人类预先设定,筛选逻辑无法随模型能力的提升自主进化,当模型变强后旧的评判标尺很快失效,仍会持续产出低价值样本。
单纯通过扩大数据集规模、反复清洗已有数据,已经很难再撬动模型能力的进一步跃升。训练数据仍依赖人类逐题生产,模型的进化速度被人类出题的速度牢牢卡住,这正是RSI落地的核心障碍之一。BigBang团队换了一个全新的视角思考这一问题:如果模型可以实现自我改进,那么能否让训练数据的生产系统本身,也成为被优化的对象?
由此,问题从“如何收集更多科学数据”转变为“如何让数据生产系统随着模型能力的提升持续进化”。要搭建这样的自进化数据系统,任务必须同时满足两个核心条件:一是前沿性,任务需要位于当前知识或模型能力的边界,甚至没有已知最优答案,科学领域不断涌现的新理论、新数据、新工具会持续产生新问题,不会像静态题库一样被模型快速耗尽;二是可验证性,候选方案需要能通过形式化方法、程序执行、数值计算、模拟器、实验反馈或领域工具进行客观检查,只有前沿性而无法验证的任务无法提供可靠的训练信号,而只有可验证性但缺乏难度的任务则会快速落后于模型能力,二者缺一都会导致数据快速贬值。
BigBang团队选择科学领域作为模型的训练载体,恰好同时满足了前沿性和可验证性两大条件。科学研究天然涵盖了搜索、阅读、提出假设、数学推导、代码开发、工具调用、实验分析和结果写作等全流程,相当于一套面向通用智能的综合训练课程。正如Jeff Dean所说,Discovery Loop的路线适用于具备可衡量目标的科学和工程领域,BigBang选择科学作为训练训练场,底层逻辑与此完全一致。通过可验证的前沿任务牵引数据生产,让数据生产系统与模型能力共同进化,正是BigBang给出的核心思路,正如其团队提出的理念:
AI advancing science, and science advancing AI.
将这一理论落地为工程实现,BigBang的核心在于一套能够持续修改和优化自身生产策略的自演化合成数据管线。团队将RSI机制嵌入训练管线内部,让AI直接参与任务构造、求解、验证、筛选,以及下一轮数据生产策略的优化。
系统的核心是两类协同工作的智能体:Generator Agent负责不断提出并解决科学、技术及AI研究中的高难度任务,它并非按照固定Prompt生成题目的普通生成器,而是作为代码Agent,能够直接修改、运行和调试数据合成程序。它可以自主调整任务所属的科学领域、问题需要的推理链长度、应使用的工具类型(搜索、计算、代码、模拟等),还能决定哪些样本需要保留、哪些需要淘汰,以及哪些生成策略在后续轮次中不再使用。每一轮实验结束后,它还会记录修改动机、实验结果和失败原因,让后续探索能够继承此前的经验。
Critic Agent则从对抗视角审查候选数据,第一层审查会检查格式、工具执行情况、数据完整性和约束满足情况;第二层则会进一步判断任务是否正确、可验证、足够困难、具备足够多样性,以及是否真正具备训练价值。未通过审查的任务会被拒绝或回炉重造,只有通过审查的任务才会被纳入合成数据集。Generator负责生成任务,Critic负责筛选校验,这套对抗与协作的机制类似AlphaGo的自我对弈,只不过将棋盘替换成了开放的科学任务空间。
这套快速的内循环虽然高效,但存在一个潜在隐患:Generator可能逐渐学会迎合Critic的评判标准,生成一些表面复杂、评分很高,但在实际训练中无法迁移到真实任务的数据。因此BigBang在快速循环之外,又加入了一层由真实训练结果驱动的外循环。
系统会生成不同版本的数据生产管线,分别用于训练模型,再将训练得到的模型放到预留的真实研究任务中进行评测。如果Critic认为某类数据价值很高,但训练后的模型并未获得真正的能力提升,说明评价标准存在偏差,系统就会用真实的训练结果反向校准Critic,并调整Generator下一轮的任务领域和难度;反之,如果某类看似狭窄的科学任务带来了搜索、推理或工具使用能力的广泛提升,系统则会加大对该方向的探索力度。内外双循环共同运转,让数据和模型实现协同进化。
随着模型能力增强,原本困难的任务会逐渐变得“不值钱”,过去无法处理的问题会变得可解,因此数据管线必须保持动态,能够跟随模型的变化同步调整。这就是BigBang的数据层RSI闭环:上一轮模型和实验产生的结果,会直接影响下一轮训练数据的生成与筛选方式。依靠这套闭环,100%纯AI合成的训练数据打破了“合成数据会坍缩”的魔咒,错误的答案不会被当作正确答案继续喂入训练,因为全程都有验证链兜底。
当然,这并不意味着人类会退出整个研发流程。研发目标、资源预算、风险边界、最终验收标准,仍然由人类定义。AI不能自行修改评测标准,也不能仅凭Critic的高分就直接批准某个方案进入下一轮训练。人类负责确定方向和定义有效进步的标准,AI则负责大规模探索、执行实验、整理失败经验、生产下一轮训练所需的数据。可以说,这是训练数据生产关系的一次重新分工。
BigBang-V1背后的无尽前沿团队,是学术与产业深度结合的产物。团队创始成员之一是上海交大人工智能学院副教授陈思衡,他是CMU博士,曾任职于Uber ATG自动驾驶部门,回国后带领团队打造出通用科研智能体SciMaster,该产品曾登顶OpenAI FrontierScience榜单,实现了“搜、读、算、做、写”的完整科研闭环。另一位核心成员是上海交大助理教授张林峰,这位年轻博导主攻模型压缩与数据蒸馏方向,他提出的大模型数据蒸馏方法曾获得CVPR满分,长期探索如何更科学地合成数据,以及如何让模型用更少的数据实现更强的能力。产业端,深势科技创始人张林峰与中国科学院院士鄂维南为这支团队补充了AI for Science的产业纵深。
无尽前沿团队的目标,是依托可验证前沿任务的自进化合成体系,实现开放式通用智能,搭建完整的AI自我迭代训练飞轮。当训练数据的生产不再依赖人类逐题产出,当AI开始参与决定下一代AI的学习内容,AI进步的天花板就被自己抬高了。或许,下一个AI赛点的关键不再是算力堆叠,而是数据智能。
模型主页:https://huggingface.co/endless-frontier/BigBang-v1
代码地址:https://github.com/endless-frontier/BigBang-v1
团队主页:https://endlessfrontier.tech

