文章摘要
2026世界人工智能大会期间,国内科研机构发布书生系列大模型Intern - S2 - Preview - 397B,其参数达397B,实现参数与效能平衡。它采用“知识与推理分离”双引擎设计,解决通用与专业能力兼顾难题。该模型在多领域评测表现优异,还助力科研提升效率。基于此模型打造的「书生·端砚」平台已落地多领域,其采用的新预训练范式也有显著优势。

在2026世界人工智能大会期间,国内顶尖人工智能科研机构正式发布书生系列大模型的全新迭代版本——Intern-S2-Preview-397B。这款模型参数规模达397B,在分子设计、材料结构生成等核心科学任务上,性能表现已经追平该实验室此前推出的万亿参数级大模型,实现了参数规模与任务效能的精准平衡。

当前科学智能(AI4S)领域长期面临一个核心矛盾:通用认知能力与专业领域知识难以兼顾。传统大模型中,知识存储与逻辑推理高度耦合,不仅无法充分利用既有知识开展推理,每引入一个新学科的知识,还可能扰动已经成型的通用能力,导致模型在跨领域任务中表现失衡。针对这一痛点,Intern-S2-Preview-397B从底层架构入手进行根本性革新,同时与昇腾计算生态展开深度协同,探索从模型能力提升到国产算力基础设施优化的协同演进路径。

这款模型采用了“知识与推理分离”的双引擎设计,由Memory Decoder与Mobius两个核心模块组成,彻底打破了传统大模型的耦合局限。

其中Memory Decoder模块引入了专业领域的可插拔外部记忆系统,不同学科的最新专业知识可以在独立的记忆模块中单独训练,之后根据任务需求按需接入基础模型。这一设计让模型在吸收垂域专业知识时,最大程度减少对原有参数和通用能力的扰动,专业知识不再需要通过反复改写整个模型来“硬编码”,而是可以像扩展内存一样持续更新,及时校正模型在探索未知过程中对新信息的理解偏差。

Mobius模块则专注于基座模型内部的知识与推理解耦。通过将模型内部的知识向量与推理算子彻底分离,Mobius构建了全局共享的知识向量库,一方面提升了知识在模型层间的可复用性,实现了更高效的知识压缩;另一方面为不同推理算子提供了灵活的知识存取空间,让模型可以根据输入动态组织计算路径,使得数学、物理、化学、生物等多领域共同需要的分析、验证和纠错能力能够跨任务迁移复用。

值得一提的是,Mobius架构还原生集成了反向残差连接与动态隐空间推理两大创新机制。前者打破了只有浅层隐状态可以访问深层知识的限制,让模型的深层隐状态也能够调取浅层积累的通用知识;后者则使用连续向量替代传统的Token作为信息载体,这种载体拥有更高的信息密度,更适配科学模态的信息传递需求,同时允许模型动态为不同输入分配合理的推理开销。这种“解耦”的架构设计,反而让记忆调用与推理过程实现了更紧密的协同,使得模型在面对相同科学任务时,端到端的推理效率提升接近4倍。

这套双引擎架构的关键价值,在于将大模型的专业化改造从一次性的整体重构,转变为可持续的能力生长模式:基础模型负责稳定的通用理解与推理能力,专业记忆模块承载不断演进的学科知识,而推理算子则可以在不同任务之间灵活复用。三者分工协作,为“引入专业知识而不牺牲基础通用能力”提供了全新的实现路径。

对于科学智能领域而言,这种分工模式尤为关键。科学知识更新速度快、学科边界不断交叉融合,模型既需要及时纳入新的事实、方法与数据,又需要保持跨领域的比较、类比与推演能力。可插拔的外部记忆让专业知识的更新变得轻量高效,而共享的推理算子则让跨学科能力的构建无需从零开始训练,极大降低了专业模型的研发成本与周期。

“记忆”与“思考”的分离,也为科学智能体提供了更灵活的底层算力支撑。当面对需要多轮规划、频繁检索专业知识和持续调用工具的长程科研任务时,模型可以将计算资源集中在真正需要推理的环节,并根据环境反馈不断修正执行路径,实现更高效的科研闭环。

Intern-S2-Preview-397B将大模型的能力扩展尺度,从单一的参数规模扩张,推进到架构效率、任务深度与专业知识协同演进的新阶段。基于全新的底层架构,这款模型无需为每一种专业能力单独搭建一套系统,而是可以在统一的基座上持续生长新的专业能力。随着参数扩张面临算力、成本与能耗的多重约束,架构效率正在成为基础模型竞争的新核心变量。

这款模型是业界首次真正实现让大模型的“记忆”与“思考”各司其职并完美协同,这也印证了一个重要结论:大模型的进步不只来自“更多参数”,更可以来自更合理的知识组织方式、更高密度的推理训练和更高效的计算路径。这正是“通识为体、专业为用”的核心内涵:通用能力构成稳定的底层底座,专业能力按需接入、彼此协同,在解决真实科研问题的过程中共同抬升模型的整体能力上限。

这种协同能力的习得,离不开底层训练范式的同步革新。针对传统训练依赖静态语料、难以习得复杂决策逻辑的痛点,研发团队构建了InternBootcamp交互验证环境。与常规的文本训练不同,InternBootcamp平台将电路设计、金融建模等真实科研与产业任务转化为标准化的交互场景,并自动生成验证函数进行仿真核验。

在这种“行动—反馈”的高密度训练模式中,Intern-S2-Preview-397B不再是对文本概率的简单拟合,而是通过反复试错内化领域逻辑,使得模型的长程规划与工具调用能力得到了根本性强化。同时,InternBootcamp平台还提供从数据沉淀、Reward评估、模型评测到安全对齐的一体化支撑,以更低的成本打造“更懂行业”的专域模型,为书生系列大模型后续的生态应用创新按下了加速键。

书生系列大模型凭借卓越的科学理解与推理能力长期处于行业领跑位置,在纯文本、多模态、代码智能体等多个领域都展现出顶尖实力,位列开源模型第一梯队。

在科学专业任务领域,Intern-S2-Preview-397B的表现全面优于闭源和开源旗舰模型。在Biology-Instructions、Mol-Instructions、MP20等生命科学和材料结构理解、生成与设计相关的专业任务评测中,这款模型大幅领先其他同类开闭源旗舰模型,证明其已经具备了服务真实科学研究所需的专业基础能力。

同时,Intern-S2-Preview-397B还具备长周期自主规划与迭代纠错等科研所需的通用智能体能力,这一点在软件工程开发的主流评测中得到了充分印证。例如在当前极具挑战的代码智能体评测TerminalBench2.1和SWEBench-Pro上,该模型在开源模型中优于Kimi-2.7-Code和DeepSeek-V4-Pro,仅次于GLM5.2;而在SWEBench-Multilingual评测中,其表现同样优于其他开闭源模型,与GLM5.2持平。

在科研领域,基准测试只能回答模型“会不会”的基础问题,而真实的科研场景则在追问:模型能否将单次推理转化为可验证、可复现、可迭代的完整工作流?Intern-S2-Preview-397B给出了一份令人满意的答案。

它将通用理解、专业推理、结果诊断与工具调用收束于同一基座,让模型不仅能够给出最终答案,还能清晰解释判断依据、提出后续优化方案,并接受计算或实验结果的检验与迭代。

以免疫治疗靶点IL-7Rα的蛋白结合剂设计为例,传统科研流程往往面临“大海捞针”的困境:每一轮分子筛选都需要生成上千个候选分子,再通过AlphaFold3折叠预测与Rosetta能量筛选进行层层淘汰。由于缺乏全局视角的精准引导,大量候选分子在验证环节因结构不稳或界面质量不佳被淘汰,整体通过率仅为0.47%,单轮“设计—验证”闭环动辄需要数日时间,效率瓶颈十分显著。

依托Intern-S2-Preview-397B作为智能决策中枢,模型可以深度学习实验的全量反馈数据,将原本“盲目试错”的过程转化为可审阅的“策略优化链”。科研人员只需调用模型,就能获得针对性的设计改进建议——例如将分散的43个关键残基精准精简至30个,并聚焦于B链102—189位的核心表位。这一过程从源头解决了蛋白分子被迫拉伸、接触分散及折叠不稳的结构难题,科研人员不仅可以逐步查看模型做出判断的依据,还可以一键按照建议重跑整个流程。

这一过程并不会替代最终的生物物理验证,其核心价值在于将研发初期最耗时、最容易出错的“参数调优”环节,转化为模型驱动的智能诊断。在同等算力预算下,基于该模型的优化策略,AlphaFold3与Rosetta的验证通过数大幅攀升,分子筛选通过率从0.47%跃升至1.56%,增幅高达233%,可交付的优质候选分子数提升超过3倍。同时,原本以天计算的人工经验迭代过程,被成功压缩为分钟级的智能诊断与精准重跑,极大提升了研发效率。

在材料科学领域,Intern-S2-Preview-397B同样展现了强大的决策支撑能力。以五元氧化物Sr₂Ho₁Cu₂Ru₁O₈为例,随着材料中元素种类的增加,晶体结构的组合可能性呈指数级爆炸式增长,对大模型的空间推理能力与晶体学知识内化程度都是极大的考验。

依托Intern-S2-Preview-397B,科研人员只需输入化合物的化学式,模型就能结合晶体学逻辑,自动匹配其所属的空间群(如P4/mmm对称性结构),并从晶格参数、晶胞体积到原子分数坐标进行系统化构建。这一过程同样不会替代最终的物理计算与实验验证,但其核心价值在于将研发初期最耗时、最容易出错的“结构探索”环节,转化为模型驱动的精准构建,不仅大幅缩短了研发的起点,更让后续的高阶科学研究能够站在一个更高、更准确的起点,真正实现从“经验试错”向“模型驱动”的研发模式转型。

基于Intern-S2-Preview-397B一贯领先的科学能力,研发团队打造了「书生·端砚」科学发现平台,将科学推理送入可验证的完整闭环。

「书生·端砚」面向真实科研全流程打造,承载完整科学发现的全流程推演、记录、验证与沉淀工作。它以书生科学大模型为智能中枢,以多智能体系统为执行引擎,系统性整合算力、数据、模型、智能体与实验平台,覆盖从“假设提出”到“实验验证”的完整科研流程。

基于Intern-S2-Preview-397B的核心底座,「书生·端砚」将能力向数学、物理、生命科学、材料科学、地球科学等多个核心科研领域纵深拓展。平台并不做泛化的通用问答,而是深度学习各学科的研究范式、实验规范与专业工具接口:生命科学领域可对接AlphaFold、BLAST、UniProt等专业工具;材料科学领域则打通Materials Project、RDKit、第一性原理计算等平台;地球科学领域则接入遥感、地质专业模型。

目前,「书生·端砚」已经在生命科学、关键材料、半导体、核聚变、量子、地球气象六大核心科研领域实现落地。其中在蛋白质、材料等前沿研究中,该平台已经完成了干湿实验闭环,实现了科学发现全流程的端到端验证。

科学知识的载体远不止文字,分子构型、晶体坐标、实验谱线与复杂公式图表中,蕴含了大量自然语言难以穷尽的关键信息。这也意味着,单纯依赖文字输入难以实现完整的智力涌现,无法从根本上解决科学智能的深层问题。针对这一挑战,研发团队提出了“视觉预训练反哺语言模型”的创新路径。

在传统的预训练流程中,复杂的PDF文献需要预先解析为纯文本,这一过程极易导致版面结构、图表逻辑与公式语义的严重损耗,模型接收的信息往往是“残缺”的。而Intern-S2-Preview-397B采用了视觉与语言深度互动的全新预训练范式,模型从一开始就直接“阅读”原始文献页面,在同一表征空间内联合学习符号语义与图像信息的对应关系,无需依赖中间的解析环节。

这种多模态联合建模方式完整保留了图文对应关系,为高度依赖空间与图像推理的科学任务奠定了坚实的认知基础。同时,视觉预训练还显著提升了语料的利用效率:数据显示,相同的科学文献经视觉编码生成的Token量,仅为解析后纯文本的1/4。这使得Intern-S2-Preview-397B能够以极高的信息密度学习复杂知识,在大幅降低训练开销的同时,习得更多对科学推理至关重要的隐性结构信息。

随着通用人工智能进入下一发展阶段,“科学智能不应只是人工智能的一个应用分支,而是检验智能能否理解复杂世界、提出可验证假设并在反馈中持续进化的终极试炼。”相关负责人表示。Intern-S2-Preview-397B的发布,正是对这一“终极试炼”的积极探索与回应。

作为人工智能的下一个前沿阵地,科学发现既是推理智能的终极试炼场,也是“通专融合”理念的验证舞台。大规模推理能力将赋能科学发现的加速迭代,而科学发现的实践也将反哺推理能力的持续进化,正式开启面向科学发现的智能体基座时代。

以上内容不代表本平台立场,仅供读者参考