文章摘要
本文系统解析OpenAI预训练超大模型从GPT-4.5到Bel的发展。介绍其技术演进脉络,如从GPT-1到GPT-4确立范式,GPT-4.5引发预训练极限争议,GPT-5系列架构革新等。分析核心技术,含MoE架构、原生多模态等。还探讨数据、算力、成本,对比模型参数,指出预训练未失效,且市场竞争多极化,安全框架重要性上升。

自2018年GPT-1问世以来,OpenAI的预训练超大模型始终站在自然语言处理技术的最前沿。从最初的1.17亿参数到如今超过10万亿参数的Bel模型,OpenAI预训练超大模型的规模扩张见证了深度学习 scaling law 从理论走向现实的全过程。本文系统梳理OpenAI预训练超大模型的技术演进脉络,涵盖GPT-4.5、GPT-5系列、GPT-6及Doug、Bel等最新预训练项目,深入解析MoE架构、原生多模态、Agentic能力等核心技术突破,并基于2026年最新披露的财务与研发信息,探讨预训练规模法则的边界与未来方向。

OpenAI预训练超大模型

一、OpenAI预训练超大模型的技术演进脉络

1.1 从GPT-1到GPT-4:预训练范式的确立

OpenAI预训练超大模型的根基可以追溯到2018年发布的GPT-1。这个参数量仅为1.17亿的模型首次验证了“生成式预训练 Transformer”路线的可行性。模型在BooksCorpus约5GB的数据上进行无监督预训练,随后在特定任务上微调。GPT-2将参数量提升至15亿,展示了零样本学习的能力。GPT-3则以1750亿参数震惊业界,首次让大规模预训练成为AI领域的核心范式。

GPT-4是OpenAI预训练超大模型发展史上的分水岭。虽然OpenAI从未公开GPT-4的确切参数量,但业界普遍估算其总参数约为1.8万亿,采用MoE(混合专家)架构。GPT-4的预训练数据量达到数万亿token,训练成本据估计在1-2亿美元量级。更重要的是,GPT-4验证了“更多数据+更多算力=更强能力”的 scaling law 在万亿参数规模依然有效。OpenAI首席研究员Mark Chen在2025年底的访谈中明确表示:“我们认为预训练还能挖出巨量空间。很多人说’Scaling已经死了’我们完全不同意。”

GPT-4o于2024年5月发布,是GPT-4系列中首个原生多模态模型。然而此后近两年间,OpenAI预训练超大模型的迭代节奏发生了显著变化——公司更多地依赖后训练(post-training)、强化学习(RL)和推理时计算(inference-time compute)来推动能力增长,而非进行全规模的基础模型预训练换代。这一策略转变在2025-2026年引发了广泛讨论。

1.2 GPT-4.5“Orion”:迄今最大规模的预训练尝试

2025年2月27日,OpenAI正式发布GPT-4.5,内部代号“Orion”。这一模型是OpenAI预训练超大模型家族中规模最为庞大的成员之一。据公开信息,GPT-4.5是一个采用MoE架构的模型,拥有约1万亿激活参数,在高达120T tokens的数据上完成了预训练。其训练所消耗的计算能力和数据量超过了OpenAI此前所有发布版本的总和。

GPT-4.5的训练投入极为惊人。据估计,该模型的训练使用了3万到5万颗NVIDIA H100 GPU,总投资在7.5亿到15亿美元之间。OpenAI在2025年的研发支出高达191.8亿美元,其中向微软支付的模型训练相关费用就达105.9亿美元,GPT-4.5无疑是这笔巨额开支的重要组成部分。

然而GPT-4.5也引发了一个核心争议:大规模预训练是否已经触及能力天花板?有分析指出,Orion可能是“大规模预训练已触及极限”的首个实证。GPT-4到GPT-4.5的性能提升约为10倍,但这一提升的“性价比”是否仍符合 scaling law 的预期,业界存在不同看法。OpenAI内部人员描述GPT-4.5带来了“难以量化但全方位增强的智能”,但这也暗示传统的benchmark指标可能已无法充分衡量预训练超大模型的真实进步。

值得注意的是,GPT-4.5是OpenAI最后一个“非推理模型”。此后,OpenAI预训练超大模型的发展方向发生了根本性转变——从纯粹的“生成式预训练”走向“预训练+强化学习”的双轮驱动。

二、GPT-5系列:预训练超大模型的架构革命

2.1 GPT-5的发布与统一架构

2025年8月7日,OpenAI正式发布GPT-5。这标志着OpenAI预训练超大模型进入了一个全新的发展阶段。GPT-5不再是单一模型,而是一个从Nano到Ultra的完整模型家族。这一设计理念的核心在于:用同一套预训练基础模型,通过不同的推理配置和激活策略,覆盖从毫秒级响应到深度推理的全场景需求。

GPT-5的预训练基础模型在Microsoft Azure AI超级计算机上完成训练。虽然确切参数量仍是商业秘密,但行业分析师估计总权重在数万亿量级,每次查询激活的参数在2万亿到5万亿之间。OpenAI通过MoE架构实现了推理时的动态计算——每次推理只激活约8%至15%的专家模块。这意味着一个1万亿参数的预训练超大模型,实际推理算力需求仅相当于约1500亿参数的稠密模型。

GPT-5的技术报告中披露了多项关键创新。模型采用层级化路由机制(hierarchical routing)来动态分配计算资源。上下文窗口扩展至40万token,推理速度比GPT-4o平均快1.8倍。在GPQA(研究生水平问答)基准上,GPT-5得分超过88%,超越了普通人类博士在复杂科学问题上的表现。幻觉率相比前代模型大幅下降。

2.2 GPT-5.2至GPT-5.6:快速迭代的预训练优化

从2025年底到2026年上半年,OpenAI预训练超大模型的迭代速度达到了前所未有的频率。2026年1月发布GPT-5.2;2月发布GPT-5.3 Codex;3月5日发布GPT-5.4。每一版都在前代基础上进行单维度增强——推理能力更好、编程能力更强、工具调用更稳定。

GPT-5.4在API中将上下文窗口扩展至100万token。这意味着模型可以一次性处理《三体》三部曲级别的长文本、完整代码仓库或整份企业合同。GPT-5.4的事实错误率比上一代减少了33%。GPT-5.5则进一步将上下文窗口提升至200万token,并配合改进的稀疏注意力机制(Sparse Attention + Streaming LM),显著优化了超长文本的推理效率和显存占用。

2026年7月,有爆料称GPT-5.6将成为GPT-5.x系列的最后一个模型。OpenAI预训练超大模型的焦点正在向下一代架构转移。

2.3 GPT-5.5“Spud”:完全重预训练的里程碑

2026年4月24日,OpenAI发布GPT-5.5,内部代号“Spud”。这一模型的意义远超普通的小数点版本更新——它是自GPT-4.5以来首个完全重训练的基础模型。

GPT-5.5“Spud”的预训练底座参数量约为4万亿。OpenAI总裁Greg Brockman在内部演讲中描述Spud时用了这样的词:“两年的研究量在这个模型里面。它不是小迭代——它有大模型的感觉。”Sam Altman本人则称其为“能真正加速经济的强模型”。

GPT-5.5“Spud”的预训练投入约为2亿美元级别。模型引入了新数据、重做了架构决策,并从底层融入了面向智能体(Agent)的训练目标。在技术特性上,GPT-5.5实现了原生多模态——文本、图像、音频、视频统一在同一个模型里;具备更强的自主任务执行能力;并且更少依赖提示词工程——用户不再需要写复杂的system prompt,模型自己能理解上下文意图。

GPT-5.5在Terminal-Bench基准上达到82.7%,展现了在真实世界任务执行中的显著进步。GPT-5.5的发布也伴随着一个重要决定:OpenAI正式停用GPT-4.5和DALL-E系列,标志着OpenAI预训练超大模型的代际切换正式完成。

三、预训练的重启:从Doug到Bel

3.1 近两年的预训练“空窗期”

理解OpenAI预训练超大模型的最新动向,必须回溯2024年5月到2026年中期这段特殊的“预训练空窗期”。2024年5月13日,OpenAI发布GPT-4o。此后接近两年的时间里,OpenAI虽然训练并发布了GPT-4.5等新模型,却始终没有完成一轮能够被广泛部署为下一代主力前沿模型的全规模预训练。

与此同时,OpenAI的模型能力增长越来越多地来自另一条路线。2024年9月,o1-preview发布。相比依靠更大规模预训练推动能力增长的传统路径,o系列模型展示了另一种 scaling 方法——通过大规模强化学习让模型学会投入更多计算进行推理。2025年4月,o3正式发布。2025年8月,GPT-5发布,但SemiAnalysis认为GPT-5系列实际上仍建立在GPT-4o时代的基础模型体系之上,并没有伴随一次与GPT-4o相当的全新基础模型世代跃迁。

这一策略在2025年底遭遇了严峻挑战。2025年11月18日,Google发布Gemini 3。十天后,SemiAnalysis抛出了一个引发广泛讨论的判断:自GPT-4o以来,OpenAI没有完成一轮能够被广泛部署为新前沿模型的成功全规模预训练。当Google推出Gemini 3后,这种差异从训练路线问题变成了直接的竞争压力。OpenAI首席研究员Mark Chen在回应这一质疑时强调:“也正是这些努力的结果,我们最近训练出的模型强了很多,这也让我们在面对Gemini 3和今年底的其他发布时,非常有信心。”

3.2 Doug:史上最大规模预训练项目的启动

2026年8月,长期关注OpenAI模型动向的消息源爆料称,OpenAI正在推进代号为“Doug”的新一轮大型预训练模型。Doug被描述为OpenAI迄今规模最大的一次预训练项目,规模约10万亿参数。

Doug的命名本身就是一个重要信号——它致敬的是OpenAI联合创始人Greg Brockman(本名Douglas)。用创始人的名字为史上最大预训练项目命名,传递了OpenAI重新押注基础模型路线的战略决心。SemiAnalysis在8月7日发布的研究备忘录中佐证了这一判断:“OpenAI已克服预训练方面的问题,一个代号Doug、规模大得多的模型正在积极推进。”

Doug预计最迟在2026年11月前推出。其训练将使用英伟达下一代Vera Rubin芯片。Vera Rubin NVL72是英伟达GTC 2026发布的六芯片机架系统——Rubin GPU采用台积电3纳米制程,训练算力较Grace Blackwell提升3.5倍、推理算力提升5倍,NVLink 6互联带宽达260TB/s,推理token成本降低10倍,训练MoE模型所需GPU数量减少75%。OpenAI已被确认为Vera Rubin平台的首批大型用户之一。Vera CPU被英伟达定位为“为智能体而生”的处理器,专门强化学习与智能体工作负载——这与Doug“把预训练、后训练与智能体能力放进同一套芯片架构里重新打磨”的定位高度契合。

Doug的规模体量令人震撼。作为参照,2026年WAIC上亮相的月之暗面Kimi K3为2.8万亿参数——Doug的规模是其3倍以上。这也是自GPT-4时代以来,OpenAI首次把预训练规模推向新的数量级。

3.3 Bel:Doug的继任者与AGI阈值模型

就在Doug消息曝光后不到三周,2026年8月26日,消息源披露OpenAI已完成下一代预训练模型“Bel”。Bel是Doug的直接继任模型,总参数量超过10万亿,规模与GPT-4.5相近。

Bel的完成标志着OpenAI预训练超大模型进入了又一个新阶段。OpenAI希望Bel在经过进一步强化学习后,成为Astra及GPT-6的基础模型。更重要的是,OpenAI期望Bel能成为GPT-6之后的基础模型,甚至有潜力成为通用人工智能阈值模型的基础。

这一消息让竞争对手Anthropic感到担忧。OpenAI方面认为Anthropic目前尚无足以应对Astra公开发布的有效方案,主要原因在于算力受限。Anthropic预计今年剩余的大部分时间都将处于OpenAI的领先地位,但相信2027年初有望重新取得领先。

从Spud(4T)到Doug(10T)再到Bel(10T+),OpenAI预训练超大模型的参数规模在短短数月内完成了从万亿级到十万亿级的跨越。这一速度令人瞩目,也反映了当前头部AI企业之间预训练规模竞赛的白热化程度。

四、核心技术架构深度解析

4.1 MoE架构与稀疏激活

MoE(Mixture of Experts,专家混合)是OpenAI预训练超大模型最核心的架构创新之一。其基本思想是:将模型拆分为多个“专家”子网络,每个输入只激活其中一小部分专家进行计算。

这一架构的价值在于突破了稠密模型的算力瓶颈。一个1万亿参数的OpenAI预训练超大模型,如果采用稠密架构,每次推理需要计算全部1万亿参数,算力成本极为高昂。而通过MoE架构,每次推理只激活约8%至15%的专家模块,实际算力需求仅相当于1500亿参数的稠密模型。这使得万亿参数级别的OpenAI预训练超大模型在推理阶段具备了商业可行性。

MoE架构也带来了训练效率的提升。Vera Rubin芯片训练MoE模型所需的GPU数量比训练同等规模稠密模型减少75%。这意味着在相同算力预算下,MoE架构可以支撑更大规模的预训练。

4.2 原生多模态融合

GPT-5之前的OpenAI预训练超大模型在多模态能力上采用的是“拼接方案”——独立的视觉编码器加上语言模型。这种方案虽然可行,但存在跨模态信息传递的瓶颈。

GPT-5及后续的OpenAI预训练超大模型放弃了这一方案,转向统一的Transformer架构。文本、图像、音频、视频共享同一个token空间和注意力层。这一“原生多模态”设计带来的实际提升包括:图像理解速度提升约3倍(无需单独的视觉编码器推理),跨模态推理更加准确(文本和图像在注意力层直接交互)。

GPT-5 Preview于2026年6月6日发布时,原生多模态架构已从底层打通了文本、图像、音频的理解与生成。这意味着OpenAI预训练超大模型不再需要外挂视觉或音频模块,所有模态的理解和生成都在同一个预训练框架内完成。

4.3 从“问答”到“执行”:Agentic架构的跃迁

如果说GPT-4时代的OpenAI预训练超大模型是“问答模式”——用户提问,模型回答,一个回合结束;那么GPT-5.5开启的则是“执行模式”——用户给目标,模型自主拆解任务、调用工具、循环反馈,直到达成目标。

这一转变的本质是:GPT-4的能力上限等于模型本身的智能水平;而GPT-5.5的能力上限等于模型智能乘以工具生态的广度。OpenAI预训练超大模型不再只是一个“更聪明的工具”,而是一个“可以指挥工具干活的数字员工”。

GPT-5.5的智能体架构分为三层:

第一层:规划层(Planner) 。模型自身对任务进行分解,将复杂目标拆解为可执行的子任务序列。这依赖于GPT-5系列新增的Chain-of-Thought+(增强思维链)能力,支持更长步数的内省推理。

第二层:执行层(Executor) 。每个子任务调用对应的工具(浏览器、代码解释器、文件系统、API)。GPT-5.5支持原生Tool Use,响应格式内置function_call语义,不再需要复杂的提示词工程。

第三层:反馈层(Reflector) 。执行结果反馈给模型,模型判断是否需要重新规划或调整策略。这一层是GPT-5.5与早期智能体系统的本质区别——它不是线性执行,而是真正的感知-决策-执行循环。

4.4 稀疏注意力与超长上下文

上下文窗口是衡量OpenAI预训练超大模型能力的重要维度。从GPT-4的8K-32K token,到GPT-5的40万token,再到GPT-5.4和GPT-5.5的100万token,上下文窗口在短短两年内扩大了数十倍。

支撑这一扩张的关键技术是稀疏注意力机制。GPT-5.5配合改进的稀疏注意力(Sparse Attention + Streaming LM),在200万token的超长文本场景下,推理效率和显存占用均得到显著优化。100万token的上下文窗口意味着OpenAI预训练超大模型可以一次性处理整个代码仓库、整部《三体》三部曲级别的长文本、或完整的企业年度合同。

这一能力对B端应用场景具有深远影响——全量合同审查、完整代码仓库理解、多模态内容生产等任务从“理论可行”变成了“开箱即用”。

五、预训练数据、算力与成本

5.1 数据规模的指数级增长

OpenAI预训练超大模型对数据的需求量呈现出指数级增长趋势。GPT-1的训练数据约为5GB。GPT-3使用了约570GB的文本数据。GPT-4的训练数据达到数万亿token。GPT-4.5在120T tokens数据上完成预训练。GPT-5的预训练数据量据估计超过70PB,过滤后约70万亿token。

有分析指出,当前顶级OpenAI预训练超大模型的预训练数据量,约是从纯训练效率角度出发所需数据量的100倍。这意味着OpenAI在预训练阶段采用了大幅度的“过度训练”策略——用远超理论最优解的数据量来换取模型能力的提升。这一策略的有效性本身也印证了预训练规模法则的持续有效性。

5.2 算力投入与财务现实

OpenAI预训练超大模型的训练算力需求同样惊人。GPT-4.5据估计使用了3万到5万颗H100 GPU。GPT-5的训练跨越了超过30万个GPU节点,每秒产生数十亿次GPU间的数据交换。

OpenAI 2025年的财务数据揭示了预训练超大模型的真实成本。公司2025年研发支出高达191.8亿美元。其中向微软支付的模型训练相关费用达105.9亿美元。2025年全年OpenAI净亏损约390亿美元。这些数字表明,开发OpenAI预训练超大模型是一项资本密集度极高的长期投入,其商业回报需要在更长时间尺度上评估。

六、模型家族横向对比

以下是OpenAI预训练超大模型主要成员的关键参数横向对比:

模型 发布时间 参数量(总/激活) 上下文窗口 核心特性 预训练特点
GPT-4 2023年3月 ~1.8T / ~? 8K-32K 首次万亿参数MoE 数万亿token预训练
GPT-4o 2024年5月 ~? 128K 原生多模态雏形 基于GPT-4架构
GPT-4.5 Orion 2025年2月 >10T / ~1T 128K 最大规模预训练 120T tokens
GPT-5 2025年8月 数万亿 / 2-5T 400K 统一路由架构 70PB+数据
GPT-5.4 2026年3月 数万亿 1M 长文本优化 基于GPT-5架构
GPT-5.5 Spud 2026年4月 ~4T 1-2M 原生Agent架构 完全重预训练
Doug 预计2026年11月 ~10T 待公布 史上最大预训练 Vera Rubin芯片训练
Bel 2026年8月完成预训练 >10T 待公布 AGI阈值潜力 Doug继任者

这一对比清晰展示了OpenAI预训练超大模型在参数量、上下文窗口和架构复杂度上的持续演进轨迹。

七、预训练规模法则的再审视

7.1 预训练并未“死亡”

2024年至2025年间,AI业界关于“预训练规模法则是否已死”的争论持续升温。GPT-4.5的发布以及随后OpenAI近两年未进行全规模预训练换代的事实,似乎为“预训练已触及天花板”的观点提供了论据。

然而Doug和Bel的相继曝光彻底改变了这一叙事。OpenAI不仅没有放弃预训练,反而启动了公司历史上规模最大的预训练项目。从Spud(4T)到Doug(10T)再到Bel(10T+),OpenAI预训练超大模型的参数规模在短短数月内完成了跨越式增长。

OpenAI首席研究员Mark Chen的表态具有代表性:“我们认为预训练还能挖出巨量空间。”这一判断与Doug和Bel的实践相互印证——预训练规模法则并未失效,只是进入了一个由新一代芯片架构(如Vera Rubin)和全新训练方法论托底的新阶段。

7.2 预训练、强化学习与推理时计算的三维协同

一个更为 nuanced 的共识正在形成:OpenAI预训练超大模型的 scaling 已从单一维度的“预训练规模扩张”演变为“预训练+强化学习+推理时计算”的三维协同。

今天的OpenAI预训练超大模型可以被理解为预训练和强化学习的结合——先进行大规模预训练获取基础能力,然后在其之上进行强化学习来优化推理行为,二者缺一不可。这正是OpenAI自2019年起的研究计划核心。

o系列推理模型的出现以及GPT-5将快速模型与深度推理模型统一在同一路由系统下的设计,都体现了这一三维协同的工程化落地。预训练提供了知识的广度与深度,强化学习优化了推理的策略与效率,推理时计算则根据任务复杂度动态分配资源——三者共同构成了OpenAI预训练超大模型的完整能力图谱。

八、竞争格局与未来展望

8.1 多极化的预训练竞赛

2026年的AI预训练大模型市场已从OpenAI的“单极格局”演变为多极竞争。Anthropic的Claude 5在2026年6月发布,MMLU-Pro基准达到98.3%。Google的Gemini 3.0选择了一条与GPT-5截然不同的路线——不堆参数,而是解决可用性和隐私,80%的推理计算可在端侧完成。DeepSeek正在为V4版本的正式发布做准备。百度文心一言5.0采用1.2万亿参数MoE架构。

在这一格局下,OpenAI预训练超大模型的“先发优势”正在被压缩。2026年上半年OpenAI按月发布新模型的节奏,本质上是对竞争压力的直接回应。Sam Altman的一贯逻辑是先发布再快速迭代,比等到完美再发更有利——这一策略在Doug和Bel的推进中预计将继续延续。

8.2 安全框架成为研发上游闸门

2026年8月的一个重要事件是Astra模型因安全问题被紧急暂缓发布。这标志着安全框架第一次真正成为OpenAI预训练超大模型发布的研发上游闸门。Astra因网络安全与智能体编程能力逼近“严重”风险阈值而停摆。

这一事件揭示了OpenAI预训练超大模型发展中的新张力:能力越强,潜在风险越大;安全评估不再只是发布前的“最后一道检查”,而是可能直接决定一个模型能否进入发布流程。GPT-5的系统卡中已明确将gpt-5-thinking在生物和化学领域归类为“高能力”,并激活了相应的安全措施。随着Doug和Bel等更大规模OpenAI预训练超大模型的到来,安全框架的重要性还将持续上升。

8.3 通往AGI的预训练路径

Bel被描述为“有潜力成为通用人工智能阈值模型的基础模型”。这是OpenAI首次在公开爆料中将具体模型与AGI阈值直接关联。

从技术路径来看,Bel的预训练完成意味着OpenAI正在走一条“更大规模预训练+更强强化学习”的AGI路线。这一路线的基本逻辑是:预训练提供世界知识的广度和深度,强化学习提供推理和决策的能力,两者的规模同时扩大,最终在某个临界点实现质的飞跃。Bel的超过10万亿参数规模和“后GPT-6时代乃至接近AGI门槛模型的底座”的定位,使这一技术路线的前景更加清晰。

当然,从预训练超大模型到真正的AGI之间仍有巨大的鸿沟。推理效率、能源消耗、安全性、可解释性等问题都远未解决。但Bel的出现至少表明,OpenAI预训练超大模型的规模扩张尚未到达终点,预训练作为通向AGI的核心路径之一仍在持续演进。


常见问题解答

问:OpenAI预训练超大模型的总参数量到底有多大?

GPT-4的总参数估计约1.8万亿。GPT-4.5超过10万亿总参数。GPT-5的总权重在数万亿量级,每次查询激活2万亿到5万亿参数。GPT-5.5“Spud”的底座参数量约4万亿。最新的Doug和Bel模型均超过10万亿参数。需要注意的是,由于MoE架构的存在,“总参数”和“激活参数”是两个不同的概念。

问:GPT-5和GPT-5.5的主要区别是什么?

GPT-5(2025年8月发布)是统一路由架构的旗舰模型,将快速响应和深度推理统一在同一系统中。GPT-5.5“Spud”(2026年4月发布)是自GPT-4.5以来首个完全重训练的基础模型,引入了原生多模态、原生Agent架构和200万token上下文窗口。GPT-5.5代表了OpenAI预训练超大模型从“问答”到“执行”的能力跃迁。

问:Doug和Bel是什么关系?

Bel是Doug的直接继任模型。Doug于2026年8月初被曝光,是OpenAI迄今规模最大的预训练项目,约10万亿参数,预计2026年11月前推出。Bel于2026年8月26日被披露已完成预训练,总参数量超过10万亿,预计将成为Astra及GPT-6的基础模型。

问:OpenAI预训练超大模型的训练成本有多高?

GPT-4.5的训练估计花费7.5亿到15亿美元。GPT-5.5“Spud”的预训练投入约2亿美元。整体来看,OpenAI 2025年的研发支出达191.8亿美元,其中向微软支付的模型训练相关费用为105.9亿美元。开发前沿OpenAI预训练超大模型是一项资本密集度极高的长期投入。

问:预训练规模法则真的失效了吗?

没有。虽然2024年至2025年间业界有“Scaling Law已死”的讨论,但Doug和Bel的曝光证明OpenAI仍在持续扩大预训练规模。OpenAI首席研究员明确表示“预训练还能挖出巨量空间”。当前的共识是:预训练的scaling已从单一维度扩张演变为“预训练+强化学习+推理时计算”的三维协同。

问:原生多模态是什么意思?

原生多模态指OpenAI预训练超大模型在预训练阶段就将文本、图像、音频、视频统一在同一个Transformer架构中训练。这与GPT-4时代“独立的视觉编码器+语言模型”的拼接方案不同。原生多模态消除了跨模态信息传递的瓶颈,使图像理解速度提升约3倍,跨模态推理更加准确。

问:什么是MoE(混合专家)架构?

MoE是将OpenAI预训练超大模型拆分为多个“专家”子网络,每个输入只激活一小部分专家进行计算的架构。这使得1万亿参数的模型实际推理算力需求仅相当于1500亿参数的稠密模型。MoE是在保持超大参数规模的同时控制推理成本的关键技术。

以上内容不代表本平台立场,仅供读者参考