马斯克官宣Grok 4.8:2.5万亿参数,本周完成训练,这意味着什么?

2026年9月14日,马斯克在X平台透露,马斯克官宣Grok 4.8是一款参数量达2.5万亿的大模型,采用xAI全新C++软件栈训练,本周完成训练后启动强化学习。这一数字较Grok 4.6的1.5万亿参数膨胀约67%,但参数越大是否意味着能力越强?本文从参数竞赛、软件栈迁移、迭代节奏与真实能力边界四个层面,做一次不留情面的拆解。

一、马斯克官宣Grok 4.8到底说了什么
先把事实和噪音分开。
马斯克的原话非常简短。他在X上表示,Grok 4.8是一款参数规模2.5万亿的模型,采用全新的C++软件栈训练,将于本周完成训练并启动强化学习。大约十二小时后,他补充说Grok 4.8“将比尚未发布的Grok 4.7带来明显改进”。
需要立刻划清一条边界:Grok 4.8当前的状态是“训练中”,不是“已发布”。xAI官方文档中仍然没有Grok 4.7的模型页面,Grok 4.8的模型ID、定价、上下文窗口、基准测试卡全部为零。Artificial Analysis追踪xAI已发布模型的列表中,最新条目仍停留在Grok 4.6。
换句话说,马斯克官宣Grok 4.8的信息量,大约等于一条推文。但这条推文之所以值得认真对待,是因为它透露的三件事——参数规模、软件栈选择、迭代节奏——每一项都指向xAI当前的真实状态。
1.1 一个被跳过的版本号
Grok 4.7原本计划9月12日发布,马斯克随后改口称需要再过几天。延期的原因并不体面:强化学习阶段的回复长度惩罚设置过重,导致模型倾向于过早放弃困难任务,也无法严谨地回查自己的工作。这是一个典型的RL训练管线故障,不是能力问题,是工程问题。
然后马斯克做了一件不常见的事:他跳过了对4.7延期的进一步解释,直接开始预告4.8。这种“向前看”的沟通策略在xAI的迭代历史中反复出现——用下一个版本的前景覆盖当前版本的尴尬。问题是,当4.7连模型页面都没有、4.8只有一条推文、4.9和5已经被预告的时候,开发者面对的是一个越来越长的“承诺清单”和越来越短的可验证交付记录。
二、2.5万亿参数的真实位置:一场没有终点的军备竞赛
2.1 参数规模的横向坐标
要理解2.5万亿参数的分量,需要把它放进当前前沿模型的参数坐标系中。
| 模型 | 参数规模 | 状态 | 关键特征 |
|---|---|---|---|
| Grok 4.6 | 约1.5万亿 | 已发布 | xAI当前可用的最新模型 |
| Grok 4.7 | 约2.1万亿(据传) | 未发布 | 延期,RL阶段修复中 |
| Grok 4.8 | 2.5万亿(马斯克口径) | 训练中 | 全新C++软件栈 |
| Kimi K3 | 2.78万亿 | 已发布 | 全球最大开源权重模型 |
| Qwen 3.8 | 2.4万亿 | 已发布 | 阿里旗舰,超节点适配 |
| DeepSeek V4 | 1.6万亿 | 已发布 | 国产开源代表 |
数据来源:Grok 4.6参数规模据OrcaRouter分析推算,Kimi K3、Qwen 3.8、DeepSeek V4参数来自公开报道。
这张表暴露了一个容易被忽略的事实:2.5万亿参数在2026年9月并不构成“绝对领先”。月之暗面的Kimi K3以2.78万亿参数成为全球最大开源权重模型,阿里的Qwen 3.8达到2.4万亿,两者都已发布并可下载权重。Grok 4.8的参数规模在已发布模型中排名第二,在“已官宣但未发布”模型中排名第一——这个“第一”的含金量取决于你对马斯克推文的信任程度。
2.2 参数扩张的边际收益问题
Grok 4.8的2.5万亿参数较Grok 4.6的约1.5万亿膨胀了67%,较Grok 4.7的约2.1万亿增长约19%。这个增速在“万亿俱乐部”中属于稳健而非激进——真正激进的预测来自国产算力阵营:壁仞科技AI框架架构副总裁丁云帆公开表示,按照当前趋势,2027年将出现5万亿参数级别的模型。
但参数规模与模型能力之间的关系,已经从“正相关”退化为“条件相关”。Scaling Law仍然在发挥作用,但它的边际收益正在递减,而且高度依赖于数据质量、训练策略和架构效率。一个2.5万亿参数的模型如果在数据配比、RLHF对齐或多模态融合上存在短板,完全可能被一个1.5万亿参数但训练得更精细的模型在特定任务上超越。
这不是理论推演。Grok 4.3在编程实战评测中虽然以“高性价比和出色的函数调用能力”吸引了开发者,但在复杂代码重构场景中“仍需人工复核”的评价,说明xAI的工程化能力与其参数规模之间存在落差。参数是xAI最擅长的叙事工具,但不一定是它最需要解决的问题。
三、C++软件栈:一个被低估的信号
马斯克官宣Grok 4.8时提到“全新C++软件栈”,这句话在中文报道中往往被一笔带过,但它可能是整条推文中最值得关注的技术信息。
当前主流大模型的训练栈几乎默认建立在Python生态之上——PyTorch或JAX做计算图,CUDA做底层加速,Python做胶水层。这套栈的优势是迭代快、生态成熟;劣势是Python的解释执行开销、GIL锁竞争、以及大规模分布式训练中的调度延迟。
转向C++软件栈意味着xAI在训练基础设施层面做了一个根本性的技术选择。C++在内存控制和执行效率上的优势,在数万卡规模的训练集群中可能转化为可观的吞吐量提升和成本下降。但它也意味着放弃了PyTorch生态中大量现成的优化工具和预训练组件,需要自建大量基础设施。
这个选择的风险在于:如果C++栈的性能收益不足以覆盖生态迁移的成本,xAI可能在一个错误的方向上投入了大量工程资源。但如果收益显著,它可能为xAI建立起一个短期难以被复制的工程壁垒——毕竟,OpenAI和Anthropic的训练栈深度绑定在Python/CUDA生态上,迁移成本极高。
一个值得追问的细节:马斯克说的是“软件栈”,不是“训练框架”。软件栈涵盖的范围更广——编译器、运行时、通信库、调度系统。如果xAI真的在训练栈的多个层面做了C++重写,这比单纯的“换框架”要激进得多。但到目前为止,没有任何xAI工程博客或技术论文对这套C++栈的架构细节做出说明。在缺乏技术文档的情况下,“全新C++软件栈”仍然是一个需要被验证的说法,而非一个已确认的事实。
四、迭代节奏的真相:承诺与交付之间的裂缝
4.1 三十六小时内的四个模型
马斯克在约三十六小时内连续提到了Grok 4.7、4.8、4.9和5四个版本。其中4.7已经延期且没有发布页面,4.8在训练中,4.9和5只有一句话的前景描述。
这种沟通节奏在xAI的发展史上并非首次。但它的累积效应值得警惕:每一次新的版本预告都会部分消解前一个版本的紧迫性,让开发者社区的注意力从“这个版本能做什么”转移到“下一个版本会做什么”。对于依赖Grok API构建产品的开发者来说,一个清晰的发布路线图比一连串的版本号更重要。
马斯克对Grok 4.7的评价也值得注意:他说4.7的水平“大致相当于Claude Opus 5.0,而不是5.1。它在某些方面更好,在另一些方面则更弱。我们需要改进多模态性能。”这是马斯克少见的对竞品保持克制评价的时刻——他承认了Grok 4.7不如Opus 5.1,也承认了多模态是短板。这种诚实反而比过度承诺更有信息量。
4.2 强化学习阶段的不确定性
Grok 4.8“本周完成训练”指的是预训练阶段结束,随后进入强化学习。这是一个关键的阶段转换,也是模型能力最终成型的阶段。
从Grok 4.7的延期原因可以推断,xAI在RL训练管线的调参上遇到了具体困难——回复长度惩罚过重导致模型过早放弃困难任务,且无法严谨自检。这是一个需要精细平衡的超参数问题:惩罚太轻,模型输出冗长啰嗦;惩罚太重,模型在遇到复杂问题时倾向于给出简短但不完整的答案。
Grok 4.8进入RL阶段后是否会重复4.7的问题,目前无法判断。但有一个结构性风险:如果RL管线的基础设施没有根本性改变,4.8在RL阶段遇到类似问题的概率并不低。xAI在三十六小时内从4.7跳到4.8的沟通策略,可能恰恰反映了团队在RL管线修复上遇到了比预期更长的调试周期。
五、Grok 4.8的真实能力边界:从可验证数据中推断
5.1 编程能力的已有证据
Grok 4.8没有基准测试数据,但Grok 4.3和4.5的编程评测提供了有价值的历史参照。
在终端环境编程能力评测Terminal-Bench 2.1中,Grok 4.5获得83.3分,超过Claude Opus 4.8的78.9分,接近GPT-5.5的83.4分。在软件工程问题解决评测SWE-bench Pro中,Grok 4.5获得64.7分,领先GPT-5.5的58.6分,但落后于Claude Opus 4.8的69.2分。
这组数据传递的信号是清晰的:xAI的模型在终端操作类编程任务上已经达到前沿水平,但在复杂软件工程任务上仍落后于Anthropic。如果Grok 4.8的参数增长和C++软件栈的效率提升能够转化为训练质量的改善,这个差距有可能缩小。但参数规模本身不解决SWE-bench Pro所测试的问题——代码库理解、模块关系推理、长程规划能力——这些更依赖于训练数据的质量和RL策略的精细度。
5.2 多模态的已知短板
马斯克自己承认Grok 4.7的多模态性能需要改进。这是一个重要的自我披露。在当前的前沿模型竞争中,多模态已经从一个“加分项”变成了“基础能力”——Claude和GPT系列在视觉理解、文档解析、图像推理方面的表现,直接决定了它们在企业和开发者场景中的可用性。
Grok 4.8的参数规模和软件栈变化是否针对多模态做了专门优化,目前没有任何信息。如果xAI的2.5万亿参数主要集中在文本能力的扩展上,而多模态架构没有实质性改进,那么Grok 4.8在综合能力对比中仍然会在多模态维度上处于劣势。
六、这对AI行业意味着什么
6.1 参数竞赛没有结束,但重心正在转移
2.5万亿参数不是终点。国产算力阵营对2027年5万亿参数模型的预测,以及Kimi K3已经达到的2.78万亿开源规模,都说明参数规模的增长曲线仍在延续。但“参数规模是唯一变量”的时代已经过去。
真正区分前沿模型的,正在从“有多大”转向“怎么训”。数据配方、RL策略、架构效率、推理成本——这些维度的竞争烈度在上升,而参数规模的宣传价值在下降。Grok 4.8的2.5万亿参数如果最终以更高的推理成本呈现给开发者,它的市场接受度将受到直接影响。Grok 4.3之所以能吸引开发者,恰恰是因为“高性价比和出色的函数调用能力”。
6.2 xAI的处境:速度与交付的张力
xAI的迭代速度在前沿实验室中是最快的之一,但快节奏也带来了一个结构性问题:承诺的密度超过了交付的密度。Grok 4.7延期、4.8在训练中、4.9和5被预告——这条时间线上,唯一可以下载和使用的模型仍然是Grok 4.6。
对于一个开发者生态来说,这种状态是可持续的,但前提是下一个交付确实值得等待。如果Grok 4.8的RL阶段顺利完成并在质量上兑现“明显改进”的承诺,当前的延期和跳票可以被理解为通往更高能力水平的必要代价。但如果4.8的RL阶段再次遇到管线问题,xAI的信誉损耗将开始产生累积效应。
关键数据速查
| 维度 | Grok 4.8 | 对比基准 |
|---|---|---|
| 参数规模 | 2.5万亿 | Grok 4.6:~1.5T;Kimi K3:2.78T |
| 软件栈 | 全新C++ | 主流:Python/PyTorch |
| 当前阶段 | 预训练完成→RL | 发布状态:未发布 |
| 编程能力参照 | 无直接数据 | Grok 4.5:Terminal-Bench 83.3 |
| 多模态 | 待改进(马斯克承认) | Claude/GPT系列领先 |
| 已知延期 | 4.7跳票,4.8接棒 | 4.7延期原因:RL惩罚参数 |
FAQ
Grok 4.8什么时候正式发布?
马斯克只说了“本周完成训练并启动强化学习”,没有给出发布日期。基于xAI过往的训练完成到发布之间的间隔,Grok 4.8的正式上线可能在训练完成后的数周内。但目前没有任何官方时间表。
2.5万亿参数意味着Grok 4.8会比GPT-5.5或Claude Opus 5更强吗?
参数规模不直接等于能力。Grok 4.5在Terminal-Bench上接近GPT-5.5,但在SWE-bench Pro上落后Claude Opus 4.8。Grok 4.8的能力取决于RL阶段的训练质量和多模态架构的改进程度,2.5万亿参数本身不能回答这个问题。
“全新C++软件栈”对用户有什么实际影响?
如果C++栈的训练效率提升显著,可能带来更快的模型迭代节奏和更低的推理成本。但如果xAI没有将效率收益传递给API定价,对开发者的直接影响有限。目前没有xAI的定价信息。
Grok 4.7还会发布吗?
目前状态不明确。马斯克已经跳过了对4.7的进一步讨论,转而预告4.8。xAI文档中没有4.7的模型页面,但也没有宣布取消。最可能的情况是4.7的RL管线问题修复后仍会发布,或者直接被4.8取代。
Grok 4.8与国产模型的参数差距在缩小吗?
在参数规模上,Grok 4.8的2.5万亿已经被Kimi K3的2.78万亿超越,与Qwen 3.8的2.4万亿处于同一量级。参数差距在缩小,但架构效率、训练数据质量和RL策略的差距是另一回事。

