Mistral发布万亿参数旗舰模型Le Chonk:欧洲AI的胖猫突围战

2026年10月6日,法国Mistral发布万亿参数旗舰模型Le Chonk(Mistral Large 4),总参数1.05万亿、激活49B,欧洲数据中心训练,主打代码、网安、法律与视觉定位。Mistral发布万亿参数旗舰模型Le Chonk引发全球关注,但它真正的价值不在参数,而在开源权重的战略意义。

一个猫咪梗如何催生了1万亿参数的巨兽
2026年6月,X和Reddit上开始疯传一个虚构的Mistral模型——“Le Chaton Fat”(法语意为"肥猫"),网友们给它编造了超过30万亿参数、每秒"喵"1000次的荒诞规格。Mistral CEO Arthur Mensch当时也在X上加入了玩梗。
谁也没想到,几个月后这个玩笑变成了一部分现实。2026年10月6日,Mistral正式发布Mistral Large 4(ML4),内部代号"Le Chonk"——网络俚语中形容圆滚滚胖猫的词。这个模型真的做到了1万亿参数规模。
但代号背后的选择,折射出Mistral更深层的意图。联合创始人Guillaume Lample在被问及ML4是否就是那个梗的兑现时,给出了一个意味深长的回答:ML4只是"那个想法的一个初步版本",更大的模型还在后面。这不仅是致敬社区,更是在告诉整个行业——Mistral的野心远不止于此。
1万亿参数里的稀疏哲学:MoE架构拆解
Mistral发布万亿参数旗舰模型Le Chonk最值得细看的技术细节,藏在参数比例中。ML4采用细粒度混合专家架构(MoE),总参数约1.05万亿,但每个token只激活约490亿参数,模型被拆成大量"专家",每处理一个词只唤醒其中一小部分。
这个架构选择决定了ML4的成本本质。总参数决定了模型能装下多少知识,激活参数决定了每生成一个token消耗多少算力。1T对49B的比例约为1比20,意味着模型虽然装了大量知识,但每次运算只走通二十分之一的网络。这正是MoE架构的精髓——用更大的参数容量换取更强的知识储备,用稀疏激活控制推理成本。
从代际对比看,上一代Mistral Large 3总参数6750亿、激活410亿,用3000张H200训练。ML4总参数跨过万亿门槛,激活参数增至490亿,训练GPU升级到约3800-4000张NVIDIA Grace Blackwell。额外配置的1.6B视觉编码器让ML4原生支持图文输入,输出仍为文本。
上下文窗口从上一代的25.6万token跃升到100万token,扩展约3.9倍。这意味着模型可以在单次请求中处理约1500页文本,对于需要通读合同、审计日志或长篇技术文档的场景,意义不言而喻。
训练规模:欧洲数据中心里的两个月
ML4从零开始在Mistral自己的欧洲数据中心完成训练,耗时约两个月,训练数据覆盖超过160种语言,包括所有欧盟官方语言。
横向对比美国头部实验室的算力储备,约4000张Blackwell GPU在绝对数量上并不突出。Mistral把这一点当作叙事素材——用相对有限的硬件规模,做出和美中顶级模型可比的性能。这个叙事的说服力如何,取决于最终独立评测的结果。
值得一提的是,ML4的强化学习阶段在发布时仍在进行中。Mistral明确表示,能力提升尚未见顶,权重放出前的分数还会变化。这解释了为什么目前的评测数据都带有"预览版"标签。
实测成绩单:哪些是真强,哪些是话术
Mistral发布万亿参数旗舰模型Le Chonk后,围绕性能的讨论迅速分化为两个阵营:官方自报数据和第三方独立评测之间的差距。
官方自报:多个领域的亮眼数字
Mistral公布的数据中,网络安全是最突出的亮点。在CyberGym-E2E测试中,ML4达到82%的通过率,在需要复现真实软件漏洞并修复的测试中,这一成绩位列全球前列。在Cybench安全竞赛题测试中,模型解决了93%的问题。在CTF Speedrun限时安全挑战中,ML4在40分钟内完成了19项任务中的18项,排名榜首。
代码能力方面,DeepSWE v1.1测试中ML4预览版达到62%,官方后续数据更新为61.7%。作为参照,GLM-5.3为61%,DeepSeek-V4-Pro为57%,Qwen 3.8 Max为51%。代码代理指数(Coding Agent Index)达到49.8%。
法律领域,在Harvey法律代理基准测试中,ML4任务通过率约15%,高于Kimi K3的13%和GPT-6 Astra的5%。Vals AI的独立评测将ML4评为法律代理基准上表现最好的开源权重模型。
视觉定位方面,DIOR-RSVG遥感图像测试中ML4达到73%,GPT-6 Astra为68%;Dense200测试中两者均为42%。Mistral声称在视觉定位上超过了闭源前沿模型。
金融任务方面,FinWorkBench企业财务流程测试中ML4达到67%,与DeepSeek-V4-Pro持平,远高于Mistral自家上一代Medium 3.5的37%。
第三方实测:38分的真实坐标
Artificial Analysis的Intelligence Index v4.3.2给出了最冷静的标尺。ML4预览版得分38,与OpenAI GPT-6 Luna持平,略低于DeepSeek V4.1 Flash的39分。
放到完整榜单上看,Claude Opus 5.5以58分领跑,Claude Fable 5.1、GPT-6 Astra和Gemini 4 Argon以53分并列第二梯队。中国开源模型中,小米MiMo-V2.6-Pro以46分位居开源榜首,智谱GLM-5.3为45分,Moonshot Kimi K3为44分。
Mistral Large 4在整体榜单上排名第18位,在开源模型中排第八。它确实碾压了欧美其他开源权重模型——NVIDIA Nemotron 3 Ultra仅23分,gpt-oss-120b仅12分——但与中国开源模型之间仍有明显差距。
多维度对比一览
| 维度 | Mistral Large 4 (Le Chonk) | DeepSeek V4.1 Flash | GLM-5.3 | Kimi K3 | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|---|---|---|
| 总参数量 | 1.05万亿 | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 |
| 激活参数 | 49B | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 |
| 上下文窗口 | 100万token | 未公开 | 未公开 | 未公开 | 未公开 | 未公开 |
| Intelligence Index | 38 | 39 | 45 | 44 | 53 | 58 |
| 开源权重 | 是(10月底) | 是 | 是 | 是 | 否 | 否 |
| 代码(DeepSWE) | 61.7% | 57% | 61% | — | — | — |
| 网络安全(Cyber Index) | 50分 | 低于ML4 | 与ML4相当 | 低于ML4 | — | — |
| 法律(Harvey) | 15% | — | — | 13% | 5% | — |
| 视觉定位(Dense200) | 42% | — | — | — | 41% | — |
| API输入价格($/百万token) | 0.68(促销) | — | — | — | — | — |
数据来源:
表格解读:ML4在开源可获取性上占据独特位置——它是欧美唯一可获取的万亿参数级开源权重模型。但在综合智能水平上,它与Claude Opus 5.5之间存在约20分的差距,与中国头部开源模型之间也有6-8分的距离。在网络安全和法律等专业垂直领域,ML4确实展现出了差异化优势。
安全、主权与企业:Le Chonk的真正战场
如果只看综合跑分,ML4的定位似乎是"开源第二梯队"。但Mistral发布万亿参数旗舰模型Le Chonk的战略重心,并不在通用能力排行榜上。
网安能力为何成为核心卖点
在ML4发布前夕,Mistral做了一件不寻常的事:与网络安全专家、审核合作伙伴和国家机构合作,以降低安全护栏、扩大网络能力的方式对模型进行真实环境红队测试。这意味着ML4不仅在基准测试中表现好,还被有意识地训练和调校为适合安全防御场景。
CNET的报道指出,ML4专为防御性网络安全任务设计,包括日志审查、代码审计和检查新发布的漏洞利用。联合创始人Guillaume Lample的表述更为直白:网络防御能力能让企业和政府去防住那些越狱闭源模型发动攻击的人。
数据主权与企业部署
ML4的全部训练在欧洲数据中心完成,这不仅仅是一个地理标签。对于受监管行业——金融、医疗、政府——而言,模型在哪个司法管辖区训练和运行,直接关系到数据合规。ML4计划在10月27日开放模型权重,企业可以将模型部署在自己的基础设施上,保留数据在自己的安全边界内,定义自己的安全策略,并通过微调适配自身业务需求。
数据分析和可视化公司Plotly在博文中评价称,Mistral"正在成为我们欧洲客户寻求开放、主权模型的绝佳选择"。
这种"主权AI"的定位不是营销话术。Mistral在9月完成了由三星电子领投的30亿欧元D轮融资,估值超过210亿欧元。资金的一部分显然流向了算力基础设施——约4000张Grace Blackwell GPU部署在欧洲数据中心,本身就是一个重资产的主权承诺。
开源权重的战略赌注
Mistral计划在10月27日发布ML4的开放权重。在万亿参数级别做开源权重发布,这件事本身值得认真对待。
目前市场上,万亿参数级模型要么是闭源的(Claude、GPT-6、Gemini),要么是中国实验室的开源模型(但欧美企业出于合规考量未必愿意采用)。ML4提供了一个独特选项:欧美企业可以获取一个万亿参数级别的开源权重模型,部署在自己的基础设施上,不依赖任何外部API。
代价同样明确。1T参数的MoE模型即便压缩后,对硬件的要求仍然很高。ML4当前促销价每百万token输入0.68美元、输出2.09美元,列表价分别为1.36美元和4.18美元。一旦权重开放,企业需要自行承担推理基础设施成本,这并非一笔小数目。
许可证条款是另一个未知数。Mistral尚未公布权重发布时的具体许可条款,仅表示将采用"定制Mistral许可证"。这对企业采用决策有实质性影响。
万亿参数竞赛的欧洲样本
Mistral发布万亿参数旗舰模型Le Chonk的深层意义,不在于它是否"打败"了某款中国模型或美国模型。放在更长的技术演进线上看,ML4代表了一种不同的竞争策略。
美国头部实验室的路径是堆算力、堆数据、闭源迭代,用最大规模的资源投入换取前沿能力。中国开源模型实验室的路径是在算力受限的条件下追求极致的工程效率,以较小的激活参数实现高智能密度。Mistral选择的第三条路是:用开源权重作为差异化武器,在欧洲主权和合规需求的框架下,建立一个可持续的企业级市场定位。
这条路能走多远,取决于几个变量。ML4强化学习完成后的最终性能提升幅度、权重许可条款对企业采用的实际友好程度、以及Mistral能否在1T级别模型的推理成本上找到有竞争力的部署方案。
从Mistral Large 3的9分到ML4的38分,一代之间的跃升幅度超过四倍,说明Mistral的工程能力在执行层面是扎实的。但38分与58分之间的差距,反映的是算力规模和训练数据积累上的结构性鸿沟,这不是靠架构优化能在短期内弥合的。
Le Chonk(胖猫)的名字或许暗示了Mistral对自身处境的清醒认知——它很大,但不假装自己是最快的。在欧洲AI的叙事里,它更像一只守住了自家地盘的猫:不出去争霸,但谁也别想轻易把它赶走。
常见问题
问:Mistral Large 4和Le Chonk是同一个模型吗?
是的。Le Chonk是Mistral Large 4的官方代号,源自网络俚语中形容圆胖猫咪的词。模型API标识为mistral-large-4。
问:Le Chonk有多少参数?
总参数约1.05万亿,每个token激活约490亿参数,另配1.6B视觉编码器。总参数与激活参数的比例约为20比1。
问:Le Chonk是开源模型吗?
目前在公开预览阶段,模型权重计划于2026年10月27日发布,届时将成为可下载的开源权重模型。但许可证条款尚未公布,将采用"定制Mistral许可证"。
问:Le Chonk和DeepSeek、GPT-6相比表现如何?
在Artificial Analysis Intelligence Index上,Le Chonk得38分,DeepSeek V4.1 Flash得39分,GPT-6 Astra得53分,Claude Opus 5.5得58分。在网络安全领域,Le Chonk的Cyber Index得50分,在开源模型中处于领先位置。
问:Le Chonk的API价格是多少?
当前促销价每百万token输入0.68美元、缓存输入0.07美元、输出2.09美元。列表价分别为1.36美元、0.14美元和4.18美元。促销结束日期未公布。
问:1M上下文窗口意味着什么?
相当于约1500页文本的处理能力。对于需要分析长篇法律合同、审计大量日志或阅读完整技术文档的场景,可以在单次请求中完成,无需分段处理。
问:Le Chonk支持中文吗?
支持。训练数据覆盖超过160种语言,包括所有欧盟官方语言。但Mistral未公布各语言的具体性能数据。

