GPT-6拒答考题 万亿开源AI拿下82%高分

欧洲AI领域迎来重磅新作,法国AI独角兽Mistral正式推出全新旗舰模型Mistral Large 4,这款总参数量达万亿的大模型即将在月底开放全部权重,正式加入开源AI阵营。
碾压闭源旗舰的网安实力
在第三方智能评测机构的评分体系中,这款模型拿下38分,追平了GPT-6 Luna的成绩,位列欧美开源模型榜首,第二名的同类竞品仅拿到25分。根据评测机构的评价,在中美之外的全球AI模型阵营中,Mistral Large 4是目前表现最亮眼的一款。
更值得关注的是,在多项硬核测试中,这款模型的表现甚至超过了GPT-6和Claude这类闭源旗舰。在法律Agent测试中,它的得分是GPT-6 Astra的近三倍;金融任务和视觉定位测试中,它同样击败了GPT-6 Astra;科学编程任务上,则超越了Claude Opus 5。尤其是在一道漏洞修复的网安考题中,它拿到了82%的全场最高分,而Claude Opus 5.5和GPT-6 Astra直接选择拒答,几乎交了白卷。
作为安全从业者的核心工具,漏洞复现是漏洞修复的关键前提——只有成功复现攻击路径,才能准确定位漏洞并验证修复效果。但不少闭源模型会一刀切地拒绝相关请求,反而让安全团队陷入被动。Mistral Large 4则完全没有这类限制,在全球网安指数评测中,它成功完成了50次漏洞复现任务,位列全球前五;而GPT-6 Astra仅完成33次,却有38次被自身安全机制拦截,Claude Opus 5.5完成29次,拦截次数更是达到36次,闭源巨头的拒答策略反而束缚了安全工作的开展。
在收录40道安全竞赛真题的Cybench测试中,Mistral Large 4解出了93%的题目;在Mistral内部的19道网安挑战题中,它答对了16道。更令人惊喜的是,在未经过专门训练的情况下,它还能独立完成恶意软件分析、漏洞优先级排序、检测规则编写等任务。比如在拿到未标注的恶意加载程序后,它自主完成了反编译、定位命名管道、追踪加密载荷、破解XOR加密的全流程操作。同时,面对越狱攻击和恶意Agent任务,它的拒绝率比所有开源模型都要高,在公开的AI安全基准测试中,它挡住了93.3%的攻击,是目前已知的最高分。
全赛道的全能表现
除了网安领域的出色表现,Mistral Large 4在代码编写、办公自动化、视觉理解等多个赛道都交出了亮眼的答卷。
在编程能力方面,它在DeepSWE v1.1中拿到61.7%的得分,SWE-Atlas-QnA为59.4%,Terminal-Bench 4为28.3%,综合编程Agent指数达到49.8%,超越了两款顶级开源模型。在收录657个真实业务流程的AutomationBench测试中,它拿到59.9%的得分,该测试要求模型在Gmail、Google表格、Slack、Salesforce等平台间无缝切换完成工作。在AA-Briefcase测试中,它的Elo评分达到1393,该测试专注于表格制作、PPT修改、PDF生成等长线知识工作。第三方评测机构用真实的法律和金融任务测试后发现,Mistral Large 4的表现超过了GPT-6 Astra,在法律AI公司的法律Agent基准测试中,它同样碾压了所有开源模型。
在视觉理解领域,这款模型同样表现出色。在十亿像素级的卫星影像中,它可以精准定位目标,帮助救灾团队快速获取信息;面对工程装配图,它可以放大细节、核对零件,给出准确结论。比如在一张真空翻转夹爪的装配图中,当被问及压缩弹簧是否会碰到滑动轴承时,它准确找到了两个零件,并指出中间隔着3号真空销,因此不会发生碰撞。在视觉定位测试Dense 200中,它拿到42%的得分,略高于GPT-6 Astra的41.5%;在科学编程测试SciCode-Verified中,它以91.8%的得分成为欧美开源模型中的最高分,甚至超过了Claude Opus 5的91.3%。在实际科研场景中,它可以一次性写出完整的Hartree-Fock模拟代码,完成量子化学中分子电子结构计算的复杂流程。
万亿参数的轻量化设计
Mistral为这款万亿参数模型起了官方代号,意为“大胖猫”,该公司高管还在社交平台呼应了这个趣味称呼。这款模型采用混合专家架构,每生成一个token只会激活其中490亿参数,因此兼顾了参数量和运行速度,做到“胖而不慢”。它集成了指令遵循、逻辑推理和Agent能力,支持160多种语言,覆盖欧盟所有官方语言。
Mistral在欧洲本地机房使用3800块英伟达Grace Blackwell芯片从零开始训练这款模型,目前开放的预览版同样运行在这批硬件上。后续的训练采用了大规模强化学习方案:一套自动扩缩的集群同时运行数万次尝试,单条任务轨迹会消耗数百万token,模型从每一次尝试的结果中自主学习。按照当前的训练规模,每天可以产出330亿token的训练数据,经过过滤后剩余约160亿token用于模型迭代。目前在客服Agent、跨应用业务流程、Excel表格编辑、事实问答四类任务中,训练奖励仍在持续上升,该公司表示,在接下来的几周和几个月里,这款模型还会有大幅的性能提升。
目前,Mistral Large 4的预览版API已经在官方平台上线,定价为每百万输入token 1.36美元,每百万输出token 4.18美元,完整的模型权重将在月底开放,企业可以将其部署在私有云或者本地机房中,自主掌握模型的控制权。
将AI决策权交还给用户
随着AI向通用人工智能方向发展,模型能够完成的任务越来越多,“谁来决定模型可以做什么”成为了关键问题。过去两年,这个决策权一直掌握在少数闭源厂商手中,当GPT-6和Claude宣布拒答漏洞复现相关请求时,依赖这些模型的安全工程师只能被迫停止工作。而Mistral Large 4将这款可以比肩闭源旗舰的万亿参数模型,连同完整的控制权交还给了用户。
当模型权重掌握在自己手中时,企业和开发者可以自主决定模型的部署位置和使用场景,不会在关键时刻被厂商切断服务。值得注意的是,这还只是未完成训练的预览版,Mistral手握30亿欧元的D轮融资,这是欧洲科技公司史上规模最大的股权融资之一,这笔资金将用于扩建欧洲本地机房的算力,而Mistral Large 4只是该公司技术路线上的第一个重要节点。

