美法开放模型密集发布 紧追中国头部梯队

近期全球开放大模型赛道迎来新的竞争节点,美欧两大厂商接连推出重量级开放权重模型,试图追赶此前占据领先位置的中国开放模型阵营。
据行业统计平台数据,过去一年里,中国开源大模型在全球开源社区的下载量占比达到41%,月度下载量和累计下载量均超越美国。包括多家厂商的模型持续刷新开放模型的能力上限,成为全球开源开发者的重要参考对象。同时,开放模型的应用场景也在快速拓展,根据推理平台的生产流量数据,今年8月开放权重模型已经承接了平台56%的Token处理量,而去年12月这一比例还不足10%,这也让全球开放模型的竞争成为必然趋势。
美国创业公司推出首款开放模型
被外界关注的美国创业公司Reflection,于当地时间10月5日发布了首款开放权重模型Beam。该公司成立于2024年,两名核心创始人均来自Google DeepMind:首席执行官Misha Laskin曾负责Gemini的奖励建模工作,首席技术官Ioannis Antonoglou参与过AlphaGo、AlphaZero项目,之后主导了Gemini的人类反馈强化学习团队。
Reflection最初的研发方向并非对标特定厂商,公司早期聚焦自主编程领域,希望通过强化学习打造能够自主完成复杂工作的超级智能系统,当时团队判断西方市场会持续涌现足够强的开放模型,因此可以基于现有模型开展后续研发。直到中国相关模型快速迭代让西方迟迟没有同级别替代品出现,这一情况推动Reflection调整路线,决定自主训练前沿开放模型,目标是将西方开放模型的技术前沿重新带回全球视野中。
Beam属于混合专家模型,总参数量达到5010亿,每个Token仅激活230亿参数,主要面向编程、推理和智能体工作负载设计。模型基于23.8万亿Token进行预训练,研发团队动用了1.05万张Nvidia GB300显卡,连续进行4周高算力强化学习,生成超过1亿次rollout数据。目前该模型仍处于最终红队测试阶段,Reflection计划在10月公开模型权重、技术报告和开发工具包。
从Reflection公布的测试结果来看,Beam的核心优势并非绝对性能,而是推理效率。公司表示,在部分高级推理任务中,该模型仅需要同类模型约四分之一到三分之一的推理算力,就能实现接近的表现效果。不过如果与中国最新一代开放模型横向对比,Beam仍存在明显差距:在Agent编程测试DeepSWE v1.1中,Beam得分为44.4,几乎与部分前代中国模型持平,但低于最新的多款国产模型;在Terminal Bench v2.1测试中,Beam得分80.1,同样落后于国产头部模型;在Humanity's Last Exam测试中,Beam得分也低于多款国产最新模型。
Reflection官方也承认国产头部模型在绝对能力上仍处于领先位置,因此将Beam的卖点调整为单位算力的智能产出,将其定位为企业可长期稳定运行的主力模型,而非单纯追求榜单排名的超大参数模型。该公司已经完成数十亿美元融资,获得了Nvidia的大额投资,并通过与多家企业合作锁定了大量算力资源,属于依托资本和最新硬件支持的研发模式。
Ioannis表示,公司未来几年的目标是让开放模型前沿与封闭模型前沿最终实现对齐。2027年,Reflection计划发布规模更大的模型,同时持续扩大强化学习算力投入,并参考国产模型的迭代路径,在基础模型之上连续推出多个强化学习增强版本。Misha则认为,强化学习已经从早期特定领域的技术,转变为推动通用模型、编程模型和智能体模型进步的基础方法。在他看来,当前的大模型要么已经具备了通用人工智能潜力,要么已经清晰地处在通往通用人工智能的连续发展路径上,接下来行业的核心问题不再只是如何持续提升模型性能,而是如何将这种能力工程化、产品化,并通过多极化、开放程度更高的生态实现扩散。
欧洲厂商重新冲刺头部市场
相比刚刚推出首款基础模型的Reflection,欧洲模型厂商Mistral面临的竞争压力更大。两三年前,Mistral曾是全球开放模型领域最具代表性的企业之一,但随着国产模型的快速迭代,Mistral在前沿能力榜单上的存在感逐渐下降。今年9月,该公司首席执行官在接受采访时被直接问到是否已经被同行甩开,当时他回应称新一代大模型即将发布,公司已经规划了后续迭代路线,刚刚完成的融资将大量用于扩大训练算力。
两周后,Mistral Large 4正式亮相。该模型的激活参数为520亿,总参数量达到1.05万亿,搭载了16亿参数的视觉编码器,原生支持多模态交互和超过160种语言,上下文窗口长度达到100万Token。值得注意的是,该模型是在Mistral位于欧洲的数据中心中,使用约3800张Nvidia显卡从头训练完成的。目前模型已经开放API预览版本,完整权重将在10月底正式公开。
根据Mistral官方公布的测试数据,该模型的表现已经超过部分海外竞品,但仍低于国产头部模型;在第三方盲测中,其代码质量评分也处于中等偏上水平。Mistral此次的推广重点并非仅面向开发者,而是主打企业智能体场景,在多应用业务工作流测试中表现超过部分竞品,但仍低于国产模型。本次发布中,Mistral特别强调了模型的网络安全能力,称其已进入全球相关榜单前五,在漏洞复现修复任务中得分达到该测试最高分,同时提到开放权重模型允许企业自行定义安全策略并本地部署,而部分闭源模型可能因为安全限制无法完成某些任务。不过目前这些测试数据大多来自自身内部测试,且模型仍处于预览阶段,完整权重尚未正式开放。
借鉴国产厂商的商业化路径
在模型能力之外,Mistral和Reflection都在尝试国内厂商已经初步验证的商业化路线。Reflection的模式带有典型的全栈AI基础设施思路:公司希望打造全新的完整AI基础设施提供商,从基础模型出发,向上承接各类AI服务,向下深入算力管理、集群调度等领域,长期甚至计划自主建设数据中心。
该公司认为,各类技术层级在长期都会走向商品化,能够持续获得较高利润的企业,往往是能够垂直整合整个技术栈的公司。开放模型本身不一定能直接产生收入,但能够创造巨大的推理需求,就像开源项目推动了全球云市场发展一样,开放模型会推动企业采购相关服务,因此Reflection真正销售的是围绕模型构建的整套智能基础设施能力。该公司还将自身类比为早期的云服务厂商,内部的算力调度、服务技术最终也可以对外输出。
Mistral的商业化路径则更偏向区域化全栈AI理念。其首席执行官主张,小而高效、支持定制和本地部署的开放模型,比单纯追求最大参数规模的通用模型更符合企业的实际需求。Mistral同时建设自有模型、企业定制平台和欧洲算力基础设施,希望成为从训练到部署都能够在欧洲法律和基础设施体系内完成的供应商。在该公司看来,欧洲企业不能将核心AI能力完全建立在别国厂商的服务基础上,因此需要掌握从算力到部署的完整链条。
行业核心判断与市场观察
尽管两家公司分处不同地区,但近期的公开表态显示,他们对开放模型市场的发展形成了越来越相似的判断:AI行业已经从“谁能提供最好用的API”阶段,进入到“谁拥有模型、谁控制基础设施”的竞争新阶段。
在“为何必须研发开放模型”的问题上,Reflection的解释是:AI市场正在从“租赁智能”转向“拥有智能”。早期企业调用闭源API服务就像租房,简单高效但缺乏自主权,而随着AI进入企业核心业务,企业需要能够自主控制的智能能力,这意味着模型必须具备足够的开放性。
相关负责人则从技术角度分析认为,开放模型与闭源模型的前沿能力差距正在不断缩小,只要拥有足够的人才和算力资源,开放模型完全可以达到与闭源模型相同的性能水平。过去企业不愿使用开放模型,核心原因只是其能力尚未达标;而如今国产开放模型已经能够直接替代闭源模型完成大量任务,商业迁移的前提条件已经成熟。
当被问及为何中国开放模型能够率先实现突破时,两家公司的判断也颇为一致:中国开放模型的领先并非单一公司偶然推出一款优秀模型的结果,而是商业激励、产业环境和训练资源共同作用的产物。美国其实也曾拥有全球最强的开放模型,但当时市场以API服务为主,厂商没有足够动力开放前沿能力。中国的转折点则是相关模型的全球影响力提升,之后出现了集中的研发推进浪潮,背后的核心动力之一是建设自主开放生态的产业和战略价值。从工程层面来看,中国头部实验室的算力和迭代效率都具备优势,因此能够实现快速的模型迭代。
关于开放模型的安全讨论
尽管两家公司都在积极为开放模型辩护,但都没有将自己定位为极端开放派。Reflection的核心安全论点是,开放本身能够提升系统的整体安全性,足够多的开发者参与可以快速发现并修复漏洞,封闭实验室的安全团队规模有限,无法覆盖所有长尾问题,开放生态的安全性反而更高。他们还引用了行业内的安全事件,说明单一的安全哲学并不可靠,闭源模型可能因为安全限制无法执行某些防御任务,而开放模型能够提供另一套安全工具方案。
相关负责人进一步提出了“用AI防御AI”的思路:随着模型能力不断增强,异常行为的智能体可以被其他AI系统快速发现和约束。模型和服务提供商越多,系统的冗余度就越高;如果最强的AI能力只集中在少数几家公司手中,反而会形成单点故障的风险。
不过Reflection也明确表示,开放并非没有边界。当模型达到一定的能力等级后,部署方式需要更加谨慎;当模型超过某个风险阈值后,行业和政府应该共同协商决定发布条件和是否需要设置访问控制。另有厂商负责人公开反驳了超级智能失控风险的说法,认为相比主动减缓研发速度,更应该加强智能体监控、安全工程和实际治理措施,这一立场与部分行业同行的观点存在重合。

