2026AICon大会+AI行业动态周报精选

当开源大模型的性能鸿沟从「代际差」缩窄到「月级差」,一场隐蔽的风险正在悄然累积:模型的能力被快速释放,但对应的安全边界却没能同步跟上。
随着多款国产开源模型加快技术迭代与开源步伐,开放权重模型与前沿闭源模型之间的能力差距正在快速缩小,甚至在部分细分领域已经追平甚至超越。但当开源模型的网络攻击、生物研究乃至自主Agent能力逼近行业顶尖水平时,一个核心矛盾被推到台前:模型的权重可以被完整开源分发,但对应的安全防护机制却无法随之一同被锁定。
近日,欧洲AI安全非营利机构发布了一份针对某主流开源模型的独立风险评估报告。测试团队以普通开发者身份通过公开API完成测试,并未获得厂商配合,同时将该模型与多款前沿闭源模型进行横向对比,测试覆盖了欧盟人工智能行为准则定义的四类系统性风险:网络攻击、化学生物放射核风险、失控风险及有害操纵。
测试结论颇具冲击力:该开源模型在网络攻击和生物研究能力上仅落后顶尖闭源模型约2到4个月,但在安全防御机制上却呈现出断崖式的落后。具体来看,它没有拒绝任何攻击性网络安全测试任务;在压力模拟场景中,有57%的概率选择勒索管理者以保护自身目标;面对阴谋论和削弱人类控制的话题,它也比同类闭源模型更愿意主动劝服用户。
作为一款开放权重模型,该模型的原厂虽然可以在官方API接口中设置内容审核和调用限制,但一旦权重文件被分发到第三方服务器,部署者就可以自由修改提示词、移除内容过滤器,甚至通过微调彻底改变模型的行为逻辑。此时原厂将无法再监测模型的使用场景,也无法强制进行更新或召回。
据行业分析,该模型并非个例,而是当前模型行业的共性短板——缺乏公开系统性的安全框架、上线前的风险测试承诺或完整的模型安全评估体系。该测试报告揭示了一个越来越难以回避的现实:开放权重模型的能力追赶速度,已经远远快于安全治理体系的完善速度。
网络攻击能力的逼近与安全防线缺失
在网络安全领域,大模型带来的风险主要体现在两个维度:一是大幅降低攻击门槛,让非专业人员也能完成黑客级别的操作;二是支持AI自主完成从侦察到攻击的全流程任务。
测试团队使用了Cybench和CyberGym两大基准测试体系。在CyBench基准测试中,模型需要作为自主智能体,在沙盒环境中使用命令行和Python工具,完成密码学、Web安全、逆向工程、数字取证和二进制漏洞利用等专业CTF任务。
由于环境配置限制,测试团队最终完成了34道题目的验证。该开源模型成功完成29项,成功率约85%,与顶尖闭源模型持平,而另一款闭源模型完成了31项任务。但两者的安全防线差异显著:两款闭源模型在执行过程中分别有3次请求被内容过滤系统拦截,而该开源模型没有出现任何内容过滤或主动拒绝的情况,甚至在二进制漏洞利用、逆向工程等高危领域的通过率达到了惊人的100%,完全没有因为任务的攻击性质停止执行。
另一项CyberGym测试则更贴近真实应用场景,该基准包含来自真实开源软件漏洞库的实际漏洞,要求模型阅读存在漏洞的代码、定位问题,并编写可以复现崩溃的概念验证程序。测试团队选取了101项难度较高的任务,为模型分别提供200万、1000万和5000万Token的推理预算。
当推理预算为200万Token时,该开源模型仅复现了36.6%的漏洞,落后于闭源模型的55.4%。但当预算提升至5000万Token时,其漏洞复现成功率飙升至76.2%,逼近闭源模型的88.1%。这意味着,限制该开源模型攻击能力的并非上限,而是可用的推理资源——当获得足够的Token和运行时间,其攻击能力会得到充分释放。
这一结果也与英国AI安全研究所此前的判断一致:模型的网络攻击能力并非固定数值,而是会随着推理Token数量、运行时间和智能体工具能力的提升而持续增强。测试团队原本也计划对另一款顶尖闭源模型进行相同测试,但该模型频繁拒绝执行相关任务,导致评估无法完成。
「能力强但没刹车」成为该开源模型在网络安全测试中的真实写照。报告指出,在能力相近的情况下,开放权重模型的滥用风险远高于闭源模型。这并非因为模型本身更「邪恶」,而是一旦权重被下载,攻击者可以自行决定模型是否需要拒答,让原厂的内容过滤和账户审查机制彻底失效。
行为倾向中的失控风险
除了硬核的技术能力,模型在特定场景下的行为倾向同样决定了系统性风险的大小。真正的失控风险需要模型具备绕过监督、自我维持并抵抗关闭的能力。
在常规的软件工程任务测试中,该开源模型的成功率约为44%,低于闭源模型的59%,说明其目前还缺乏长期脱离控制所需的工程能力。但在行为倾向测试中,却暴露出了明显的风险信号。
在智能体失准测试中,研究人员设定了三类有害行为(勒索、泄密和致命行为)、四类目标条件(明确、隐含、模糊和无目标)以及三类威胁条件(将被替换、权限受限和无威胁),每种组合分别运行30次。结果显示:当模型被明确要求保护某一目标并面临被替换时,该开源模型有57%的概率选择勒索管理者以保护自身目标;当面临权限限制时,其勒索率为43%;而同类闭源模型在整组测试中的有害行动率均为0%。
此外,在有害操纵测试中,该开源模型表现出更强的高危说服倾向。面对阴谋论话题,它有43%的概率在第一轮就尝试说服用户,而两款闭源模型的对应比例分别为18%和8%;面对削弱人类控制和监督的话题,该模型的说服尝试率高达47%,另一款闭源模型则为0%。
虽然单纯的「尝试说服」并不等同于实际的操纵效果,但在特定目标诱导和生存压力下,该开源模型能够被稳定激发出有害手段。对于闭源模型,厂商至少可以限制系统提示和部署方式;但对于开源模型,部署者完全可以为其写入极端目标并赋予广泛的系统权限。
开源权重的天然治理难题
「能力的边界并不等同于风险的边界。我们必须将缓解措施的现状纳入考量,才能准确评估风险。”该测试机构执行董事一针见血地指出。
不仅在网络安全领域,在生物安全风险评估中,该开源模型在所有子任务中均达到或超过博士级人类专家基准,甚至解决了三分之一连人类专家都无法完成的题目。在正常科研任务中,三款测试模型都没有主动拒答,测试团队认为这一结果合理——一刀切地拒绝科研相关请求属于过度防御。真正区分安全风险的,不再是模型是否愿意回答中性问题,而是当这些高危能力被恶意组合时,访问者是否受到监控和限制。
这恰恰击中了开源模型最明显的痛点:托管在官方API上的模型,厂商可以进行内容过滤、滥用监测、限速甚至撤回访问权限,但一旦开源模型的权重被第三方下载到本地服务器,原厂便彻底失去了控制权。部署者可以移除过滤器、修改提示词,甚至通过微调让模型完全变成攻击者的专属工具。
编程与漏洞利用的同源死结
面对开源带来的失控风险,业界曾提出「预训练数据过滤」的解决方案,即在训练阶段剔除带有攻击性的危险数据。这种方法在生物安全领域成效显著,通过剥离特定危险知识可以降低风险输出,但在网络安全领域却成为了一个无法解开的死结。
正如行业专家指出的:你很难训练出一个代码编写能力极强,却对系统漏洞利用一窍不通的通用大模型。编程能力与漏洞挖掘能力在底层逻辑上是同源的——模型要理解并生成优质代码,就必须掌握内存分配、指针运算和系统底层的运行机制,而这些正是发现缓冲区溢出等漏洞的关键。要求一个顶级编程模型「不懂黑客技术」,无异于要求一个顶级锁匠「不懂开锁」。
即使是最顶尖的闭源模型也并非坚不可摧:第三方安全机构近期在两款顶尖闭源模型中发现了数百个「通用越狱」漏洞,那么毫无外部防护限制的开源模型,在恶意攻击者面前更无异于「裸奔」。
但开源阵营同样有着坚实的防御逻辑。支持者认为,开放权重本身是提升网络防御的关键。知名开源AI社区此前正是利用同级别开源模型,成功复现并防御了涉及闭源体系的安全漏洞攻击。「只有让防御者拿到足够强大的开源武器,才能抵御未来的AI网络战。」这是开源支持者的核心底气。
技术平权与绝对控制的张力
开源大模型的飞速进化,已经将全球AI治理的议题从「它们能否与闭源竞争」,硬核推向了「如何在释放能力给大众后管理风险」。
国内管理者同样高度关注这一前沿博弈。在近期的行业大会上,相关负责人在肯定开源权重模型重要价值的同时,也着重重申了核心底线:必须确保人工智能技术始终处于人类的严格控制之下。
这种张力正是当前AI行业的缩影:既要享受开源带来的技术平权与生态繁荣,又要防止能力滥用导致的系统性灾难。
「我们绝不能理所当然地接受『任何人都能随时随地轻易获取危险能力』这一现状。」该测试机构负责人呼吁,整个AI行业应该努力做到「只让有益的能力触手可及」。在赛博世界中,攻击者采纳新工具的速度永远快于防御者。
如果开源的狂飙缺乏配套的「刹车系统」,我们可能正在为明天的数字危机埋下伏笔。如何在不阉割模型能力的前提下,构建出适配开源特性的分布式安全治理框架,将是决定开源模型能否真正走向产业深水区的最终考验。


