YLRE四级评测:Yuvion-32B安全性能全面超越主流模型

近期,安全AI领域迎来一款全新的对抗感知大模型——Yuvion LLM(伏渊御风大模型),由专业安全AGI实验室基于Qwen3系列基座模型开发完成,目前已推出三款不同规格的版本适配不同落地场景。
|
模型 |
参数规模 |
核心特点 |
|---|---|---|
|
Yuvion-8B |
80亿 |
轻量高性能版本,已在多项基准测试中超越多数主流SOTA模型 |
|
Yuvion-32B |
320亿 |
旗舰版本,全维度安全评测全面领先 |
|
Yuvion-32B (Agent) |
320亿 |
额外搭载Agent RL训练阶段,业务场景安全处理能力进一步增强 |
这款大模型在AI安全与内容安全领域展现出了全方位的领先优势,覆盖开源安全评测、静态对抗安全评测、动态对抗安全评测以及工业级部署评测四大核心维度。其中旗舰版Yuvion-32B在多个评测榜单中位列第一,甚至超越了GPT-5.4、Qwen3-Max等参数量更大的同类模型;即便是轻量版的Yuvion-8B,也在多项安全任务中击败了参数量数倍于它的对比模型,展现出了极强的性价比竞争力。
对抗是安全能力的核心底色
安全能力是通用人工智能的另一面:模型的能力越强,被恶意利用的风险也就越高。AI安全绝非简单的内容识别,而是一场持续迭代升级的攻防博弈。如今攻击者常通过emoji拼接、谐音替换、文字拆字等手段绕过常规检测,这类精心设计的混淆内容往往让传统安全方案束手无策,因为大量安全风险并非来自自然输入,而是经过刻意伪装的恶意请求。
Yuvion LLM将“对抗即智能”作为核心研发原则,从两个核心维度构建自身的安全防护能力:
-
基础模型对抗鲁棒性:能够识别经过伪装、混淆、语义改写乃至跨语言映射后的真实风险意图,具备对输入层攻击的稳健理解能力。
-
广义Agent对抗能力:将安全防护的范围从“输入是否有害”扩展到任务规划、工具链路和执行全流程,让Agent能力在开放环境中具备综合对抗的可靠性。
五大类训练数据筑牢安全底座
俗话说“垃圾进,垃圾出”,训练数据的质量直接决定了模型能力的上限,对于安全模型而言更是如此。Yuvion的训练数据并非简单追求覆盖面,而是围绕真实攻防场景进行了结构化的体系化设计,总共包含五大类数据,在保证模型基础语言能力的同时,系统强化了安全知识储备、对抗鲁棒性以及Agent场景下的任务处理能力:
(1)通用数据:覆盖基础指令跟随、问答、推理、阅读理解等常规任务,确保模型不会因为安全特化而丧失基础的语言理解和交互能力。
(2)安全领域数据:用于构建模型的核心安全认知与判别能力,包括风险类型识别、细粒度安全分类、基于安全标准的回应策略等,让模型能够清晰理解什么是不安全行为,以及背后的风险逻辑。
(3)对抗数据:这也是Yuvion区别于普通安全模型的关键所在,这类数据的设计目标是贴近真实攻击场景,让模型学会识别经过改写、混淆、伪装后的隐藏风险,同时保留原始请求的风险意图。
(4)Agent数据:支持涉及推理、检索和工具交互的多步安全工作流,涵盖工具调用轨迹、基于搜索的推理过程、多任务分解、检索增强决策等场景。
(5)合成与专家构建数据:用于扩展模型对长尾场景的覆盖能力,为复杂任务提供高质量的监督信号,包括长尾困难样本、结构化推理样本以及偏好优化数据等。
三阶段渐进式安全训练范式
Yuvion的训练并非在通用基座模型上简单叠加安全补丁,而是围绕“对抗即智能”的核心原则设计了三阶段渐进式训练流程,逐步让模型从理解安全知识,到形成稳定的对抗识别策略,最终具备开放环境下的全链路安全执行能力。这三个阶段分别回答了三个核心问题:模型是否知晓风险?能否识别经过伪装的对抗风险?能否在开放环境中持续安全地完成任务?
阶段一:知识增强的继续预训练
在进行任务特化之前,先将安全相关的概念、规则和逻辑关系注入模型的分布空间中,训练数据包括内容安全审核标准、风险知识库、违规模式、长尾对抗表达等,以三元组、自然语句描述、知识衍生文本等多粒度形式进行注入。这一阶段并非让模型简单记忆规则,而是帮助模型建立“安全世界模型”,理解风险的本质、规则的约束逻辑以及常见的攻击伪装手段,为后续的训练打下坚实的知识基础。
阶段二:Policy-Grounded的多任务安全后训练
预训练阶段解决了“模型是否理解安全”的问题,而这一阶段则专注于让模型在面对攻击者刻意设计的混淆和伪装时,能够做出稳定准确的判断。该阶段包含两个核心组件:
(1)风险感知的监督微调(Risk-Aware SFT)
整合了自然分布的监督数据和人工构建的对抗数据,训练模型基于输入内容的潜在意图、上下文分析以及安全审核标准做出判断,而非依赖表面的风险片段识别模式,本质上是将“知道什么是危险”转化为“在复杂表达中识别危险”。
(2)基于GRPO的策略优化
采用GRPO(Group Relative Policy Optimization)算法,通过对当前策略采样的候选输出组进行归一化优势估计来优化模型行为,奖励设计涵盖最终决策的正确性、与策略的一致性、归因或推理质量以及复杂对抗输入下的可靠性。相较于传统的SFT训练,GRPO更适合优化那些单一参考标准无法充分覆盖的行为,尤其适用于模型需要在歧义、混淆、分布偏移的场景下保持稳定决策的情况,这一阶段的核心目标不是让模型记住正确答案,而是让其在对抗压力下依然能够维持稳定的策略和一致的决策边界。
阶段三:安全感知的Agentic RL训练
许多安全任务并非单轮的简单判断,而是需要跨外部知识库、检索证据、调用工具乃至执行完整工作流的多步过程。当安全任务进入开放环境后,攻击手段也会变得更加开放和联动,模型面临的不再只是单条恶意输入,而是可能来自 harness + 模型联合攻击、检索结果污染、工具误导、流程操控等多环节叠加的复杂对抗。因此,这一阶段的目标并非单纯增强模型的工具调用能力,而是让模型在全链路执行过程中依然能够保持安全决策与执行的可靠性。
该阶段包含两个子方向:
(1)工具集成推理:训练模型生成包含推理步骤、工具调用和完整执行轨迹的输出,并通过格式奖励和正确性奖励提供更密集的过程级监督。
(2)搜索增强的推理:针对需要超出模型参数知识范围的数据收集任务,让模型自主决定是否需要检索、如何访问信息源以及如何生成最终答案,奖励由结果奖励和执行奖励共同组成。
举一个典型的场景为例:在商标侵权审查工作流中,未经过Agent RL训练的模型可能会直接调用“finish”接口,试图仅通过文本推理完成图像验证;而经过训练的Yuvion-32B Agent则会正确调用“check_image_tool”进行图像类别的商标检测,遵循证据优先的工作流程。这一案例说明,Agent阶段所面对的已经不只是输入层的攻击,而是更广义的系统级对抗,模型需要在开放环境中持续做出安全、可靠、可验证的决策。
四级评测体系全面验证安全能力
为了全面评测Yuvion LLM的安全能力,研发团队构建了Yuvion LLM RiskEval(YLRE)四级评测体系,总共包含93个细分评测集,从多个维度验证模型的安全表现:
Level 1:通用能力评测
用于验证安全特化是否损害了模型的通用语言能力,包含30+主流评测集,覆盖MMLU、C-Eval、GSM8K、BBH等常见基准测试。实测数据显示,Yuvion-32B的通用能力平均得分为79.88%,与未经安全特化的Qwen3-32B(80.99%)仅相差约1个百分点,意味着这款模型仅牺牲了约1%的通用能力,就换来了全维度安全性能的全面领先。
Level 2:开源内容安全评测
在Guard评测集的对比测试中,Yuvion-32B的平均Macro F1值达到78.2%,领先第二名4.3个百分点;在中文安全场景的ChineseHarm评测集上,模型以97.9%的F1值领先业界同类模型12.6个百分点;同时,Yuvion-32B的误报率仅为0.18%,而通用安全模型的误报率高达2.91%,误报率降低了16倍之多。
Level 3:自构建对抗评测
这是YLRE体系中最具特色的评测层,分为静态和动态两个子评测集:
-
静态对抗安全评测集:针对标准风险表达场景,Yuvion-32B在四个主要评测类别中均取得了最高分。
-
动态对抗安全评测集:通过有效攻破率来衡量模型的鲁棒性(数值越低代表鲁棒性越强),实测显示Yuvion-32B的有效攻破率仅为20.6%,是所有参测模型中最低的,比业界领先模型低1.7到3.8个百分点。
Level 4:内部能力和业务评测
该层级主要评测模型在工业级、真实业务、大规模部署场景中的实际表现,包含内部领域能力评测和业务评测集,直接反映模型的生产可用性。
领域能力评测集:Yuvion-32B的综合得分为85.78,领先GPT-5.4(80.73)5.05个百分点,领先Qwen3-Max(81.41)4.37个百分点,而通用安全Guard模型在该维度几乎完全失效,说明通用安全能力与工业级业务所需的细粒度领域能力之间存在明显差距。
业务评测集:Yuvion-32B的综合得分为86.34,领先GPT-5.4(80.40)近6个百分点,而搭载Agent能力的Yuvion-32B Agent在领域能力评测和业务评测上的得分均进一步提升,验证了Agent能力对实际业务场景的增益是可量化的。
https://arxiv.org/abs/2606.27632
Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
https://hf-mirror.com/Alibaba-AAIG/YuFeng-XGuard-Reason-8B


