文章摘要
当前人工智能有符号空间和物理空间智能两大成熟方向。2024 年图灵奖得主提出智能体需自主生成经验,但经验来源存疑。知境团队指出完整经验智能离不开社会心智,其推出社会心智大模型技术体系,含评测、模型、部署框架。该体系打通技术路径,Zing 系列模型在基准测试中表现亮眼,未来可在机器人、复杂决策、多智能体协作场景落地赋能。

当前人工智能领域已经形成了两大相对成熟的技术方向:一类是以大语言模型为代表的符号空间智能,擅长自然语言理解、逻辑推理与代码生成,比拼的是模型的“智商”;另一类是以具身机器人为代表的物理空间智能,核心能力在于环境感知、动作执行与场景控制,聚焦于模型的“行动力”。这两条赛道都已经形成了清晰的技术迭代路径。

在2026年的行业大会上,2024年图灵奖得主、强化学习领域的先驱理查德·萨顿提出,人工智能正在从“人类数据时代”迈入“经验时代”:智能体不能仅仅依赖人类遗留的二手训练数据,而是需要通过与真实世界的持续交互,自主生成属于自身的专属经验。

可问题随之而来:萨顿所说的“经验”到底从何而来?它真的只靠个体与物理世界的碰撞就能生成吗?

来自国内顶级科研机构的知境团队,就针对这一问题提出了全新的视角:经验并非在真空环境中产生,而是诞生于社会关系的网络之中,存在于“我知道你知道我知道”的递归信念互动里,也体现在读懂一个细微的眼神、推断未说出口的真实意图的过程中。

这意味着,真正完整的经验智能,必然离不开社会心智的支撑。能够理解他人信念、推断潜在意图、感知情绪变化、权衡社会规范的社会智能能力,正是通用人工智能长期以来缺失的“第三极”。

该团队隶属于中国科学院计算技术研究所智能算法安全全国重点实验室,他们的核心目标是为现有大模型补上“理解人心”的短板,让人工智能在面对复杂社会场景时,能够拥有更贴合人类认知的情商、更高的可信度与可托付性。他们想要探索的核心问题是:社会心智能力能否像语言理解、代码生成一样,被定义为一种可以被持续测量、训练和迭代优化的工程化能力?

为了实现这一目标,知境团队近期推出了完整的社会心智大模型技术体系,这套体系包含三大核心组成部分:用于能力评估的评测基准SoMBench、多参数版本的社会心智模型Zing,以及支持智能体部署的框架Actio。

这套技术体系形成了完整的闭环链路:SoMBench作为能力诊断工具,将“理解人类”的能力拆解为可精准定位的认知缺口;Zing模型则根据诊断结果开展自适应训练,让原本依赖提示词的临时社会推理能力,转化为模型参数中固化的稳定能力;Actio部署框架则通过动态组织心理技能、心智状态、实践经验与社会文化知识,为模型的落地部署提供可选择、可校验的支撑能力,最终打通了“评测-能力内化-实际应用”的完整技术路径。

这三大组件共同指明了社会智能的技术发展方向:曾经被视为模型模糊“情商”的社会智能,如今已经成为了拥有标准化评测工具、系统化训练方法与标准化运行接口的工程化能力,这也是大模型从“能说会道”迈向“值得托付”的关键一步。

在5项国际权威的社会心智评测基准测试中,Zing系列模型展现出了亮眼的性能:多模态模型Zing-27B的综合均值达到79.80,超越了GPT-5.5的78.44;文本模型Zing-32B的综合均值为76.14,与DeepSeek-V4-Pro的75.90水平相当;而轻量级模型Zing-8B和Zing-14B则凭借极小的参数量,在高阶信念推理基准HiToM上,超越了参数量为其数十倍的基线模型。

SoMBench:社会心智的“体检系统”

SoMBench围绕心智表征、社会交互和规范内化三大核心能力构建,覆盖17个二级维度、71项细粒度任务,包含3481道经过15名专家评审、严格保留率达到87%的测试实例。通过多题型交叉验证、选项扰动、捷径检测等多种技术手段,SoMBench不仅能够给出整体的能力评分,还可以精准定位模型的错误推理模式,为后续的模型训练指明具体的优化方向。

在对20个当前顶级大模型的测试中,表现最优的模型正确率仅为72.08%,17个次级维度中没有任何一个能够达到90%的天花板水平。这意味着,即使是当前最先进的大模型,在系统性的社会心智评测中仍然存在近三成的能力缺口,也凸显了SoMBench作为全新评测基准的价值,为行业后续的模型迭代指明了重点优化方向。

Zing:训练目标随能力共同进化

Zing模型没有采用传统的“固定题库、固定损失函数”的训练模式,而是构建了一套能够自我进化的训练系统。当模型在诊断数据集上暴露出能力短板时,FLARE数据飞轮会精准定位到具体的认知维度,针对性地合成全新的训练样本——这些样本在语义、场景、推理路径上都与原题不同,但都瞄准同一种能力缺陷。值得注意的是,FLARE使用的诊断集与评测集是严格隔离的,评测集在整个开发流程中完全冻结,不会参与任何数据合成或模型训练,确保了评测结果的客观性。

模型的训练分为两个阶段推进:第一阶段用于构建通用的社会心智基础能力,采用Mixed-Reward GRPO强化学习框架,动态组合过程奖励与可验证奖励;第二阶段则针对情绪理解、意图推断、社会规范、视角采择等专项能力进行强化训练。此外,OPD在线蒸馏技术会在强化学习过程中引入教师模型的token级分布约束,防止模型在探索更优推理路径时,偏离已经验证有效的正确推理模式。

FLARE解决了“学什么”的问题,两阶段训练安排明确了“什么时候学”的节奏,而OPD技术则负责“向谁学、不忘什么”的细节,最终Zing构建出了一套能够随着模型能力状态持续自适应进化的训练系统。

Actio:让部署按需调用

Actio框架以Harness作为统一的编排核心,能够根据任务的心智变量和推理需求,选择性激活四类支撑模块:PRISM模块提供76项分层的心理与社交技能;Starling Memory模块可以显式记录“谁、何时、相信什么”的社会关系信息;SAGE模块用于沉淀跨任务可复用的推理经验;Gated RAG模块则可以按需检索社会文化相关的知识。通过这种模块化的设计,Actio能够灵活适配不同的社会智能应用场景,为模型的实际部署提供可选择、可校验的支持。

评测验证:Zing系列模型多维性能领先

Zing-27B多模态模型综合均值超越GPT-5.5

在5项国际权威社会心智评测基准中,多模态模型Zing-27B的综合均值达到79.80,超过了GPT-5.5的78.44。其中,HiToM基准测试的是“我知道你知道我知道”的递归信念追踪能力,推理阶数越高,难度呈现指数级增长。Zing-27B在该基准上取得了82.00的得分,超越了GPT-5.5的77.92,成为首个在该基准上超越GPT-5.5的百亿参数规模公开模型。

Zing-32B文本模型比肩DeepSeek-V4-Pro

文本模型Zing-32B在5项基准的综合均值达到76.14,与DeepSeek-V4-Pro的75.90水平基本相当。在EmoBench情感推理基准测试中,Zing-32B以77.25的得分大幅领先DeepSeek-V4-Pro的71.88,差距达到5.37个百分点,这表明知境团队的专项社会心智训练在情感理解维度上形成了显著的优势。

Zing-8B/14B以小博大,高阶心智超越数十倍参数规模大模型

在高阶信念推理基准HiToM上,Zing-8B和Zing-14B凭借极小的参数量,实现了对参数量为其数十倍的基线模型的超越。随着递归推理阶数的提升,任务难度呈指数级增长,Zing-8B在三阶信念推理上的正确率达到67.50%(基线模型为45.83%),四阶信念推理的正确率达到65.83%(基线模型为43.75%),分别比基线模型提升了21.67和22.08个百分点。这一结果证明,社会智能能力的提升,核心来自于训练方法的结构化设计,而非单纯的参数规模放大。

社会心智为AI带来的落地赋能方向

知境团队的社会心智能力,未来可以在三个真实世界的场景中实现落地赋能。

赋能一:让机器人从“能动手”到“能动心”。当前的机器人已经能够完成端茶倒水等基础动作,但无法理解人类的潜在意图。知境的8B/14B轻量级模型可以嵌入端侧设备,让机器人能够推断“主人皱眉是因为茶水太烫还是情绪不佳”,这在家庭看护、协作陪伴等场景中具有广阔的应用前景。

赋能二:让复杂决策从“拍脑袋”到“先彩排”。复杂决策的失败往往不是因为计算错误,而是因为忽略了人的因素。知境的社会心智能力未来可以应用于商业决策、团队协作推演等场景,它不是预测未来的结果,而是帮助决策者在行动之前,提前推演不同选择可能引发的连锁社会反应,就像正式演出前的彩排一样,提前规避潜在的社交风险。

赋能三:让多智能体从“各说各话”到“同频共振”。在人类、机器人、AI智能体共同协作的场景中,最大的协作风险来自于“信息不对称的认知偏差”,也就是“你以为我懂了,我以为你懂了”的误解。知境框架未来可以提供统一的心智状态协议,让不同的智能体能够在同一套社会认知坐标系下完成协作,不再是简单的信息同步,而是实现“我知道你知道我知道”的递归共识。

以上内容不代表本平台立场,仅供读者参考