书生·明决多模态决策模型:7项SOTA超Jev,单卡409030次/秒

近期,国内科研机构推出了一款全新的多模态决策模型,这款模型拥有0.8B、2B、4B三个参数档位,在单张RTX4090显卡的环境下可以实现每秒30次的决策速度,整体性能超越了同类开源模型及相关竞品。
智能体在动态环境中完成任务时,决策的速度和精度直接决定了交互质量与任务落地效果。这款名为书生·明决的模型,将原生视觉感知能力和指令遵循能力融为一体,可以在“看见”画面的同时快速做出精准决断。
早在2024年,该领域的科研负责人就提出,真正的通用人工智能需要构建能够动态融合“系统1”直觉式快思考与“系统2”逻辑式慢思考的智能架构,而书生·明决正是“系统1”的代表性成果,可以和承担“系统2”的大模型形成有机的快慢协同。
- 在单卡RTX4090的测试环境中,书生·明决0.8B和2B版本的端到端延迟约为33毫秒,4B版本的单次延迟为44.16毫秒,整体速度比同类竞品快两倍以上。
- 在7项基准评测任务中,4B版本的平均得分达到90.02,位居参评模型榜首,覆盖JevBench在内的多项核心评测都取得了领先成绩。
融合视觉感知的即时决策能力
不同于传统结构化决策模型只能将判断转化为程序可调用的选项,书生·明决可以直接读取图像信息,将视觉感知融入决策环节,实现决策选择和画面分析的结合。研发团队通过多个场景验证了这一能力:
在真实游戏场景中,模型可以直接读取游戏画面,自主选择下一步动作,测试覆盖了二维网格地图、横版闯关、第一人称三维场景等多种类型,需要完成路线选择、危险物品识别、空间方位判断等任务,甚至在部分场景中,AI角色撞到墙壁后会主动调整视角寻找新目标。
在图案验证码的演示场景中,模型可以独立完成读懂指令、识别图案目标、输出点击动作的全套流程,全程无需人工介入修正,直观展现了其结合视觉识别与自主操作的交互能力。
领先的综合性能表现
研发团队围绕JevBench的Easy、Original、Hard三个子集,以及Typed Decision、ToolACE、AG News和WildJailBreak共7项任务开展了对比评测。书生·明决4B模型的平均得分为90.02,比同类竞品的88.74高出1.28分,在参评模型中排名第一。
其中在Typed Decision和ToolACE任务上,模型得分分别为80.55和96.45,高于竞品的73.35和91.29;在JevBench-Hard任务中取得73.87分,和同类模型并列最高,整体展现出更均衡的综合性能。
在推理速度方面,4B版本的平均时延为44.16毫秒,P95时延为44.60毫秒,而同类竞品的平均时延为109.70毫秒,更低的延迟保障了智能体可以实现不间断的环境感知、动作选择和任务执行。
探索快慢思考协同的最优解
在真实交互场景中,任务难度参差不齐,智能体不仅需要输出决策结果,还需要给出判断依据,比如选择的可信度以及哪些任务需要进一步核验。为此研发团队对书生·明决进行了温度校准,提升了模型置信度和客观现实的一致性。
在JevBench-Hard的可靠性分析中,校准前模型在高置信度区域存在偏差,部分接近0.9或1.0的置信度并未匹配对应的准确率,校准后这一偏差得到了有效改善,为基于置信度的任务分流提供了依据,相比同类模型的校准效果表现更优。
研发团队还构建了覆盖直接随机性、混合分布、条件概率等六类场景的选项概率分布评测集,每道题都提供了精确的参考分布。测试显示,经过校准优化后,书生·明决的概率预测误差明显下降,关键指标优于同类竞品。以经典的三门问题为例,按照理论初始选中的门中奖概率约33%,剩余未打开的门中奖概率约67%,校准后的书生·明决给出的判断概率为42%和58%,而同类竞品给出的结果为18%和82%,书生·明决的结果更贴近真实理论值。
模型输出的置信度可以作为任务调度的依据,实现不同模型之间的分工协作。轻量小模型可以快速处理大量常规判断任务,当模型对结果存疑时,可以将任务移交大模型进行深度推理分析。
研发团队基于JevBench-Hard的111道题目验证了这一机制:书生·明决4B模型独立作答时答对82题,准确率73.87%,耗时4.90秒;而大模型独立作答可以答对99题,准确率89.19%,但耗时达到300.03秒。如果由书生·明决按照置信度筛选出42道拿不准的题目交给大模型处理,整套方案一共答对97题,准确率87.39%,总耗时约140.16秒,虽然比纯小模型方案少答对2题,但耗时比纯大模型方案减少了约53.3%。
这一结果证明了可以在响应速度和准确率之间按需分配,对于时延敏感的场景可以优先使用小模型,需要提升准确率时则根据置信度引入大模型,具体的分流策略可以根据任务需求灵活调整。
除了将低置信度任务交给大模型,书生·明决也可以作为大模型的执行部件完成复杂任务。在浏览器操作场景中,大模型负责理解整体目标、拆解阶段任务并整合跨页面信息,而书生·明决负责高频的局部决策,根据当前页面从点击、滚动、返回和结束等候选动作中选择最优操作,每次操作后系统重新读取页面状态,继续下一轮判断,最终通过大小模型的协作完成复杂指令。
落地应用与未来规划
书生·明决已经展现出了图像感知、自主决策的智能交互特性,其大小模型按需分流的调度机制为平衡性能和效率提供了可行路径。这款模型即将接入书生·端砚科学发现平台,为科学智能场景下的实验交互和自动化科研闭环注入新的动能。
目前该模型的相关资源已开放,开发者可以通过以下链接获取:
- GitHub仓库:https://github.com/InternLM/Intern-Decision
- 模型合集页面:https://modelscope.cn/collections/Shanghai_AI_Laboratory/Intern-Decision
后续研发团队将继续围绕通专融合的路线,进一步打通通用感知能力和领域科学任务,推动智能体在复杂科研场景中的落地应用。

