Light-MER:<1B多模态情感识别模型性能超8B教师

多模态大语言模型正在重塑情感识别的研究路径。不同于传统方法只能输出“高兴”“悲伤”这类固定情感标签,新一代生成式多模态情感识别模型可以同时理解视频、音频和文本信息,还能用自然语言解释判断情感状态的依据。不过这类模型往往需要庞大的参数量作为支撑,现有主流方案大多依赖至少7B参数的语言模型,不仅需要高额的显存和计算资源,还会带来较长的推理延迟,很难部署到机器人、车载座舱、移动终端这类边缘设备上。
要实现高质量的多模态情感理解与识别,真的必须使用参数规模超过1B的模型吗?
来自格拉斯哥大学、山东大学和中国科学院计算技术研究所的研究者提出了Light-MER方案,挑战了“大模型才是高性能基础”的假设。他们将8B参数教师模型的多模态情感理解能力迁移到参数量不足1B的学生模型中,通过隐藏状态蒸馏和多奖励强化学习,在大幅降低计算开销的同时,实现了超越教师模型的平均性能。该论文已被ACM Multimedia 2026主会收录。
该论文主要包含三个核心亮点:
- 构建参数规模低于1B的生成式多模态情感模型。 Light-MER将大规模教师模型压缩为总参数量约854.93M的学生模型,在参数量与FLOPs均降低约11倍的情况下,平均性能超过8B教师模型。
- 提出基于切片Wasserstein距离的隐藏状态蒸馏方法SWD-H。 与只对齐输出概率或逐点拟合隐藏状态不同,SWD-H从分布几何的角度迁移教师模型内部的多模态情感表示。
- 提出面向生成质量与推理效率的多奖励优化方法M-GRPO。 该方法同时考虑情感识别准确性、回答长度、情感信息密度、句子完整性和重复程度,使学生模型生成更简洁、更流畅的情感描述,并进一步降低推理延迟。
为什么要把多模态情感模型做小?
多模态情感识别的很多应用场景并不在云端服务器,而是在需要实时交互的边缘设备上。这类系统需要持续处理人脸、语音和文本信息,并在短时间内给出判断。7B以上的大模型虽然情感理解和生成能力更强,但需要更多显存和计算资源,如果每次识别都依赖高端GPU或者将音视频上传到云端,不仅会增加响应延迟,还会受到设备算力和网络条件的限制。
因此,小模型的意义不仅是节省计算量,更是让多模态情感识别能够落地到实际使用场景中:降低硬件门槛、缩短交互等待时间,同时为弱网环境或本地处理提供可能。Light-MER并没有要求在训练阶段完全抛弃大模型,而是将大模型作为知识来源,最终只部署参数量低于1B的学生模型,核心目标是在大幅降低部署成本的同时,保留生成式多模态情感理解能力。
Light-MER如何保留多模态情感理解能力?
Light-MER采用教师-学生框架。8B的教师模型仅在训练阶段使用,负责提供强大的多模态情感理解能力;真正用于推理和部署的是参数量约854M的学生模型。知识迁移分为两个关键阶段:
第一阶段:SWD-H隐藏状态蒸馏
传统的知识蒸馏方法通常让学生模型模仿教师模型的最终输出,但对于情感识别任务来说,真正重要的不仅是“给出什么答案”,更是模型如何整合表情、语音和文本中的情感线索。SWD-H使用切片Wasserstein距离对齐教师和学生的隐藏状态分布,让学生学习教师模型内部的情感表示结构,而不是仅仅复制最终的答案。
第二阶段:M-GRPO多奖励优化
经过SWD-H蒸馏后的学生模型虽然可以准确判断情绪,但可能会继承教师模型过于冗长的表达方式。对于生成式情感识别来说,回答越长并不代表效果越好,模型可能会反复描述相同的线索,或者生成大量与最终判断无关的内容,这不仅会降低信息密度,还会增加推理时间。如果仅以情感识别准确率作为优化目标,模型甚至可能通过罗列大量情感词汇来获得更高分数,却无法保证回答简洁、完整和自然。
M-GRPO会针对同一个样本生成多个候选回答,再根据综合奖励比较这些回答的质量,奖励维度包含五个方面:
- 情感判断是否准确
- 回答长度是否合理
- 情感信息是否足够集中
- 句子表达是否完整
- 内容是否存在重复
M-GRPO的目标并不是简单地让模型“少说”,而是在保留关键情感信息的前提下减少冗余内容。从训练曲线可以看到,总奖励在训练前期快速提升并逐渐趋于稳定,同时情感分析的生成长度持续下降,在训练后期收敛到约53个英文单词,这说明模型正在逐步学习更集中、高效的表达方式。因此,两个阶段分别解决了不同的问题:SWD-H负责迁移大模型内部的多模态情感表示,M-GRPO则进一步优化学生模型的生成质量和推理效率。
<1B对决8B:小模型真的能超过老师吗?
研究团队在九个公开数据集上进行了实验,覆盖基础情感识别、情感倾向分析和开放词汇细粒度情感识别。实验的核心结论是:在完整的视频、音频、文本输入条件下,Light-MER的九数据集平均分为74.61,超过了8B教师模型的73.93,并且在其中七个数据集上取得了更好的效果。
在“音频+文本”和“视频+文本”两种模态组合的输入设置下,Light-MER的平均性能同样超过了教师模型,这说明其效果并不依赖特定的模态组合。
学生不必止步于老师:知识蒸馏也能实现性能反超
传统的知识蒸馏通常被认为是一种性能妥协——学生模型更小更快,但通常只能尽可能接近教师模型的性能。而Light-MER的实验结果展示了另一种可能性:学生模型并不是机械地复制教师的输出,而是通过SWD-H学习教师模型隐藏状态中的分布结构,再通过M-GRPO对生成行为进行重新优化。
因此,学生模型一方面继承了教师模型的多模态情感理解能力,另一方面还修正了教师模型输出过长、信息密度不足的问题。从这个角度来看,教师模型更像是能力来源,而不是学生模型性能的上限。只要知识迁移的目标设计合理,小模型不仅可以接近大模型,甚至可以在特定任务和部署目标下超越大模型。
从性能到部署:Light-MER有多轻量?
相比教师模型,Light-MER的参数量和FLOPs都减少了约11倍,峰值显存从20.04GB降低到了2.54GB。在测试环境中,模型直接输出情感标签仅需约0.52秒/样本,达到了亚秒级响应,适合对短视频片段进行交互式情感判断;如果需要生成完整的情感解释,约需3.11秒/样本,属于秒级响应,可以用于机器人对话、人机交互这类对延迟相对宽容的场景。
从2.54GB的峰值显存来看,Light-MER已经不再依赖20GB级的高端GPU,理论上具备约4GB显存的设备就可以运行;考虑到系统和推理框架的额外开销,使用6GB及以上显存的消费级GPU或嵌入式边缘计算平台会更加稳妥。从20.04GB到2.54GB的转变,Light-MER将生成式多模态情感识别从高端GPU的场景推向了更轻量的边缘计算平台。
写在最后
过去几年,多模态情感识别的发展似乎一直沿着“模型越大,能力越强”的路径前进,模型规模从7B、8B继续增长,成为了获得更强生成和推理能力的默认选择。而Light-MER重新审视了这一前提,通过SWD-H将8B教师模型的多模态情感表示迁移到不足1B参数的学生模型中,再通过M-GRPO优化生成质量,最终在九个基准数据集上的平均性能超过了8B教师模型,同时将参数量、FLOPs和峰值显存都大幅降低。
对于开篇提出的“我们真的需要超过1B参数的模型才能实现高质量的多模态情感识别吗?”这个问题,Light-MER给出的答案是:不一定。与单纯扩大模型规模相比,如何有效迁移和优化模型内部的多模态知识,可能才是更关键的因素。

