微信开源WeMM-Embedding多模态模型:2B参数如何越级挑战8B?

2026年9月,微信视觉团队正式开源通用多模态嵌入模型WeMM-Embedding,包含2B、4B、9B三个参数版本,全面支持文本、图像、视频、视觉文档及任意交错的多模态输入。该模型已在微信朋友圈搜索、视频号推荐、公众号推荐及电商等核心业务中大规模部署,线上日调用量高达十亿量级。在国际权威多模态嵌入基准MMEB-v2上,WeMM-Embedding-2B以77.9分超越此前领先的8B开源基线,9B版本更以80.6分登顶总榜榜首。这不仅是技术实力的证明,更标志着多模态Embedding模型从实验室走向大规模产业落地的关键转折。

为什么多模态Embedding是AI系统的“通用语言”
现代AI系统面临一个根本性挑战:如何让机器同时理解文本、图像、视频这些本质上不同的信息形态。传统做法是为每种模态训练单独的模型——文本用BERT,图像用ResNet,视频用3DCNN——然后在应用层做“翻译”和“拼接”。这种“各说各话”的方式存在天然局限:模态间的语义鸿沟无法弥合,跨模态检索只能依赖粗糙的映射,更不用说处理图文交织的复杂输入了。
多模态Embedding模型正是为解决这一问题而生。它的核心理念是将所有模态的内容映射到同一个连续的向量空间中,使得“苹果”的文字描述、一张苹果的照片、一段关于苹果的视频,在向量空间中都处于相近的位置。这样,系统就能真正“理解”不同模态内容之间的语义关联,实现文本搜图片、图片搜视频、图文混合查询等任意对任意的跨模态检索。
WeMM-Embedding在这一领域做出了关键突破。与早期CLIP-style模型依赖模态特定的双编码器不同,WeMM-Embedding基于原生多模态架构Qwen3.5构建,能够自然支持任意交错的文本-图像-视频输入。这意味着用户可以用“一张带字幕的截图+一段文字描述”作为查询,系统能同时理解截图中的视觉信息和文字中的语义指令,返回最相关的结果。
WeMM-Embedding的技术架构:不止是“另一个多模态模型”
两阶段训练:从“对齐”到“精调”
WeMM-Embedding的训练分为两个精心设计的阶段。
第一阶段:大规模多模态对齐。 团队构建了数亿级的异构训练语料库,系统涵盖六大核心数据家族:弱监督图文/视频对提供广阔的跨模态语义先验;细粒度描述对覆盖物体属性、空间关系与动态事件;跨模态检索对囊括组合式查询与智能体工具检索;分类对将识别任务转换为匹配任务;多模态问答对覆盖OCR、文档图表解析与时空推理;分级相关性对引入多档位相关度标注,专门建模搜索与推荐中的精细偏序。这一阶段的目的是让模型在海量数据中学习模态间的基本对齐关系。
第二阶段:精选数据精调。 团队构建了规模约为原数据十分之一的精选数据集,引入难负样本挖掘、Reranker重排序和模型蒸馏等技术,进一步提升模型的细粒度区分能力。这就像学生先通读百科全书建立知识框架,再通过精读重点章节掌握核心考点。
套娃表示学习:一个向量,多种维度
WeMM-Embedding支持嵌套表征学习(Matryoshka Representation Learning, MRL)。简单说,模型输出的向量可以“层层剥开”:最外层是完整的高维向量(如2560维),提供最丰富的语义信息;剥开一层是中等维度的子向量(如1024维),适合中等精度的检索任务;再剥开一层是更低的维度(如512维、256维),适合存储和快速匹配。
这一设计的精妙之处在于:开发者无需为不同精度需求训练多个模型。同一个WeMM-Embedding模型,既能输出高维向量用于精细排序,也能输出低维向量用于十亿级向量库的快速召回。套娃表示学习让“一个模型、多种用途”成为现实,大幅降低了多模态检索系统的部署和维护成本。
专用Embedding Token:告别CLS池化的粗糙
WeMM-Embedding在架构上还有一个值得注意的细节:它在输入序列的末尾追加一个专用的<embedding> token,用这个token的最后一层隐状态作为整个输入的表示。这与CLIP-style模型常用的“取[CLS] token”或“平均池化”方案形成鲜明对比。
为什么这很重要?多模态大模型的输入序列中,不同位置的token承载着不同的信息——开头的token可能更多关注全局上下文,中间的token聚焦局部细节,末尾的token则综合了前面所有信息。用专门训练的<embedding> token来“总结”整个输入,比简单取某个现有token或做平均池化,能够更精准地捕捉输入的完整语义。这个设计看似微小,实则是从“能用”到“好用”的关键跨越。
性能实测:2B越级挑战8B,9B登顶全球第一
MMEB-v2基准:78个数据集的全面检验
MMEB-v2是目前多模态Embedding领域最权威的公开基准之一,涵盖78个数据集,横跨图像、视频、视觉文档等多个领域。WeMM-Embedding在這一基准上的表现堪称惊艳:
-
WeMM-Embedding-2B:综合得分77.9分,其中图像任务79.6分、视频任务70.8分、视觉文档任务80.7分。这一成绩超越了参数量四倍的Qwen3-VL-Embedding-8B(77.8分) 。
-
WeMM-Embedding-4B:综合得分79.2分。
-
WeMM-Embedding-9B:综合得分80.6分,登顶MMEB-v2官方总榜榜首,全面超越所有已提交的开源与闭源模型。
这一成绩意味着什么?2B模型用四分之一的参数量击败了8B模型,说明WeMM-Embedding在训练数据质量、训练策略和架构设计上找到了更高效的路径。9B模型登顶榜首则证明,在同等量级下,WeMM-Embedding已经达到了目前公开可得的最高水平。
内部验证:26个任务、14次A/B测试
公开基准的领先固然重要,但真正的考验在于实际业务中的表现。WeMM-Embedding在微信内部的26个任务基准上取得了显著提升,并在14项在线A/B测试中实现了一致改进。
这14次A/B测试覆盖了微信视频号推荐、公众号内容推荐、朋友圈搜索和电商搜索等核心场景。每一次A/B测试都是对模型实际效果的“真金火炼”——用户不会因为模型在基准上拿了第一就多看一眼推荐内容,只有真正提升了点击率、留存率或搜索满意度,才算通过了检验。
横向对比:WeMM-Embedding vs. 主流多模态Embedding模型
| 对比维度 | WeMM-Embedding-2B | WeMM-Embedding-9B | Qwen3-VL-Embedding-8B | CLIP ViT-B/32 | Omni-Embed-Nemotron-3B |
|---|---|---|---|---|---|
| 参数量 | 2B | 9B | 8B | ~150M | 3B |
| MMEB-v2综合得分 | 77.9 | 80.6(第1名) | 77.8 | 未公开提交 | 43.5 |
| 支持模态 | 文本+图像+视频+视觉文档+交错输入 | 同左 | 文本+图像+视频 | 文本+图像 | 文本+图像 |
| 交错输入支持 | ✅ 原生支持 | ✅ 原生支持 | ❌ | ❌ | ❌ |
| 套娃表示学习 | ✅ | ✅ | ❌ | ❌ | ❌ |
| 开源协议 | Apache 2.0 | Apache 2.0 | Apache 2.0 | MIT | 未开源 |
| 实际部署验证 | 微信十亿级日调用 | 同左 | 有限 | 广泛但不聚焦检索 | 未知 |
| 输出维度灵活性 | 64-2560可调 | 64-2560可调 | 固定 | 512 | 固定 |
数据来源说明:MMEB-v2得分来自官方榜单;参数量信息来自各模型官方发布;模态支持信息来自技术报告;套娃表示学习支持来自技术报告;开源协议来自GitHub仓库;微信部署信息来自官方披露;CLIP参数来自公开模型卡;Omni-Embed-Nemotron数据来自技术报告对比表。
从表格可以清晰看出,WeMM-Embedding在多个维度上具有显著优势:
模态覆盖最广。 大多数多模态Embedding模型只支持文本和图像,少数扩展到视频。WeMM-Embedding在此基础上增加了对视觉文档(如扫描件、截图、图表)和任意交错输入(图文混排、带字幕的视频等)的支持。这意味着它可以处理真实世界中绝大多数内容形态,而不仅仅是实验室里的“干净”数据。
效率最优。 2B版本以四分之一的参数量击败8B竞品,这不仅仅是“性价比高”——在云计算成本敏感的时代,这意味着同样的硬件资源可以服务更多用户、响应更快。
部署验证最充分。 大多数开源模型发布时只在基准上跑过分数,WeMM-Embedding已经在微信的十亿级日调用场景中经受住了考验。“线上验证”和“实验室验证”之间的差距,往往比基准分数差距大得多。
微信生态中的实战:从朋友圈搜索到视频号推荐
朋友圈搜索:当“找图”变得智能
朋友圈每天产生海量的图文内容。用户想找“去年在海边拍的那张日落照片”时,传统搜索只能依赖文字标签或文件名匹配,体验往往差强人意。
WeMM-Embedding让朋友圈搜索具备了真正的“多模态理解”能力。用户输入“海边日落”的文字描述,系统能在向量空间中匹配到语义相近的图片;用户上传一张参考图,系统能找到视觉相似的过往朋友圈内容;用户甚至可以用“那张有红色气球和摩天轮的照片”这样的图文混合描述进行检索。搜索从“关键词匹配”进化到了“语义理解” 。
视频号推荐:内容理解的跨越
视频号推荐系统需要判断一个视频“好不好看”、“用户会不会喜欢”。传统做法依赖标题文字和少量标签,但视频的精髓在于画面内容——一段标题平淡但画面精彩的视频可能被低估,一段标题夸张但内容空洞的视频可能被高估。
WeMM-Embedding能够同时理解视频的画面内容、字幕文本和封面图,将它们融合成一个统一的表示向量。推荐系统基于这个向量计算内容与用户兴趣的匹配度,推荐精度实现了质的提升。
公众号推荐与电商搜索
公众号文章的推荐同样受益于多模态理解——文章中的配图、排版、信息图等视觉元素与正文文本一起被编码,推荐系统能更准确地判断文章与读者兴趣的匹配度。微信电商场景中,商品的主图、详情图、标题和描述被统一编码,用户搜索“红色连衣裙”时,系统能同时匹配文字和视觉信息,返回真正符合需求的商品。
开源的意义:不只是“开放代码”
从“内部工具”到“公共基础设施”
微信视觉团队将WeMM-Embedding的模型权重、推理代码和评测工具全部开源,采用Apache 2.0许可证。这意味着任何开发者都可以:
- 直接下载预训练模型用于自己的多模态检索、推荐或智能体应用
- 基于开源代码进行二次开发和定制化训练
- 使用配套的评测工具在自己的数据集上验证模型效果
一个有趣的细节:腾讯替千问先做了Qwen3.5 Embedding
WeMM-Embedding基于Qwen3.5架构构建。有趣的是,千问(Qwen)官方尚未推出Qwen3.5-Embedding版本,目前官方版本仍是Qwen3-Embedding和Qwen3-VL-Embedding。腾讯微信视觉团队率先基于Qwen3.5开发了新一代Embedding模型并开源。这展现了腾讯在大模型生态中的技术实力,也体现了开源社区“共建共享”的精神——基础模型的能力通过不同团队的创新被充分释放。
社区反响:这是一次“部署故事”而非“榜单炫技”
开发者社区对WeMM-Embedding的开源反响热烈。有评论指出,WeMM-Embedding最值得关注的不是它在MMEB-v2上拿了第一,而是它已经在微信生产环境中稳定运行。在AI领域,“基准第一”的模型比比皆是,但能经受十亿级日调用考验的模型屈指可数。WeMM-Embedding的开源,本质上是在分享一个经过大规模验证的“部署故事”,而不仅仅是一组漂亮的数字。
独到见解:WeMM-Embedding带来的三个范式转变
转变一:从“模态专属”到“模态无关”
传统AI系统为不同模态训练不同模型,导致系统架构臃肿、维护成本高、跨模态能力弱。WeMM-Embedding证明了一个统一的模型可以同时处理文本、图像、视频和文档,且效果优于专门的模态模型。这指向了未来AI系统的发展方向:用更少的模型做更多的事。
转变二:从“基准驱动”到“场景驱动”
很多模型的优化目标是“在XX基准上拿到最高分”,为此不惜在训练数据中“针对性优化”。WeMM-Embedding的独特之处在于,它的优化目标首先是“在微信场景中表现更好” 。26个内部任务和14次A/B测试证明了它在真实场景中的价值。基准领先是结果,而不是目标。
转变三:从“黑盒模型”到“可调向量”
套娃表示学习让WeMM-Embedding的输出维度可以根据任务需求灵活调整。这不仅仅是技术上的便利,更代表了一种思维转变:Embedding模型不应该输出固定维度的“标准答案”,而应该提供可调节的“语义光谱” 。不同任务对向量的精度和维度要求不同,让开发者根据实际需求选择合适维度,才是真正的“可用性”设计。
局限与展望
WeMM-Embedding目前不支持音频输入。对于包含语音的多模态内容(如带旁白的视频),音频信息暂时无法被编码到统一的向量空间中。微信视觉团队在技术报告中表示,音频支持是未来的重要方向之一。
另一个值得关注的方向是更高效的推理部署。虽然2B版本已经在效率上表现出色,但在移动端和边缘设备上部署仍然面临挑战。社区已经出现了WeMM-Embedding-2B的GGUF量化版本,表明开发者正在积极探索轻量化部署方案。
常见问题(FAQ)
Q1:WeMM-Embedding是什么?和ChatGPT这类聊天模型有什么区别?
WeMM-Embedding是一个多模态Embedding模型,它的任务是把文本、图像、视频等内容转换成统一的向量表示,用于搜索、推荐和内容匹配。它不像ChatGPT那样生成文本回复,而是为其他系统提供“理解内容”的基础能力。可以把它想象成AI系统的“通用翻译器”——把不同语言(模态)的内容翻译成同一种“向量语言”。
Q2:WeMM-Embedding有哪几个版本?应该选哪个?
共有三个版本:2B、4B和9B。2B版本参数量最小、推理最快,在MMEB-v2上已经达到77.9分,适合对延迟敏感或资源有限的场景。9B版本以80.6分登顶榜首,适合对精度要求最高的场景。4B版本介于两者之间。三者共享相同的架构和训练策略,开发者可以根据硬件资源和精度需求灵活选择。
Q3:WeMM-Embedding支持哪些输入类型?
支持文本、图像、视频、视觉文档(如扫描件、截图、图表)以及这些类型的任意交错组合。例如,你可以输入“一段文字+一张图片+一个视频”的混合内容,模型会输出一个统一的向量表示。目前不支持纯音频输入。
Q4:WeMM-Embedding的开源协议是什么?在哪里可以下载?
采用Apache 2.0许可证。模型权重可在Hugging Face的Tencent组织页面下载,代码和推理工具可在GitHub上的Tencent/WeMM-Embedding仓库获取。技术报告可在arXiv上查阅(arXiv:2608.24053)。
Q5:WeMM-Embedding在MMEB-v2上的具体得分是多少?
WeMM-Embedding-2B综合得分77.9分(图像79.6、视频70.8、视觉文档80.7),4B得分79.2分,9B得分80.6分。9B版本位列MMEB-v2官方总榜第一名。
Q6:WeMM-Embedding已经在哪些微信场景中使用了?
已大规模部署在朋友圈搜索、视频号推荐、公众号推荐和微信电商等核心业务中,线上日调用量达十亿次。
Q7:套娃表示学习是什么?对我有什么好处?
套娃表示学习让同一个模型可以输出不同维度的向量(如2560维、1024维、512维、256维等)。高维向量语义更丰富但计算成本高,适合精细排序;低维向量语义略粗糙但匹配速度快,适合十亿级向量库的粗召回。开发者无需为不同精度需求训练多个模型,一个WeMM-Embedding就能覆盖从召回到排序的全链路。
Q8:WeMM-Embedding和CLIP有什么区别?
CLIP采用双编码器架构——文本用一个编码器、图像用另一个编码器,两个编码器通过对比学习对齐。这种架构的局限在于无法处理图文交错的复合输入。WeMM-Embedding基于原生多模态大模型,用一个统一的模型处理所有模态,自然支持任意交错的输入。此外,WeMM-Embedding支持套娃表示学习,输出维度可灵活调整,而CLIP的输出维度是固定的。
Q9:我能在自己的项目中使用WeMM-Embedding吗?需要什么硬件?
可以。模型已开源,任何开发者都可以下载使用。2B版本对硬件要求相对较低,可以在消费级GPU上运行;9B版本需要更高配置。社区已有2B版本的GGUF量化实现,进一步降低了部署门槛。具体硬件需求可参考GitHub仓库中的部署文档。
Q10:WeMM-Embedding未来的发展方向是什么?
根据技术报告,音频模态的支持是重要方向之一。此外,更高效的推理优化、更小规模的模型变体、以及更广泛的下游任务适配都可能是未来的重点。社区已经围绕WeMM-Embedding展开了积极的生态建设,包括量化部署和推理框架集成等。

