腾讯这次开源的东西不太起眼,但分量不轻。微信视觉团队把自家线上每天调用十亿量级的多模态嵌入模型 WeMM-Embedding 放了出来,2B、4B、9B 三个尺寸全给,Apache 2.0。我看完后最直接的感受是:这不是一篇”我们做了个新模型”的论文式 PR,而是一套已经在十亿级流量里被验证过的工程方案,被完整送到了开发者手上。对做检索、推荐、Agent 记忆的团队来说,这个东西的可用性比它的榜单分数更值钱。
01 一句话讲清楚:发生了什么
微信视觉团队开源了通用多模态嵌入模型家族 WeMM-Embedding,提供 2B / 4B / 9B 三个版本,把文本、图像、视频、视觉文档以及任意交错的多模态输入,统一编码进同一个向量空间。
在权威多模态嵌入榜单 MMEB-v2(78 个数据集)上,9B 版本以 80.6 分位列第一,2B 版本 77.9 分,超过了参数规模四倍于它的 Qwen3-VL-Embedding-8B(77.8)。

02 它解决的是什么问题
微信里的内容从来不是单一形态的。一条朋友圈是文字配九张图,一篇公众号是图文交错,一条视频还叠了画面、字幕和标题。当用户敲下”海边日落”四个字,系统凭什么从海里捞出对的图片和视频?
答案就是嵌入模型:把不同形态的内容统统翻译成向量,意思相近的,向量距离就近。搜索和推荐因此有了一套可以统一计算的语言。
顺带纠正一个常见误解
很多人觉得,既然大模型理解能力最强,那用它来抽 embedding 肯定最好。但大模型的目标是”预测下一个词”,不是”度量语义相似性”;在 embedding 这种高频、大批量的检索任务上,算力和延迟成本根本扛不住。所以工业界的主流一直是体积小得多的专项嵌入模型 —— 这也是 WeMM 只有 2B 到 9B 的原因。
03 三个值得注意的技术点
统一架构,而不是双编码器
早期方案是图像一个编码器、文本一个编码器,各算各的最后再对齐。但真实内容是交错的,”图 — 文 — 图”的顺序本身就是语义的一部分。WeMM 直接基于 Qwen3.5 多模态架构做统一骨干,图文视频从输入开始就在同一条序列里处理,末尾追加一个专门的 <embedding> token,取其最后一层隐藏状态做 L2 归一化,就是这段内容的向量表示。巧思在于:在视频后放一个 token 得到纯视频表示,再加上字幕再放一个 token 就得到视频+文本的联合表示,一次前向计算能同时拿到不同层次的表示。
两阶段训练,先见得广、再分得细
第一阶段用数亿规模多模态数据建立广泛的语义空间,并引入”重复感知掩码”,避免把相似内容误当负例推远。第二阶段转向细粒度:语义重采样 + 质量过滤 + 补充困难负样本(查”红色连衣裙”时,粉色连衣裙比汽车更有教学价值),再由 9B 当老师,把候选内容之间完整的相似度关系蒸馏给 2B 和 4B —— 不只告诉学生”哪个最相关”,还告诉它”第二名差多少”。消融显示,蒸馏给 2B 带来 0.9 分提升,第二阶段整体累计 2.2 分。
套娃表示学习,把成本和精度做成可调旋钮
训练时同时考核 64、128、256、512、1024 维直到完整向量,逼着模型把信息按重要性排序。推理时只算一次完整向量,业务按成本截取前 N 维即可,不用重新训练。实测 2B 版本截到 256 维,仍能保留全维度下 98.7% 的图像和视频性能 —— 向量长度降到八分之一,效果几乎不掉。工程上这意味着粗排和精排可以共用一套向量库。
04 榜单成绩一览
| 基准 | 2B | 4B | 9B |
| MMEB-v2(78 个数据集) | 77.9 | 79.2 | 80.6 |
| MMEB-v3(190 个任务) | 56.0 | 58.2 | 59.5 |
| 12 项跨模态检索均值 | 79.8 | 80.8 | 81.7 |
| 微信内部 26 项任务 | 2B 相比同规模基线 60.9 → 72.0 | ||
05 已经跑在微信里了
这部分才是重点。WeMM 不是”榜单模型”,它已经大规模部署在微信的推荐与搜索系统中,覆盖视频号、直播、公众号、电商和朋友圈,日调用量 10 亿量级,用于候选检索、排序特征、用户序列建模和跨域内容理解。
已经完成 14 次在线 A/B 测试并全量上线,对长尾内容和新发布内容的提升尤其明显。

06 怎么用
第一步 下载代码并安装依赖
克隆仓库后 pip install -r requirements.txt,推荐 transformers 5.2.0 以保证结果可复现。
第二步 准备素材
准备一张图片或一段视频,把命令里的文件路径换成本地路径。
第三步 运行推理脚本
单次推理可输出 64 到 4096 维的嵌套向量。生产环境可用 vLLM(–runner pooling)或 SGLang(–is-embedding)起服务,支持高并发。
开源地址/相关链接
● GitHub:github.com/Tencent/WeMM-Embedding
● Hugging Face:huggingface.co/collections/tencent/wemm-embedding
● 论文:arxiv.org/abs/2608.24053
07 个人愚见
小模型的性价比被重新划线了
2B 打平甚至超过 8B,意义不在榜单而在部署:同样的效果,显存、延迟、成本降一个量级,很多原本做不起多模态检索的中小团队现在做得起了。
“已在十亿级业务全量上线”是最硬的背书
大量开源模型死在”榜单好看、线上翻车”,WeMM 少走了这一步。它甚至把内部 26 项任务的评测结果一并公开,这种坦白在国产开源里不算多见。
套娃表示是被低估的工程细节
粗排低维、精排高维共用一个模型,省掉的是多套模型的训练和维护成本,对长期运维比跑分重要得多。
一个需要提醒的缺口
WeMM 目前不支持音频,MMEB-v3 榜单选这一项记 0 分。场景涉及语音或音视频混合检索的话,这还是个洞。另外 80.6 分的榜首成绩是截至 2026 年 8 月 24 日的榜单快照,追兵不会停。
本文由作者@AI星球大本营,授权发布于平台,未经许可禁止转载。

