抖音搜索多模态团队联合中国人民大学高瓴人工智能学院,发布抖音多模态表征模型 DME(Douyin Multimodal Embedding),在多模态表征权威评测榜单 MMEB-v2(78 个数据集,覆盖图像、视频、视觉文档三大域)上,DME 模型在 2B、9B 两个参数量级下均取得对应规模 SOTA,整体得分分别达到 74.8(2B)、78.4(9B),视频与视觉文档检索的优势尤为突出。DME 的技术已部署进抖音线上系统:内部离线评测集整体相对提升 2.92%;线上 A/B 实验验证核心业务指标 0.1% 的 LT(Lifetime)收益,目前已应用于生成式搜索、视觉搜索、AI 搜索等场景。
DME 想验证的核心是:检索表征的“效率”与“细粒度”不必二选一。将 “该看哪里” 和 “必须记住什么” 两大任务前置至训练阶段,保障在线推理的高效性。该能力不仅适配百亿级工业检索场景,还可支撑 AI 搜索、Agent 等需要依托检索结果开展深度推理的新兴场景。在这类场景下,向量需要真正承载非对称语义,而不只是作为排序所用的相似度信号。

MMEB-v2 上的整体与分域表现:DME 在 2B 与 9B 两个量级上都取得同规模最优,视频与视觉文档检索的增益尤为明显。
论文链接:https://arxiv.org/pdf/2608.02148
1. 背景:AI 时代,检索能力比以往更依赖底层表征
表征(Embedding)在大模型时代承接的任务变多了:此前主要服务搜索与推荐链路,如今还要为 RAG 取回外部知识、为 Agent 充当感知外部世界的检索工具。当承接的任务变得更多的时候,就越依赖这层地基把证据准确取回来。
而新调用方要的东西也变了。传统搜索的 query 多是短关键词,把”语义相近”的内容拉到一起就够用;AI 搜索与 Agent 发出的往往是一整句带多重约束的指令,要的不是”看起来相关的候选”,而是能支撑后续推理的证据。这对向量提出了一个此前不被要求的性质:不能只留一个用于排序的粗糙相似度信号,还得真正承载住内容语义——而纯对比学习恰恰不保证这件事,它只监督”哪两个该靠近”,不关心向量里留下了什么。
在工业检索场景,这层地基要同时满足两件事:一是覆盖足够广的任务——查询与内容都可能是文本、图像、视频或它们的混合,且包含电商、内容理解等各类场景;二是在百亿级规模下同时保住质量与效率——内容要能离线编码建索引,在线只允许一次查询侧编码。MMEB-v2作为被广泛使用的公开榜单,能够直接的衡量这层地基的通用可靠性。
抖音搜索多模态团队提出的 DME 就是围绕这两件事做的:以扎实的数据与工程为底座,再创新性地增加一个以信息完备为目标的 Stage 2——让向量建立在检索证据之上、并保留住匹配对面的细粒度语义。关键在于这些能力都被放在训练阶段完成,在线几乎不引入额外推理消耗。MMEB-v2 上的同量级 SOTA 验证了这条路走得通:质量足够高,速度也足够快。
2. 痛点:真实的工业检索系统规模约束

三种范式的取舍:对比式够快但粗,显式 CoT 够细但慢,DME取二者优势交集
DME 面对的问题不是从榜单里来的,是从抖音的检索系统里来的。在抖音这样的视频平台上,待检索内容是百亿量级,且模态高度复杂:查询可能是自然语言、图片、视频或它们的混合,候选内容里同时存在视觉帧、图文、标题、OCR 文字与各类元信息。
这个规模与复杂度给出了三重要求。前两个是约束:效率上,百亿级内容必须能离线编码建索引、在线只允许一次查询侧编码,这直接锁定了双编码器形态;细粒度上,真实查询往往带有对物体、属性、动作、OCR 文字、时序或空间关系的多重限定,而难负例常与正样本共享同一个全局场景,只差一个局部区域或一个关键帧。第三个则是对绝对能力的要求:正因为待检索的数据量足够大、分布足够杂,模型必须先具备一个覆盖广、几何稳定的表征空间,否则再精细的机制也无从发挥。
顺着这三重要求,DME 需要做的事就很清楚了,也正好对应两个训练阶段:
- 用扎实的数据工程支撑起足够广阔的表征空间。这是绝对能力的来源——通过大规模、多模态的数据 scaling,先把统一向量空间撑开,尤其是视频与视觉文档这类长上下文、强时序模态的上限。
- 在效率与细粒度的双重约束下,补足模型的细粒度感知能力。难点在于不能为此改变部署形态:现有对比学习路线只监督”哪两个实例该靠近”,不告诉模型该看哪里、该记住什么;而显式 CoT 一类的推理增强路线虽然能提升细粒度,却要付出文本生成与额外前向的代价,在百亿级在线系统里做主检索编码器并不成立。
3. 方法
3.1 训练基石:两阶段训练、数据Scaling与关键取舍

两阶段训练框架:一阶段大规模对比学习预训练,二阶段语义充分性学习
- 训练范式:两阶段训练
生成式大模型天然面向生成任务,核心目标是基于隐层表示预测下一个 token;而向量模型面向表征与检索任务,核心目标是将不同模态、不同粒度的内容映射到统一向量空间中,并通过相似度完成匹配与召回。为了将生成式大模型改造为高质量向量模型,DME 采用了两阶段训练范式:先通过大规模对比学习建立通用表征能力,再通过高质量指令化数据强化检索场景下的语义充分性。
Stage 1:大规模对比学习预训练
第一阶段使用约 2500 万组数据对进行大规模对比预训练,目标是构建一个覆盖广泛、结构稳定的统一多模态向量空间。在这一阶段,训练样本统一组织为(查询样本,相关样本)形式,覆盖文本、图像、视频等多种数据形态,并采用标准的 InfoNCE loss 进行优化。通过大规模对比学习,模型能够完成从生成式模型到表征模型的初步转化,建立跨模态、跨任务的基础语义对齐能力,为后续精调打下基础。
其中,表示第 i 个查询样本,表示与匹配的正样本,表示 batch 内第 j 个候选样本。表示温度系数,用于调节相似度分布的平滑程度。
Stage 2:语义充分性学习
第二阶段使用约 500 万条高质量数据进行语义充分性(Semantic Sufficiency)学习。所谓语义充分性,是指一个好的向量表示不仅要在整体语义上与相关样本对齐,还应当基于检索相关证据进行建模,并尽可能保留匹配对象中的细粒度语义信息。为此,Stage 2 在对比学习的基础上,进一步加入生成式联合训练与隐式推理机制,使模型不仅能 “匹配得上”,也能更充分地理解 “为什么匹配”。同时,本阶段引入难负例训练,进一步强化模型对语义相近但并不等价内容的细粒度区分能力。
-
训练数据:数据构成与质量
数据 Scaling
模型的基础能力主要依赖 数据 Scaling 来建立。Stage1 以大规模弱监督数据为主,覆盖文本、图像、视频三大模态,包括文本–文本匹配、图像–文本匹配、视频–文本匹配等多种数据形态,帮助模型在不同模态之间建立基础语义对齐能力。
进入 Stage 2 后,训练数据切换为更高质量的监督数据,覆盖图文检索、视频文本检索、视觉文档检索、问答、分类式检索和混合模态检索等多类任务,并显式引入任务指令,使模型能够更好地理解不同检索场景下的任务目标。
此外,我们还引入了一批自有和合成数据,用于补足公开数据在质量、场景覆盖和时序理解上的不足。例如,通过高质量图像 caption 提升图文语义对齐质量,通过长视频 caption 和自建视频–文本对齐语料增强模型对视频内容的建模能力,并为模型提供帧级与片段级的密集监督,从而提升其对时序信息和复杂视觉场景的理解能力。
训练过程中,我们按任务族进行平衡采样,避免单一任务或大规模数据集主导训练分布,从而提升模型在不同检索场景下的泛化能力与稳定性。
数据清洗
为保证训练信号的稳定性和一致性,我们将所有样本统一归一化为(查询样本,相关样本)格式,并系统剔除空样本、损坏样本、低质量 caption、低分辨率图像以及近重复样本。
负样本空间扩容
在对比学习中,负样本空间的规模直接影响训练难度和表征质量。我们通过增大 Batch Size 扩展 in-batch 负样本数量,使模型在每一步训练中面对更多候选干扰项,从而提升匹配任务的区分难度,并进一步增强模型的表征能力。
难负例挖掘
仅依赖随机负样本,往往不足以训练模型对细粒度语义差异的区分能力。因此,我们在训练前先使用已有模型对大规模候选库进行离线召回与打分,从中筛选出与 query 语义相近、模型容易误判为相关、但实际并不匹配的样本,作为难负样本加入训练。
相比随机负样本,这类样本更接近真实检索场景中的干扰项,能够为模型提供更有挑战性的学习信号。通过引入离线挖掘得到的难负样本,模型需要进一步学习区分 “看起来相关” 和 “真正相关” 的边界,从而提升对相似但不等价内容的判别能力,并增强检索结果的精确性。
伪负例过滤
在大规模对比学习中,部分负样本可能与正样本语义高度接近,甚至实际上也是合理答案。这类样本如果被直接作为负例参与训练,会向模型传递错误的优化信号。为此,我们通过计算负样本与正样本文档之间的相似度,过滤掉分值过高的样本,即潜在的伪负例,避免模型在错误梯度方向上收敛,提升训练稳定性。
任务均衡的 In-batch 混合采样
为了兼顾同任务训练的一致性与多类型数据混合的多样性,我们探索了任务均衡的 In-batch 混合采样策略:在同一个 Batch 内,对同一数据源按一定比例进行连续采样,同时混入不同任务类型的数据。这样既能保留同源样本带来的训练稳定性,又能增加跨任务、跨模态的对比信号,帮助模型学习更通用的统一表征。
- 训练配置:效率、稳定性与性能的平衡
在训练配置上,我们重点关注三类取舍:一是如何在有限资源下高效适配大模型,二是如何保证大 batch 对比学习的稳定性,三是如何控制多模态输入带来的显存压力。
最终,我们采用 LoRA 进行参数高效微调,并围绕 batch size、学习率和温度系数等关键超参进行调优,以保证对比学习过程中的收敛稳定性。多模态输入侧,我们对图片 token 数和视频抽帧数量进行了约束:图片 token 数最多为 1280,视频均匀抽取 32 帧,在保留足够视觉与时序信息的同时控制计算成本。
同时,训练中结合 bf16 与 gradient checkpointing 以及 Zero 优化显存使用,使模型能够在较大 batch 和多模态长输入下稳定训练。

Stage 2 训练:对比学习联合隐式推理和生成式监督优化语义充分性
3.2 隐式推理:让编码器知道”该看哪里”
Stage 1 的对比学习只监督最终相似度分数,不约束编码器该关注哪里,而 Agent 时代的检索要求模型理解隐含的推理要求。DME 的思路不是让模型生成一大段显式推理文本,而是在一次编码过程中加入少量隐式 token,让模型先完成一套简单的内部推理流程:
先找证据:模型从文本、图片或视频中找到最关键的词、区域或关键帧。模型为每个模态分配若干 anchor token,通过可学习投影计算 anchor 隐状态与同模态内容 token 的注意力分布,即”该 anchor 看向哪里”;教师标注的证据目标转成 token 级分布后,用证据命中损失监督。
再理解证据:不只是知道“看哪里”,还要理解这部分内容表达了什么。anchor 分布同时定义出一个证据表征,聚合后得到全局证据表征,再与教师模型产出的缓存向量做余弦对齐。意义在于:不只要求 anchor 覆盖到正确位置,还要求池化出的证据保留住那个位置本该有的语义。
然后做匹配判断:判断哪些证据支持正样本,哪些细节能够排除那些“看起来很像、但其实不对”的 hard negative。查询侧额外放置少量带检索角色的隐式状态,角色体系包含 localize、align_pos、reject_neg、summarize,分别用三类目标监督:语义定位状态与教师状态描述的缓存向量对齐;正样本对齐状态以轨迹级对比目标训练,使其能检索出对应正样本;负样本拒绝状态要求相对负样本更偏好正样本。
最后生成检索向量:最终把找到的证据和最终判断融合成一个 embedding,用于后续向量检索。
训练时,教师模型会帮助标出关键文本、图片区域或视频帧,并给出简短的语义提示,指导模型学会“应该看哪里”和“这部分为什么重要”。同时,模型还会学习让正样本更接近、让难负样本更远。
整个过程都发生在同一次编码器前向计算内部,不会生成显式 CoT,也不需要额外多轮推理。因此上线时仍然和普通 embedding 模型一样,只输出一个向量,额外延迟很小。DME 的目标就是在保持双塔检索效率的前提下,让 embedding 不再只是“整体相似”,而是能够保留真正决定相关性的局部证据。
3.3 重建损失:既是训练目标,也是评估指标
如果说 3.2 改善的是”向量怎么形成”,这一节约束的是向量必须留住多少信息。团队观察到,在纯对比学习监督下,MLLM 骨干继承来的细粒度生成理解能力会趋于退化,而且向量从未被要求保留那些”真正区分开一个相关对”的对面语义。
作为训练目标:交叉条件重建
做法可以概括为一句话:把检索向量本身当成语义瓶颈。
取归一化之前的读出向量,作为解码序列的第一个前缀 token 送回同一个骨干。给定正样本对,用 query 向量重建 document 侧文本,再对称地用 document 向量重建 query 侧文本。由于该向量归一化后就是检索用的 embedding,任何”重建对面文本所需的信息”都被迫从这个向量里流过。
在此之上叠加两个互补目标:NTP(下一 token 预测)只在对面侧文本 token 上计算交叉熵;MTP(多 token 预测)在每个位置额外监督 D 个未来 token,促使向量捕捉更长程的对面语义,进一步优化模型对于对侧信息的理解。
在解码过程与 MTP 模块只用于把 token 级梯度回传进共享骨干与读出层,推理时整体丢弃。因此 DME 在线仍是标准双编码器,不做任何额外的解码——这套监督对在线检索链路是零额外开销。
作为评估指标:可测量的表征完备度
提出”语义充分性”之后,紧接着的问题是怎么证明它真的被优化了。团队把上面的监督反过来做成了一个评估指标。
动机很直接:交叉熵无界,看不出”这个向量到底留住了多少内容”。于是把 NTP 目标改写成有界形式——只给一个池化向量作为唯一条件前缀,在 teacher-forcing 下跑一遍,统计 ground-truth token 落在 Top-K 预测里的比例,即 acc@K(每样本只评估前 10 个位置,micro 平均)。指标落在 [0,1],可直接读成”向量能在 Top-K 猜测内恢复出目标前若干 token 的比例”,因而在数据集、方向与模态之间可比。
四个探测方向回答两类问题:自重建方向(q2q、d2d)衡量向量对自身内容的还原忠实度;跨向方向(q2d、d2q)衡量它留住了多少配对对面的信息。可视化结果见实验4.3章节。
4. 实验结果
4.1 刷新公开榜单MMEBv2 SOTA 纪录
在 MMEB-v2 的 78 个数据集上,DME-2B 整体 74.8,DME-9B 整体 78.4,两个量级均为同规模最优。超过阿里和Meta等公司或团队提出的表征模型指标。三个域上均衡领先——Image 75.9 / 79.8、Video 65.6 / 70.8、VisDoc 79.9 / 82.0,保证了在多种模态下的通用泛化能力。

MMEB-v2 主结果(78 个数据集):DME 在 2B 与 9B 两个量级上均取得同规模 SOTA。
4.2 消融实验
训练模块消融
在同一份 Stage-2 数据上做累积式叠加,逐步验证三个模块的有效性。整体从 70.9 提升到 74.8,累积 +3.9 分
- Stage 1 大规模预训练:+1.6(70.9→72.5),增益集中在视频(+4.0)与视觉文档(+1.9);
- Stage 2-A Latent Reasoning:+1.3(72.5→73.8),视频单项 +4.4;
- Stage 2-B 重建损失:+1.0(73.8→74.8),三个域增益均衡。

累积训练配方诊断:三个模块逐步叠加,整体从 70.9 提升到 74.8。
训练参数消融
-
负样本空间扩容
增大 Batch Size 可以扩展 in-batch 负样本空间,从而提升对比学习的训练难度和模型判别能力。实验显示,当 Batch Size 从 128 增加到 8192 时,模型在各项指标上整体稳步提升。但当 Batch Size 进一步增大时,性能提升趋于饱和甚至出现回落,主要原因在于batch内伪负样本的干扰加剧,以及困难负样本梯度被大量简单负样本稀释等。

负样本空间扩容:batch size对于指标的影响
-
任务均衡的 In-batch 混合采样
为了兼顾同任务训练的一致性与多类型数据混合的多样性,我们探索了任务均衡的 In-batch 混合采样策略,即在同一个 Batch 内,不同数据源按一定比例连续采样。结果显示,采样比例为 0.25 时,模型在任务一致性和数据多样性之间取得了较好平衡,整体效果最优。

混合采样:混合采样配比对于指标的影响
-
视觉分辨率与帧数优化
视频抽帧策略:将视频训练和推理时的抽帧数量从 8 帧提升至 32 帧,显著增强了对长视频动作和语义的捕获。

视频抽帧:视频抽帧策略对于指标的影响
图像 Token 扩展:通过增大训练和推理时的图像输入分辨率,强化对视觉细节的表征能力。

图像分辨率:图像分辨率对于指标的影响
4.3 表征完备度:指标与可视化相互印证
按 3.3 定义的 acc@K 探测四个方向,结果表明向量是信息完备的,而非只保留了一个用于排序的粗糙摘要:自重建方向 q2q 87.9%、d2d 74.3%(Top-1),跨向方向 d2q 87.7%、q2d 65.9%,四个方向的 Top-10 均超过 88%。分域差异也符合直觉——结构规整的 VisDoc 最易重建(q2d 达 95.1%),视频跨向最难(59.2%),反映文本查询与时序视觉目标之间天然的信息差。

四个方向的 acc@K:Self 为自重建完备度,Cross 为对面完备度
把向量作为唯一前缀送回骨干做贪心解码(不提供任何原始文本或视觉 token),可以直观看到这些数字对应什么:
- 向量仍是”语言可解码”的——包括纯图像、纯视频输入的向量,都能解码出连贯切题的文本,说明对比训练没有把骨干的生成理解能力压塌成纯相似度几何。
- 它是抽象瓶颈,不是逐字复制——长指令查询被解码成 “Hamster eating food” 这样的紧凑短语,保留检索要点、丢弃表面细节。
- 向量会浮现查询与目标的语义交集——查询侧解码出 “Hamster eating food”,目标侧解码出 “Hamster”;”Saxophone player in a music store” 对应 “Saxophone player”。检索相关性本就定义在匹配对的共享语义上,这一现象从机制上解释了重建损失为何有效;同时也说明这些向量承载的是可被继续消费的语义,而非仅够排序的相似度信号——这正是 AI 搜索与 Agent 检索所需要的性质。

重建可视化:只给一个向量、不给任何原始输入,两侧解码出的共享概念稳定浮现。
4.4 效率:性能与效率友好,代价每 query 不到 1 毫秒
启用隐式推理后,查询编码的 p50 延迟增量为 纯文本 +0.87 ms、图文 +0.08 ms、视频 +0.80 ms(每 query),全部在 1 毫秒以内。
原因符合设计预期:隐式推理不做自回归生成、不做多轮推理,只是在同一次前向里多加了几个 soft token;对视频这类输入,计算本就被原始视觉 token 主导,额外成本被进一步摊薄。
与 4.2 对照:3.9 分的 MMEB-v2 提升,在线代价不到 1 毫秒——这个性价比是 DME 敢于进主检索链路的前提。

Query 编码器 p50 延迟对比:开启隐式推理的额外成本每 query 均在 1 毫秒以内。
4.5 落地效果:抖音场景离线 +2.92%,线上 LT +0.1%
以 DME 为初始化,把相关技术迁移到内部设定下继续训练,在抖音内部离线评测集上取得整体相对提升 2.92%,四个跨模态方向高度一致:Text2Video +3.10%、Text2Image +3.03%、Image2Video +2.83%、Image2Image +2.70%。
线上侧,DME已部署于抖音搜索,支撑生成式搜索,并作为排序阶段的特征参与打分,A/B 实验验证核心业务指标 LT(Lifetime)+0.1%。目前已应用于生成式搜索、视觉搜索、AI 搜索等多个真实场景。
5. 总结与展望
DME工作探索了如何在工业场景的高效与细粒度场景限制要求,通过系统探索多模态表征的数据组建、训练范式与评测引导,在一阶段搭建了完善了表征基础能力,第二阶段则是补充了对比监督信号的内容缺失,对比学习只告诉模型哪两个实例该靠近,确没有包含具体的内容细粒度信息——Latent Reasoning 与交叉条件重建共同补上了这件事。这也是我们认为生成式目标值得被引入表征训练的原因——当检索结果要被 Agent 或 AI 搜索继续消费时,向量里留下了什么,比它排得多准更值得关心。构建了服务于工业场景以及下一代Agent的高质高效通用多模态表征模型,在公开评测、抖音离在线多个场景取得了稳定的收益。
当提升检索精度的常规解法越来越倾向于在线加推理、加重排、加工具调用时,DME 给出的是一个反方向的样本——把认知负担前移到训练,让在线保持简单。对任何受延迟与索引成本约束的检索系统,这个方向都值得参考。接下来团队会沿数据与模型规模两条 scaling 继续推进,初步尝试均已带来一致增益。
表征不是大模型时代的旧基建,而是它的地基。地基做得更扎实,上面的推理才有可能站得更稳。
6. 加入我们
我们是服务于抖音的多模态搜索技术团队,致力于用多模态大模型技术推动搜索系统代际升级,打造用户首选的多模态搜索入口。在这里,你有机会接触到 2000+ GPU 算力集群与超大规模的多模态数据,可以亲手实践大规模Continue Train、Post Train、CoT+RL、生成式搜索等技术方向。团队人才密度高、技术氛围浓厚,现招募 2028 年及之后毕业的实习生,要求具备多模态经验与扎实的数理基础,每周到岗≥3天,能持续实习4个月以上。
投递方式:发送简历至 wangyuanjiang@bytedance.com,邮件标题格式为「姓名 + 学校 + 实习时长」。
本文作者@字节跳动技术团队。原文链接:https://mp.weixin.qq.com/s/7uiU7PViWK3G7stmX1f_Kw
