# UEmbed：统一稀疏与稠密的多模态嵌入模型

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-03 08:00
- AIHOT 分数：74
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmse4jxrl0d1ero2edxdc05fq
- 原文链接：https://arxiv.org/abs/2608.02583

## 精选理由

UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入，稀疏模式精度接近稠密且原生适配倒排索引，对兼顾效率和精度的检索系统，省去了维护多套模型的开销。

## AI 摘要

UEmbed 是一种仅解码器的多模态嵌入模型，可在单次因果前向传播中同时生成稀疏词级和稠密表示，通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。

## 正文

宋廷宇

李明欣

张彦昭

龙定坤

谢鹏军

聂志杰

赵一伦

吴舒

songtingyu23@mails.ucas.ac.cn

yilun.zhao@yale.edu

shu.wu@nlpr.ia.ac.cn

2026年8月3日

摘要

稀疏检索支撑着现代搜索系统，从网页搜索到检索增强生成。已有工作引入了学习型稀疏检索（LSR），以突破精确词法匹配、迈向更丰富的语义理解。然而，LSR 至今仍局限于编码器式双向架构，且其向多模态场景的扩展仍严重依赖辅助的跨模态模块。为解决这些局限，我们提出了 UEmbed（统一嵌入），一种仅解码器的多模态嵌入模型，能够在一次因果前向传播中同时生成稀疏词法表示和稠密表示。UEmbed 在输入中附加可学习的特殊 token，并将词表划分为互不相交的子集。每个 token 的因果隐状态预测其对应子集上的稀疏权重，各子集拼接后构成完整的稀疏向量。基于公开数据训练，我们发布了 2B、4B 和 9B 三个规模的 UEmbed。UEmbed-9B 在 MMEB-v2 上取得 71.8（稠密）和 71.0（稀疏）的成绩，在稠密检索中领先于基于公开数据训练的模型，并在稀疏检索中刷新了最优水平。在 BEIR 上，UEmbed 同样与强力的稠密和稀疏基线保持竞争力。此外，我们从三个维度展示了 UEmbed 的实际应用价值：有效性、效率以及智能体应用。总体而言，UEmbed 提供了一种新范式：它将稠密与稀疏嵌入统一于单一模型中，同时进一步将稀疏检索扩展至文本与多模态输入的统一处理。

宋廷宇（）\通讯作者赵一伦（）、吴舒（）\项目负责人龙定坤 \项目主页https://alibaba-nlp.github.io/UEmbed

图 1：UEmbed 概览。（a）框架：我们在仅解码器多模态大语言模型上附加可学习的特殊 token，并为每个 token 分配一个互不相交的词表子集。（b）稀疏案例：UEmbed-9B 产生的激活词法 token 示例。（c）性能：UEmbed 在 MMEB-v2 上取得了优异的稀疏与稠密检索结果。

1 引言

信息检索（IR）支撑着广泛的现实应用，包括网络搜索和问答系统。BM25（bm25）等稀疏词法方法因其高效性和可解释性而仍被广泛部署，但其对精确词项匹配的依赖限制了其捕捉超越表层词法重叠的语义相似性的能力。学习型稀疏检索（LSR）通过训练神经模型生成稀疏词法表示来弥补这一差距。SPLADE（spladev1; spladev2; spladepp）等代表性方法将词元级变换与最大池化相结合，显著提升了相较于经典词项加权方案的检索质量。

尽管取得了上述进展，LSR 在三个关键方面仍存在局限。（1）架构约束：当前的 LSR 方法主要构建在编码器式双向架构（如 BERT（bert））之上。由于单向注意力的因果掩码机制，仅解码器模型无法直接复用传统的池化策略来捕捉稀疏表示所需的全局上下文。利用大语言模型（LLM）进行稀疏检索通常需要要么将因果主干转换为双向架构（bgem3），要么采用专门的训练课程（laconic），这两种方式都会带来额外的训练成本，并破坏与 vLLM（vllm）等经过优化的因果模型推理框架的兼容性。（2）模态受限：大多数 LSR 方法仍局限于文本，因为传统方法高度依赖仅支持文本的 BERT 架构，缺乏原生多模态能力。少数多模态方法（visualsparta; stair）引入了辅助的跨模态模块，而非直接从单一多模态主干中派生稀疏表示，这使得它们难以扩展到新的模态。（3）实际效用未被探索：现有稀疏方法主要在 COCO（coco）等传统基准上进行评估，导致稀疏检索在准确性之外的实际优势未得到充分检验。

从因果模型中导出稀疏表示的主要挑战在于信息瓶颈：依赖单个 token（如 EOS、CLS）投影到大规模维度词汇空间，会严重限制表示能力。为克服这一问题，我们提出 UEmbed（统一嵌入），该方法向多模态大语言模型（MLLM）追加可学习的特殊 token，并为每个 token 分配词汇表的一个不相交子集。具体而言，这些子集通过 k-means 聚类得到，这显式地鼓励每个 token 表示不同的空间方向。在因果注意力机制下，每个特殊 token 从其位置汇总输入，并对其分配的簇预测稀疏权重。随后将这些子集拼接成完整的稀疏向量。这种分区投影有效规避了单 token 表示瓶颈。稠密嵌入则从特殊 token 之前的 EOS token 的隐藏状态获得。如图 1(b) 所示，UEmbed 产生了具有语义意义的词汇激活，表明稀疏表示捕获了跨模态语义。

我们在文本和多模态嵌入基准上评估了 UEmbed，结果汇总于图 1(c)。在 MMEB-v2 上，UEmbed-9B 达到 71.8（稠密）和 71.0（稀疏），在我们测试的每个规模下都将两种模式之间的差距缩小到 1 分以内。在 BEIR（9 个数据集，nDCG@10）上，UEmbed 与 SPLADE-v3（spladev3）等强稠密和稀疏基线保持竞争力。此外，我们的分析揭示了 UEmbed 的三个实际优势。首先，其稠密和稀疏模式上的混合评分持续改善文本和视觉文档检索。其次，其设计保持与高吞吐量服务栈（如 vLLM）和倒排索引搜索的兼容性。最后，在 BrowseComp-Plus（browsecompplus）上，稀疏模式在保持相当召回率的同时降低了工具调用成本。

•

我们提出 UEmbed，它从单一解码器主干同时生成稀疏和稠密检索表示。

•

UEmbed 将不同模态统一在一个模型中，并且可以轻松扩展到多种模态设置。据我们所知，UEmbed 是首个在 MMEB-v2 上评估的稀疏模型，并在稀疏多模态检索场景中树立了新的最先进水平。

•

我们的全面评估表明，UEmbed 的稀疏模式同时提升了效率和有效性，而其在智能体搜索中的强劲表现则凸显了其广泛的实用价值。

2 相关工作

2.1 学习型稀疏检索

学习型稀疏检索用神经模型取代了 BM25 等固定的词法统计方法，这些神经模型既会对已出现的词项重新加权，也会通过原文中不存在的语义相关词项来扩展表示。基于 SPLADE 的方法表明，上下文词元加权和词汇扩展可以使稀疏检索与强大的稠密基线相抗衡（spladev1；spladev2；spladev3）。近期工作利用 LLM 主干和更强的训练方案进一步拓展了这一研究方向（laconic）。虽然相关研究要么将解码器主干适配为双向行为以用于检索（laconic），要么在单一模型内联合训练稠密和稀疏检索（bgem3；sparsejoint），但我们的工作不同之处在于，我们在统一主干内以因果注意力机制原生地研究稀疏检索。

2.2 多模态检索

近期，多模态大语言模型（MLLM）（如 gemini2、qwen3vl2025、gpt5）在广泛的任务中展现出了卓越的性能。因此，通用多模态嵌入模型（如 vlm2vec、thinkthenembed2025、qwenvlembedding）也基于这些 MLLM 主干构建，并在 MMEB-v2（vlm2vecv2）等基准上取得了极具竞争力的结果。然而，多模态稀疏检索的研究仍远未充分。现有的学习型稀疏检索（LSR）工作通常引入辅助模块或额外的模型来解释非文本模态（如 visualsparta、stair、blipsparse、frozen、splare）。这类辅助模块将稀疏模型限制在特定的模态对上，并使其扩展到新模态变得复杂。我们的工作通过将解码器原生稀疏检索、统一稠密与稀疏建模以及多模态支持结合在单一因果主干中，填补了这一空白。

3 方法

图 1 展示了 UEmbed 的整体框架。我们首先在 §3.1 中回顾对比学习与学习型稀疏检索的相关预备知识，然后在 §3.2 中介绍所提出的方法，最后在 §3.3 中描述数据整理过程。

3.1 预备知识

InfoNCE 损失。

给定一个查询、一个正例文档以及一组批内负例，InfoNCE 损失鼓励模型对正例对赋予更高的相似度：

（1）

其中 为批内负例集合， 表示相似度函数（例如，稠密检索使用余弦相似度，稀疏检索使用内积）， 为温度超参数。

学习型稀疏检索。

基于 SPLADE 的模型（spladev1、spladev2）通过将每个 token 的隐藏状态投影到词表上，并使用最大池化和饱和激活函数在序列维度上进行聚合，从而生成稀疏表示：

（2）

其中 为第 个输入 token 的隐藏状态， 为词表词项 的嵌入向量， 为序列长度， 为词项 的最终权重。该稀疏向量可由标准倒排索引提供服务。

3.2 UEmbed 方法

将稀疏检索适配到仅解码器模型的关键挑战在于，单向注意力机制使得每个位置无法关注未来 token，导致对所有隐藏状态进行最大池化（max-pooling）效果不佳。我们通过引入附加到输入序列末尾的特殊 token，并将词表划分为互不相交的子集来解决这一问题。

词表压缩。

LLM 分词器通常包含冗余 token（例如，空白符、重音符号）。在划分之前，我们通过使用 NLTK（nltk）进行去重音、小写化和空白符折叠来压缩词表。共享相同规范形式的 token 会被合并为单个条目。例如，Hello、HELLO 和 héllò 都会被合并为 hello。在评分时，我们保留其中最大的权重。这使词表大小从 248,320 减少到 184,016。

分区稀疏头。

给定长度为 的输入序列，我们在末尾附加可学习的特殊 token。每个特殊 token 可以关注所有先前的 token，从而有效地总结整个输入。为了促使每个特殊 token 捕获不同的语义子空间，我们采用 k-means 聚类将词表划分为大小大致相等的互不相交子集。

每个特殊 token 负责通过一个子集专属的稀疏头为其分配的子集生成稀疏权重。设 表示 的最终隐藏状态。我们使用线性投影计算词表项 的稀疏权重：

(3)

对于所有 成立，其中 和 分别是第 个稀疏头中对应于词项 的特定权重向量和偏置标量。稀疏表示通过拼接所有子集向量获得：

(4)

其中 表示拼接操作。

稠密表示。

对于稠密检索，我们使用特殊 token 之前的 EOS token 的隐藏状态作为稠密嵌入 。当仅需要稠密检索时，可以完全省略特殊 token，不会产生额外的前向计算开销。

统一目标。

我们使用涵盖两种检索模式的组合损失来训练模型：

(5)

其中 和 分别使用余弦相似度和内积计算。 和 是 FLOPS 正则化项（paria2020flops），分别对查询和文档的平方平均项权重进行惩罚，以鼓励稀疏性。、 和 是平衡四个损失的标量系数。训练细节见附录 A。

3.3 数据整理

数据来源。

我们从三个公开可用的数据集中提取训练对，共计 394 万个样本。(1) Echo-embedding 训练数据（echoemb），提供覆盖广泛领域的大规模查询-文档对；(2) MLDR 训练数据（bgem3），提供长文档训练数据；(3) MMEB 训练集（vlm2vecv2），提供涵盖多种视觉和跨模态任务的多模态训练数据。

难负样本挖掘。

正如先前工作（spladepp）所证明的，难负样本对于训练学习型稀疏检索器至关重要。由于多模态数据集缺乏有效训练所需的负样本，我们利用 Qwen3-VL-Embedding-8B（qwenvlembedding）作为教师模型，为所有多模态数据挖掘难负样本。具体来说，对于每个查询，我们使用教师模型从语料库中检索出最相似的非相关文档，并将这些文档视为我们的难负样本。

4 实验

4.1 实验设置

媒体内容 · 前往原文查看

模型 图像 VisDoc 全部

CLS QA RET GD 平均 CLS QA RET MRET 平均 VDRv1 VDRv2 VR OOD 平均

数据集数量 10 10 12 4 36 5 5 5 3 18 10 4 6 4 24 78

Qwen3-VL-Embedding-8B 74.2 81.1 80.2 92.3 80.1 78.4 71.0 58.7 56.1 67.2 87.2 69.9 88.7 73.3 82.4 77.8

Qwen3-VL-Embedding-2B 70.3 74.3 74.8 88.5 75.0 71.9 64.9 53.9 53.3 61.9 84.4 65.3 86.4 69.4 79.2 73.2

RzenEmbed-V2-7B 70.6 71.7 78.5 92.1 75.9 58.8 63.5 51.0 45.5 55.7 89.7 60.7 88.7 34.7 75.5 71.1

Embed-RL-4B 63.7 70.5 71.3 91.3 71.2 57.6 58.4 45.1 49.5 53.0 80.2 53.4 84.9 67.1 74.7 68.1

Embed-RL-2B 62.8 67.9 68.6 90.4 69.2 57.0 55.9 45.1 49.4 52.1 80.0 52.0 84.6 65.7 74.1 66.8

Ops-MM-Embed-7B 69.7 69.6 73.1 87.2 72.7 59.7 62.2 45.7 43.2 53.8 80.0 59.6 79.3 33.7 68.7 67.1

Ops-MM-Embed-2B 68.1 65.1 69.2 80.8 69.0 53.6 55.6 41.8 33.7 47.6 76.4 53.2 77.6 32.5 65.5 63.0

UniME-7B 67.1 69.2 71.9 84.8 71.2 48.6 60.7 38.2 39.3 47.5 75.7 50.5 83.7 29.1 65.7 64.1

UniME-2B 64.8 62.8 67.6 77.2 66.6 44.3 51.0 32.9 39.7 42.2 72.4 46.2 79.2 28.9 62.5 59.7

GME-7B 57.6 34.6 71.2 59.5 55.9 37.3 50.3 28.3 37.5 38.4 89.5 55.5 85.0 34.7 73.6 57.3

VLM2Vec-V2-2.0B 62.9 56.4 69.6 77.1 64.9 39.2 34.7 28.4 37.5 34.7 74.4 44.6 79.3 31.2 63.5 57.5

UEmbed-2B（dense） 59.2 67.9 68.8 85.6 67.8 56.3 52.8 45.8 41.8 50.0 82.3 59.9 85.6 67.9 77.0 66.5

UEmbed-2B（sparse） 58.9 66.1 68.5 85.1 67.0 53.7 49.5 44.2 40.3 47.7 82.3 60.6 84.5 67.3 76.7 65.5

UEmbed-4B（dense） 62.3 72.3 72.6 88.4 71.4 61.4 65.0 50.1 47.9 57.0 84.1 61.0 87.3 70.4 78.8 70.4

UEmbed-4B（sparse） 61.9 70.2 72.3 88.0 70.6 61.8 63.3 48.3 47.1 56.0 84.3 60.6 87.2 69.5 78.6 69.7

UEmbed-9B（dense） 64.7 73.9 73.9 90.6 73.2 63.0 65.6 51.8 53.5 59.0 85.5 59.1 87.9 70.4 79.2 71.8

UEmbed-9B（sparse） 64.3 72.3 73.7 89.5 72.5 60.9 63.7 50.9 52.4 57.5 86.2 57.9 87.6 69.7 79.1 71.0

表 1：MMEB-v2 上的结果。加粗标记各列中模型（即不包括使用大规模专有数据训练的 Qwen3-VL-Embedding）的最佳得分。

骨干网络与模型规模。

我们从 Qwen3.5 系列中实例化 UEmbed，涵盖三个规模：2B、4B 和 9B 参数。对于每个规模，我们训练一个同时支持稠密检索和稀疏检索的单一检查点。

多模态基准与基线。

我们在 MMEB-v2（vlm2vecv2）上评估 UEmbed，该基准为多模态嵌入任务提供了全面的评估。为了全面定位我们的模型在当前领域中的位置，我们将其与一系列当前强基线进行了比较：（1）Qwen3-VL-Embedding（qwenvlembedding），一个使用大规模数据训练的强视觉语言嵌入基线；（2）RzenEmbed（rzenembed），我们采用了具有竞争力的 RzenEmbed-V2-7B 变体；（3）Embed-RL（embedrl），我们选择了其 2B 和 4B 两个版本；（4）Ops-MM-Embed（ops）和（5）UniME（unime2025），我们选择了 2B 和 7B 两个版本进行多尺度综合比较；（6）GME-7B（gme），一个稳健的 7B 多模态检索器；以及（7）VLM2Vec（vlm2vecv2），专门评估 VLM2Vec-V2-2.0B 版本。

文本基准与基线。

我们在 BEIR 的九个数据集上评估 UEmbed，并采用 nDCG@10 作为评估指标。评估设置的详细信息见附录 B。为确保公平比较，我们特意选择多模态嵌入模型作为稠密基线，有意排除纯文本模型。此外，我们还纳入了具有竞争力的稀疏模型，以构建全面的评估框架。我们选定的基线包括：(1) GME-7B (gme)，一个稳健的 7B 多模态嵌入模型，在 BEIR 上展现出强大的文本检索性能；(2) Qwen3-VL-Embedding (qwenvlembedding)，一个在大规模数据上训练的强大视觉语言嵌入基线，同样展现出具有竞争力的纯文本检索能力；(3) SPLADE-v3 (spladev3)，代表经典稀疏检索方法的最新迭代；(4) Echo-Mistral-SPLADE (mistralsplade)，利用强大的 LLM 主干生成高效稀疏表示。

4.2 多模态结果

表 1 报告了 MMEB-v2 在全部三个超类别上的结果。

UEmbed 与最强的开放多模态嵌入模型具有竞争力。

UEmbed-9B（稠密）达到 71.8 的聚合分数。虽然这一分数被 Qwen3-VL-Embedding-8B 超越，但需要指出的是，Qwen 的模型受益于使用海量专有数据集的多阶段训练，因此直接比较具有挑战性。与其他公开检查点并在开放数据集上训练的模型相比，UEmbed-9B（稠密）在公开数据训练的模型中处于领先地位，超越了 RzenEmbed-V2-7B（71.1）和 Ops-MM-Embed-7B（67.1）等模型。在更小规模上，情况保持一致：UEmbed-4B（稠密）以 70.4 的分数超越了 4B 参数级别的所有其他模型，例如 Embed-RL-4B（68.1）。此外，我们最紧凑的模型 UEmbed-2B（稠密）以 66.5 的分数，与 UniME-7B（64.1）等部分 7B 规模开放基线高度接近，甚至有所超越。为更好地理解 UEmbed 与 Qwen3-VL-Embedding 之间的差距，我们还在附录 C 中进行了分析。

在多模态场景下，稀疏检索仍然与稠密检索具有竞争力。

我们的研究结果表明，在多模态领域，稀疏嵌入是稠密嵌入的一种可行且强大的替代方案。如表所示，我们的稀疏模型在各规模下的性能都与对应的稠密模型非常接近，整体性能差距至多为 1.0 个百分点（例如，9B 模型为 71.8 对比 71.0）。据我们所知，这是该基准上首次报告的稀疏多模态嵌入结果，且其性能显著优于已有的稠密模型。例如，UEmbed-4B（稀疏）以 69.7 的成绩超过了稠密的 Ops-MM-Embed-7B（67.1）。进一步观察可以发现，稀疏模型在视觉丰富文档（VisDoc）任务上尤其有效，其性能下降微乎其微（例如，9B 模型为 79.2 对比 79.1）。这表明，稀疏嵌入的固有结构可能非常适合基于文档的任务，而在视频类别中，性能差距则稍显明显。

媒体内容 · 前往原文查看

模型 ArguAna FiQA 2018 NFCorpus NQ Quora SCIDOCS SciFact COVID Touche 2020 平均

稠密模型

GME-7B 64.6 57.1 38.4 67.7 88.1 27.4 62.3 52.6 23.3 53.5

Qwen3-VL-Embedding-2B 43.2 41.8 37.2 58.1 86.6 21.9 75.1 89.6 30.8 53.8

Qwen3-VL-Embedding-8B 45.8 47.8 39.7 64.5 86.5 24.9 79.4 84.1 26.9 55.5

UEmbed-2B 58.1 47.5 37.8 55.5 89.3 20.3 75.3 80.2 18.2 53.6

UEmbed-4B 60.0 53.4 40.5 60.9 89.2 22.5 77.0 82.7 18.1 56.0

UEmbed-9B 62.5 54.3 39.8 61.9 89.9 23.4 77.8 77.9 19.2 56.3

稀疏模型

SPLADE-v3 50.9 37.4 35.7 58.6 81.4 15.8 71.0 74.8 29.3 50.5

Echo-Mistral-SPLADE 56.2 57.7 42.3 56.0 86.7 25.6 77.2 76.8 18.0 55.2

UEmbed-2B 55.7 45.1 35.9 53.4 88.2 18.0 70.8 84.8 18.7 52.3

UEmbed-4B 58.8 49.4 38.4 59.9 88.6 20.8 74.4 75.4 16.7 53.6

UEmbed-9B 58.4 51.2 38.1 59.9 88.7 20.6 74.5 82.1 23.4 55.2

表 2：BEIR 数据集上的 nDCG@10。加粗标记了每种检索模式下每列的最佳得分。

4.3 文本结果

在稠密检索场景下，如表 2 所示，UEmbed 在各项评估基准上均展现出极具竞争力的性能。我们的 UEmbed-9B 模型在对比模型中取得了最高的平均 nDCG@10 分数（56.3），UEmbed-4B 紧随其后，达到 56.0。这使得我们的模型领先于 Qwen3-VL-Embedding-8B 和 GME-7B 等近期强基线模型。此外，UEmbed 在特定数据集上表现尤为突出，例如在 Quora 上取得 89.9（UEmbed-9B），在 NFCorpus 上取得 40.5（UEmbed-4B）。

在稀疏检索场景下，UEmbed-9B 的平均分数达到 55.2，与强大的专业模型 Echo-Mistral-SPLADE（55.2）基本持平。关键在于，UEmbed 在实现这一性能持平的同时，还在单一骨干网络内同时支持稠密检索和多模态输入。这些结果确立了 UEmbed 作为统一模型的定位——在文本性能几乎无损的情况下，获得了强大的多模态和稠密检索能力。

5 分析

为更深入地理解 UEmbed，本节从以下角度对模型进行分析：（1）组件分析：通过受控消融实验验证各设计选择的贡献（§5.1）；（2）跨模态鲁棒性：通过案例研究展示模型在不同模态下的表现（§5.2）；（3）实际优势：稀疏检索在混合评分、服务效率和智能体搜索中的实用价值。

5.1 组件分析

除非另有说明，本节中的消融实验使用在完整混合数据集中随机抽取的 50 万条实例子集上训练的 2B 骨干模型，并在 MMEB-v1（vlm2vec）上进行评估。

基线对比。

模型 CLS QA RET GRD 平均

SPLADE 55.8 57.1 62.9 80.9 61.3

UEmbed（稠密） 55.5 65.3 65.1 83.3 64.5

UEmbed（稀疏） 54.7 63.1 64.8 81.8 63.4

媒体内容 · 前往原文查看

表 3：在 MMEB-v1 图像子集上与双向 SPLADE 基线的对比。

划分方式 CLS QA RET GRD 平均

随机 55.0 62.3 64.2 81.0 63.0

最大距离 55.1 62.4 64.9 79.8 63.2

语义（我们的） 54.7 63.1 64.8 81.8 63.4

媒体内容 · 前往原文查看

表 4：在 MMEB-v1 图像子集上，不同词汇划分策略下的稀疏检索性能。

为评估§4.2中的提升是否归因于UEmbed方案，我们将UEmbed-2B与基于SPLADE的基线进行对比。该基线共享相同的Qwen3.5主干网络、训练数据和FLOPS正则化，但采用双向注意力机制，并配有标准SPLADE最大池化头（公式2）。表3表明，UEmbed-2B在两种模式下均超越该双向基线：稠密模式平均得分（61.3对64.5），稀疏模式平均得分（61.3对63.4）。差距在IMG-QA上最为显著（稠密、稀疏），这表明标准SPLADE方案未能充分利用自回归主干网络固有的问答能力。因此，我们统一的因果公式化表述对嵌入质量本身就有益，而不仅仅是提供了服务部署上的便利。

对联合训练的鲁棒性。

（a）联合训练与单模式训练。

（b）稀疏温度参数。

（c）特殊token数量。

图2：UEmbed的消融研究：（a）联合训练与单模式专家模型表现相当；（b）扫描稀疏softmax温度参数；（c）扫描追加特殊token的数量。

多任务学习中的一个常见陷阱是目标之间的负迁移。为验证我们的联合目标（公式5）是否损害任一检索模式，我们在相同条件下训练了仅稠密模式和仅稀疏模式的基线模型。如图2（a）所示，联合训练的UEmbed模型与两种单模式专家模型的性能高度接近。这证实了双模式能力在训练过程中带来的性能损失可忽略不计。

词汇表划分。

稀疏头将词汇表划分为互不相交的子集。我们比较了三种平衡划分策略：（1）随机均匀分配；（2）最大距离法，即将距离最远的 -means 聚类两两配对，以在子集内部强制实现语义多样性；（3）我们的方法（语义聚类），即将单个 -means 聚类分配给不同的子集。语义聚类取得了最佳性能，而随机划分表现最差。这表明，将语义相关的 token 分组，可以让每个特殊 token 充当“软主题专家”，优化其有限的表征能力，而不是同时费力地去建模不相关的概念。

超参数敏感性。

我们扫描了稀疏头特有的两个超参数：稀疏温度（）。与稠密头的余弦相似度不同，稀疏内积的动态范围要大得多。因此，共享温度会过度锐化稀疏 softmax。图 2(b) 表明，解耦温度并使用更大的 值可以在不损害稠密检索的情况下提升稀疏性能；我们采用 作为默认值，同时注意到在我们报告的单种子扫描中， 的表现与之相当。特殊 token 数量（）。扫描 （图 2(c)）显示，在 之前性能保持稳定，而在 处出现明显下降。我们将这种退化归因于词汇子集过小以及对比序列长度被不合理地拉长。我们采用 作为实现默认值。

5.2 案例研究

基于图 1(b) 中的示例，我们展示了跨多种模态的更多案例研究。如图 3 所示，我们的模型展现出强大的能力，能够识别输入中的关键组成部分并激活语义相关的概念。例如，它可以仅凭天际线推断出图像拍摄地点为新加坡，并能准确识别出某枚火箭属于 SpaceX。

图 3：UEmbed 在不同模态上的案例研究。我们可视化了激活程度最高的前 10 个稀疏 token。

然而，我们也观察到两个主要局限：（1）异常 token 的生成：模型偶尔会产生非标准 token（例如“_alt”）。与 BERT 这类在受限且高度结构化词汇表内运作的传统掩码语言模型不同，现代大语言模型极其庞大的词汇量增加了生成此类边缘情况 token 的概率。这表明可能有必要进一步压缩词汇表或进行针对性剪枝，以确保表征的稳定性。（2）多语言支持有限：模型主要激活英文和中文 token，而忽略了其他语言。这种偏差主要源于我们的训练语料库——其内容严重偏向英文和中文——以及底层基础模型固有的跨语言局限性。

5.3 实际优势

稀疏检索在实际部署中具有结构性优势。在本节中，我们考察 UEmbed 的三个层面：（1）通过混合评分结合其稀疏与稠密模式所带来的效果提升；（2）由自回归推理和原生倒排索引兼容性所实现的部署端效率；（3）其在下游智能体搜索工作流中作为检索器的实用性。

效果。

由于 UEmbed 在单次前向传播中同时生成稀疏和稠密表征，因此无需额外的编码过程即可将两种模式结合。我们通过线性插值稠密与稀疏相似度来构建混合评分；详细公式和各模态权重见附录 B.3。表 5 显示，混合评分提升了 Text（）和 VisDoc（）的表现，其中精确的词法匹配对稠密语义形成了补充。相比之下，自然图像和视频帧携带的表面词法信息很少，使得稀疏检索能够贡献的额外信号有限。尽管稀疏检索在依赖词法的任务上可能带来收益，但由于在多样化的 MMEB-v2 和 BEIR 基准上的稀释效应，总体提升幅度较为有限。

效率。

媒体内容 · 前往原文查看

模型 TXT IMG VID VDR

UEmbed（稠密） 53.6 67.8 50.0 77.0

UEmbed（稀疏） 52.3 67.0 47.7 76.7

UEmbed（混合） 53.9 67.9 50.0 77.5

表 5：UEmbed-2B 在密集、稀疏和混合模式下的分模态性能。

UEmbed 具有两个部署侧优势。首先，由于该模型是纯自回归模型，嵌入向量的生成可直接兼容 vLLM（vllm）等高吞吐量服务栈。其次，稀疏表示可直接接入标准倒排索引，从而在生产环境中实现可扩展的词汇检索。我们将倒排索引搜索效率的详细分析推迟到附录 B.3 中讨论。

应用场景：智能体搜索。

媒体内容 · 前往原文查看

模型 准确率（%） 召回率（%） 平均搜索 校准误差（%）

BM25 36.87 43.02 17.91 –

Qwen3-Embedding-8B 44.46 62.32 30.37 –

Qwen3-VL-Embedding-2B 26.87 38.20 34.99 12.13

Qwen3-VL-Embedding-8B 31.45 44.42 34.19 12.35

UEmbed-2B（密集） 44.10 53.47 39.19 16.69

UEmbed-2B（稀疏） 44.05 57.04 32.67 8.54

UEmbed-4B（密集） 51.57 61.03 38.47 14.34

UEmbed-4B（稀疏） 45.54 60.10 31.85 8.79

UEmbed-9B（密集） 49.76 64.72 33.68 7.06

UEmbed-9B（稀疏） 49.76 64.33 31.05 8.16

表 6：BrowseComp-Plus 上的结果。“平均搜索”指每道题的平均搜索轮数。

正如 meng2026revisiting 所指出的，LLM 智能体经常发出简短、关键词密集的查询，在这种场景下，稀疏检索通常优于密集检索。为进一步探索该问题，我们在 BrowseComp-Plus（browsecompplus）上测试了 UEmbed，这是一个 LLM 在迭代推理过程中将检索作为工具的基准。我们使用 DeepResearch-30A3B（tongyidr）作为骨干推理引擎。如表 6 所示，UEmbed 的稀疏模式始终比其密集模式需要更少的工具调用搜索轮数。在 2B 规模下召回率更高，在 4B 和 9B 规模下则相当。这些结果验证了稀疏检索在关键词密集查询占主导、对成本敏感的迭代推理循环中是一种实用的选择。

6 结论

在本工作中，我们提出了 UEmbed，一个仅解码器的多模态嵌入模型，它在一个因果前向传播中原生统一了稠密检索与稀疏检索。通过克服因果注意力的固有瓶颈，UEmbed 系统性地消除了对双向编码器和辅助跨模态模块的依赖。我们的综合评估表明，UEmbed 在稀疏多模态检索中树立了新的最先进水平，同时在稠密检索中保持高度竞争力。通过严格的组件分析，我们验证了算法设计的合理性，并提供了实用设置。关键在于，UEmbed 在实现强大效果的同时，与自回归服务栈和倒排索引原生兼容，并在智能体搜索场景中展现出成本优势。总体而言，它将稀疏检索从传统的独立模块转变为多模态大语言模型的原生副产品。

局限性

尽管 UEmbed 为统一多模态检索奠定了坚实基础，我们仍识别出若干未来可改进的方向。（1）语言与文化偏差：本工作使用的训练语料主要偏向英语和中文。因此，稀疏头激活的跨语言泛化能力有限。要将该框架的稀疏能力扩展到更广泛的语言，将需要高度语言多样化的大规模训练数据。（2）词汇稳定性与伪影：与词汇表受限的传统掩码语言模型不同，在现代大语言模型的庞大词汇表上操作偶尔会导致异常 token 激活（例如，非标准子词或类似“_alt”的伪影）。未来的迭代可以探索有针对性的词汇剪枝、精细化的语义聚类，或事后过滤机制，以确保在严格的生产环境中表征的稳定性。（3）模态特定性能差距：虽然稀疏和稠密表征在文本和静态视觉文档上保持接近的性能水平，但我们观察到在视频领域存在略微更明显的差距。我们将此归因于视频帧固有的高信息密度和时间动态性。这表明，将时空数据简单池化为扁平稀疏向量可能会遇到容量瓶颈。

伦理考量

我们的模型仅使用公开可用的数据集进行训练，并发布模型权重以促进可复现性。我们承认，嵌入向量模型可能继承其训练数据和骨干大语言模型中存在的偏见；从业者在高风险检索应用中部署之前，应评估不同人口群体间的公平性。稀疏表征通过呈现激活的词汇项提供了一定程度的可解释性，与纯稠密模型相比，这可能有助于偏见审计。

参考文献

附录 A 实现细节

A.1 训练数据

我们构建了一个多源训练混合数据集，涵盖文本、图像、视频以及富含视觉信息的文档检索。各数据源的组成比例见图4，每个数据集的检索指令列于表7和表8。

图4：训练数据源分布。

文本训练数据。

为支持文本嵌入能力，我们纳入了来自Echo-Embedding（echoemb）和M3-Embedding（bgem3）的训练对。文本子集包含NLI、DuReader、ELI5、FEVER、HotpotQA、MIRACL、MrTyDi、MSMARCO Passage、MSMARCO Document、Natural Questions、Quora Duplicates、SQuAD、T2Ranking、TriviaQA和MLDR。对于标准文本任务，我们设置最大序列长度为1,500个token；对于长文档检索（MLDR），我们将其扩展至1,800个token。

多模态训练数据。

对于视频检索，我们使用来自LLaVA-Hound（llava-hound）的VideoCaption300k和VideoQA240k数据集。每个视频采样8帧，每帧分配最多200个token。对于视觉文档检索，我们整合了来自ViDoRe（vidore）和VisRAG（visrag）的ColPali训练集（118k）、VisRAG-Synthetic（239k）和VisRAG-IID（123k）。对于图像-文本检索，我们纳入MMEB训练数据集（vlm2vec），涵盖CIRR、NIGHTS、MSCOCO、VisualNews、N24News、ImageNet-1K、SUN397、VOC2007、HatefulMemes、A-OKVQA、OK-VQA、Visual7W、ChartQA、DocVQA、InfographicsVQA、VisDial和WebQA。对于视频任务，最大序列长度为1,800个token，每个视频采样8帧，每帧最多200个token。对于所有其他多模态任务，最大序列长度为1,500个token，其中图像最多分配1,000个token。

图5：训练动态对比。我们绘制了训练过程中的损失、最大负间隔和平均负间隔。

媒体内容 · 前往原文查看

数据集 指令

AllNLI 给定一个前提，检索一个由该前提蕴含的假设。检索语义相似的文本。

DuReader 给定一个中文搜索查询，检索能够回答该问题的网页段落。

ELI5 给定一个用户问题，检索Reddit ELI5论坛上获赞最高的回答。

FEVER 给定一个主张，检索支持或反驳该主张的文档。

HotpotQA 给定一个多跳问题，检索有助于回答该问题的文档。

MIRACL 给定一个问题，检索能够回答该问题的维基百科段落。

MrTyDi 给定一个问题，检索能够回答该问题的维基百科段落。

MSMARCO-Doc 给定一个网络搜索查询，检索能够回答该查询的相关文档。

MSMARCO-Psg 给定一个网络搜索查询，检索能够回答该查询的相关段落。

NQ 给定一个问题，检索能够回答该问题的维基百科段落。

Quora 给定一个问题，检索与输入问题语义等价的问题。

SQuAD 检索能够回答该问题的维基百科段落。

T2Ranking 给定一个中文搜索查询，检索能够回答该问题的网络段落。

TriviaQA 检索能够回答该问题的维基百科段落。

MLDR 检索能够回答该问题的维基百科段落。

表 7：文本训练数据集的检索指令。

A.2 训练细节

我们从预训练的多模态骨干网络初始化，并向分词器和嵌入矩阵添加特殊 token。训练使用应用于注意力层和 MLP 投影（q_proj、k_proj、v_proj、up_proj、down_proj、gate_proj）的 LoRA（lora2022），视觉编码器保持冻结。我们使用 bf16 混合精度进行训练，并启用 DeepSpeed ZeRO 和梯度检查点。

超参数。

我们基于 Qwen3.5 训练 UEmbed 模型。我们使用余弦学习率调度，峰值学习率为 ，预热比例为 0.1。稠密检索温度设置为 ，稀疏检索温度设置为 。对于 FLOPS 正则化器，我们设置 ，并在前 200 步内进行线性升温。稀疏损失因子使稀疏和稠密 InfoNCE 损失权重相等。我们训练 1 个 epoch，并将随机种子固定为 42。UEmbed-2B 和 UEmbed-4B 在 16 块 A100 GPU 上训练，每设备批大小为 16；UEmbed-9B 在 32 块 A100 GPU 上训练，每设备批大小为 8，确保所有模型的批大小一致为 256。

A.3 训练分析

由于稀疏分数是通过内积计算的，未归一化相似度的大动态范围可能导致稀疏训练不稳定。我们发现，加入文本训练数据能显著提升多模态稀疏模型训练的稳定性和速度。参照 GVE（gve），我们在训练过程中监控三个关键指标：损失、最大负间隔和平均负间隔。最大负间隔定义为批次内正样本与负样本之间的最大分数差，而平均负间隔则是批次内所有正负样本对的平均分数差。如图 5 所示，使用文本数据训练时，模型能快速（100 步内）学习到有效的稀疏表示。相比之下，仅使用多模态数据（如图像、视频）训练时，模型需要近 500 步才能可靠地区分正样本与负样本。

媒体内容 · 前往原文查看

数据集 指令

CIRR 给定一张图像，找到一张具有所述变化的相似日常图像。

NIGHTS 找到一张与所提供图像相似的日常图像。

MSCOCO 选择图像中隔离出该物体的部分。

MSCOCO（图像到文本） 找到描述给定日常图像的图像标题。

VisualNews（图像到标题） 为给定照片中的新闻找到标题。

MSCOCO（文本到图像） 找到一张与给定标题匹配的日常图像。

VisualNews（文本到图像） 检索一张与该新闻标题对应的图像。

N24News 对给定新闻图像的领域进行分类。

ImageNet_1K 对给定图像进行分类。

SUN397 识别图像中所示的场景。

VOC2007 识别图像中所示的物体。

HatefulMemes 判断给定图像是否构成仇恨言论。

A-OKVQA 回答关于给定图像的问题。

OK-VQA 回答关于给定图像的问题。

Visual7W 回答关于给定图像的问题。

ChartQA 回答关于给定图表图像的问题。

DocVQA 回答关于给定文档图像的问题。

InfographicsVQA 回答关于给定信息图图像的问题。

VisDial 根据给定的对话检索图像。

WebQA 找到一张能回答该问题的维基百科图像。

VISRAG-IID 找到一张能回答该问题的维基百科图像。

ViDoRe 找到一张能回答这个问题的维基百科图片。

VisRAG-Synthetic 找到一张能回答这个问题的文档图片。

VideoCaption300k（文生视频） 找到一段与给定描述匹配的视频。

VideoCaption300k（视频生文） 找到一段能够描述给定视频的文字说明。

VideoQA240k 回答关于给定视频的问题。

表 8：多模态训练数据集的检索指令。

附录 B 实验细节

B.1 评估模型

我们在表 9 中提供了与 UEmbed 进行对比的基线模型在多模态基准 MMEB-v2（表 1）和文本基准 BEIR（表 2）上的详细信息。

媒体内容 · 前往原文查看

模型 发布时间 检索方式 骨干网络 参数量

基线模型

Qwen3-VL-Embedding-8B 2026-01 稠密 Qwen3-VL-8B 8B

Qwen3-VL-Embedding-2B 2026-01 稠密 Qwen3-VL-2B 2B

RzenEmbed-V2-7B 2025-10 稠密 Qwen2-VL-7B 7B

Embed-RL-4B 2026-02 稠密 Qwen3-VL-4B 4B

Embed-RL-2B 2026-02 稠密 Qwen3-VL-2B 2B

Ops-MM-Embed-7B 2025-07 稠密 Qwen2-VL-7B 7B

Ops-MM-Embed-2B 2025-07 稠密 Qwen2-VL-2B 2B

UniME-7B 2025-10 稠密 Qwen2-VL-7B 7B

UniME-2B 2025-10 稠密 Qwen2-VL-2B 2B

GME-7B 2024-12 稠密 Qwen2-VL-7B 7B

VLM2Vec-V2-2.0B 2025-05 稠密 Qwen2-VL-2B 2B

SPLADE-v3 2024-03 稀疏 BERT 110M

Echo-Mistral-SPLADE 2024-08 稀疏 Mistral-7B 7B

我们的模型

UEmbed-2B 2026-08 稠密与稀疏 Qwen3.5-2B 2B

UEmbed-4B 2026-08 稠密与稀疏 Qwen3.5-4B 4B

UEmbed-9B 2026-08 稠密与稀疏 Qwen3.5-9B 9B

表 9：与 UEmbed 对比的基线模型详细信息。多模态模型在 MMEB-v2 上评估；纯文本模型在表 2 中报告的九个 BEIR 数据集上评估。UEmbed 从单个检查点同时生成稠密和稀疏嵌入向量。

B.2 评估设置

评估指标。

对于 MMEB-v2（vlm2vecv2），我们对不同数据集使用其对应的评估指标。对于 BEIR，我们使用 nDCG@10 作为评估指标。

分数计算。

除非另有说明，稠密分数是 EOS token 隐藏状态（即特殊 token 之前的最后一个内容 token，定义见 §3.2）的余弦相似度，稀疏分数是 §3.2 中定义的分区词表表示上的内积。

B.3 消融实验细节

有效性。

我们进一步详细说明 §5.3 中使用的混合评分。给定查询 和候选 ，混合分数将稠密余弦相似度和稀疏内积线性组合为

(6)

由于 和 处于完全不同的量级，稠密余弦相似度被限制在 范围内，而稀疏内积的取值幅度可以大得多。我们对 进行固定，并在留出集上按模态分别调节 。我们对 Text 使用 ，对 Image 使用 ，对 Video 使用 ，对 VisDoc 使用 。纯文本的最优值要小几个数量级，因为原始稀疏内积会随着激活 token 数量的增加而迅速增长，而多模态输入产生的激活模式要稀疏得多，因此可以容纳相对更大的取值。

效率。

UEmbed 的稀疏表示与倒排索引天然集成，为大规模词法检索打开了大门。为了量化这一点，我们对 BrowseComp-Plus 的离线检索模式进行了基准测试，将基于 Faiss 的稠密索引与基于 Lucene 的稀疏倒排索引进行了对比。图 6 展示了我们稀疏模式的延迟-精度权衡：通过限制每个查询的最大激活 token 数量（），实践者可以灵活地在搜索延迟与检索质量（NDCG@5）之间进行权衡，以适应部署约束。虽然在该语料库规模下稠密搜索的绝对性能略高，但我们预计随着语料库的增长，倒排索引检索将变得越来越有优势；系统性的多规模评估留待未来工作。

图 6：稠密检索与稀疏倒排索引检索之间的搜索效率-效果权衡。

B.4 额外实验结果

为了对我们的超参数设置进行更可靠的检验，我们报告了使用随机种子 42 训练的模型在 MMEB-v2 上的结果。这些趋势与主论文中的设置大体一致：（1）联合稠密-稀疏训练在保持稠密性能的同时，产生了一个具有竞争力的稀疏分支（表 10）。（2）使用过多的特殊 token 会损害稀疏检索（表 11）。（3）更高的稀疏训练温度是有益的（表 12）。

媒体内容 · 前往原文查看

模式 图像 VisDoc 全部

CLS QA RET GD 平均 CLS QA RET MRET 平均 VDRv1 VDRv2 VR OOD 平均

数据集数量 10 10 12 4 36 5 5 5 3 18 10 4 6 4 24 78

仅稠密 55.3 65.4 65.3 83.5 64.6 56.3 52.2 44.8 48.3 50.6 81.6 61.7 82.9 66.8 76.1 64.9

仅稀疏 54.1 63.6 64.2 79.8 63.0 54.1 52.6 43.6 45.6 49.3 79.9 58.5 82.5 64.9 74.5 63.4

UEmbed-2B（稠密） 55.5 65.3 65.1 83.3 64.5 58.3 46.9 45.6 47.5 49.8 81.6 59.5 83.1 66.7 75.8 64.6

UEmbed-2B（稀疏） 54.7 63.1 64.8 81.8 63.4 56.0 46.3 44.4 45.7 48.4 79.9 59.3 82.0 65.9 74.7 63.4

表 10：不同表示模式下的 MMEB-v2 性能对比。

媒体内容 · 前往原文查看

图像 视觉文档 全部

CLS QA RET GD 平均 CLS QA RET MRET 平均 VDRv1 VDRv2 VR OOD 平均

数据集数量 10 10 12 4 36 5 5 5 3 18 10 4 6 4 24 78

2 56.0 62.9 65.0 81.2 63.7 56.6 48.2 45.3 46.6 49.4 80.1 59.4 82.1 65.8 74.8 63.8

4 55.0 62.7 64.9 80.4 63.3 57.0 47.3 45.7 44.5 49.1 80.2 60.3 82.0 65.7 74.9 63.6

8 54.9 62.2 65.2 81.0 63.2 55.1 48.9 44.8 46.1 49.0 79.6 58.8 81.6 65.8 74.3 63.4

16 54.7 63.1 64.8 81.8 63.4 56.0 46.3 44.4 45.7 48.4 79.9 59.3 82.0 65.9 74.7 63.4

32 54.6 62.8 65.0 80.3 63.2 54.4 46.2 41.9 45.7 47.2 75.6 22.3 73.4 65.7 64.5 59.9

表 11：不同特殊 token 数量下的 MMEB-v2 性能。

媒体内容 · 前往原文查看

温度 图像 视觉文档 全部

CLS QA RET GD 平均 CLS QA RET MRET 平均 VDRv1 VDRv2 VR OOD 平均

数据集数量 10 10 12 4 36 5 5 5 3 18 10 4 6 4 24 78

2 53.7 61.7 62.8 77.4 61.6 50.7 48.6 41.7 44.3 46.6 79.5 57.5 80.0 64.4 73.4 61.8

4 52.9 60.4 63.2 78.0 61.2 50.4 49.0 42.4 44.1 46.7 79.1 56.5 80.3 64.7 73.2 61.6

8 55.0 60.8 64.5 80.2 62.6 54.9 50.6 43.2 43.6 48.6 80.3 58.1 81.6 65.3 74.4 63.0

16 54.0 62.2 64.3 80.8 62.7 55.7 53.0 43.0 44.8 49.6 80.1 57.7 82.2 65.4 74.4 63.3

32 54.7 63.1 64.8 81.8 63.4 56.0 46.3 44.4 45.7 48.4 79.9 59.3 82.0 65.9 74.7 63.4

64 54.8 63.4 64.7 81.8 63.5 54.6 50.5 44.5 49.3 49.8 80.4 58.9 82.1 64.9 74.7 63.8

表 12：不同温度值下的 MMEB-v2 性能。

附录 C 案例研究

C.1 定性分析

为了更好地理解 UEmbed 与 Qwen3-VL-Embedding 之间的差距，我们在 MMEB-v2 上重新计算了每个查询的 Hit@1，并检查了 Qwen3-VL-Embedding 成功而 UEmbed 失败的案例。这些错误具有模态依赖性：（1）图像。差距主要出现在细粒度识别（ImageNet-A、SUN397、N24News）和基于问题的视觉问答（GQA、ScienceQA）中，在这些任务中 UEmbed 有时会混淆视觉上相似的类别，或受到误导性的词汇线索影响。（2）视频。Qwen3-VL-Embedding 在动作识别、时间片段定位和长视频推理（HMDB51、UCF101、EgoSchema、NExTQA、QVHighlight）方面表现更强，这很可能归功于其专门的时间/运动监督，而我们当前的训练数据中几乎不包含视频专用数据。（3）视觉文档。差距较小，主要出现在多语言 ViDoRe 以及表格/数值推理类文档中。Qwen3-VL-Embedding 可能受益于其 rank-KL 目标函数，该目标函数将重排序器的分数蒸馏到嵌入模型中。

C.2 案例研究

我们展示了 UEmbed 在不同任务和模态下的更多案例研究。对于每个示例，我们可视化了前 10 个激活的稀疏 token。在图中，蓝色 token 表示查询激活，绿色 token 表示语料库激活，红色 token 表示查询和语料库之间共享的共激活 token。我们发现，稀疏表示在问答、检索和定位任务上表现良好，激活的 token 与查询意图高度相关。然而，对于分类任务，模型倾向于过度关联不相关的概念，并且在遵循指令方面存在困难，导致稀疏激活不够精确。

图 7：UEmbed 在分类任务（N24News）上的案例研究。我们可视化了前 10 个激活的稀疏 token。

图 8：UEmbed 在问答任务（OK-VQA）上的案例研究。我们可视化了前 10 个激活的稀疏 token。

图 9：UEmbed 在文生图检索任务（MSCOCO）上的案例研究。我们可视化了前 10 个激活的稀疏 token。

图 10：UEmbed 在定位任务（MSCOCO）上的案例研究。我们可视化了前 10 个激活的稀疏 token。
