# 用于学习语义丰富视觉表征的文本条件JEPA

- 来源：Apple Machine Learning Research（RSS）
- 发布时间：2026-05-07 08:00
- AIHOT 分数：69
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmovtn194006zslcxkg4a1yti
- 原文链接：https://machinelearning.apple.com/research/text-conditional-jepa-visual-representations

## 精选理由

Apple 这篇 TC-JEPA 把文本融入自监督视觉预训练，用稀疏交叉注意力减少预测不确定性，对多模态表征学习是个不错的思路补充，做视觉模型的值得一看。

## AI 摘要

研究人员提出文本条件联合嵌入预测架构（TC-JEPA），通过引入图像描述文本作为条件信息来降低掩码特征预测中的视觉不确定性。该方法采用细粒度文本调节器，对输入文本标记计算稀疏交叉注意力，从而调制预测的图像补丁特征。与基于掩码特征预测的I-JEPA相比，TC-JEPA能够学习到语义更丰富的视觉表征，解决了原有方法因视觉不确定性导致的语义学习不足问题。

## 正文

基于图像的联合嵌入预测架构（I-JEPA）通过掩码特征预测，为视觉自监督学习提供了一种有前景的方法。然而，由于掩码位置固有的视觉不确定性，特征预测仍然具有挑战性，并且可能无法学习到语义表示。在这项工作中，我们提出了文本条件联合嵌入预测架构（TC-JEPA），它利用图像描述来降低预测不确定性。具体来说，我们使用一个细粒度的文本调节器来调制预测的块特征，该调节器对输入的文本 token 计算稀疏交叉注意力。通过这种调节，块特征变得可以根据文本进行预测，因此更具语义意义。我们证明 TC-JEPA 提高了下游性能与训练稳定性，并具有良好的扩展特性。TC-JEPA 还提供了一种仅基于特征预测的新视觉-语言预训练范式，在多种任务上优于对比方法，尤其是在需要细粒度视觉理解和推理的任务上。

相关阅读与更新。

重新思考 JEPA：使用冻结教师模型实现计算高效的视频自监督学习

视频联合嵌入预测架构（V-JEPA）通过使用指数移动平均（EMA）更新的教师模型在潜在空间中预测掩码区域，来学习可泛化的现成视频表示。虽然 EMA 防止了表示坍塌，但它使可扩展的模型选择变得复杂，并将教师模型与学生模型的架构耦合在一起。我们重新审视了掩码潜在预测，并证明一个冻结的教师模型就足够了。具体来说，我们（i）训练一个……

JEPA 如何避免噪声特征：深度线性自蒸馏网络的隐式偏差

数据表示的自监督学习存在两种相互竞争的范式。联合嵌入预测架构（JEPA）是一类架构，其中语义相似的输入被编码成能够相互预测的表示。近期一种属于 JEPA 框架的成功方法是自蒸馏，即训练一个在线编码器来预测目标编码器的输出，有时会使用……

发现机器学习领域的机遇。
