基于图像的联合嵌入预测架构(I-JEPA)通过掩码特征预测,为视觉自监督学习提供了一种有前景的方法。然而,由于掩码位置固有的视觉不确定性,特征预测仍然具有挑战性,并且可能无法学习到语义表示。在这项工作中,我们提出了文本条件联合嵌入预测架构(TC-JEPA),它利用图像描述来降低预测不确定性。具体来说,我们使用一个细粒度的文本调节器来调制预测的块特征,该调节器对输入的文本 token 计算稀疏交叉注意力。通过这种调节,块特征变得可以根据文本进行预测,因此更具语义意义。我们证明 TC-JEPA 提高了下游性能与训练稳定性,并具有良好的扩展特性。TC-JEPA 还提供了一种仅基于特征预测的新视觉-语言预训练范式,在多种任务上优于对比方法,尤其是在需要细粒度视觉理解和推理的任务上。
相关阅读与更新。
重新思考 JEPA:使用冻结教师模型实现计算高效的视频自监督学习
视频联合嵌入预测架构(V-JEPA)通过使用指数移动平均(EMA)更新的教师模型在潜在空间中预测掩码区域,来学习可泛化的现成视频表示。虽然 EMA 防止了表示坍塌,但它使可扩展的模型选择变得复杂,并将教师模型与学生模型的架构耦合在一起。我们重新审视了掩码潜在预测,并证明一个冻结的教师模型就足够了。具体来说,我们(i)训练一个……
JEPA 如何避免噪声特征:深度线性自蒸馏网络的隐式偏差
数据表示的自监督学习存在两种相互竞争的范式。联合嵌入预测架构(JEPA)是一类架构,其中语义相似的输入被编码成能够相互预测的表示。近期一种属于 JEPA 框架的成功方法是自蒸馏,即训练一个在线编码器来预测目标编码器的输出,有时会使用……