HuggingFace Daily Papers(社区热门论文)
精选
72AI 编辑部评分,满分 100

SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

2026-08-04 08:00· 2天前
AI 导读

SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。

推荐理由

基准将场景文字冲突转化为连续的地理定位诊断,揭示对抗性文本可让定位误差扩大4.8倍,为多模态模型的证据仲裁能力提供了可量化的评估框架。

正文 · AI 翻译

多模态大语言模型(MLLM)通过结合视觉与文本线索在真实场景中进行有依据的预测,然而现有基准测试很少揭示当这些证据来源相互冲突时,模型如何在二者之间进行仲裁。我们引入了 SIGNPOST-Bench,这是一个受控的反事实基准测试,用于评估文本-视觉冲突消解能力。每个源图像被转换为由原始(Original)、空白(Blank)、相似(Similar)、随机(Random)和对抗(Adversarial)变体组成的反事实五元组。合成、局部化的场景文本干预被设计为保留非文本内容,从而能够对定位性能的变化以及由冲突文本引入的、指向地理目标的定向偏移进行配对测量。SIGNPOST-Bench 包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。我们评估了来自七家提供商的 20 个 MLLM。与原始(Original)图像相比,对抗(Adversarial)变体将中位定位误差从 282 公里提升至 1,347 公里,增加了 4.8 倍。在可地理编码的对抗样本中,各模型有 6.5%–20.1% 的预测落在注入目标 50 公里以内,并且每个被评估的模型在从空白(Blank)到对抗(Adversarial)的目标距离上均表现出正的平均配对缩减。兼容、无关和冲突的文本替换对模型预测产生不同的影响,而干净输入下的定位性能并不能完全预测对冲突文本的鲁棒性。这些结果将视觉地理定位确立为场景文本仲裁的连续诊断工具,并为评估 MLLM 如何消解冲突的多模态证据提供了一个受控框架。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

HuggingFace Daily Papers(社区热门论文)·2026-08-04 08:00·2天前
AI 导读

SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。

正文 · AI 翻译

多模态大语言模型(MLLM)通过结合视觉与文本线索在真实场景中进行有依据的预测,然而现有基准测试很少揭示当这些证据来源相互冲突时,模型如何在二者之间进行仲裁。我们引入了 SIGNPOST-Bench,这是一个受控的反事实基准测试,用于评估文本-视觉冲突消解能力。每个源图像被转换为由原始(Original)、空白(Blank)、相似(Similar)、随机(Random)和对抗(Adversarial)变体组成的反事实五元组。合成、局部化的场景文本干预被设计为保留非文本内容,从而能够对定位性能的变化以及由冲突文本引入的、指向地理目标的定向偏移进行配对测量。SIGNPOST-Bench 包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。我们评估了来自七家提供商的 20 个 MLLM。与原始(Original)图像相比,对抗(Adversarial)变体将中位定位误差从 282 公里提升至 1,347 公里,增加了 4.8 倍。在可地理编码的对抗样本中,各模型有 6.5%–20.1% 的预测落在注入目标 50 公里以内,并且每个被评估的模型在从空白(Blank)到对抗(Adversarial)的目标距离上均表现出正的平均配对缩减。兼容、无关和冲突的文本替换对模型预测产生不同的影响,而干净输入下的定位性能并不能完全预测对冲突文本的鲁棒性。这些结果将视觉地理定位确立为场景文本仲裁的连续诊断工具,并为评估 MLLM 如何消解冲突的多模态证据提供了一个受控框架。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org