# SIGNPOST-Bench：多模态大模型文本-视觉冲突消解新基准

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-08-04 08:00
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmshrbwe70p2sronk0v4mh3d3
- 原文链接：https://arxiv.org/abs/2608.04244

## 精选理由

基准将场景文字冲突转化为连续的地理定位诊断，揭示对抗性文本可让定位误差扩大4.8倍，为多模态模型的证据仲裁能力提供了可量化的评估框架。

## AI 摘要

SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准，包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。

## 正文

多模态大语言模型（MLLM）通过结合视觉与文本线索在真实场景中进行有依据的预测，然而现有基准测试很少揭示当这些证据来源相互冲突时，模型如何在二者之间进行仲裁。我们引入了 SIGNPOST-Bench，这是一个受控的反事实基准测试，用于评估文本-视觉冲突消解能力。每个源图像被转换为由原始（Original）、空白（Blank）、相似（Similar）、随机（Random）和对抗（Adversarial）变体组成的反事实五元组。合成、局部化的场景文本干预被设计为保留非文本内容，从而能够对定位性能的变化以及由冲突文本引入的、指向地理目标的定向偏移进行配对测量。SIGNPOST-Bench 包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。我们评估了来自七家提供商的 20 个 MLLM。与原始（Original）图像相比，对抗（Adversarial）变体将中位定位误差从 282 公里提升至 1,347 公里，增加了 4.8 倍。在可地理编码的对抗样本中，各模型有 6.5%–20.1% 的预测落在注入目标 50 公里以内，并且每个被评估的模型在从空白（Blank）到对抗（Adversarial）的目标距离上均表现出正的平均配对缩减。兼容、无关和冲突的文本替换对模型预测产生不同的影响，而干净输入下的定位性能并不能完全预测对冲突文本的鲁棒性。这些结果将视觉地理定位确立为场景文本仲裁的连续诊断工具，并为评估 MLLM 如何消解冲突的多模态证据提供了一个受控框架。
