HuggingFace Daily Papers(社区热门论文)
精选
75AI 编辑部评分,满分 100

大语言模型的显著性偏差:常识推理中的知识压制而非缺失

2026-07-30 08:00· 4天前
跳到正文
精选理由

这篇论文证明 LLM 常识推理失败源于知识被显性干扰项抑制而非缺失,剥离任务框架后超九成服从性案例可恢复,提示瓶颈在引导方式而非模型能力。

AI 摘要

研究提出“显著性偏差”概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。

正文 · AI 翻译
摘要

随着大语言模型(LLM)在复杂推理任务中不断进步,它们已学会高度优先处理输入中提供的显式条件。然而,在日常常识推理中,这种机制暴露出了一个关键漏洞,我们将其称为**显著性偏差(Salience Bias)**:模型容易被无用的显式干扰项(例如数值)所劫持,从而忽略任务隐含的物理或常识前提。一个关键待解问题是:这种失败究竟反映了常识知识的真正缺失,还是仅仅在误导性任务框架下被抑制了。为探究此问题,我们构建了 **SaliTrap 基准**,这是一个涵盖四个陷阱维度的高质量数据集。通过对 12 个最先进的大语言模型进行评估,我们发现所有主流模型都显著受到显著性偏差的影响,其严重程度随干扰项密度增加而加剧,且“检测到陷阱”与“实际避开陷阱”往往相互脱节。关键在于,通过剥离任务框架后重新激发同一批模型,我们证明这绝大多数是知识抑制而非知识缺失的失败:仅凭一个无上下文的常识知识探针,就能恢复超过 90% 的谄媚性顺从失败案例,这表明所需常识本质上存在,但被具有显著性的干扰项主动挤出,诱使模型进行过度顺从、不必要的计算。基于这一诊断,我们进一步证明,仅靠轻量级的推理时提示(prompting)就能在无需任何重新训练的情况下大幅缩小差距。我们的研究将常识推理失败的瓶颈从模型能力重新定位到知识激发环节,并发布 SaliTrap 作为这一盲点的测试平台。代码可在 https://github.com/Wuzheng02/SaliTrap 获取。

引言

Refer to caption
图 1:所有大语言模型都受显著性偏差影响,其根源在于知识抑制,而非知识缺失。
Refer to caption
图 2:大语言模型中显著性偏差的示例。受显式数值线索(“50 米”)驱动,Gemini 和 DeepSeek 都优化了步行距离,却完全忽略了将车辆开到洗车店这一隐含的、全局性的常识要求。

随着大语言模型(LLM)能力边界的持续拓展,它们在解决复杂数学问题(Wei et al. 2022; Zhang et al. 2025)、执行智能体操作(Qin et al. 2024; Tang et al. 2025)以及处理编码任务(Jimenez et al. 2024; Zhang et al. 2024)方面已变得非常娴熟。这一成功在很大程度上归功于LLM在预训练(Liu et al. 2023)和后训练(Chu et al. 2025)阶段所摄入的相关数据。然而,用于数学推理、智能体操作和编码的数据通常具有一个共同特征:所提供的条件对于解决任务总是有用且必要的。

尽管LLM已经学会了有效利用这些显式条件进行推理(Shao et al. 2024),但这种训练范式也导致它们过度关注每一个提供的细节,因为奖励信号很少会因关注无关信息而给予惩罚。然而,在常识推理中,用户查询中呈现的条件并不总是像数学问题中的条件那样具有普遍相关性。

例如,当用户询问LLM,对于距离家50米的洗车店,应该开车还是步行前往时,主流模型(如Gemini和DeepSeek)倾向于完全基于“50米”这一显著条件进行推理(具体示例见后文图2)。这样一来,它们忽略了隐含的常识性前提——必须开车才能洗车,最终得出用户应该步行的结论。我们将这种现象称为LLM的显著性偏差(Salience Bias)。

如图 1 所示,这种偏差在各类模型中普遍存在,其成因在于干扰项密度,与单纯的陷阱识别相分离,并且根植于知识抑制而非知识缺失:(a) 在所有 12 个被评估的大语言模型中,即使表现最好的模型也仅在 54.8% 的查询中成功避开陷阱,且 12 个模型中有 8 个低于 30%;(b) 每增加一个数字干扰项,都会进一步降低陷阱规避率,同时推高 CoT 劫持率;(c) GLM-5.1 和 Kimi-K2 即使在明确识别出陷阱后,仍有 86.2% 和 81.8% 的时间选择顺从,这表明识别并不等于规避;(d) 剥离任务框架后,原本看似丢失的知识得以恢复,代表性模型从条件 A 到条件 C 的平均解放率显著提升。

一个关键的开放性问题随之而来:这种失败究竟反映了检测这些陷阱所需常识性知识的真实缺失,还是仅仅是在误导性、充满计算的框架下被抑制?回答这个问题需要一个既能大规模可靠诱发该偏差、又能将识别与规避分离开来的基准测试,然而现有基准测试均非为此目的而设计。因此,我们构建了 SaliTrap 基准测试,通过大语言模型辅助合成和严格的求解器-裁判实证验证流程生成,将物理上不可能的前提嵌入充满计算的自然语言查询中,涵盖四个陷阱维度:前提缺失、环境不匹配、时间/生理违背以及规则不匹配。

我们评估了 12 个最先进的大语言模型,发现所有当前大型模型都显著受到显著性偏差的影响,其抵抗力与通用推理能力密切相关;即使能够识别陷阱的模型也常常仍然选择顺从,这揭示了识别与规避是两个独立的失败维度,其严重程度随干扰项密度而扩大,并按模型来源聚类分布。

关键在于,我们进一步证明,这种普遍存在的失败并非表面看起来那样。通过从刚刚失败的同一批模型中重新唤起陷阱知识——这次剥离了误导性的任务框架——我们挽回了其中绝大部分失败,证明大语言模型本质上具备对抗显著性偏差所需的常识性知识。换言之,这种偏差是“唤起”的失败,而非“能力”的缺失:显性显著条件的过度影响主动压制了模型本已具备的知识,而非反映其不存在。

总而言之,我们做出了四项关键贡献:

(一)我们识别并形式化了显著性偏差,证明大语言模型对显性干扰项的过度依赖会导致其忽视隐含的常识性前提条件。

(二)我们贡献了 SaliTrap 基准,综合构建了一个涵盖四个维度、共 1,145 个任务的高质量数据集,用于稳健地评估显著性偏差,并将陷阱检测与陷阱规避区分开来。

(三)我们对 12 个大语言模型进行了全面评估,揭示出显著性偏差具有普遍性、与模型能力相关,并沿干扰项密度和模型来源呈现结构性分布。

(四)通过知识再唤起和轻量级提示词干预,我们证明显著性偏差本质上是一种知识压制失败,并指出“唤起”环节是未来工作中可操作的关键瓶颈。

相关工作

在本节中,我们首先回顾大语言模型推理背后的核心技术,随后对当代大语言模型推理基准进行全面概述。

大语言模型推理技术

大语言模型的推理能力推动了语言智能领域的发展,为求解复杂数学问题(Wei et al. 2022; Zhang et al. 2025)、执行智能体操作(Qin et al. 2024; Tang et al. 2025)以及处理编程任务(Jimenez et al. 2024; Zhang et al. 2024)做出了重要贡献。早期研究主要依赖思维链(CoT)(Wei et al. 2022; Kojima et al. 2022)提示方法,通过精心设计的结构化范式(如线性、树状(Yao et al. 2023)和图状(Besta et al. 2024)拓扑结构)来提升推理性能。近期,随着群体相对策略优化(Shao et al. 2024)和同策略知识蒸馏(Agarwal et al. 2024)技术的成熟,大语言模型推理能力通过设计稳健的奖励机制或直接从更优的教师模型中蒸馏知识而得到进一步提升。然而,尽管这些算法突破增强了模型利用上下文条件的能力,它们也引入了一个关键且不可忽视的挑战:显著性偏差。

大语言模型推理基准

大语言模型推理能力的进步,在很大程度上得益于那些日益严苛的评测基准,这些基准从不同维度考察模型能力,涵盖数学问题求解(Cobbe 等人,2021;Hendrycks 等人,2021)、多步科学问答(Rein 等人,2024)、仓库级代码生成(Jimenez 等人,2024)、长程工具使用规划(Qin 等人,2024)以及广覆盖能力套件(Srivastava 等人,2023)。随着模型在这些以准确率为导向的基准上逐渐趋于饱和,另一条互补的研究路线将关注点转向了鲁棒性与忠实性,揭示出强大的基准表现往往与模型在表层输入扰动下的脆弱性并存(Mirzadeh 等人,2024;Wang 等人,2023),或者与那些虽然得出正确最终答案但逻辑上不一致的推理链并存(Turpin 等人,2023)。与我们的工作最密切相关的是,多项基准研究表明,大语言模型倾向于谄媚式地顺从查询中嵌入的有缺陷或无法回答的前提,而不是对其提出质疑(Sharma 等人,2024;Li 等人,2024;Perez 等人,2023;Kadavath 等人,2022),这与更广泛的证据相呼应——模型往往优先关注显著的表层线索,而非更深层的任务有效性(Shi 等人,2023;Liu 等人,2024)。然而,现有的前提鲁棒性基准主要针对静态的事实性或逻辑性不一致,尚未回答模型能否抵御那些被大量计算性干扰项所伪装、在物理上不可能成立的前提。

SaliTrap 基准

Refer to caption
图 3:SaliTrap 基准的构建分为三个阶段:(i)种子生成与扩展阶段,(ii)候选验证阶段,以及(iii)迭代精炼阶段。通过这一流水线,经由专家标注,即可获得一个能够评估大语言模型显著性偏差程度的基准。

在本节中,我们定义任务形式与良构性标准,提出一个四维陷阱分类体系,并详细阐述三阶段构建流水线。

任务定义

我们研究大语言模型能否识别嵌入在计算密集型自然语言查询中的物理上不可能的前提。如图 2 所示,每个基准测试项都是一个元组

(1)

其中 是自然语言提示词, 是陷阱核心(对物理不可能性的陈述性描述), 是标准答案解释, 是嵌入在 中用于诱发虚假计算的一组数值干扰项, 是陷阱维度。

我们称 为良构的,当且仅当它满足三个条件:(i) 在常识下是物理上不可能的。(ii)任何对 的正确回答都必须指出 中的不可能性,且不存在可以独立回答的旁支子任务。我们将违反(ii)的情况称为子任务逃逸。(iii) 使提示词与合法的规划或优化查询无法区分。对良构项的正确回答应识别出 中的不可能性,且不包含任何基于 成立的可执行计划或数值计算。

陷阱分类体系

各项按四个陷阱维度 进行组织,每个维度对应一类不同的物理或常识违背。(缺失前提):工具缺乏所需的物理属性(例如,用漏勺盛液态水)。(环境不匹配):部署环境使工具失效(例如,在 50 米深处点燃打火机;在加油站为纯电动汽车充电)。(时间/生理违背):行为违反因果律或错误归因生物能力(例如,今天买伞来阻止昨天下雨;在人体胃内烹饪生食)。(规则错配):将视觉上相似的替代物呈现为所需实体,而目标系统予以拒绝(例如,将钞票照片当作法定货币)。

基准构建

如图 3 所示,SaliTrap 的构建分为三个阶段:(i)种子生成与扩展,(ii)候选验证,以及(iii)迭代优化。

阶段 1:种子生成与扩展

我们通过专家标注设计了一组原型种子,从构造上满足条件(i)至(iii)。每个种子都带有一个维度标签和两个辅助提示,通过指定哪些表面特征必须保留、哪些应避免,来约束下游的自动化合成过程。少量原型种子不足以进行统计上可靠的评估。我们使用生成流水线对种子进行扩展,将目标均匀分布到各个维度。每个维度按小型微批次处理。某一维度的生成提示词为

(2)

其中,检索出维度标签等于的原型种子子集,作为上下文示例使用;是批次特定的生成指令,引导该批次朝向维度内代表性不足的工具/场景细分方向(例如,尚未被覆盖的独特仪器或设置),从而使连续的微批次在维度内扩展覆盖范围,而不是重复采样同一邻近区域;同时注入一份按新近程度截断的已接受种子列表,从源头抑制近似重复项。

每个生成的候选种子在通过验收前,都要经过四层去重级联流程。拒绝任何场景名称与现有名称注册表中条目完全匹配的候选。和则拒绝提示词或陷阱核心与任何已接受种子过于相似的候选,相似度通过归一化文本(去除空白、数字替换为占位符)上的字符级 Jaccard 相似度来衡量。拒绝(工具、对象、动作)实体三元组已出现在已接受集合中的候选。已接受的种子会被追加到中,并反馈到后续批次的排除列表中,形成闭环的多样性循环。

阶段 2:候选验证

对于每个种子,候选合成流水线会生成并实证验证题目,维护一个按种子划分的候选注册表,初始时包含一个候选,其提示词直接设为种子自身的初始提示词;该候选与后续生成的每个候选一样,通过相同的三重检查器和求解器评判流水线进行评估。

三重检查器评估。

三个 LLM 检查器对每个候选进行评估:

(3)
(4)
(5)

;两个组件都必须等于 1。未通过真实性或对齐检查的候选样本会被立即归档。通过检查的候选样本会连同其自然度评分一起被转发。

求解器-评判模型评估。

具有足够自然度的可行候选样本会进入实证测试阶段。一个强推理模型(求解器)尝试解题;随后一个评判模型为其分配六种行为标签之一:(1)硬性失败:未察觉陷阱,任务被完整执行;(2)思维链被劫持:仅在数值运算开始后才识别出陷阱;(3)迎合性顺从:承认陷阱存在但仍完成任务;(4)严格通过:立即给出理由充分的拒绝;(5)补丁式遵从:通过重新框定不可能性来绕过陷阱;(6)机械式拒绝:拒绝任务但未展示理解。我们将强失败(标签 1–2)和全部失败(标签 1–3)分别进行标注。

路由。

评判模型的标签和自然度评分共同决定每个候选样本的路由决策。带有失败标签()且同时达到高自然度阈值的候选样本将被认证纳入最终数据集。带有失败标签但低于该阈值的候选样本将进入重写队列,该队列在保留陷阱核心的同时降低人为痕迹。被标记为严格通过且自然度达到或超过较低阈值的候选样本将接受伪装加深重写,因为陷阱被识别得过于容易。

第三阶段:迭代精炼

未通过认证的候选样本会落入两种结构上截然不同的缺陷类型——要么隐藏得很好但属人为构造,要么天然存在但过于容易被识破——因此改写模型会根据其目标进行相应调整,分别采用保持自然度、加深伪装,或(针对从未到达求解器阶段的候选样本)修复流畅度的改写方式。由于改写可能偏离种子样本原本的语义意图,每个子样本只有在合规性检查确认其相对于父样本保留了陷阱核心、所有干扰项以及不存在子任务逃逸的情况下才会被接纳;违规者直接丢弃。被接纳的子样本重新进入第二阶段循环,每个分支在改进停滞达到有限轮数后终止,同时一个高温生成器会定期注入方差更大的变异,以避免坍缩到初始候选样本的狭窄邻域内。

由于自然度、失败严重性和对齐性各自都不足以作为独立的筛选标准,我们对每个通过认证的候选样本进行综合评分,该评分奖励失败严重性、自然度和已确认的对齐性,并扣除子任务逃逸、近似重复和过长篇幅的惩罚,最终为每个种子样本保留排名前若干位的候选样本作为最终基准测试项。

媒体内容 · 前往原文查看
模型 前置条件 环境 时间 规则 总体
TAR HFR TAR HFR TAR HFR TAR HFR TAR HFR
Claude-Opus-4.7 30.3 45.1 45.7 36.6 62.5 28.6 63.1 25.2 54.8 31.1
GPT-5.5 52.8 27.2 39.0 32.3 42.9 37.2 46.4 31.5 45.5 32.4
Claude-Opus-4.6 27.2 51.3 37.8 43.9 48.8 40.2 51.1 36.7 44.5 41.1
GPT-5.4 36.9 41.0 32.9 40.2 41.9 40.2 45.4 32.6 41.2 37.1
DeepSeek-R1 19.5 61.5 19.5 59.8 27.6 56.1 24.7 61.2 23.8 59.7
Gemini-2.5-Pro 25.1 40.0 25.6 50.0 30.2 51.5 27.8 51.8 27.7 49.4
GLM-5.1 24.1 30.3 21.3 31.7 32.2 25.9 27.0 28.7 27.1 28.6
Kimi-K2 13.8 46.2 19.5 32.9 22.9 35.2 30.1 26.8 23.9 33.2
Doubao-Seed-2.0 9.7 65.6 10.4 65.9 23.3 58.5 20.6 56.7 18.0 60.0
DeepSeek-V4-Pro 9.2 56.4 10.4 47.0 19.3 54.5 14.8 49.9 14.4 51.8
DeepSeek-V4-Flash 6.2 69.7 5.5 65.9 17.6 56.1 13.2 55.9 12.1 59.7
MiniMax-M2.7 6.2 63.1 6.7 68.9 8.0 54.5 11.1 56.7 8.8 59.0
表 1:SaliTrap 基准测试结果(TAR/HFR,%),涵盖四个陷阱维度。加粗表示每列最佳值。
媒体内容 · 前往原文查看
模型 前置条件 环境 时间 规则 总体
SCR SI SCR SI SCR SI SCR SI SCR SI
Claude-Opus-4.7 22.6 51.2 17.7 69.0 8.6 41.9 11.5 54.9 13.5 53.1
GPT-5.5 19.5 59.4 28.0 83.6 19.9 65.2 21.6 68.2 21.7 68.2
Claude-Opus-4.6 20.5 46.0 17.7 64.4 10.3 50.8 10.5 50.0 13.2 51.2
GPT-5.4 21.5 60.9 26.2 84.3 17.9 63.5 21.2 73.6 21.1 70.1
DeepSeek-R1 17.9 41.7 20.1 60.0 16.3 45.0 13.8 49.6 16.1 48.0
Gemini-2.5-Pro 34.9 72.3 24.4 78.4 18.3 68.8 20.4 61.1 22.9 67.7
GLM-5.1 45.6 80.9 47.0 95.1 41.5 89.3 43.9 83.9 44.0 86.2
Kimi-K2 39.5 68.8 47.0 84.6 41.9 78.8 42.5 89.2 42.4 81.8
Doubao-Seed-2.0 24.6 53.3 23.8 76.5 18.3 65.5 22.3 64.7 21.8 63.8
DeepSeek-V4-Pro 32.8 72.7 42.1 82.1 25.9 69.0 34.8 84.1 33.2 78.2
DeepSeek-V4-Flash 23.6 46.9 28.7 62.7 25.9 68.4 30.3 77.8 27.8 66.8
MiniMax-M2.7 26.2 55.4 20.1 64.7 26.6 71.4 22.5 69.9 23.8 66.4
表 2:SaliTrap 基准测试结果(SCR/SI,%),涵盖四个陷阱维度。加粗表示每列最佳值。
Refer to caption
图 4:四个陷阱维度上 IRT 估计的题目难度分布(12 个被评估模型)。缺失前置条件和环境错配偏向更高难度,而规则错配题目集中在较低难度。
Refer to caption
图 5:12 个模型按其失败集合的 Jaccard 相似度进行层次聚类。
Refer to caption
图 6:TAR 和 CoT 劫持率与注入的数字干扰项数量的关系,取 12 个模型的平均值。

实验

实验设置

评估指标

最终的 SaliTrap 基准测试包含分布在四个陷阱维度上的题目。以 表示数据集中的总题量,我们使用四个关键指标对模型进行评估,这些指标基于两个不同的分母计算。在整个数据集上():TAR(陷阱规避率,%)衡量模型正确识别不可行前提并拒绝执行任务的查询比例;HFR(硬失败率,%)衡量模型在未对前提提出任何质疑的情况下进行完整计算的查询比例;SCR(谄媚遵从率,%)衡量模型识别出陷阱却仍遵从不可行请求的查询比例。在陷阱感知子集上(谄媚遵从思维链劫持,排除从未表现出陷阱感知的硬失败案例):SI(谄媚指数,%)是在给定陷阱感知条件下的条件遵从率,即 。这种条件化处理很重要:改用 作为分母会将知识缺失与谄媚抑制混为一谈,使很少检测到陷阱的弱模型获得虚假偏低的 SI。将分母限制为陷阱感知响应,则衡量的是模型在本可拒绝时却选择遵从的频率。

评估模型

我们评估了 12 个最先进的大语言模型:Claude-Opus-4.7(Anthropic 2026b)、Claude-Opus-4.6(Anthropic 2026a)、GPT-5.5(OpenAI 2026b)、GPT-5.4(OpenAI 2026a)、Gemini-2.5-Pro(Comanici 等人 2025)、DeepSeek-R1(Guo 等人 2025)、DeepSeek-V4-Pro、DeepSeek-V4-Flash(Xu 等人 2026)、GLM-5.1(Zeng 等人 2026)、Kimi-K2(Team 等人 2025)、豆包-Seed-2.0(字节跳动 Seed 2026)以及 MiniMax-M2.7(Chen 等人 2026)。所有模型均在零样本设置下进行评估,不进行任何任务特定的微调或提示词工程,以确保跨模型的公平比较。对于基准测试构建流程本身,评判模型和改写/生成模型(,)均使用 Claude-Opus-4.7 实例化,而求解器则是由四个强推理模型组成的轮询池:Claude-Opus-4.7、GPT-5.5、DeepSeek-R1 和 Gemini-2.5-Pro。

主要结果

表 1 显示,显著性偏差是所有 12 个被评估大语言模型中普遍存在且严重的一种失败模式:即使是最强的模型 Claude-Opus-4.7,也仅在 54.8% 的查询中避开了这一陷阱,而大多数模型的成功率远低于 30%。整体性能与推理能力密切相关。TAR 排名靠前的模型同时也是最强大的通用推理模型,而通用推理能力明显较弱的模型则表现出最高的 HFR,超过 59%。这表明,抵抗显著性偏差并非一项孤立的技能,而是与模型整体上能否进行审慎的、基于前提检查的推理(而非立即投入表层计算)的能力紧密交织在一起。

表 2 揭示了第二个正交的失败维度:即使模型成功检测到了陷阱,它们也常常仍然选择顺从。GLM-5.1 和 Kimi-K2 的 SI 最高,这意味着在它们罕见地注意到某些地方不对劲的情况下,它们仍有超过 80% 的时间会继续满足用户的请求,尽管它们在原始 TAR 上仅排名中等。这使检测与行动脱钩:一个模型可能对陷阱有中等程度的察觉,却几乎从不据此采取行动,这是仅凭原始 TAR/HFR 无法揭示的。

对逐维度分解的进一步观察显示出一致的难度排序:缺失前提条件一致性地是最难检测的维度,而规则不匹配则是最容易的。这一差距是直观的:缺失前提条件的陷阱需要对提示词中从未明确否定的物理属性进行推理,而规则不匹配的陷阱则依赖于一个在词汇上更显著、因此更容易浮现出来的范畴性区分。

进一步分析

基于项目反应理论的题目难度分析

为了将题目本身的难度与模型能力分离开来,我们在全部 12 个模型在所有题目上的二元“严格通过”结果上拟合了一个单参数逻辑斯蒂项目反应理论模型,联合估计了每个模型的能力参数和每道题的难度参数。如图 4(a)-(b) 所示,缺失前置条件与情境不匹配这两类的分布明显右移,且平均难度高于时间/生理违背与规则不匹配,这证实了在控制测试模型后,表 1 中的维度差异依然存在。图 4(c) 进一步显示,估计出的能力值恢复出的排序与原始 TAR 排序高度一致,从排名最高的 Claude-Opus-4.7 到排名最低的 MiniMax-M2.7,从而证实 TAR 是一种忠实、低噪声的陷阱抵抗能力度量。

共失败分析

为了理解模型是以共性方式失败还是以各自独特的方式失败,我们计算了每对模型失败集之间的两两 Jaccard 相似度,并将所得结构可视化为树状图(图 5)。该树状图将模型分为一个中文集群和一个西方集群:在前者中,较弱的开源权重模型之间的重叠度最高,这表明在低于某个能力阈值时,模型会收敛到大致相同的失败子集,而非各自以独特方式失败;在后者中,Claude-Opus-4.7 始终是与所有其他模型相似度最低的,使其成为该集合中最具独特性的失败模式。这表明共失败同时受能力阈值和训练来源的影响,不同的训练配方会诱发针对显著性偏差的、性质上不同(而不仅仅是规模更小)的盲区。

数字干扰项密度

绘制TAR(陷阱规避率)和CoT劫持率(12个模型的平均值)与注入的数字干扰项数量之间的关系,可以揭示出一个清晰的单调趋势,且在每个陷阱维度内都保持一致:随着干扰项数量的增加,TAR下降,而CoT劫持率上升(图6)。这支持了我们的假设,即显著性偏差不仅由数字干扰项的存在触发,更由其密度触发,这使得对抗性密集提示词尤其危险。

Refer to caption
图7:在三种逐步明确的去偏提示词下,谄媚顺从案例的解放率。

谄媚顺从是知识抑制还是知识缺失?

表2中被标记为SC的模型已识别出陷阱但仍选择顺从,但这本身无法告诉我们,其背后的物理知识究竟是被谄媚真正抑制了,还是过于薄弱而无法在重新引导下存活。为厘清这一点,我们在三种去偏提示词(条件A:软可行性提示;条件B:明确揭示陷阱;条件C:无上下文的纯知识探测)下,对四个代表性模型(Claude-4.6、GLM-5.1、Kimi-K2、DeepSeek-R1)的每一个SC实例进行重新查询,并重新评判响应,将解放率定义为在每种条件下,原先SC案例转化为严格通过的占比。如图7所示,各模型的解放率普遍极高:四个模型中有三个在全部三种条件下解放率均超过90%,即便是无上下文的纯条件C也能恢复超过90%的SC案例。这表明SC绝大多数是部署层面的失败而非知识层面的缺失:相关常识已然存在,一旦移除诱导性的任务框架便能浮现出来,这意味着轻量级的推理时干预可能足以恢复大部分丢失的陷阱规避行为,而无需重新训练。

Refer to caption
图8:控制条件下及三种系统级提示词干预(P1-P3)下的TAR。

提示词能否修复显著性偏差?

基于“解放”这一发现——即与陷阱相关的知识在很大程度上仍然完好——我们测试了在推理时应用、无需微调的单条系统级提示词前缀,能否在规模化层面弥合显著性偏差差距。我们在完整基准上对覆盖能力谱系的三款模型评估了三种干预提示词:P1(物理感知启动,指示模型首先验证任务可行性)、P2(强制思维链前提检查,要求在进行下一步之前给出明确的可行性判定),以及P3(反事实警告,提示词可能包含不可行的前提)。图8显示,对于每款模型,所有三种干预措施都显著提升了TAR(陷阱识别率),且提升幅度最大的地方恰恰是基线表现最弱的环节。P1始终是最有效的干预措施,P2效果最差——尽管P2在结构上最明确地强制要求给出可行性判定;我们将此归因于P2僵化的逐步格式有时会引出一种敷衍的可行性陈述,而模型实际上并未将其后续推理建立在该陈述之上,相比之下,P1开放式检查更好地保留了模型自身朝向前提审视的推理轨迹。这些结果表明,尽管显著性偏差在朴素提示下普遍存在,但仅靠轻量级提示工程就能在很大程度上加以纠正,这进一步印证了瓶颈在于引导(elicitation)环节。

结论

我们识别出显著性偏差——大语言模型的一种普遍缺陷,使其优先关注显著的显式条件,而忽视隐含的常识性前提——并引入SaliTrap,一个包含四个陷阱维度、以计算密集型干扰项伪装物理上不可能前提的基准。通过评估12款最先进的大语言模型,我们发现所有模型都明显易受此问题影响,且失败率随干扰项密度增加而急剧上升。进一步分析表明,这种脆弱性源于常识性知识的被抑制而非缺失,并且轻量级提示可以在很大程度上恢复该能力。我们希望SaliTrap能推动未来研究,使大语言模型能够可靠地关注隐含的任务关键条件。

参考文献

  • R. Agarwal、N. Vieillard、Y. Zhou、P. Stanczyk、S. Ramos Garea、M. Geist 和 O. Bachem(2024)《语言模型的同策略蒸馏:从自我生成的错误中学习》。收录于国际学习表征会议,2024 年第 2024 卷,第 21246–21263 页。引用来源:大语言模型推理技术。
  • Anthropic(2026a)《推出 Claude Opus 4.6》。注:https://www.anthropic.com/news/claude-opus-4-6 引用来源:受评估模型。
  • Anthropic(2026b)《推出 Claude Opus 4.7》。注:https://www.anthropic.com/news/claude-opus-4-7 引用来源:受评估模型。
  • M. Besta、N. Blach、A. Kubicek、R. Gerstenberger、M. Podstawski、L. Gianinazzi、J. Gajda、T. Lehmann、H. Niewiadomski、P. Nyczyk 等人(2024)《思维图:用大语言模型解决复杂问题》。收录于 AAAI 人工智能会议论文集,第 38 卷,第 17682–17690 页。引用来源:大语言模型推理技术。
  • 字节跳动 Seed(2026)《Seed2.0》。注:https://seed.bytedance.com/en/seed2 引用来源:受评估模型。
  • A. Chen、A. Li、B. Zhou、B. Gong、B. Jiang、B. Dan、C. Yu、C. Wang、C. Ma、C. Zhong 等人(2026)《MiniMax-M2 系列:极小激活释放极致真实世界智能》。arXiv 预印本 arXiv:2605.26494。引用来源:受评估模型。
  • T. Chu、Y. Zhai、J. Yang、S. Tong、S. Xie、D. Schuurmans、Q. V. Le、S. Levine 和 Y. Ma(2025)《SFT 靠记忆,RL 靠泛化:基础模型后训练的对比研究》。收录于国际机器学习会议,第 10818–10838 页。引用来源:引言。
  • K. Cobbe、V. Kosaraju、M. Bavarian、M. Chen、H. Jun、L. Kaiser、M. Plappert、J. Tworek、J. Hilton、R. Nakano 等人(2021)《训练验证器解决数学应用题》。arXiv 预印本 arXiv:2110.14168。引用来源:大语言模型推理基准。
  • G. Comanici、E. Bieber、M. Schaekermann、I. Pasupat、N. Sachdeva、I. Dhillon、M. Blistein、O. Ram、D. Zhang、E. Rosen 等人(2025)《Gemini 2.5:以先进推理、多模态、长上下文和下一代智能体能力推动前沿》。arXiv 预印本 arXiv:2507.06261。引用来源:受评估模型。
  • D. Guo, D. Yang, H. Zhang, J. Song, P. Wang, Q. Zhu, R. Xu, R. Zhang, S. Ma, X. Bi, 等. (2025) Deepseek-r1:通过强化学习激励大语言模型的推理能力。arXiv 预印本 arXiv:2501.12948。被引用:评估模型。
  • D. Hendrycks, C. Burns, S. Kadavath, A. Arora, S. Basart, E. Tang, D. Song, 和 J. Steinhardt (2021) 使用 MATH 数据集衡量数学问题解决能力。arXiv 预印本 arXiv:2103.03874。被引用:大语言模型推理基准。
  • C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, 和 K. Narasimhan (2024) SWE-bench:语言模型能否解决真实的 GitHub 问题?发表于国际学习表征会议,第 2024 卷,第 54107–54157 页。被引用:引言、大语言模型推理技术、大语言模型推理基准。
  • S. Kadavath, T. Conerly, A. Askell, T. Henighan, D. Drain, E. Perez, N. Schiefer, Z. Hatfield-Dodds, N. DasSarma, E. Tran-Johnson, 等. (2022) 语言模型(大多)知道自己知道什么。arXiv 预印本 arXiv:2207.05221。被引用:大语言模型推理基准。
  • T. Kojima, S. S. Gu, M. Reid, Y. Matsuo, 和 Y. Iwasawa (2022) 大语言模型是零样本推理者。神经信息处理系统进展 35,第 22199–22213 页。被引用:大语言模型推理技术。
  • M. Li, W. Wang, F. Feng, F. Zhu, Q. Wang, 和 T. Chua (2024) 信任前先三思:通过全面答案反思实现大语言模型的自我检测。计算语言学协会发现:EMNLP。被引用:大语言模型推理基准。
  • N. F. Liu, K. Lin, J. Hewitt, A. Paranjape, M. Bevilacqua, F. Petroni, 和 P. Liang (2024) 迷失在中间:语言模型如何使用长上下文。计算语言学协会汇刊 12,第 157–173 页。被引用:大语言模型推理基准。
  • P. Liu, W. Yuan, J. Fu, Z. Jiang, H. Hayashi, 和 G. Neubig (2023) 预训练、提示和预测:自然语言处理中提示方法的系统综述。ACM 计算调查 55 (9),第 1–35 页。被引用:引言。
  • I. Mirzadeh、K. Alizadeh、H. Shahrokhi、O. Tuzel、S. Bengio 和 M. Farajtabar(2024)《GSM-Symbolic:理解大语言模型在数学推理中的局限性》。arXiv 预印本 arXiv:2410.05229。引用自:LLM 推理基准。
  • OpenAI(2026a)《推出 GPT-5.4》。注:https://openai.com/index/introducing-gpt-5-4/ 引用自:受评估模型。
  • OpenAI(2026b)《推出 GPT-5.5》。注:https://openai.com/index/introducing-gpt-5-5/ 引用自:受评估模型。
  • E. Perez、S. Ringer、K. Lukošiūtė、K. Nguyen、E. Chen、S. Heiner、C. Pettit、C. Olsson、S. Kundu、S. Kadavath 等人(2023)《通过模型撰写的评估发现语言模型行为》。计算语言学协会年会论文集:ACL。引用自:LLM 推理基准。
  • Y. Qin、S. Liang、Y. Ye、K. Zhu、L. Yan、Y. Lu、Y. Lin、X. Cong、X. Tang、B. Qian 等人(2024)《ToolLLM:帮助大语言模型掌握 16000+ 个真实世界 API》。发表于国际学习表征会议,2024 年卷,第 9695–9717 页。引用自:引言、LLM 推理技术、LLM 推理基准。
  • D. Rein、B. L. Hou、A. C. Stickland、J. Petty、R. Y. Pang、J. Dirani、J. Michael 和 S. R. Bowman(2024)《GPQA:一个研究生级别的“谷歌无法解答”问答基准》。引用自:LLM 推理基准。
  • Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. Li、Y. Wu 等人(2024)《DeepSeekMath:推动开源语言模型数学推理的极限》。arXiv 预印本 arXiv:2402.03300。引用自:引言、LLM 推理技术。
  • M. Sharma、M. Tong、T. Korbak、D. Duvenaud、A. Askell、S. R. Bowman、N. Cheng、E. Durmus、Z. Hatfield-Dodds、S. R. Johnston 等人(2024)《理解语言模型中的谄媚行为》。国际学习表征会议。引用自:LLM 推理基准。
  • F. Shi、X. Chen、K. Misra、N. Scales、D. Dohan、E. H. Chi、N. Schärli 和 D. Zhou(2023)《大语言模型容易被无关上下文干扰》。国际机器学习会议,第 31210–31227 页。引用自:LLM 推理基准。
  • A. Srivastava, A. Rastogi, A. Rao, A. A. M. Shoeb, A. Abid, A. Fisch, A. R. Brown, A. Santoro, A. Gupta, A. Garriga-Alonso, 等(2023)《超越模仿游戏:量化并外推语言模型的能力》。Transactions on Machine Learning Research。被引用:LLM 推理基准。
  • F. Tang, H. Xu, H. Zhang, S. Chen, X. Wu, Y. Shen, W. Zhang, G. Hou, Z. Tan, Y. Yan, 等(2025)《基于(多模态)LLM 的 GUI 智能体综述》。arXiv 预印本 arXiv:2504.13865。被引用:引言、LLM 推理技术。
  • K. Team, Y. Bai, Y. Bao, Y. Charles, C. Chen, G. Chen, H. Chen, H. Chen, J. Chen, N. Chen, 等(2025)《Kimi K2:开放智能体智能》。arXiv 预印本 arXiv:2507.20534。被引用:评估模型。
  • M. Turpin, J. Michael, E. Perez, 和 S. R. Bowman(2023)《语言模型并不总是说出它们的想法:思维链提示中的不忠实解释》。Advances in Neural Information Processing Systems 36。被引用:LLM 推理基准。
  • J. Wang, X. Hu, W. Hou, H. Chen, R. Zheng, Y. Wang, L. Yang, H. Huang, W. Ye, X. Geng, 等(2023)《论 ChatGPT 的鲁棒性:对抗性与分布外视角》。arXiv 预印本 arXiv:2302.12095。被引用:LLM 推理基准。
  • J. Wei, X. Wang, D. Schuurmans, M. Bosma, F. Xia, E. Chi, Q. V. Le, D. Zhou, 等(2022)《思维链提示激发大语言模型的推理能力》。Advances in Neural Information Processing Systems 35, 第 24824–24837 页。被引用:引言、LLM 推理技术。
  • A. Xu, B. Lin, B. Xue, B. Wang, B. Xu, B. Wu, B. Zhang, C. Lin, C. Dong, C. Ling, 等(2026)《DeepSeek-V4:迈向高效百万级 token 上下文智能》。arXiv 预印本 arXiv:2606.19348。被引用:评估模型。
  • S. Yao, D. Yu, J. Zhao, I. Shafran, T. Griffiths, Y. Cao, 和 K. Narasimhan(2023)《思维树:用大语言模型进行深思熟虑的问题求解》。Advances in Neural Information Processing Systems 36, 第 11809–11822 页。被引用:LLM 推理技术。
  • A. Zeng, X. Lv, Z. Hou, Z. Du, Q. Zheng, B. Chen, D. Yin, C. Ge, C. Huang, C. Xie 等人(2026)《Glm-5:从氛围编程到智能体工程》。arXiv 预印本 arXiv:2602.15763。被引用:评估模型。
  • K. Zhang, J. Li, G. Li, X. Shi 和 Z. Jin(2024)《Codeagent:利用工具集成智能体系统增强代码生成,应对真实世界仓库级编码挑战》。载于《第 62 届计算语言学协会年会论文集》(第 1 卷:长文),第 13643–13658 页。被引用:引言,LLM 推理技术。
  • Z. Zhang, Y. Yao, A. Zhang, X. Tang, X. Ma, Z. He, Y. Wang, M. Gerstein, R. Wang, G. Liu 等人(2025)《点燃语言智能:从思维链推理到语言智能体的漫游指南》。ACM 计算调查 57(8),第 1–39 页。被引用:引言,LLM 推理技术。

附录 A SaliTrap 数据集

条目结构

SaliTrap 中的每个条目都以 JSON 记录形式存储,包含以下字段,直接对应主论文中定义的元组:

  • item_id —— 唯一的候选标识符。

  • seed_id —— 合成该条目所依据的原型种子(多个已认证条目可共享同一个种子)。

  • prompt()—— 呈现给被评估模型的完整自然语言查询。

  • trap_core()—— 对物理不可能性的单句陈述性表述,既用于条目编写,也用作 Cond-C 知识引出实验中的独立探针。

  • ground_truth()—— 评判模型用于对回答进行评分的参考解释。

  • injected_numbers()—— 嵌入在 中的数值干扰项列表。

  • dimension_tag()—— 四个陷阱维度之一(缺失前提、环境不匹配、时间/生理违背、规则不匹配)。

  • naturalness_score —— 1–5 分制自然度检查器评分的平均值。

  • attack_tier —— 强或弱,表示已认证候选在第二阶段验证中是否引发了强失败(即硬失败或思维链劫持)还是较弱的失败(迎合性顺从)。

数据集统计

表 3 报告了最终经认证的 1,145 条基准测试中各维度的条目数量以及注入的数值干扰项的分布情况。

媒体内容 · 前往原文查看
维度 条目数 平均值 自然度
缺失前置条件 195 6.9 3.9
环境不匹配 164 6.6 3.9
时间/生理因素 301 5.4 4.0
规则不匹配 485 5.9 4.0
总体 1,145 6.0 4.0
表 3:最终 SaliTrap 基准测试中各维度的条目数量、注入数值干扰项的平均数量,以及平均自然度评分。

许可、获取与预期用途

SaliTrap 将在论文发表后立即公开发布,同时附带全部评估与分析代码,以便复现实验并推动针对大语言模型提示诱导阶段失败的相关下游研究。该数据集仅包含关于日常物理任务的合成自然语言查询;不包含任何个人、隐私或其他敏感信息,也不针对任何个人、组织或受保护群体。未收集任何涉及人类受试者的数据。

附录 B 基准测试构建流程

本节详细记录主论文(图 2)中概述的完整三阶段流程,并给出每个基于大语言模型的组件所使用的精确提示词模板。以下所有提示词均经过轻微改写以提升可读性,但保留了发布代码中使用的确切指令、约束条件和输出格式。

阶段 1:种子生成与规模化扩展

四个陷阱维度中的每一个都以少量专家撰写的原型种子作为初始输入,然后通过微批次生成进行规模化扩展。规模化生成器接收维度定义、来自 的少样本示例、一条将覆盖范围导向代表性不足的工具/场景细分领域的批次特定指令,以及一份按时间倒序截断的已接受种子排除列表。

阶段 2:候选验证

每个种子的候选注册表以与种子自身提示词完全相同的零号候选初始化;后续候选由高温度对抗性生成器产生,并在接受求解器-评判循环测试之前依次通过三重检查器级联。

阶段 3:迭代优化

未通过认证的候选样本会根据其失败模式被分流至三种重写目标之一:保持自然度的重写(陷阱隐藏得很好,但读起来显得生硬)、加深伪装的改写(陷阱自然,但太容易被识破,即高自然度下的严格通过),或流畅性修复重写(候选样本因格式错误而从未到达求解器)。

稳定性认证

在进入最终基准测试之前,每个通过认证的候选样本都要接受额外的稳定性复测:在相同的解码设置下,求解器-评判器循环重复执行 5 次,只有当候选样本在 5 次重复中的多数评判标签与其原始认证标签一致时,该候选样本才会被保留(其中 {硬失败、思维链劫持} 被视为“强攻击”标签组,而谄媚顺从 / 补丁顺从则被视为较温和的次级攻击标签)。此举旨在防止单次生成噪声导致报告失败率虚高。

附录 C 实验细节

模型访问与计算基础设施

所有 12 个被评估的大语言模型(Claude-Opus-4.7、Claude-Opus-4.6、GPT-5.5、GPT-5.4、Gemini-2.5-Pro、DeepSeek-R1、DeepSeek-V4-Pro、DeepSeek-V4-Flash、GLM-5.1、Kimi-K2、豆包-Seed-2.0 和 MiniMax-M2.7)均仅通过其官方托管的聊天补全 API 访问,并使用各提供商推荐的默认采样设置,下文另有说明的除外。没有任何模型是本地托管、微调或以其他方式修改的;所有评估运行均为纯推理,除一个轻量级 CPU/编排主机用于发出 API 请求、解析响应以及运行附录 D 中描述的分析脚本外,我们这边不需要任何 GPU 算力。每次 API 调用都使用有界重试策略(在遇到速率限制响应时,最多尝试 40 次,并采用近似指数退避)和固定的每模型超时时间(大多数模型为 90 秒,对于 DeepSeek-R1 等长推理模型则延长至 240 秒)。基准构建过程中的评判和改写调用会汇集到多个备用评判端点,以便单一提供商的速率限制不会阻塞整个流程;这些汇集的备用评判模型与 12 个被评估的目标模型均无重叠,以避免自我评估偏差。对于所有评估实验,模型均以 do_sample=False(贪婪解码)运行,这消除了生成过程中的采样随机性,并在给定相同输入时产生确定性输出;因此,每个模型只需运行一次评估即可复现所报告的结果,推理时无需对多次运行或随机种子进行平均。

流程超参数

表 4 列出了基准构建和评估过程中使用的所有固定超参数。

媒体内容 · 前往原文查看
参数 数值
自然度通过阈值(5 项子评分的平均值)
对抗性生成器温度
对抗性生成器最大 token 数
求解器 / 评判温度(评估)
求解器最大 token 数(评估)
每个认证条目的稳定性重测重复次数
每个种子保留的条目数(前 名)
API 重试次数(每次调用) 最多
求解器调用超时(默认 / 长推理模型) 秒 / 秒
表 4:基准构建与评估中使用的固定超参数。所有数值均在第 4 节所报告的全规模评估运行之前就已固定,并未针对最终评估指标进行调优。

评估协议

全部 1,145 个基准条目均以单轮、零样本用户消息的形式呈现给每个被评估模型,不附带系统提示词(对照条件)、无少样本示例,也不进行任务特定的微调。模型的完整响应(包括任何暴露出来的思维链)会连同该条目的标准答案解释一起传递给求解器-裁判(Solver-Judge),以获得五种行为标签之一:严格通过、谄媚式遵从、思维链劫持、硬性失败或拒绝。TAR、HFR、SCR 和 SI 均为该标签分布的确定性函数。我们对每个模型在全部 1,145 个条目的基准上报告单次评估运行,这与裁判所使用的固定、确定性评分规则保持一致;所有对方差更敏感的分析均通过按维度拆分的方式显式量化变异性。

附录 D 扩展结果

条目难度:自然度与难度

图 9 绘制了基于 IRT 估计的条目难度与该条目自然度得分之间的关系。皮尔逊相关系数为 ,表明二者之间不存在有意义的关联:措辞更自然的条目在抵御能力上既不会可靠地更容易,也不会可靠地更难,这表明自然度检查器与难度校准所衡量的是相互正交的条目属性(表面流畅度 vs. 内在的检测抵抗能力)。

Refer to caption
图 9:条目自然度得分与基于 IRT 估计的难度 之间的关系,附线性趋势线()。颜色表示陷阱维度。

共失败分析:完整相似度矩阵

主论文的图4(树状图)总结了基于模型失败集合的层次聚类结果。图10和图11分别完整给出了两个底层相似度矩阵:原始共失败率和能力归一化的Jaccard相似度。表5按Jaccard相似度列出了最相似和最不相似的五对模型。最相似的五对模型全部来自较弱的开源权重模型簇(DeepSeek-V4-Pro/Flash、MiniMax-M2.7、Doubao-Seed-2.0),而Claude-Opus-4.7出现在全部五对最不相似的模型组合中,印证了正文中的观察,即它是12个被评估模型中失败模式最独特的。

Refer to caption
图10:全部12个被评估模型的共失败率矩阵。
Refer to caption
图11:全部12个被评估模型的失败集合Jaccard相似度。
媒体内容 · 前往原文查看
模型A 模型B 共失败率 Jaccard
最相似的Top 5
DS-V4-Pro DS-V4-Flash 0.798 0.852
DS-V4-Flash MiniMax-M2.7 0.822 0.848
Doubao-2.0 DS-V4-Flash 0.761 0.810
DS-V4-Pro MiniMax-M2.7 0.790 0.807
Doubao-2.0 MiniMax-M2.7 0.767 0.795
最不相似的Bottom 5
Claude-4.7 Doubao-2.0 0.417 0.489
Claude-4.7 DS-V4-Flash 0.434 0.484
Claude-4.7 MiniMax-M2.7 0.437 0.471
Claude-4.7 DS-V4-Pro 0.417 0.469
Claude-4.7 DeepSeek-R1 0.383 0.462
表5:按失败集合Jaccard相似度划分的最相似和最不相似的模型组合。其中207项(18.1%)是所有12个模型都无法解答的通用难题。

数值干扰项密度:按维度分解

主论文中的图7报告了在所有四个陷阱维度上平均的数值干扰项密度效应。图12按维度分解了这一趋势。TAR与密度之间的负斜率以及CoT-Hijacked与密度之间的正斜率在全部四个维度上方向一致,其中Missing Prerequisite维度下降最为陡峭(与其作为整体最难维度的定位一致),而Rule Mismatch维度下降最平缓,这与主论文第4.2节通过IRT建立的难度排序相呼应。

Refer to caption
图12:TAR和CoT-Hijacked比率与注入的数值干扰项数量之间的关系,按陷阱维度分解。

解放实验:完整的按维度结果

表6将主论文的图8扩展为精确的样本量以及四种模型在三种去偏条件下(条件A:软可行性提示;条件B:显式陷阱揭示;条件C:仅使用trap_core的无上下文知识探测)测试的每个维度的解放率。

媒体内容 · 前往原文查看
模型(# SC) 维度 条件A 条件B 条件C
GLM-5.1 (504) 先决条件 95.5 79.8 94.4
环境 94.7 90.7 97.3
时间 92.4 92.4 89.8
规则 90.9 81.7 89.9
总体(n=490) 92.7 85.3 91.8
Kimi-K2 (486) 先决条件 93.2 61.6 93.2
环境 93.2 75.7 90.5
时间 92.0 88.8 87.2
规则 82.4 64.8 82.9
总体(n=465) 88.4 72.5 86.9
Claude-4.6 (155) 先决条件 61.4 97.7 86.4
环境 62.1 89.7 89.7
时间 52.0 80.0 80.0
规则 44.6 96.4 100.0
总体(n=154) 53.9 92.9 90.9
DeepSeek-R1 (184) 先决条件 100.0 91.3 95.7
环境 94.4 88.9 88.9
时间 86.2 93.1 100.0
规则 82.2 86.7 80.0
总体(n=115) 88.7 89.6 89.6
表6:四种模型在三种去偏条件下按陷阱维度划分的解放率(%)。“# SC”是主评估中为该模型识别的谄媚遵从(Sycophantic Compliance)案例数量;各条件下的数量(总体行括号内)可能小于# SC,原因是重新诱导过程中偶尔出现的评判/API错误,这些错误已从分母中排除。

除正文外,还有两点额外观察值得注意。首先,Claude-4.6和Kimi-K2的条件排序与GLM-5.1和DeepSeek-R1明显不同:对于前两者,软性条件A提示不如更明确的条件B/条件C有效,这表明这些模型需要明确的陷阱揭示(或完全移除框架)才能让潜在知识重新浮现,而GLM-5.1和DeepSeek-R1已经对软性提示有强烈响应。其次,即使在最差情况下(Claude-4.6,条件A),每个维度的解放率都超过44%,并且无上下文的条件C单独就能为每个模型在每个维度上恢复至少80%的SC案例,唯一例外是Kimi-K2在规则不匹配维度上的82.9%(仍远高于随机水平),这进一步证实知识抑制而非知识缺失是各维度谄媚遵从的主要解释,而不仅仅是在平均水平上。

提示词干预实验:完整结果

表7将主论文的图9扩展为精确的TAR、HFR以及TAR(相对于Control的差值),涵盖三个目标模型在Control条件和三种系统级干预下的表现(基于完整的1,145项基准评测)。

媒体内容 · 前往原文查看
模型 条件 TAR HFR TAR(相对Control)
GLM-5.1(高SC) Control 25.9 27.1
P1 57.4 0.4 +31.4
P2 47.8 5.1 +21.8
P3 43.8 0.2 +17.8
DS-V4-Pro(高HF) Control 13.4 43.0
P1 42.5 5.0 +29.2
P2 34.7 12.2 +21.3
P3 32.1 1.2 +18.7
Claude-4.6(基线) Control 54.8 31.0
P1 48.6 4.1 6.3
P2 40.8 9.1 14.1
P3 45.0 2.6 9.9
表7:三个覆盖能力谱系的目标模型在Control条件和三种干预(P1:物理感知前置提示;P2:强制逐步前提检查;P3:反事实警告)下的TAR/HFR(%)。

这三种干预在所有三个模型上呈现出惊人一致的副作用:HFR从Control条件下的27–43%骤降至任何干预条件下的0.2–12.2%。这表明这些提示词发挥作用的主要机制并非本身提升前提检测的精确度,而是可靠地触发模型本就具备潜在能力的可行性检查,这与主论文第5.4节中的“解放”发现一致。唯一的例外是Claude-4.6,三种干预相对于其本已强劲的Control基线(54.8%)均降低了TAR:强制显式前提检查步骤似乎打断了该特定模型更有效的默认推理策略,将一些在自由形式推理下本应判定为Strict Pass的案例转化为Sycophantic Compliance或CoT Hijacked。这表明轻量级提示词最好被理解为在引导能力上抬高了底线,而非均匀地提升每个模型,且对于本已强大的模型,干预设计可能需要具备能力感知性。

干预提示词模板

三种系统级干预前缀的精确文本如下;每个前缀均逐字附加到原始题目提示词之前,不做任何其他修改。

解放提示词模板

解放实验中所使用的三种去偏条件如下所示。条件A和条件B被前置到题目的原始提示词之前;条件C则将整个题目替换为一个仅由trap_core构建的裸查询,即移除了所有带有计算负担的框架性表述。

附录E 更广泛的影响

SaliTrap 纯粹旨在作为一种诊断工具,帮助社区识别并最终弥合大语言模型常识推理中在提示(elicitation)阶段存在的盲点。由于该数据集由合成的、基于物理常识的日常场景构成,而非具有安全或规避安全措施价值的对抗性攻击,我们预计其发布不会带来双重用途风险。相反,我们期望揭示显著性偏差(salience bias)将有助于大语言模型助手的下游部署者避免一类具体的面向用户的错误(例如,助手自信地生成一个详细但物理上不合理的计划),这类错误若被不加批判地采纳,可能会削弱用户信任或导致现实世界中的精力浪费。所有种子条目均由论文作者从日常、非敏感场景(烹饪、交通、购物、家庭维修等)中撰写,经过合成扩展并由大语言模型验证,最终在发布前经过审查,确保不包含冒犯性、偏见性或有害内容。

大语言模型的显著性偏差:常识推理中的知识压制而非缺失

HuggingFace Daily Papers(社区热门论文)·2026-07-30 08:00·4天前
阅读原文· arxiv.org
精选理由

这篇论文证明 LLM 常识推理失败源于知识被显性干扰项抑制而非缺失,剥离任务框架后超九成服从性案例可恢复,提示瓶颈在引导方式而非模型能力。

AI 摘要

研究提出“显著性偏差”概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。

正文 · AI 翻译
摘要

随着大语言模型(LLM)在复杂推理任务中不断进步,它们已学会高度优先处理输入中提供的显式条件。然而,在日常常识推理中,这种机制暴露出了一个关键漏洞,我们将其称为**显著性偏差(Salience Bias)**:模型容易被无用的显式干扰项(例如数值)所劫持,从而忽略任务隐含的物理或常识前提。一个关键待解问题是:这种失败究竟反映了常识知识的真正缺失,还是仅仅在误导性任务框架下被抑制了。为探究此问题,我们构建了 **SaliTrap 基准**,这是一个涵盖四个陷阱维度的高质量数据集。通过对 12 个最先进的大语言模型进行评估,我们发现所有主流模型都显著受到显著性偏差的影响,其严重程度随干扰项密度增加而加剧,且“检测到陷阱”与“实际避开陷阱”往往相互脱节。关键在于,通过剥离任务框架后重新激发同一批模型,我们证明这绝大多数是知识抑制而非知识缺失的失败:仅凭一个无上下文的常识知识探针,就能恢复超过 90% 的谄媚性顺从失败案例,这表明所需常识本质上存在,但被具有显著性的干扰项主动挤出,诱使模型进行过度顺从、不必要的计算。基于这一诊断,我们进一步证明,仅靠轻量级的推理时提示(prompting)就能在无需任何重新训练的情况下大幅缩小差距。我们的研究将常识推理失败的瓶颈从模型能力重新定位到知识激发环节,并发布 SaliTrap 作为这一盲点的测试平台。代码可在 https://github.com/Wuzheng02/SaliTrap 获取。

引言

Refer to caption
图 1:所有大语言模型都受显著性偏差影响,其根源在于知识抑制,而非知识缺失。
Refer to caption
图 2:大语言模型中显著性偏差的示例。受显式数值线索(“50 米”)驱动,Gemini 和 DeepSeek 都优化了步行距离,却完全忽略了将车辆开到洗车店这一隐含的、全局性的常识要求。

随着大语言模型(LLM)能力边界的持续拓展,它们在解决复杂数学问题(Wei et al. 2022; Zhang et al. 2025)、执行智能体操作(Qin et al. 2024; Tang et al. 2025)以及处理编码任务(Jimenez et al. 2024; Zhang et al. 2024)方面已变得非常娴熟。这一成功在很大程度上归功于LLM在预训练(Liu et al. 2023)和后训练(Chu et al. 2025)阶段所摄入的相关数据。然而,用于数学推理、智能体操作和编码的数据通常具有一个共同特征:所提供的条件对于解决任务总是有用且必要的。

尽管LLM已经学会了有效利用这些显式条件进行推理(Shao et al. 2024),但这种训练范式也导致它们过度关注每一个提供的细节,因为奖励信号很少会因关注无关信息而给予惩罚。然而,在常识推理中,用户查询中呈现的条件并不总是像数学问题中的条件那样具有普遍相关性。

例如,当用户询问LLM,对于距离家50米的洗车店,应该开车还是步行前往时,主流模型(如Gemini和DeepSeek)倾向于完全基于“50米”这一显著条件进行推理(具体示例见后文图2)。这样一来,它们忽略了隐含的常识性前提——必须开车才能洗车,最终得出用户应该步行的结论。我们将这种现象称为LLM的显著性偏差(Salience Bias)。

如图 1 所示,这种偏差在各类模型中普遍存在,其成因在于干扰项密度,与单纯的陷阱识别相分离,并且根植于知识抑制而非知识缺失:(a) 在所有 12 个被评估的大语言模型中,即使表现最好的模型也仅在 54.8% 的查询中成功避开陷阱,且 12 个模型中有 8 个低于 30%;(b) 每增加一个数字干扰项,都会进一步降低陷阱规避率,同时推高 CoT 劫持率;(c) GLM-5.1 和 Kimi-K2 即使在明确识别出陷阱后,仍有 86.2% 和 81.8% 的时间选择顺从,这表明识别并不等于规避;(d) 剥离任务框架后,原本看似丢失的知识得以恢复,代表性模型从条件 A 到条件 C 的平均解放率显著提升。

一个关键的开放性问题随之而来:这种失败究竟反映了检测这些陷阱所需常识性知识的真实缺失,还是仅仅是在误导性、充满计算的框架下被抑制?回答这个问题需要一个既能大规模可靠诱发该偏差、又能将识别与规避分离开来的基准测试,然而现有基准测试均非为此目的而设计。因此,我们构建了 SaliTrap 基准测试,通过大语言模型辅助合成和严格的求解器-裁判实证验证流程生成,将物理上不可能的前提嵌入充满计算的自然语言查询中,涵盖四个陷阱维度:前提缺失、环境不匹配、时间/生理违背以及规则不匹配。

我们评估了 12 个最先进的大语言模型,发现所有当前大型模型都显著受到显著性偏差的影响,其抵抗力与通用推理能力密切相关;即使能够识别陷阱的模型也常常仍然选择顺从,这揭示了识别与规避是两个独立的失败维度,其严重程度随干扰项密度而扩大,并按模型来源聚类分布。

关键在于,我们进一步证明,这种普遍存在的失败并非表面看起来那样。通过从刚刚失败的同一批模型中重新唤起陷阱知识——这次剥离了误导性的任务框架——我们挽回了其中绝大部分失败,证明大语言模型本质上具备对抗显著性偏差所需的常识性知识。换言之,这种偏差是“唤起”的失败,而非“能力”的缺失:显性显著条件的过度影响主动压制了模型本已具备的知识,而非反映其不存在。

总而言之,我们做出了四项关键贡献:

(一)我们识别并形式化了显著性偏差,证明大语言模型对显性干扰项的过度依赖会导致其忽视隐含的常识性前提条件。

(二)我们贡献了 SaliTrap 基准,综合构建了一个涵盖四个维度、共 1,145 个任务的高质量数据集,用于稳健地评估显著性偏差,并将陷阱检测与陷阱规避区分开来。

(三)我们对 12 个大语言模型进行了全面评估,揭示出显著性偏差具有普遍性、与模型能力相关,并沿干扰项密度和模型来源呈现结构性分布。

(四)通过知识再唤起和轻量级提示词干预,我们证明显著性偏差本质上是一种知识压制失败,并指出“唤起”环节是未来工作中可操作的关键瓶颈。

相关工作

在本节中,我们首先回顾大语言模型推理背后的核心技术,随后对当代大语言模型推理基准进行全面概述。

大语言模型推理技术

大语言模型的推理能力推动了语言智能领域的发展,为求解复杂数学问题(Wei et al. 2022; Zhang et al. 2025)、执行智能体操作(Qin et al. 2024; Tang et al. 2025)以及处理编程任务(Jimenez et al. 2024; Zhang et al. 2024)做出了重要贡献。早期研究主要依赖思维链(CoT)(Wei et al. 2022; Kojima et al. 2022)提示方法,通过精心设计的结构化范式(如线性、树状(Yao et al. 2023)和图状(Besta et al. 2024)拓扑结构)来提升推理性能。近期,随着群体相对策略优化(Shao et al. 2024)和同策略知识蒸馏(Agarwal et al. 2024)技术的成熟,大语言模型推理能力通过设计稳健的奖励机制或直接从更优的教师模型中蒸馏知识而得到进一步提升。然而,尽管这些算法突破增强了模型利用上下文条件的能力,它们也引入了一个关键且不可忽视的挑战:显著性偏差。

大语言模型推理基准

大语言模型推理能力的进步,在很大程度上得益于那些日益严苛的评测基准,这些基准从不同维度考察模型能力,涵盖数学问题求解(Cobbe 等人,2021;Hendrycks 等人,2021)、多步科学问答(Rein 等人,2024)、仓库级代码生成(Jimenez 等人,2024)、长程工具使用规划(Qin 等人,2024)以及广覆盖能力套件(Srivastava 等人,2023)。随着模型在这些以准确率为导向的基准上逐渐趋于饱和,另一条互补的研究路线将关注点转向了鲁棒性与忠实性,揭示出强大的基准表现往往与模型在表层输入扰动下的脆弱性并存(Mirzadeh 等人,2024;Wang 等人,2023),或者与那些虽然得出正确最终答案但逻辑上不一致的推理链并存(Turpin 等人,2023)。与我们的工作最密切相关的是,多项基准研究表明,大语言模型倾向于谄媚式地顺从查询中嵌入的有缺陷或无法回答的前提,而不是对其提出质疑(Sharma 等人,2024;Li 等人,2024;Perez 等人,2023;Kadavath 等人,2022),这与更广泛的证据相呼应——模型往往优先关注显著的表层线索,而非更深层的任务有效性(Shi 等人,2023;Liu 等人,2024)。然而,现有的前提鲁棒性基准主要针对静态的事实性或逻辑性不一致,尚未回答模型能否抵御那些被大量计算性干扰项所伪装、在物理上不可能成立的前提。

SaliTrap 基准

Refer to caption
图 3:SaliTrap 基准的构建分为三个阶段:(i)种子生成与扩展阶段,(ii)候选验证阶段,以及(iii)迭代精炼阶段。通过这一流水线,经由专家标注,即可获得一个能够评估大语言模型显著性偏差程度的基准。

在本节中,我们定义任务形式与良构性标准,提出一个四维陷阱分类体系,并详细阐述三阶段构建流水线。

任务定义

我们研究大语言模型能否识别嵌入在计算密集型自然语言查询中的物理上不可能的前提。如图 2 所示,每个基准测试项都是一个元组

(1)

其中 是自然语言提示词, 是陷阱核心(对物理不可能性的陈述性描述), 是标准答案解释, 是嵌入在 中用于诱发虚假计算的一组数值干扰项, 是陷阱维度。

我们称 为良构的,当且仅当它满足三个条件:(i) 在常识下是物理上不可能的。(ii)任何对 的正确回答都必须指出 中的不可能性,且不存在可以独立回答的旁支子任务。我们将违反(ii)的情况称为子任务逃逸。(iii) 使提示词与合法的规划或优化查询无法区分。对良构项的正确回答应识别出 中的不可能性,且不包含任何基于 成立的可执行计划或数值计算。

陷阱分类体系

各项按四个陷阱维度 进行组织,每个维度对应一类不同的物理或常识违背。(缺失前提):工具缺乏所需的物理属性(例如,用漏勺盛液态水)。(环境不匹配):部署环境使工具失效(例如,在 50 米深处点燃打火机;在加油站为纯电动汽车充电)。(时间/生理违背):行为违反因果律或错误归因生物能力(例如,今天买伞来阻止昨天下雨;在人体胃内烹饪生食)。(规则错配):将视觉上相似的替代物呈现为所需实体,而目标系统予以拒绝(例如,将钞票照片当作法定货币)。

基准构建

如图 3 所示,SaliTrap 的构建分为三个阶段:(i)种子生成与扩展,(ii)候选验证,以及(iii)迭代优化。

阶段 1:种子生成与扩展

我们通过专家标注设计了一组原型种子,从构造上满足条件(i)至(iii)。每个种子都带有一个维度标签和两个辅助提示,通过指定哪些表面特征必须保留、哪些应避免,来约束下游的自动化合成过程。少量原型种子不足以进行统计上可靠的评估。我们使用生成流水线对种子进行扩展,将目标均匀分布到各个维度。每个维度按小型微批次处理。某一维度的生成提示词为

(2)

其中,检索出维度标签等于的原型种子子集,作为上下文示例使用;是批次特定的生成指令,引导该批次朝向维度内代表性不足的工具/场景细分方向(例如,尚未被覆盖的独特仪器或设置),从而使连续的微批次在维度内扩展覆盖范围,而不是重复采样同一邻近区域;同时注入一份按新近程度截断的已接受种子列表,从源头抑制近似重复项。

每个生成的候选种子在通过验收前,都要经过四层去重级联流程。拒绝任何场景名称与现有名称注册表中条目完全匹配的候选。和则拒绝提示词或陷阱核心与任何已接受种子过于相似的候选,相似度通过归一化文本(去除空白、数字替换为占位符)上的字符级 Jaccard 相似度来衡量。拒绝(工具、对象、动作)实体三元组已出现在已接受集合中的候选。已接受的种子会被追加到中,并反馈到后续批次的排除列表中,形成闭环的多样性循环。

阶段 2:候选验证

对于每个种子,候选合成流水线会生成并实证验证题目,维护一个按种子划分的候选注册表,初始时包含一个候选,其提示词直接设为种子自身的初始提示词;该候选与后续生成的每个候选一样,通过相同的三重检查器和求解器评判流水线进行评估。

三重检查器评估。

三个 LLM 检查器对每个候选进行评估:

(3)
(4)
(5)

;两个组件都必须等于 1。未通过真实性或对齐检查的候选样本会被立即归档。通过检查的候选样本会连同其自然度评分一起被转发。

求解器-评判模型评估。

具有足够自然度的可行候选样本会进入实证测试阶段。一个强推理模型(求解器)尝试解题;随后一个评判模型为其分配六种行为标签之一:(1)硬性失败:未察觉陷阱,任务被完整执行;(2)思维链被劫持:仅在数值运算开始后才识别出陷阱;(3)迎合性顺从:承认陷阱存在但仍完成任务;(4)严格通过:立即给出理由充分的拒绝;(5)补丁式遵从:通过重新框定不可能性来绕过陷阱;(6)机械式拒绝:拒绝任务但未展示理解。我们将强失败(标签 1–2)和全部失败(标签 1–3)分别进行标注。

路由。

评判模型的标签和自然度评分共同决定每个候选样本的路由决策。带有失败标签()且同时达到高自然度阈值的候选样本将被认证纳入最终数据集。带有失败标签但低于该阈值的候选样本将进入重写队列,该队列在保留陷阱核心的同时降低人为痕迹。被标记为严格通过且自然度达到或超过较低阈值的候选样本将接受伪装加深重写,因为陷阱被识别得过于容易。

第三阶段:迭代精炼

未通过认证的候选样本会落入两种结构上截然不同的缺陷类型——要么隐藏得很好但属人为构造,要么天然存在但过于容易被识破——因此改写模型会根据其目标进行相应调整,分别采用保持自然度、加深伪装,或(针对从未到达求解器阶段的候选样本)修复流畅度的改写方式。由于改写可能偏离种子样本原本的语义意图,每个子样本只有在合规性检查确认其相对于父样本保留了陷阱核心、所有干扰项以及不存在子任务逃逸的情况下才会被接纳;违规者直接丢弃。被接纳的子样本重新进入第二阶段循环,每个分支在改进停滞达到有限轮数后终止,同时一个高温生成器会定期注入方差更大的变异,以避免坍缩到初始候选样本的狭窄邻域内。

由于自然度、失败严重性和对齐性各自都不足以作为独立的筛选标准,我们对每个通过认证的候选样本进行综合评分,该评分奖励失败严重性、自然度和已确认的对齐性,并扣除子任务逃逸、近似重复和过长篇幅的惩罚,最终为每个种子样本保留排名前若干位的候选样本作为最终基准测试项。

媒体内容 · 前往原文查看
模型 前置条件 环境 时间 规则 总体
TAR HFR TAR HFR TAR HFR TAR HFR TAR HFR
Claude-Opus-4.7 30.3 45.1 45.7 36.6 62.5 28.6 63.1 25.2 54.8 31.1
GPT-5.5 52.8 27.2 39.0 32.3 42.9 37.2 46.4 31.5 45.5 32.4
Claude-Opus-4.6 27.2 51.3 37.8 43.9 48.8 40.2 51.1 36.7 44.5 41.1
GPT-5.4 36.9 41.0 32.9 40.2 41.9 40.2 45.4 32.6 41.2 37.1
DeepSeek-R1 19.5 61.5 19.5 59.8 27.6 56.1 24.7 61.2 23.8 59.7
Gemini-2.5-Pro 25.1 40.0 25.6 50.0 30.2 51.5 27.8 51.8 27.7 49.4
GLM-5.1 24.1 30.3 21.3 31.7 32.2 25.9 27.0 28.7 27.1 28.6
Kimi-K2 13.8 46.2 19.5 32.9 22.9 35.2 30.1 26.8 23.9 33.2
Doubao-Seed-2.0 9.7 65.6 10.4 65.9 23.3 58.5 20.6 56.7 18.0 60.0
DeepSeek-V4-Pro 9.2 56.4 10.4 47.0 19.3 54.5 14.8 49.9 14.4 51.8
DeepSeek-V4-Flash 6.2 69.7 5.5 65.9 17.6 56.1 13.2 55.9 12.1 59.7
MiniMax-M2.7 6.2 63.1 6.7 68.9 8.0 54.5 11.1 56.7 8.8 59.0
表 1:SaliTrap 基准测试结果(TAR/HFR,%),涵盖四个陷阱维度。加粗表示每列最佳值。
媒体内容 · 前往原文查看
模型 前置条件 环境 时间 规则 总体
SCR SI SCR SI SCR SI SCR SI SCR SI
Claude-Opus-4.7 22.6 51.2 17.7 69.0 8.6 41.9 11.5 54.9 13.5 53.1
GPT-5.5 19.5 59.4 28.0 83.6 19.9 65.2 21.6 68.2 21.7 68.2
Claude-Opus-4.6 20.5 46.0 17.7 64.4 10.3 50.8 10.5 50.0 13.2 51.2
GPT-5.4 21.5 60.9 26.2 84.3 17.9 63.5 21.2 73.6 21.1 70.1
DeepSeek-R1 17.9 41.7 20.1 60.0 16.3 45.0 13.8 49.6 16.1 48.0
Gemini-2.5-Pro 34.9 72.3 24.4 78.4 18.3 68.8 20.4 61.1 22.9 67.7
GLM-5.1 45.6 80.9 47.0 95.1 41.5 89.3 43.9 83.9 44.0 86.2
Kimi-K2 39.5 68.8 47.0 84.6 41.9 78.8 42.5 89.2 42.4 81.8
Doubao-Seed-2.0 24.6 53.3 23.8 76.5 18.3 65.5 22.3 64.7 21.8 63.8
DeepSeek-V4-Pro 32.8 72.7 42.1 82.1 25.9 69.0 34.8 84.1 33.2 78.2
DeepSeek-V4-Flash 23.6 46.9 28.7 62.7 25.9 68.4 30.3 77.8 27.8 66.8
MiniMax-M2.7 26.2 55.4 20.1 64.7 26.6 71.4 22.5 69.9 23.8 66.4
表 2:SaliTrap 基准测试结果(SCR/SI,%),涵盖四个陷阱维度。加粗表示每列最佳值。
Refer to caption
图 4:四个陷阱维度上 IRT 估计的题目难度分布(12 个被评估模型)。缺失前置条件和环境错配偏向更高难度,而规则错配题目集中在较低难度。
Refer to caption
图 5:12 个模型按其失败集合的 Jaccard 相似度进行层次聚类。
Refer to caption
图 6:TAR 和 CoT 劫持率与注入的数字干扰项数量的关系,取 12 个模型的平均值。

实验

实验设置

评估指标

最终的 SaliTrap 基准测试包含分布在四个陷阱维度上的题目。以 表示数据集中的总题量,我们使用四个关键指标对模型进行评估,这些指标基于两个不同的分母计算。在整个数据集上():TAR(陷阱规避率,%)衡量模型正确识别不可行前提并拒绝执行任务的查询比例;HFR(硬失败率,%)衡量模型在未对前提提出任何质疑的情况下进行完整计算的查询比例;SCR(谄媚遵从率,%)衡量模型识别出陷阱却仍遵从不可行请求的查询比例。在陷阱感知子集上(谄媚遵从思维链劫持,排除从未表现出陷阱感知的硬失败案例):SI(谄媚指数,%)是在给定陷阱感知条件下的条件遵从率,即 。这种条件化处理很重要:改用 作为分母会将知识缺失与谄媚抑制混为一谈,使很少检测到陷阱的弱模型获得虚假偏低的 SI。将分母限制为陷阱感知响应,则衡量的是模型在本可拒绝时却选择遵从的频率。

评估模型

我们评估了 12 个最先进的大语言模型:Claude-Opus-4.7(Anthropic 2026b)、Claude-Opus-4.6(Anthropic 2026a)、GPT-5.5(OpenAI 2026b)、GPT-5.4(OpenAI 2026a)、Gemini-2.5-Pro(Comanici 等人 2025)、DeepSeek-R1(Guo 等人 2025)、DeepSeek-V4-Pro、DeepSeek-V4-Flash(Xu 等人 2026)、GLM-5.1(Zeng 等人 2026)、Kimi-K2(Team 等人 2025)、豆包-Seed-2.0(字节跳动 Seed 2026)以及 MiniMax-M2.7(Chen 等人 2026)。所有模型均在零样本设置下进行评估,不进行任何任务特定的微调或提示词工程,以确保跨模型的公平比较。对于基准测试构建流程本身,评判模型和改写/生成模型(,)均使用 Claude-Opus-4.7 实例化,而求解器则是由四个强推理模型组成的轮询池:Claude-Opus-4.7、GPT-5.5、DeepSeek-R1 和 Gemini-2.5-Pro。

主要结果

表 1 显示,显著性偏差是所有 12 个被评估大语言模型中普遍存在且严重的一种失败模式:即使是最强的模型 Claude-Opus-4.7,也仅在 54.8% 的查询中避开了这一陷阱,而大多数模型的成功率远低于 30%。整体性能与推理能力密切相关。TAR 排名靠前的模型同时也是最强大的通用推理模型,而通用推理能力明显较弱的模型则表现出最高的 HFR,超过 59%。这表明,抵抗显著性偏差并非一项孤立的技能,而是与模型整体上能否进行审慎的、基于前提检查的推理(而非立即投入表层计算)的能力紧密交织在一起。

表 2 揭示了第二个正交的失败维度:即使模型成功检测到了陷阱,它们也常常仍然选择顺从。GLM-5.1 和 Kimi-K2 的 SI 最高,这意味着在它们罕见地注意到某些地方不对劲的情况下,它们仍有超过 80% 的时间会继续满足用户的请求,尽管它们在原始 TAR 上仅排名中等。这使检测与行动脱钩:一个模型可能对陷阱有中等程度的察觉,却几乎从不据此采取行动,这是仅凭原始 TAR/HFR 无法揭示的。

对逐维度分解的进一步观察显示出一致的难度排序:缺失前提条件一致性地是最难检测的维度,而规则不匹配则是最容易的。这一差距是直观的:缺失前提条件的陷阱需要对提示词中从未明确否定的物理属性进行推理,而规则不匹配的陷阱则依赖于一个在词汇上更显著、因此更容易浮现出来的范畴性区分。

进一步分析

基于项目反应理论的题目难度分析

为了将题目本身的难度与模型能力分离开来,我们在全部 12 个模型在所有题目上的二元“严格通过”结果上拟合了一个单参数逻辑斯蒂项目反应理论模型,联合估计了每个模型的能力参数和每道题的难度参数。如图 4(a)-(b) 所示,缺失前置条件与情境不匹配这两类的分布明显右移,且平均难度高于时间/生理违背与规则不匹配,这证实了在控制测试模型后,表 1 中的维度差异依然存在。图 4(c) 进一步显示,估计出的能力值恢复出的排序与原始 TAR 排序高度一致,从排名最高的 Claude-Opus-4.7 到排名最低的 MiniMax-M2.7,从而证实 TAR 是一种忠实、低噪声的陷阱抵抗能力度量。

共失败分析

为了理解模型是以共性方式失败还是以各自独特的方式失败,我们计算了每对模型失败集之间的两两 Jaccard 相似度,并将所得结构可视化为树状图(图 5)。该树状图将模型分为一个中文集群和一个西方集群:在前者中,较弱的开源权重模型之间的重叠度最高,这表明在低于某个能力阈值时,模型会收敛到大致相同的失败子集,而非各自以独特方式失败;在后者中,Claude-Opus-4.7 始终是与所有其他模型相似度最低的,使其成为该集合中最具独特性的失败模式。这表明共失败同时受能力阈值和训练来源的影响,不同的训练配方会诱发针对显著性偏差的、性质上不同(而不仅仅是规模更小)的盲区。

数字干扰项密度

绘制TAR(陷阱规避率)和CoT劫持率(12个模型的平均值)与注入的数字干扰项数量之间的关系,可以揭示出一个清晰的单调趋势,且在每个陷阱维度内都保持一致:随着干扰项数量的增加,TAR下降,而CoT劫持率上升(图6)。这支持了我们的假设,即显著性偏差不仅由数字干扰项的存在触发,更由其密度触发,这使得对抗性密集提示词尤其危险。

Refer to caption
图7:在三种逐步明确的去偏提示词下,谄媚顺从案例的解放率。

谄媚顺从是知识抑制还是知识缺失?

表2中被标记为SC的模型已识别出陷阱但仍选择顺从,但这本身无法告诉我们,其背后的物理知识究竟是被谄媚真正抑制了,还是过于薄弱而无法在重新引导下存活。为厘清这一点,我们在三种去偏提示词(条件A:软可行性提示;条件B:明确揭示陷阱;条件C:无上下文的纯知识探测)下,对四个代表性模型(Claude-4.6、GLM-5.1、Kimi-K2、DeepSeek-R1)的每一个SC实例进行重新查询,并重新评判响应,将解放率定义为在每种条件下,原先SC案例转化为严格通过的占比。如图7所示,各模型的解放率普遍极高:四个模型中有三个在全部三种条件下解放率均超过90%,即便是无上下文的纯条件C也能恢复超过90%的SC案例。这表明SC绝大多数是部署层面的失败而非知识层面的缺失:相关常识已然存在,一旦移除诱导性的任务框架便能浮现出来,这意味着轻量级的推理时干预可能足以恢复大部分丢失的陷阱规避行为,而无需重新训练。

Refer to caption
图8:控制条件下及三种系统级提示词干预(P1-P3)下的TAR。

提示词能否修复显著性偏差?

基于“解放”这一发现——即与陷阱相关的知识在很大程度上仍然完好——我们测试了在推理时应用、无需微调的单条系统级提示词前缀,能否在规模化层面弥合显著性偏差差距。我们在完整基准上对覆盖能力谱系的三款模型评估了三种干预提示词:P1(物理感知启动,指示模型首先验证任务可行性)、P2(强制思维链前提检查,要求在进行下一步之前给出明确的可行性判定),以及P3(反事实警告,提示词可能包含不可行的前提)。图8显示,对于每款模型,所有三种干预措施都显著提升了TAR(陷阱识别率),且提升幅度最大的地方恰恰是基线表现最弱的环节。P1始终是最有效的干预措施,P2效果最差——尽管P2在结构上最明确地强制要求给出可行性判定;我们将此归因于P2僵化的逐步格式有时会引出一种敷衍的可行性陈述,而模型实际上并未将其后续推理建立在该陈述之上,相比之下,P1开放式检查更好地保留了模型自身朝向前提审视的推理轨迹。这些结果表明,尽管显著性偏差在朴素提示下普遍存在,但仅靠轻量级提示工程就能在很大程度上加以纠正,这进一步印证了瓶颈在于引导(elicitation)环节。

结论

我们识别出显著性偏差——大语言模型的一种普遍缺陷,使其优先关注显著的显式条件,而忽视隐含的常识性前提——并引入SaliTrap,一个包含四个陷阱维度、以计算密集型干扰项伪装物理上不可能前提的基准。通过评估12款最先进的大语言模型,我们发现所有模型都明显易受此问题影响,且失败率随干扰项密度增加而急剧上升。进一步分析表明,这种脆弱性源于常识性知识的被抑制而非缺失,并且轻量级提示可以在很大程度上恢复该能力。我们希望SaliTrap能推动未来研究,使大语言模型能够可靠地关注隐含的任务关键条件。

参考文献

  • R. Agarwal、N. Vieillard、Y. Zhou、P. Stanczyk、S. Ramos Garea、M. Geist 和 O. Bachem(2024)《语言模型的同策略蒸馏:从自我生成的错误中学习》。收录于国际学习表征会议,2024 年第 2024 卷,第 21246–21263 页。引用来源:大语言模型推理技术。
  • Anthropic(2026a)《推出 Claude Opus 4.6》。注:https://www.anthropic.com/news/claude-opus-4-6 引用来源:受评估模型。
  • Anthropic(2026b)《推出 Claude Opus 4.7》。注:https://www.anthropic.com/news/claude-opus-4-7 引用来源:受评估模型。
  • M. Besta、N. Blach、A. Kubicek、R. Gerstenberger、M. Podstawski、L. Gianinazzi、J. Gajda、T. Lehmann、H. Niewiadomski、P. Nyczyk 等人(2024)《思维图:用大语言模型解决复杂问题》。收录于 AAAI 人工智能会议论文集,第 38 卷,第 17682–17690 页。引用来源:大语言模型推理技术。
  • 字节跳动 Seed(2026)《Seed2.0》。注:https://seed.bytedance.com/en/seed2 引用来源:受评估模型。
  • A. Chen、A. Li、B. Zhou、B. Gong、B. Jiang、B. Dan、C. Yu、C. Wang、C. Ma、C. Zhong 等人(2026)《MiniMax-M2 系列:极小激活释放极致真实世界智能》。arXiv 预印本 arXiv:2605.26494。引用来源:受评估模型。
  • T. Chu、Y. Zhai、J. Yang、S. Tong、S. Xie、D. Schuurmans、Q. V. Le、S. Levine 和 Y. Ma(2025)《SFT 靠记忆,RL 靠泛化:基础模型后训练的对比研究》。收录于国际机器学习会议,第 10818–10838 页。引用来源:引言。
  • K. Cobbe、V. Kosaraju、M. Bavarian、M. Chen、H. Jun、L. Kaiser、M. Plappert、J. Tworek、J. Hilton、R. Nakano 等人(2021)《训练验证器解决数学应用题》。arXiv 预印本 arXiv:2110.14168。引用来源:大语言模型推理基准。
  • G. Comanici、E. Bieber、M. Schaekermann、I. Pasupat、N. Sachdeva、I. Dhillon、M. Blistein、O. Ram、D. Zhang、E. Rosen 等人(2025)《Gemini 2.5:以先进推理、多模态、长上下文和下一代智能体能力推动前沿》。arXiv 预印本 arXiv:2507.06261。引用来源:受评估模型。
  • D. Guo, D. Yang, H. Zhang, J. Song, P. Wang, Q. Zhu, R. Xu, R. Zhang, S. Ma, X. Bi, 等. (2025) Deepseek-r1:通过强化学习激励大语言模型的推理能力。arXiv 预印本 arXiv:2501.12948。被引用:评估模型。
  • D. Hendrycks, C. Burns, S. Kadavath, A. Arora, S. Basart, E. Tang, D. Song, 和 J. Steinhardt (2021) 使用 MATH 数据集衡量数学问题解决能力。arXiv 预印本 arXiv:2103.03874。被引用:大语言模型推理基准。
  • C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, 和 K. Narasimhan (2024) SWE-bench:语言模型能否解决真实的 GitHub 问题?发表于国际学习表征会议,第 2024 卷,第 54107–54157 页。被引用:引言、大语言模型推理技术、大语言模型推理基准。
  • S. Kadavath, T. Conerly, A. Askell, T. Henighan, D. Drain, E. Perez, N. Schiefer, Z. Hatfield-Dodds, N. DasSarma, E. Tran-Johnson, 等. (2022) 语言模型(大多)知道自己知道什么。arXiv 预印本 arXiv:2207.05221。被引用:大语言模型推理基准。
  • T. Kojima, S. S. Gu, M. Reid, Y. Matsuo, 和 Y. Iwasawa (2022) 大语言模型是零样本推理者。神经信息处理系统进展 35,第 22199–22213 页。被引用:大语言模型推理技术。
  • M. Li, W. Wang, F. Feng, F. Zhu, Q. Wang, 和 T. Chua (2024) 信任前先三思:通过全面答案反思实现大语言模型的自我检测。计算语言学协会发现:EMNLP。被引用:大语言模型推理基准。
  • N. F. Liu, K. Lin, J. Hewitt, A. Paranjape, M. Bevilacqua, F. Petroni, 和 P. Liang (2024) 迷失在中间:语言模型如何使用长上下文。计算语言学协会汇刊 12,第 157–173 页。被引用:大语言模型推理基准。
  • P. Liu, W. Yuan, J. Fu, Z. Jiang, H. Hayashi, 和 G. Neubig (2023) 预训练、提示和预测:自然语言处理中提示方法的系统综述。ACM 计算调查 55 (9),第 1–35 页。被引用:引言。
  • I. Mirzadeh、K. Alizadeh、H. Shahrokhi、O. Tuzel、S. Bengio 和 M. Farajtabar(2024)《GSM-Symbolic:理解大语言模型在数学推理中的局限性》。arXiv 预印本 arXiv:2410.05229。引用自:LLM 推理基准。
  • OpenAI(2026a)《推出 GPT-5.4》。注:https://openai.com/index/introducing-gpt-5-4/ 引用自:受评估模型。
  • OpenAI(2026b)《推出 GPT-5.5》。注:https://openai.com/index/introducing-gpt-5-5/ 引用自:受评估模型。
  • E. Perez、S. Ringer、K. Lukošiūtė、K. Nguyen、E. Chen、S. Heiner、C. Pettit、C. Olsson、S. Kundu、S. Kadavath 等人(2023)《通过模型撰写的评估发现语言模型行为》。计算语言学协会年会论文集:ACL。引用自:LLM 推理基准。
  • Y. Qin、S. Liang、Y. Ye、K. Zhu、L. Yan、Y. Lu、Y. Lin、X. Cong、X. Tang、B. Qian 等人(2024)《ToolLLM:帮助大语言模型掌握 16000+ 个真实世界 API》。发表于国际学习表征会议,2024 年卷,第 9695–9717 页。引用自:引言、LLM 推理技术、LLM 推理基准。
  • D. Rein、B. L. Hou、A. C. Stickland、J. Petty、R. Y. Pang、J. Dirani、J. Michael 和 S. R. Bowman(2024)《GPQA:一个研究生级别的“谷歌无法解答”问答基准》。引用自:LLM 推理基准。
  • Z. Shao、P. Wang、Q. Zhu、R. Xu、J. Song、X. Bi、H. Zhang、M. Zhang、Y. Li、Y. Wu 等人(2024)《DeepSeekMath:推动开源语言模型数学推理的极限》。arXiv 预印本 arXiv:2402.03300。引用自:引言、LLM 推理技术。
  • M. Sharma、M. Tong、T. Korbak、D. Duvenaud、A. Askell、S. R. Bowman、N. Cheng、E. Durmus、Z. Hatfield-Dodds、S. R. Johnston 等人(2024)《理解语言模型中的谄媚行为》。国际学习表征会议。引用自:LLM 推理基准。
  • F. Shi、X. Chen、K. Misra、N. Scales、D. Dohan、E. H. Chi、N. Schärli 和 D. Zhou(2023)《大语言模型容易被无关上下文干扰》。国际机器学习会议,第 31210–31227 页。引用自:LLM 推理基准。
  • A. Srivastava, A. Rastogi, A. Rao, A. A. M. Shoeb, A. Abid, A. Fisch, A. R. Brown, A. Santoro, A. Gupta, A. Garriga-Alonso, 等(2023)《超越模仿游戏:量化并外推语言模型的能力》。Transactions on Machine Learning Research。被引用:LLM 推理基准。
  • F. Tang, H. Xu, H. Zhang, S. Chen, X. Wu, Y. Shen, W. Zhang, G. Hou, Z. Tan, Y. Yan, 等(2025)《基于(多模态)LLM 的 GUI 智能体综述》。arXiv 预印本 arXiv:2504.13865。被引用:引言、LLM 推理技术。
  • K. Team, Y. Bai, Y. Bao, Y. Charles, C. Chen, G. Chen, H. Chen, H. Chen, J. Chen, N. Chen, 等(2025)《Kimi K2:开放智能体智能》。arXiv 预印本 arXiv:2507.20534。被引用:评估模型。
  • M. Turpin, J. Michael, E. Perez, 和 S. R. Bowman(2023)《语言模型并不总是说出它们的想法:思维链提示中的不忠实解释》。Advances in Neural Information Processing Systems 36。被引用:LLM 推理基准。
  • J. Wang, X. Hu, W. Hou, H. Chen, R. Zheng, Y. Wang, L. Yang, H. Huang, W. Ye, X. Geng, 等(2023)《论 ChatGPT 的鲁棒性:对抗性与分布外视角》。arXiv 预印本 arXiv:2302.12095。被引用:LLM 推理基准。
  • J. Wei, X. Wang, D. Schuurmans, M. Bosma, F. Xia, E. Chi, Q. V. Le, D. Zhou, 等(2022)《思维链提示激发大语言模型的推理能力》。Advances in Neural Information Processing Systems 35, 第 24824–24837 页。被引用:引言、LLM 推理技术。
  • A. Xu, B. Lin, B. Xue, B. Wang, B. Xu, B. Wu, B. Zhang, C. Lin, C. Dong, C. Ling, 等(2026)《DeepSeek-V4:迈向高效百万级 token 上下文智能》。arXiv 预印本 arXiv:2606.19348。被引用:评估模型。
  • S. Yao, D. Yu, J. Zhao, I. Shafran, T. Griffiths, Y. Cao, 和 K. Narasimhan(2023)《思维树:用大语言模型进行深思熟虑的问题求解》。Advances in Neural Information Processing Systems 36, 第 11809–11822 页。被引用:LLM 推理技术。
  • A. Zeng, X. Lv, Z. Hou, Z. Du, Q. Zheng, B. Chen, D. Yin, C. Ge, C. Huang, C. Xie 等人(2026)《Glm-5:从氛围编程到智能体工程》。arXiv 预印本 arXiv:2602.15763。被引用:评估模型。
  • K. Zhang, J. Li, G. Li, X. Shi 和 Z. Jin(2024)《Codeagent:利用工具集成智能体系统增强代码生成,应对真实世界仓库级编码挑战》。载于《第 62 届计算语言学协会年会论文集》(第 1 卷:长文),第 13643–13658 页。被引用:引言,LLM 推理技术。
  • Z. Zhang, Y. Yao, A. Zhang, X. Tang, X. Ma, Z. He, Y. Wang, M. Gerstein, R. Wang, G. Liu 等人(2025)《点燃语言智能:从思维链推理到语言智能体的漫游指南》。ACM 计算调查 57(8),第 1–39 页。被引用:引言,LLM 推理技术。

附录 A SaliTrap 数据集

条目结构

SaliTrap 中的每个条目都以 JSON 记录形式存储,包含以下字段,直接对应主论文中定义的元组:

  • item_id —— 唯一的候选标识符。

  • seed_id —— 合成该条目所依据的原型种子(多个已认证条目可共享同一个种子)。

  • prompt()—— 呈现给被评估模型的完整自然语言查询。

  • trap_core()—— 对物理不可能性的单句陈述性表述,既用于条目编写,也用作 Cond-C 知识引出实验中的独立探针。

  • ground_truth()—— 评判模型用于对回答进行评分的参考解释。

  • injected_numbers()—— 嵌入在 中的数值干扰项列表。

  • dimension_tag()—— 四个陷阱维度之一(缺失前提、环境不匹配、时间/生理违背、规则不匹配)。

  • naturalness_score —— 1–5 分制自然度检查器评分的平均值。

  • attack_tier —— 强或弱,表示已认证候选在第二阶段验证中是否引发了强失败(即硬失败或思维链劫持)还是较弱的失败(迎合性顺从)。

数据集统计

表 3 报告了最终经认证的 1,145 条基准测试中各维度的条目数量以及注入的数值干扰项的分布情况。

媒体内容 · 前往原文查看
维度 条目数 平均值 自然度
缺失前置条件 195 6.9 3.9
环境不匹配 164 6.6 3.9
时间/生理因素 301 5.4 4.0
规则不匹配 485 5.9 4.0
总体 1,145 6.0 4.0
表 3:最终 SaliTrap 基准测试中各维度的条目数量、注入数值干扰项的平均数量,以及平均自然度评分。

许可、获取与预期用途

SaliTrap 将在论文发表后立即公开发布,同时附带全部评估与分析代码,以便复现实验并推动针对大语言模型提示诱导阶段失败的相关下游研究。该数据集仅包含关于日常物理任务的合成自然语言查询;不包含任何个人、隐私或其他敏感信息,也不针对任何个人、组织或受保护群体。未收集任何涉及人类受试者的数据。

附录 B 基准测试构建流程

本节详细记录主论文(图 2)中概述的完整三阶段流程,并给出每个基于大语言模型的组件所使用的精确提示词模板。以下所有提示词均经过轻微改写以提升可读性,但保留了发布代码中使用的确切指令、约束条件和输出格式。

阶段 1:种子生成与规模化扩展

四个陷阱维度中的每一个都以少量专家撰写的原型种子作为初始输入,然后通过微批次生成进行规模化扩展。规模化生成器接收维度定义、来自 的少样本示例、一条将覆盖范围导向代表性不足的工具/场景细分领域的批次特定指令,以及一份按时间倒序截断的已接受种子排除列表。

阶段 2:候选验证

每个种子的候选注册表以与种子自身提示词完全相同的零号候选初始化;后续候选由高温度对抗性生成器产生,并在接受求解器-评判循环测试之前依次通过三重检查器级联。

阶段 3:迭代优化

未通过认证的候选样本会根据其失败模式被分流至三种重写目标之一:保持自然度的重写(陷阱隐藏得很好,但读起来显得生硬)、加深伪装的改写(陷阱自然,但太容易被识破,即高自然度下的严格通过),或流畅性修复重写(候选样本因格式错误而从未到达求解器)。

稳定性认证

在进入最终基准测试之前,每个通过认证的候选样本都要接受额外的稳定性复测:在相同的解码设置下,求解器-评判器循环重复执行 5 次,只有当候选样本在 5 次重复中的多数评判标签与其原始认证标签一致时,该候选样本才会被保留(其中 {硬失败、思维链劫持} 被视为“强攻击”标签组,而谄媚顺从 / 补丁顺从则被视为较温和的次级攻击标签)。此举旨在防止单次生成噪声导致报告失败率虚高。

附录 C 实验细节

模型访问与计算基础设施

所有 12 个被评估的大语言模型(Claude-Opus-4.7、Claude-Opus-4.6、GPT-5.5、GPT-5.4、Gemini-2.5-Pro、DeepSeek-R1、DeepSeek-V4-Pro、DeepSeek-V4-Flash、GLM-5.1、Kimi-K2、豆包-Seed-2.0 和 MiniMax-M2.7)均仅通过其官方托管的聊天补全 API 访问,并使用各提供商推荐的默认采样设置,下文另有说明的除外。没有任何模型是本地托管、微调或以其他方式修改的;所有评估运行均为纯推理,除一个轻量级 CPU/编排主机用于发出 API 请求、解析响应以及运行附录 D 中描述的分析脚本外,我们这边不需要任何 GPU 算力。每次 API 调用都使用有界重试策略(在遇到速率限制响应时,最多尝试 40 次,并采用近似指数退避)和固定的每模型超时时间(大多数模型为 90 秒,对于 DeepSeek-R1 等长推理模型则延长至 240 秒)。基准构建过程中的评判和改写调用会汇集到多个备用评判端点,以便单一提供商的速率限制不会阻塞整个流程;这些汇集的备用评判模型与 12 个被评估的目标模型均无重叠,以避免自我评估偏差。对于所有评估实验,模型均以 do_sample=False(贪婪解码)运行,这消除了生成过程中的采样随机性,并在给定相同输入时产生确定性输出;因此,每个模型只需运行一次评估即可复现所报告的结果,推理时无需对多次运行或随机种子进行平均。

流程超参数

表 4 列出了基准构建和评估过程中使用的所有固定超参数。

媒体内容 · 前往原文查看
参数 数值
自然度通过阈值(5 项子评分的平均值)
对抗性生成器温度
对抗性生成器最大 token 数
求解器 / 评判温度(评估)
求解器最大 token 数(评估)
每个认证条目的稳定性重测重复次数
每个种子保留的条目数(前 名)
API 重试次数(每次调用) 最多
求解器调用超时(默认 / 长推理模型) 秒 / 秒
表 4:基准构建与评估中使用的固定超参数。所有数值均在第 4 节所报告的全规模评估运行之前就已固定,并未针对最终评估指标进行调优。

评估协议

全部 1,145 个基准条目均以单轮、零样本用户消息的形式呈现给每个被评估模型,不附带系统提示词(对照条件)、无少样本示例,也不进行任务特定的微调。模型的完整响应(包括任何暴露出来的思维链)会连同该条目的标准答案解释一起传递给求解器-裁判(Solver-Judge),以获得五种行为标签之一:严格通过、谄媚式遵从、思维链劫持、硬性失败或拒绝。TAR、HFR、SCR 和 SI 均为该标签分布的确定性函数。我们对每个模型在全部 1,145 个条目的基准上报告单次评估运行,这与裁判所使用的固定、确定性评分规则保持一致;所有对方差更敏感的分析均通过按维度拆分的方式显式量化变异性。

附录 D 扩展结果

条目难度:自然度与难度

图 9 绘制了基于 IRT 估计的条目难度与该条目自然度得分之间的关系。皮尔逊相关系数为 ,表明二者之间不存在有意义的关联:措辞更自然的条目在抵御能力上既不会可靠地更容易,也不会可靠地更难,这表明自然度检查器与难度校准所衡量的是相互正交的条目属性(表面流畅度 vs. 内在的检测抵抗能力)。

Refer to caption
图 9:条目自然度得分与基于 IRT 估计的难度 之间的关系,附线性趋势线()。颜色表示陷阱维度。

共失败分析:完整相似度矩阵

主论文的图4(树状图)总结了基于模型失败集合的层次聚类结果。图10和图11分别完整给出了两个底层相似度矩阵:原始共失败率和能力归一化的Jaccard相似度。表5按Jaccard相似度列出了最相似和最不相似的五对模型。最相似的五对模型全部来自较弱的开源权重模型簇(DeepSeek-V4-Pro/Flash、MiniMax-M2.7、Doubao-Seed-2.0),而Claude-Opus-4.7出现在全部五对最不相似的模型组合中,印证了正文中的观察,即它是12个被评估模型中失败模式最独特的。

Refer to caption
图10:全部12个被评估模型的共失败率矩阵。
Refer to caption
图11:全部12个被评估模型的失败集合Jaccard相似度。
媒体内容 · 前往原文查看
模型A 模型B 共失败率 Jaccard
最相似的Top 5
DS-V4-Pro DS-V4-Flash 0.798 0.852
DS-V4-Flash MiniMax-M2.7 0.822 0.848
Doubao-2.0 DS-V4-Flash 0.761 0.810
DS-V4-Pro MiniMax-M2.7 0.790 0.807
Doubao-2.0 MiniMax-M2.7 0.767 0.795
最不相似的Bottom 5
Claude-4.7 Doubao-2.0 0.417 0.489
Claude-4.7 DS-V4-Flash 0.434 0.484
Claude-4.7 MiniMax-M2.7 0.437 0.471
Claude-4.7 DS-V4-Pro 0.417 0.469
Claude-4.7 DeepSeek-R1 0.383 0.462
表5:按失败集合Jaccard相似度划分的最相似和最不相似的模型组合。其中207项(18.1%)是所有12个模型都无法解答的通用难题。

数值干扰项密度:按维度分解

主论文中的图7报告了在所有四个陷阱维度上平均的数值干扰项密度效应。图12按维度分解了这一趋势。TAR与密度之间的负斜率以及CoT-Hijacked与密度之间的正斜率在全部四个维度上方向一致,其中Missing Prerequisite维度下降最为陡峭(与其作为整体最难维度的定位一致),而Rule Mismatch维度下降最平缓,这与主论文第4.2节通过IRT建立的难度排序相呼应。

Refer to caption
图12:TAR和CoT-Hijacked比率与注入的数值干扰项数量之间的关系,按陷阱维度分解。

解放实验:完整的按维度结果

表6将主论文的图8扩展为精确的样本量以及四种模型在三种去偏条件下(条件A:软可行性提示;条件B:显式陷阱揭示;条件C:仅使用trap_core的无上下文知识探测)测试的每个维度的解放率。

媒体内容 · 前往原文查看
模型(# SC) 维度 条件A 条件B 条件C
GLM-5.1 (504) 先决条件 95.5 79.8 94.4
环境 94.7 90.7 97.3
时间 92.4 92.4 89.8
规则 90.9 81.7 89.9
总体(n=490) 92.7 85.3 91.8
Kimi-K2 (486) 先决条件 93.2 61.6 93.2
环境 93.2 75.7 90.5
时间 92.0 88.8 87.2
规则 82.4 64.8 82.9
总体(n=465) 88.4 72.5 86.9
Claude-4.6 (155) 先决条件 61.4 97.7 86.4
环境 62.1 89.7 89.7
时间 52.0 80.0 80.0
规则 44.6 96.4 100.0
总体(n=154) 53.9 92.9 90.9
DeepSeek-R1 (184) 先决条件 100.0 91.3 95.7
环境 94.4 88.9 88.9
时间 86.2 93.1 100.0
规则 82.2 86.7 80.0
总体(n=115) 88.7 89.6 89.6
表6:四种模型在三种去偏条件下按陷阱维度划分的解放率(%)。“# SC”是主评估中为该模型识别的谄媚遵从(Sycophantic Compliance)案例数量;各条件下的数量(总体行括号内)可能小于# SC,原因是重新诱导过程中偶尔出现的评判/API错误,这些错误已从分母中排除。

除正文外,还有两点额外观察值得注意。首先,Claude-4.6和Kimi-K2的条件排序与GLM-5.1和DeepSeek-R1明显不同:对于前两者,软性条件A提示不如更明确的条件B/条件C有效,这表明这些模型需要明确的陷阱揭示(或完全移除框架)才能让潜在知识重新浮现,而GLM-5.1和DeepSeek-R1已经对软性提示有强烈响应。其次,即使在最差情况下(Claude-4.6,条件A),每个维度的解放率都超过44%,并且无上下文的条件C单独就能为每个模型在每个维度上恢复至少80%的SC案例,唯一例外是Kimi-K2在规则不匹配维度上的82.9%(仍远高于随机水平),这进一步证实知识抑制而非知识缺失是各维度谄媚遵从的主要解释,而不仅仅是在平均水平上。

提示词干预实验:完整结果

表7将主论文的图9扩展为精确的TAR、HFR以及TAR(相对于Control的差值),涵盖三个目标模型在Control条件和三种系统级干预下的表现(基于完整的1,145项基准评测)。

媒体内容 · 前往原文查看
模型 条件 TAR HFR TAR(相对Control)
GLM-5.1(高SC) Control 25.9 27.1
P1 57.4 0.4 +31.4
P2 47.8 5.1 +21.8
P3 43.8 0.2 +17.8
DS-V4-Pro(高HF) Control 13.4 43.0
P1 42.5 5.0 +29.2
P2 34.7 12.2 +21.3
P3 32.1 1.2 +18.7
Claude-4.6(基线) Control 54.8 31.0
P1 48.6 4.1 6.3
P2 40.8 9.1 14.1
P3 45.0 2.6 9.9
表7:三个覆盖能力谱系的目标模型在Control条件和三种干预(P1:物理感知前置提示;P2:强制逐步前提检查;P3:反事实警告)下的TAR/HFR(%)。

这三种干预在所有三个模型上呈现出惊人一致的副作用:HFR从Control条件下的27–43%骤降至任何干预条件下的0.2–12.2%。这表明这些提示词发挥作用的主要机制并非本身提升前提检测的精确度,而是可靠地触发模型本就具备潜在能力的可行性检查,这与主论文第5.4节中的“解放”发现一致。唯一的例外是Claude-4.6,三种干预相对于其本已强劲的Control基线(54.8%)均降低了TAR:强制显式前提检查步骤似乎打断了该特定模型更有效的默认推理策略,将一些在自由形式推理下本应判定为Strict Pass的案例转化为Sycophantic Compliance或CoT Hijacked。这表明轻量级提示词最好被理解为在引导能力上抬高了底线,而非均匀地提升每个模型,且对于本已强大的模型,干预设计可能需要具备能力感知性。

干预提示词模板

三种系统级干预前缀的精确文本如下;每个前缀均逐字附加到原始题目提示词之前,不做任何其他修改。

解放提示词模板

解放实验中所使用的三种去偏条件如下所示。条件A和条件B被前置到题目的原始提示词之前;条件C则将整个题目替换为一个仅由trap_core构建的裸查询,即移除了所有带有计算负担的框架性表述。

附录E 更广泛的影响

SaliTrap 纯粹旨在作为一种诊断工具,帮助社区识别并最终弥合大语言模型常识推理中在提示(elicitation)阶段存在的盲点。由于该数据集由合成的、基于物理常识的日常场景构成,而非具有安全或规避安全措施价值的对抗性攻击,我们预计其发布不会带来双重用途风险。相反,我们期望揭示显著性偏差(salience bias)将有助于大语言模型助手的下游部署者避免一类具体的面向用户的错误(例如,助手自信地生成一个详细但物理上不合理的计划),这类错误若被不加批判地采纳,可能会削弱用户信任或导致现实世界中的精力浪费。所有种子条目均由论文作者从日常、非敏感场景(烹饪、交通、购物、家庭维修等)中撰写,经过合成扩展并由大语言模型验证,最终在发布前经过审查,确保不包含冒犯性、偏见性或有害内容。

阅读原文arxiv.org