强化学习(RL)微调已成为提升大语言模型(LLM)在推理密集型任务上表现的关键技术,并推动其向视觉语言模型(VLM)扩展。虽然经过 RL 微调的 VLM 在视觉推理基准测试上有所改进,但它们仍然容易受到弱视觉锚定、模型幻觉以及过度依赖文本线索的影响。我们证明,简单、受控的文本扰动——即误导性标题或不正确的思维链(CoT)轨迹——会导致鲁棒性和置信度大幅下降,并且当跨开源多模态推理模型考虑 CoT 一致性时,这些影响更为显著。相比之下,闭源模型表现出类似的失效模式,但保持了明显更强的鲁棒性和推理一致性,这表明差距反映了当前开源 RL 微调的缺陷,而非任务本身的固有限制。为了更深入地理解这些脆弱性,我们进一步分析了 RL 微调动态,并揭示了一个准确性-忠实度权衡:微调提高了基准测试的准确性,但同时可能侵蚀伴随的 CoT 的可靠性及其对上下文变化的鲁棒性。尽管对抗性增强提高了鲁棒性,但它本身并不能阻止忠实度漂移。引入一个考虑忠实度的奖励可以恢复答案与推理之间的一致性,但当与增强配对时,训练有崩溃到捷径策略的风险,且鲁棒性仍然难以实现。总之,这些发现凸显了仅以准确性评估的局限性,并推动了同时强调正确性、鲁棒性以及视觉锚定推理忠实度的训练与评估协议。
- † 哈佛大学
- ‡ OpenAI
- ** 在 Apple 期间完成的工作
相关阅读与更新。
CoT 在推理中的潜力:对轨迹动态的深入审视
思维链(CoT)提示词是一种事实上的标准技术,用于从大语言模型(LLM)中引出类似推理的回应,使其在给出最终答案之前能够逐步列出各个步骤。虽然它与人类推理的相似性不可否认,但支撑 CoT 推理成功的驱动因素在很大程度上仍不清楚。在这项工作中,我们对源自……的 CoT 轨迹进行了深入分析。
改进视觉语言模型的思维链推理
视觉语言模型(VLM)中的思维链(CoT)推理对于提高可解释性和可信度至关重要。然而,当前的训练方案通常依赖于以简短标注为主且极少包含推理过程的数据集。在这项工作中,我们表明,在简短答案上训练 VLM 会导致其在需要更详细解释的推理任务上泛化能力差。为了解决这一局限性,我们提出了一个两阶段……