Apple Machine Learning Research(RSS)
精选
62AI 编辑部评分,满分 100

RL微调VLM的鲁棒性与思维链一致性研究

2026-07-02 08:00· 45天前
AI 导读

强化学习(RL)微调被扩展至视觉语言模型(VLM)。研究发现,简单的文本扰动——误导性标题或错误思维链(CoT)——会显著降低模型鲁棒性和置信度,且开源模型衰退更明显。闭源模型呈现类似失败模式,但鲁棒性和推理一致性更强。进一步分析揭示准确性与忠实性的权衡:微调提升基准准确率,但同时侵蚀CoT的可靠性及对上下文变化的鲁棒性;对抗性增强可改善鲁棒性,却无法阻止忠实性漂移。引入忠实性感知奖励能恢复答案与推理的对齐,但与增强结合时训练易崩溃到捷径策略。这些发现强调需联合关注正确性、鲁棒性与视觉推理的忠实性。

推荐理由

RL微调让VLM基准分变好看,却可能让它的推理链变得靠不住,这个反直觉的诊断对正在用RL打磨多模态模型的团队是个警醒。

正文 · AI 翻译

强化学习(RL)微调已成为提升大语言模型(LLM)在推理密集型任务上表现的关键技术,并推动其向视觉语言模型(VLM)扩展。虽然经过 RL 微调的 VLM 在视觉推理基准测试上有所改进,但它们仍然容易受到弱视觉锚定、模型幻觉以及过度依赖文本线索的影响。我们证明,简单、受控的文本扰动——即误导性标题或不正确的思维链(CoT)轨迹——会导致鲁棒性和置信度大幅下降,并且当跨开源多模态推理模型考虑 CoT 一致性时,这些影响更为显著。相比之下,闭源模型表现出类似的失效模式,但保持了明显更强的鲁棒性和推理一致性,这表明差距反映了当前开源 RL 微调的缺陷,而非任务本身的固有限制。为了更深入地理解这些脆弱性,我们进一步分析了 RL 微调动态,并揭示了一个准确性-忠实度权衡:微调提高了基准测试的准确性,但同时可能侵蚀伴随的 CoT 的可靠性及其对上下文变化的鲁棒性。尽管对抗性增强提高了鲁棒性,但它本身并不能阻止忠实度漂移。引入一个考虑忠实度的奖励可以恢复答案与推理之间的一致性,但当与增强配对时,训练有崩溃到捷径策略的风险,且鲁棒性仍然难以实现。总之,这些发现凸显了仅以准确性评估的局限性,并推动了同时强调正确性、鲁棒性以及视觉锚定推理忠实度的训练与评估协议。

  • † 哈佛大学
  • ‡ OpenAI
  • ** 在 Apple 期间完成的工作

相关阅读与更新。

CoT 在推理中的潜力:对轨迹动态的深入审视

思维链(CoT)提示词是一种事实上的标准技术,用于从大语言模型(LLM)中引出类似推理的回应,使其在给出最终答案之前能够逐步列出各个步骤。虽然它与人类推理的相似性不可否认,但支撑 CoT 推理成功的驱动因素在很大程度上仍不清楚。在这项工作中,我们对源自……的 CoT 轨迹进行了深入分析。

改进视觉语言模型的思维链推理

视觉语言模型(VLM)中的思维链(CoT)推理对于提高可解释性和可信度至关重要。然而,当前的训练方案通常依赖于以简短标注为主且极少包含推理过程的数据集。在这项工作中,我们表明,在简短答案上训练 VLM 会导致其在需要更详细解释的推理任务上泛化能力差。为了解决这一局限性,我们提出了一个两阶段……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com

RL微调VLM的鲁棒性与思维链一致性研究

Apple Machine Learning Research(RSS)·2026-07-02 08:00·45天前
AI 导读

强化学习(RL)微调被扩展至视觉语言模型(VLM)。研究发现,简单的文本扰动——误导性标题或错误思维链(CoT)——会显著降低模型鲁棒性和置信度,且开源模型衰退更明显。闭源模型呈现类似失败模式,但鲁棒性和推理一致性更强。进一步分析揭示准确性与忠实性的权衡:微调提升基准准确率,但同时侵蚀CoT的可靠性及对上下文变化的鲁棒性;对抗性增强可改善鲁棒性,却无法阻止忠实性漂移。引入忠实性感知奖励能恢复答案与推理的对齐,但与增强结合时训练易崩溃到捷径策略。这些发现强调需联合关注正确性、鲁棒性与视觉推理的忠实性。

正文 · AI 翻译

强化学习(RL)微调已成为提升大语言模型(LLM)在推理密集型任务上表现的关键技术,并推动其向视觉语言模型(VLM)扩展。虽然经过 RL 微调的 VLM 在视觉推理基准测试上有所改进,但它们仍然容易受到弱视觉锚定、模型幻觉以及过度依赖文本线索的影响。我们证明,简单、受控的文本扰动——即误导性标题或不正确的思维链(CoT)轨迹——会导致鲁棒性和置信度大幅下降,并且当跨开源多模态推理模型考虑 CoT 一致性时,这些影响更为显著。相比之下,闭源模型表现出类似的失效模式,但保持了明显更强的鲁棒性和推理一致性,这表明差距反映了当前开源 RL 微调的缺陷,而非任务本身的固有限制。为了更深入地理解这些脆弱性,我们进一步分析了 RL 微调动态,并揭示了一个准确性-忠实度权衡:微调提高了基准测试的准确性,但同时可能侵蚀伴随的 CoT 的可靠性及其对上下文变化的鲁棒性。尽管对抗性增强提高了鲁棒性,但它本身并不能阻止忠实度漂移。引入一个考虑忠实度的奖励可以恢复答案与推理之间的一致性,但当与增强配对时,训练有崩溃到捷径策略的风险,且鲁棒性仍然难以实现。总之,这些发现凸显了仅以准确性评估的局限性,并推动了同时强调正确性、鲁棒性以及视觉锚定推理忠实度的训练与评估协议。

  • † 哈佛大学
  • ‡ OpenAI
  • ** 在 Apple 期间完成的工作

相关阅读与更新。

CoT 在推理中的潜力:对轨迹动态的深入审视

思维链(CoT)提示词是一种事实上的标准技术,用于从大语言模型(LLM)中引出类似推理的回应,使其在给出最终答案之前能够逐步列出各个步骤。虽然它与人类推理的相似性不可否认,但支撑 CoT 推理成功的驱动因素在很大程度上仍不清楚。在这项工作中,我们对源自……的 CoT 轨迹进行了深入分析。

改进视觉语言模型的思维链推理

视觉语言模型(VLM)中的思维链(CoT)推理对于提高可解释性和可信度至关重要。然而,当前的训练方案通常依赖于以简短标注为主且极少包含推理过程的数据集。在这项工作中,我们表明,在简短答案上训练 VLM 会导致其在需要更详细解释的推理任务上泛化能力差。为了解决这一局限性,我们提出了一个两阶段……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com