# 教视觉-语言模型说"电影语言"

- 来源：CMU：Machine Learning Blog
- 作者：Zhiqiu Lin
- 发布时间：2026-05-14 11:06
- AIHOT 分数：63
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmp4yeqnn09sksljxvgbqhxp4
- 原文链接：https://blog.ml.cmu.edu/2026/05/13/teaching-vision-language-models-to-speak-cinema

## 精选理由

这篇CVPR 2026 Highlight的博客版很有意思，它用100多个专业电影人来标注视频，教VLM学会推拉摇移的镜头语言，不是又多一个数据集，而是提醒我们：高质量的人工标注可能比堆模型更重要。

## AI 摘要

研究团队与百余名专业创作者历时一年，构建了一个视频描述生成流程，其核心在于扩展精细化的人类-AI协同监督，而非单纯扩大模型规模。该研究（入选CVPR 2026亮点论文）指出，当前主流视频生成模型在理解和生成具有电影感的专业运镜（如希区柯克式滑动变焦、精确的焦点转移或荷兰角镜头）时存在明显不足，常产出通用或焦点错误的画面。这项工作揭示了一条通过提升监督质量来增强模型“电影语言”表达能力的新路径。

## 正文

与超过100位专业创作者共同构建视频字幕流水线的一年，以及这段经历教会我们关于规模化监督而非模型本身的经验。

作者：林志秋与Chancharik Mitra。基于我们发表于CVPR 2026的论文《通过人机协同构建精准视频语言》（亮点论文，前3%）。

当今的视频生成器距离好莱坞摄影师还有多远？

好莱坞导演之所以选择某些镜头，是因为它们能让场景产生冲击力。它们能在观众心中唤起平淡的常规拍摄无法传达的特定感受。打开你最常用的视频生成器（Veo 3.1、Seedance 2或任何最新的开源模型），让它生成一个推拉变焦镜头：一个男人站在熙熙攘攘的街道中央，就像希区柯克用这种镜头让世界仿佛向内坍塌一般。或者一个焦点转换镜头，从咖啡杯拉焦到后面的女人——这种悄然引导观众视线看向何处的焦点变化。再或者一个荷兰角镜头，拍摄一个紧张的人凝视虚空，倾斜的画面让观众感到不安。

大多数生成器会返回某种接近普通推近镜头或慢动作片段的结果，但焦点主体却是错误的。输出画面通常在视觉上合格，却无法实现真正的意图。模型显然看过包含这些手法的视频，只是不知道如何根据文字指令来执行。

我们认为这反映了一个更广泛的差距。电影制作人使用一套共享且精准的词汇进行沟通：景别、画面位置、焦点类型、镜头畸变、摄影机高度、视频速度。而当今的视觉语言模型（VLM）以及为它们提供训练数据的字幕数据集，大多不具备这种能力。

在这篇文章中，我们介绍了 CHAI，这是一个字幕生成流程（在我们的使用场景中，字幕是指描述视频内容、运镜和摄影工作的长结构化段落，而非字幕轨道），我们与 100 多位专业视频创作者在过去一年中共同构建了它。这个缩写代表“基于批评的人机协同监督”。现有的视频字幕数据集通常由众包工作者编写，他们缺乏描述镜头所需的电影词汇；或者由大型视觉语言模型生成，其字幕读起来流畅（语法和风格上均无错误），但经常描述视频中并不存在的物体和动作（即模型幻觉）。CHAI 的核心思路是将两者结合：字幕生成模型（例如 Gemini-2.5-Pro 这样的大型视频语言模型）撰写草稿，经过培训的人类对其进行批评，然后模型根据该批评进行修改。

本文围绕四个问题展开：

1. 为什么视觉语言模型难以处理电影级提示词？

2. 人类和模型应如何分工完成字幕生成工作？

3. 人类批评的质量是否会影响模型的学习效果？

4. 训练数据中更优质的字幕能否带来更好的视频生成模型？

图 1. 当前视频字幕生成流程的三种失败模式（上方，红色），以及我们针对这些模式所做的选择（下方，蓝色）：精确的规范说明、人机协同监督循环，以及在显式偏好和批评（而非仅输出比较）基础上的后训练。

问题 1：为什么视觉语言模型难以处理电影级提示词？

一个自然的初步假设是，这属于能力问题——当前这一代视觉语言模型规模太小、上下文窗口不足，或者没有在足够多的视频上进行预训练，因而无法处理电影级提示词，下一代模型将会解决这个问题。但在对 2016 年至 2025 年间八个主流视频-文本数据集（ActivityNet Captions、MSR-VTT、DREAM-1K、ShareGPT4Video、PerceptionLM 等）进行审计后，我们认为瓶颈在别处。视觉内容存在于这些模型训练所用的视频中，现代视觉语言模型能够很好地感知它们。缺失的是语言：与这些视频配对的文本描述并不包含描述电影技法所需的精确词汇。在我们的实验中，用更多同类数据训练更大的模型，仅能略微改善这些问题。它们似乎是标注策略的问题，而非能力问题。

有三种模式反复出现：

• 术语不精确。文本描述将推近镜头（摄像机物理向前移动）与变焦推近（焦距变化）混为一谈，或者将鱼眼畸变描述为“圆形建筑”。

• 信息缺失。文本描述只描述画面中的内容，而忽略了其他一切：运动、镜头抖动、焦点变化、景别。任何与时间相关的内容、任何与摄像机相关的内容，都被丢弃了。

• 主观描述。“一个充满紧张感的气氛镜头”无法让模型在像素层面找到任何可依据的信息。

一个自然的后续想法是：直接雇佣众包标注员来撰写更细致的文本描述。我们尝试了这一点。众包标注员仍然混淆了推近镜头与变焦推近，将广角镜头称为“特写”，并将鱼眼畸变描述为“一栋圆形建筑”。看到与知道如何描述是两回事。

视频 · 前往原文观看

图 2. 针对同一片段，众包标注员与专家的描述对比。众包标注员看到了航拍镜头、鱼眼镜头的畸变效果以及推拉变焦。他们只是使用了日常语言（“鸟瞰视角”、“圆形建筑”、“扭曲效果”），而没有使用模型执行该描述所需的技术词汇。

最终奏效的方法是引入那些工作中需要使用这类词汇的人：电影摄影师、摄影指导、动态图形设计师、视觉特效艺术家、游戏设计师、摄像师。过去一年里，我们与 100 多位这样的合作者共同构建了一套结构化的标注规范。该规范包含五个方面：

• 主体（类型、属性、关系）

• 场景（构图、动态、叠加、视角）

• 运动（主体动作、交互、群体活动）

• 空间（景别、画面位置、景深、空间运动）

• 镜头（对焦类型、景深、稳定性、运动、视频速度、镜头畸变、高度、角度）

这五个方面总共涉及约 200 个底层视觉基元，每个基元都有明确的定义和适用时的判定规则。这防止了标注人员随意使用术语，因为他们只需对照规范进行标注即可。

图 3. 以往标注工作中的典型问题（左侧，红色）以及我们最终达成的方案（右侧，蓝色）。这套结构化分类体系是与电影摄影师、摄影指导、视觉特效艺术家、动态图形设计师和游戏设计师合作构建的，并配有标注策略和培训教程，以确保不同标注人员之间术语使用的一致性。

图 4. 完整的分类体系。五个方面，每个方面分解为子方面，每个子方面又基于一组视觉或运动基元。

要点：视觉语言模型难以处理电影级提示词，是因为它们训练所用的标注中不包含专业人士使用的精确词汇。在我们的实验中，仅扩大模型规模或增加数据量带来的提升微乎其微；而精心设计语言则带来了显著得多的改善。

问题 2：人类和模型应如何分工完成标注工作？

一旦我们制定了规范，仍需决定由谁来撰写这些长标注。两个显而易见的选择——人类或模型——各自都有众所周知的局限性。

仅靠人类生成的标注存在拼写错误、语法错误以及事件顺序不一致的问题。他们还会疲劳：每段视频要撰写 200 到 400 词的精炼描述，同时还要查阅规范，这既耗费精力又成本高昂。

仅靠模型生成的描述文字读起来优美流畅，但在相当一部分令人沮丧的视频片段中，它们会自信地描述并不存在的物体和动作。此外，它们还经常混淆左右方向。

我们在试点研究中注意到，这些失败模式在一种有用的方式上呈现出不对称性。如今的大语言模型能写出比大多数人类更优美的文字。但人类，尤其是经过训练的人类，在发现草稿中的视觉或动作错误方面比大语言模型强得多——比如描述文字写着“向左移动”，但主体却在向右移动。因此，我们围绕这种不对称性构建了处理流程：模型起草，人类批评，模型修改。这在概念上类似于 Saunders 等人（2022 年）针对摘要任务提出的自我批评模型，但应用于长视频描述生成时，人类仍然承担了最困难的部分：对照实际视频捕捉与事实不符的错误。

具体来说，这个循环如下：

1. 基础元素。经过训练的标注员标记视频片段中存在哪些视觉和动作基础元素。

2. 预生成描述。模型根据这些基础元素，按照规范生成一段长描述。

3. 批评。标注员对照视频阅读预生成的描述，撰写批评意见，指出哪里错了以及应该怎么改。批评意见必须准确（指出的问题确实有误）、完整（不遗漏错误）且具有建设性（告诉模型该做什么，而不仅仅是说某处不好）。

4. 后生成描述。模型利用批评意见修改其草稿。

5. 精炼。如果后生成的描述仍有问题，人类会精炼批评意见，而不是重写描述。

我们指派审核员（从表现最佳的标注员中晋升，担任质量控制角色）对照视频检查每一条批评意见和后生成的描述。这样，标注员根据其准确性获得评分，而审核员则因发现他们找到的错误而获得奖励。在进入任何建模阶段之前，就在数据层面同时激励了精确率（不标记没有错误的内容）和召回率（不遗漏确实有误的内容）。

视频 · 前往原文观看

将人类的工作从撰写转变为校对，有一个我们当初低估的附带好处：每段视频所需的认知投入大大降低，最终生成的 200 到 400 词字幕，其准确性也高于人类或模型单独完成的结果。

要点：大语言模型和人类在长视频字幕生成方面具有非对称优势。围绕这种非对称性来设计流程，而不是试图用一方取代另一方，既能获得更好的字幕，也能让标注过程更具可持续性。

问题 3：人类批评的质量会影响模型的学习效果吗？

该流程为每段视频生成一个三元组：（初始字幕，批评，修改后字幕）。这个三元组不仅仅是一条带标注的字幕，它同时为三种不同的后训练任务提供了监督信号：

• 字幕生成。训练模型生成长篇、忠实于原意的字幕。

• 奖励建模。将（初始字幕，修改后字幕）视为（被拒绝的，被偏好的）配对。

• 批评生成。训练模型根据视频和草稿自行撰写批评。

我们使用标准监督微调（SFT），联合三种格式对 Qwen3-VL-8B 进行了后训练。我们也尝试了直接偏好优化（DPO）等强化学习（RL）方法，但发现对完整三元组数据做简单的 SFT 效果最强。具体数字详见论文；核心结论是，加入明确的偏好和批评信号，能提升我们测试的所有方法。

我们很好奇，批评的质量是否会影响下游性能，还是说任何“这是错的”信号都行。于是我们做了一项消融实验：取一条干净的 CHAI 批评，每次故意降低其中一个属性（准确性、召回率、建设性），然后观察后训练的字幕模型在各项任务上的表现。

图 6。一条有用的批评必须准确（它指出的问题确实有误）、完整（它能捕捉到存在的错误），并且具有建设性（它说明应该怎么改，而不仅仅是说哪里不好）。这三个属性缺一不可；降低其中任何一个，都会损害下游模型的表现。

表 1 展示了基于每种变体对 8B Qwen3-VL 进行后训练的结果。Caption 和 Critique 采用 BLEU-4 分数（一种标准文本生成指标，在 0–100 的范围内衡量 n-gram 与参考文本的重叠程度；分数越高表示越接近人工参考），对比的是预留的参考描述和参考评论。对于 Reward 任务，我们报告了二元准确率，即描述器对后描述评分高于前描述的概率（随机水平为 50）。三项指标均为越高越好。

媒体内容 · 前往原文查看

评论变体准确完整建设性描述奖励评论

盲测 Gemini-2.5———10.944.521.1

Gemini-2.5———12.762.026.2

不准确的评论✗✓✓12.147.121.9

不完整的评论✓✗✓12.556.628.7

非建设性评论✓✓✗13.467.232.9

CHAI（含质量控制）✓✓✓18.289.841.7

表 1. 当评论在单一属性上被人为降质时的后训练结果。分数越高越好。作为额外参考点，我们还尝试使用现成模型代替我们的人工-AI 流水线来生成评论：(1) 盲测 Gemini-2.5 仅使用描述文本（无视频输入）让 Gemini-2.5 进行评论（一种语言先验基线）；(2) Gemini-2.5 使用同一模型但输入完整视频。CHAI（含质量控制）是我们的完整流水线，包含来自问题 2 的同行评审质量控制步骤——即评论是准确、完整且具有建设性的。

有三点值得注意：

1. 质量不是可选项。舍弃三个属性中的任何一个都会实质性地损害所有下游任务。非建设性评论（收集成本最低，因为你无需指出具体错误所在）造成的损害最小，但仍存在巨大差距。

2. 现有数据大多是非建设性的。我们检查了 Saunders 等人的 GDC 数据集和 MM-RLHF 等公开数据集中发布的评论。其中超过一半在我们看来是非建设性的（只说“这是错的”，没有给出修改建议）。这有助于解释为什么在这些数据集上训练会导致性能无法充分发挥。

3. 当数据质量足够好时，一个 8B 模型可以与规模大得多的闭源模型一较高下。在相同的描述、奖励和评判基准上，经过后训练的 8B Qwen3-VL 在我们报告的指标上达到或超越了 GPT-5 和 Gemini-3.1-Pro。模型规模并未改变；改变的是监督信号。

一个小彩蛋：同一个奖励模型在推理阶段也能发挥作用。使用训练好的奖励模型进行 Best-of-N 解码，可以在无需额外人工标注的情况下持续提升性能。

要点：评判的形式并非风格上的细枝末节。当模型所训练的评判数据具备准确性、完整性和建设性时，联合进行描述、偏好和评判后训练的模型在所有三项任务上的表现都会显著更好——而当其中任何一项属性缺失时，表现则会显著更差。

问题 4：训练数据中更好的描述能否带来更好的视频生成模型？

持怀疑态度的读者可能会说：这一切都很好，但描述只是上游环节，大多数人真正想要的是生成能力。因此，我们测试了改进后的描述器是否能在下游视频生成模型上带来实质改变。我们选取了一个大型专业视频语料库（包括电影、广告、音乐视频、游戏画面），用经过后训练的 8B 模型重新生成描述，并使用这些新描述对 Wan2.2 进行微调。

微调后的模型能够处理详细提示词（最长约 400 个单词），针对那些现成生成器经常出错的技法给出准确响应：

视频 · 前往原文观看

视频 · 前往原文观看

图 7. 两个长生成提示词（推理阶段输入视频生成器的文本），它们最初由我们经过后训练的描述器在相似的保留片段上生成。右侧：零样本 Wan2.2 对提示词的遵循较为松散，推拉镜头变成了普通的向后拉镜头，等距（2.5D）游戏场景变成了普通的 3D 街机风格。左侧：在 Wan2.2 使用我们模型重新描述的训练视频进行微调后，它能忠实地遵循相同的提示词。

我们没有改变生成器的架构或训练目标。唯一改变的是训练集中用于描述视频的语言。这足以让一个现有的生成器学会一类它此前无法表达的技术。

要点：在上游使用更精确的标注词汇，能够在下游实现更可控的生成效果，且无需改变模型架构或训练方案。实现电影级控制力的瓶颈在于监督信号本身，而非模型。
