karminski-牙医 · @karminski3 · X·2026-09-08 03:26·7分钟前
karminski-牙医@karminski3
37AI 编辑部评分,满分 100
2026-09-08 03:26· 7分钟前

今天的一个想法, 文本大模型与视频大模型定位的拐点到来了, 这两种模型之前看上去不存在上下游关系, 但是现在变成了"显式符号/几何模拟(3D引擎 + 符号逻辑)" →"隐式统计生成(像素级视频生成扩散/Transformer模型)"

例如GPT-6或者Kimi-K3 这种空间理解能力特别强的模型, 它能准确地表达空间关系, 甚至时序化的空间关系(让模型看一个电影然后模型输出电影的全部白模动画). 那么 seedance-2.5 这类的视频生成模型就会更倾向用在下游场景, 即资产与细节的最终补充(比如一些模拟代价特别大的流体/毛发/布料/表情等).

从历史路径来看, 这种演化如果比喻的话, 有点像磁带到数字音乐的过渡. 现在文本与 3D 模型完全可以负责提供"语义与几何的骨架"(数字信息源), 而视频生成模型负责将其渲染为"欺骗人眼的光影波形"(超逼真的D/A转换器).

管中窥豹一下的话, 未来视频模型会越来越倾向于与代表着数字信号的文本大模型对接, 而非模拟信号的人类prompt. 甚至会出现文本大模型与视频大模型对接的上下文, 普通人类看不懂的程度. (说实话现在有些模型的思维链就已经不是人话了, 各种助词介词全被切掉了).

基于这个推论:

  1. 现在的"Prompt抽卡式"纯文生视频, 应该只是技术过渡. 依靠人类匮乏的自然语言去逼近连续的物理现实, 既低效又违背控制规律. 未来的专业管线一定是 "意图 → 符号/空间排布(3D白模与时空轨迹)→ 神经网络渲染填补画面".
  1. 影视与 3D 制作的"下限"被彻底重塑. 传统工业最昂贵/最折磨人的环节, 将全面交由下游的视频模型来做"概率式补全". 而创作者的核心竞争力, 将从"会不会写玄学 Prompt", 彻底回归为对空间因果/视听调度与叙事逻辑的编排能力.

人类负责故事走向, 大模型负责细节演绎, 视频模型负责最终呈现.

P.S. 各种AI剪纸动画, 比如虾仁系列, 反而跳过了最终的视频模型展现部分, 直接是大模型生成的程序化展现. 但好看的虾仁动画很多. 这也证明了:

好的视听语言, 首先建立在"剧情和骨架上(剧情, 演出, 节奏, 分镜调度等)"的绝对精确上, 而非"皮囊(微观光影)"有多逼真.

视频生成模型要解决的, 从始至终都只是"对连续光学现实的以假乱真". 而当一种艺术风格(剪纸、皮影、甚至我的刀盾动画)主动抛弃了对细节的执念却能获得流量时, 就证明了文本大模型单凭代码与符号编排出的戏剧节奏, 就足以唤起人类最饱满的情感共鸣.

毕竟, 过去几千年我们来都一直在看prompt(书)当作消遣.

#GPT6 #seedance #kimik3 #blender

来源:karminski-牙医· x.com