Into the DreamVerse
TL;DR: 我们在 FastVideo 中的全新实时推理栈带来了 Dreamverse,这是一种新型界面的原型,让用户能够实时"指挥"自己的视频"多元宇宙"。
AI 视频生成已经足以制作令人信服的片段。但真正的创意工作并不在于一次生成一个片段。关键在于迭代。一个想法浮现,你测试它:保留主体,改变镜头角度,延续场景,再试一次。问题在于,想法的迭代速度比视频生成更快。如果每次尝试都需要几分钟,创意循环就会中断;你的想象力在视频生成之前就已经转移了。
我们认为 AI 视频生成可以有更好的交互界面,因此我们创建了 Dreamverse--一种支持名为"实时指挥"(vibe directing)的新型工作流程的界面。
实时指挥之于视频,就像实时编程(vibe coding)之于软件。你不必从零开始重写庞大的提示词,而是用自然语言与系统对话,通过快速修改来操控视频。保留主体,改变背景,放慢镜头,或者做任何其他操作!与其把所有内容塞进一个提示词里,不如用多个简单的提示词进行迭代。
这种工作流程只有在视频生成达到实时水平时才可能实现。目前像 Sora 这样的视频生成模型需要 1-2 分钟才能生成一段 5 秒的 1080p 片段。而我们可以在单张 GPU 上仅用约 4.55 秒完成。换句话说,我们在 FastVideo 中的推理栈生成一个片段的速度比你看完它还要快。这种能力彻底改变了视频生成推理的体验;它不再像被动的接收过程,而更像是在导演你自己的场景。这让我们能够创建一段更长的 30 秒场景,作为一连串 5 秒片段展开,同时保持聊天窗口打开,以便你实时继续指挥。
这之所以重要,是因为真正的视频创作几乎从来不会在第一次尝试时就完美无缺。某个镜头可能看起来不对劲。动作可能在中途出现断裂。角色可能在帧与帧之间出现漂移。此外,创作者可能对一个场景有多个版本,想要逐一预览,看看哪个更好。实际上,创作者会不断进行小幅调整并再次尝试。当修改过程很慢时,探索多种想法就会变得非常困难。然而,如果下一个结果几乎能立即返回,那么快速尝试多个想法(而不仅仅是一个想法)就变为了可能。更好的创作成果来自于更快的反馈循环,而不仅仅是更好的模型。
我们认为这正是视频生成的发展方向:一种在视频展开过程中实时导演它的方式。最好的系统将不仅仅是生成令人印象深刻的片段,而是让人们能够以想象的速度去探索想法。
这就是"氛围导演"(vibe directing)的全部意义。现在就通过我们的演示,步入 Dreamverse。
团队
核心贡献者:Will Lin*、Matthew Noto*、Junda Su*、Yechen Xu*、Peiyuan Zhang*(* 同等贡献) 贡献者:Shao Duan、Minshen Zhang、Loay Rashid、Kevin Lin UI 设计:Tina Mai 技术负责人:Will Lin、Hao Zhang 顾问:Hao Zhang(通讯作者)、Danyang Zhuo、Eric Xing、Zhengzhong Liu
了解更多
• FastVideo 文档 - FastVideo 2026年第一季度路线图