# Seedance 2.5 发布：单次生成 30 秒视频，支持多模态参考与精准编辑

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：njaremko
- 发布时间：2026-08-02 08:09
- AIHOT 分数：77
- AIHOT 链接：https://aihot.virxact.com/items/cmsb2e07t02gjrohvmoswiuvf
- 原文链接：https://seed.bytedance.com/en/blog/one-take-creation-flexible-referencing-introducing-seedance-2-5

## AI 摘要

Seedance 2.5 正式上线，单次生成最长 30 秒高质量音视频片段，并支持多轮扩展以输出数分钟连贯内容。模型可一次输入最多 30 张图片、10 段视频和 10 段音频作为参考，并新增时间戳级编辑控制，提升长叙事、多模态参考与剪辑能力。即日起登陆即梦 AI、豆包 Pro 等平台，API 即将通过 BytePlus ModelArk 提供。

## 正文

一次成片，灵活参考：Seedance 2.5 正式发布

一次成片，灵活参考：Seedance 2.5 正式发布

日期

2026-07-31

分类

模型

今天，我们正式发布新一代视频生成模型 Seedance 2.5。自 Seedance 2.0 发布以来，我们注意到用户对视频生成模型的期待正在发生转变：从仅仅生成一段片段，到完成一部完整的创意作品。在 Seedance 2.0 统一的多模态音视频联合生成架构基础上，Seedance 2.5 以基础生成和参考生成为核心，在长叙事、多模态参考和编辑方面实现了重大突破。它立足于真实使用场景，打开了更大的创意想象空间和可控性，进一步释放生产力。

核心亮点包括：

单次生成最长 30 秒，支持多轮续写：Seedance 2.5 可以一次生成高质量、30 秒的音视频片段，并支持多轮续写。它还改进了镜头切换和场景变化，使长视频的连贯性更强，并在图像、音频和运动质量方面带来显著提升，呈现出比常见 AI 生成视频更自然、更精致的画面质感。因此，用户可以制作出具有一致视听语言的高质量数分钟内容，一次成片，让完整故事跃然眼前。

多模态参考全面升级：用户现在可以一次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材。该模型还强化了一系列参考能力，包括黏土渲染、动作和创意参考，使其能够更好地理解创作者的意图，实现跨越多个主体、场景和镜头变化的复杂创意。

更精准、更稳定的编辑能力：Seedance 2.5 提供时间戳级控制，可对音视频内容进行精准编辑，显著提升效率与可控性。该模型还增强了高级编辑功能，如绿幕、镜头视角和基于参考的编辑，以满足影视、广告等专业复杂领域的严苛需求。

随着长叙事、多模态参考和编辑能力的进步，Seedance 2.5 已超越更长的单次视频生成。该模型能更好地理解创作意图，并以更强的控制力实现从创意到成片的完整流程。现在，我们邀请您观看一部由 Seedance 2.5 端到端制作的创意短片。

视频 · 前往原文观看

今天，Seedance 2.5 已在即梦 AI、豆包 Pro 等平台上线，API 访问即将通过火山方舟（BytePlus ModelArk）提供。我们诚邀您试用并分享反馈。

项目主页：

https://seed.bytedance.com/seedance2_5

访问方式：

即梦 Web -> 视频生成 -> 选择 Seedance 2.5

豆包 Pro -> 视频生成 -> 选择 Seedance 2.5

30 秒长叙事 + 多轮扩展：单次生成呈现完整故事

Seedance 2.5 将单次视频生成从 15 秒扩展到 30 秒，并进一步强化了长视频中的叙事能力。在 30 秒内，模型可以组织多个逻辑连贯的镜头，使故事通过开端、发展、转折和结局逐步展开，而非仅仅延长单一瞬间。例如，在一段歌手舞台表演的一镜到底片段中，模型呈现的是歌手在化妆间与工作人员互动、穿过后台走廊、与舞者会面、并一同登台表演的完整故事，而不仅仅是走上舞台的那一刻。

视频 · 前往原文观看

T2V 提示词：一镜到底的手持稳定器跟拍镜头。镜头缓缓穿过厚重红色幕布的缝隙推入，进入一间暖色调的后台化妆间。一位年轻女歌手背对镜头，正在调整耳返，一旁的工作人员提醒她该上场了。她转向镜头，开始演唱城市流行乐。镜头向后拉并跟拍她穿过幕布进入昏暗的后台走廊，途中与舞者们自然互动；一位工作人员递给她一支麦克风。随后她与舞者们踏上舞台，镜头绕到后方弧形移动，逐渐展现红黑配色的舞台设计、LED 屏幕、聚光灯、烟雾和反光地板。镜头最终拉远至场馆全景，展现座无虚席的观众、灯牌、荧光棒和欢呼的人群，捕捉演唱会青春奔放的高潮时刻。

得益于模型的多轮扩展能力，用户可以在已有视频输出的基础上流畅地追加后续镜头。在整个扩展过程中，模型保持主角、环境和叙事节奏的一致性。这让用户能够一次性输出长达数分钟的视频，减少了拆分片段、反复拼接素材和修补转场所需的工作量。

视频 · 前往原文观看

R2V 提示词：扩展视频。从 @Video 1 的画面和主体继续生成一段 30 秒的片段，保持人物主体、场景、视觉风格和音效一致。小男孩抱着足球沿着列车车厢奔跑。地铁到站后侧门打开，他立刻冲了出去，男主角在后面追赶。两人跑过站台来到街上，沿途惊扰了路人和车辆。男主角终于追上并抓住了他。男孩抬起头，一脸委屈。男主角的怒气渐渐消退，他拍了拍男孩的头，露出无奈的笑容。

在视觉呈现方面，该模型实现了镜头运动之间更平滑的过渡。主体在多个镜头切换中保持稳定，音画保持同步，从而生成高度连贯的长视频。例如，在一场京剧场景中，镜头跟随主角飘逸的水袖进行优雅的环形摇摄，而主体和背景始终保持完全一致。水袖的甩动在空中形成自然的弧线，高度贴合真实物理规律。

视频 · 前往原文观看

R2V 提示词：16:9 宽银幕，电影质感，单次连续拍摄，镜头运动平滑，无剪辑。场景参考：@Image 4。0–5秒：以 @Image 2 中霸王的特写开场。镜头缓慢环绕他的上半身，并过渡到中景。霸王旋转转身，他的身体和背后的靠旗迅速掠过镜头，形成自然的遮挡，镜头随之跟随到 @Image 1 中虞姬的身旁。6–10秒：镜头以中景稳定环绕 @Image 1 中的虞姬，跟随她的水袖划过弧线。她抬臂、抖腕、甩开水袖，并半转身。随后她收回水袖，定格姿态，侧目望向霸王。11–20秒：@Image 3 中的武生以空翻入场。霸王占据舞台中央，武生在对面进退攻防，形成打斗交锋。虞姬站在霸王身后稍侧的位置，穿插水袖动作，以柔衬刚。镜头从武生的中近景缓缓拉远至全景舞台。最后，三人面向观众，同时摆出京剧收势亮相。

此外，针对 AI 生成视频中常见的过度人工感问题，Seedance 2.5 系统性地优化了物体纹理、皮肤与眼部特征、光照以及色彩饱和度等细节。该模型还最大程度减少了字幕和背景音乐中不受控的意外情况，最终产出的成片在质感上高度接近实拍电影画面。

多模态参考能力全面升级，为复杂创意任务带来更强掌控力

Seedance 2.5 进一步强化了多模态参考生成能力。它允许用户在一次输入中上传最多 30 张图片、10 段视频片段和 10 段音频片段作为参考素材。更大数量、更多样化的参考内容能够更好地捕捉用户意图，生成包含更多主体、更丰富场景和更灵活镜头运动的复杂视频。

该模型能够全面理解所有素材中的视觉构图、场景、风格、角色和道具等元素，并按照指令将其应用到视频生成过程中。即使在多角色镜头或群体叙事等复杂场景中，它也能保留多个角色的外貌和声音，同时保持每个主体的特征稳定。

视频 · 前往原文观看

R2V 提示词：一段 30 秒的 16:9 横屏音乐会片段，电影级写实风格，真实的音乐厅灯光与阴影，温暖的金色舞台灯光，正式古典音乐会的氛围。场馆参考 @Image 1。钢琴家参考 @Image 2。大提琴参考 @Image 3。小提琴参考 @Image 4。主唱必须严格遵循 @Image 5。其余管弦乐队参考 @Images 6 至 10。合唱团参考 @Images 11 至 14。观众席参考 @Images 15 至 18。主唱从舞台中央走向台前。钢琴家位于钢琴旁。管弦乐队分列两侧并向后方延伸排列。合唱团站在舞台后方。开场为整个音乐厅的高角度全景镜头。钢琴家按下琴键，主唱步入聚光灯下开始演唱。镜头自然地掠过小提琴、大提琴和管弦乐队，他们共同演奏，小提琴音色明亮，大提琴音色温暖。后半段，合唱团加入。主唱与前排观众短暂对视，观众报以微笑和微微点头。结尾镜头，镜头拉远。演唱结束，观众席响起掌声。

Seedance 2.5 还增强了特定参考能力，包括黏土渲染、动作和创意参考，让用户能够更精细地控制画面中的主体、动作和运镜。例如，通过黏土渲染参考，用户可以使用无纹理的 3D 模型搭建场景的空间结构、角色姿态、运动轨迹和镜头角度。随后，模型利用这一结构生成视频，确保复杂镜头的构图和场面调度与创作者的预期高度吻合。此外，Seedance 2.5 还改进了光照控制。通过利用黏土渲染中的空间信息，它能够生成遵循物理规律的真实光照效果，例如光源方向、色温、强度和阴影投射。这使得最终输出中的光影更加自然。

视频 · 前往原文观看

R2V 提示词：参考 @Clay Render 1 的镜头运动、节奏、景别切换、主体轨迹和场面调度。参考 @Image 2 的角色设计、场景、材质、光照、色彩和童话氛围，将白色模型渲染成一部梦幻、温暖、带有童趣奇幻感的 3D 动画短片。故事展开如下：飞越幻想天空 → 神话生物在云海中伴飞 → 潜入海洋 → 与蝠鲼在深海穿梭 → 穿过时空镜像裂隙 → 从宇宙中摘取星辰 → 变回卧室 → 父亲掖好被角 → 绘本合上并定格在最后一帧。

更精准可靠的编辑能力，带来更高的创作效率

在视频创作中，用户通常需要在生成过程中控制节奏，并在后期细化细节。动作发生的精确秒数、镜头切换的准确时机，以及某个片段中角色动作是否需要调整，都会对最终结果产生深远影响。更精准可靠的编辑能力能让创作者准确地将想法变为现实，提高效率并降低重复生成的成本。

Seedance 2.5 支持通过时间戳进行精确的内容编辑。在生成阶段，用户可以使用提示词控制特定时间范围内的叙事、镜头视角、运动以及整体节奏，使输出更贴合创作意图。生成完成后，用户还可以对特定片段中的角色、动作或情节元素进行针对性修改，同时保持编辑前后的连续性和真实感。

Seedance 2.5 还提升了多项编辑功能，如绿幕编辑、镜头视角编辑和参考图编辑，以满足影视、广告等专业领域的严苛需求。以绿幕编辑为例，该模型可以在保持主体不变的情况下替换背景，讲述完全不同的故事。此外，它还能出色地渲染主体对新环境物理规则的响应，包括衣物的飘动方向、发丝状态、步态节奏以及光照交互，确保主体与场景和谐融合。

视频 · 前往原文观看

R2V 提示词：使用 @Video 1，渲染绿幕背景、障碍物、服装和配角。0–4秒：户外训练，将障碍物替换为石块、砖块、轮胎和木箱。4–10秒：更衣室，队友给予鼓励。10–15秒：国际比赛，将训练杆替换为原始防守队员和守门员，主角完成进球。整体写实风格，电影级画质。

视频 · 前往原文观看

R2V 提示词：编辑 @视频 1。保持角色、动作和视觉风格不变，仅调整镜头运动。15 秒分段运镜方案：0–4 秒，微型 FPV 镜头紧贴平底锅掠过，随后跟随弹起的吐司并甩镜至咖啡；4–7 秒，向前推进并沿锅沿横向跟拍，跟随煎蛋翻起后落回原位；7–11 秒，快速升至俯视视角，再匀速下降，扫过餐盘和键盘；11–15 秒，手持特写跟随双手快速横向甩镜，随后推进至早餐并拉出中景双人镜头。全程保持流畅、连贯、稳定。

深入更广泛的行业场景，持续探索真实世界价值

随着模型能力的演进，Seedance 2.5 正深入教育、制造等更广泛的行业场景。在教育领域，该模型已开始进入真实的学习环境。例如，Seedance 2.5 可以将课程背后的历史背景、人物和故事情节转化为更生动、更具沉浸感的视觉内容。它还能帮助教师更高效地制作教学视频，将抽象内容——科学原理、历史事件、实验步骤——转化为动态演示。这不仅降低了教学素材制作的门槛，还实现了高度灵活的内容定制。

视频 · 前往原文观看

豆包学习应用“豆包课堂”场景示例

R2V 提示词：富有表现力的东方绘画风格。南宋临安街头场景。几个孩童在熙攘的街道上奔跑呼喊，吟唱着“蓦然回首，那人却在，灯火阑珊处”。镜头跟随孩童奔跑，扫过热闹的街市。随后镜头上摇，显现出 @图片 1 中的辛弃疾。辛弃疾转头，远处灯火阑珊处站着一个人。全片镜头保持连贯。

在工业制造、具身智能和自动驾驶等领域，Seedance 2.5 正逐步融入高度专业化的生产流程。该模型能够生成高质量合成视频数据，帮助训练机器人的感知与操作技能。它还被用于工业仿真、工艺培训和设备演示。在自动驾驶方面，该模型可以模拟长尾场景，如极端天气和复杂交通状况，为系统测试和训练提供更多样化的样本。

视频 · 前往原文观看

R2V 提示词：参考 @Clay Render 1 的运镜、构图、景别、空间关系、部件位置、模型结构、装配顺序和运动路径。参考 @Image 1 的材质、光照、色彩、反射和氛围，将黏土渲染效果转化为高端、逼真的汽车装配流程。

总结与展望

Seedance 2.5 在理解和渲染真实世界方面迈出了重要一步，将视频生成从片段级输出提升为完整的创意工作流。与此同时，我们也认识到仍有改进空间，尤其是在复杂运动的物理合理性以及多主体交互场景的稳定性方面。

展望未来，Seed 团队将继续探索更连贯的叙事方式，提供更直观的生成和编辑体验，并进一步加深模型对真实世界物理规律的理解。我们希望 Seedance 系列模型能变得更加生动、更可控、更善于理解用户意图，帮助更多用户表达创意想法，同时持续探索并服务更广泛的行业需求。
