一次成片,灵活参考:Seedance 2.5 正式发布
一次成片,灵活参考:Seedance 2.5 正式发布
日期
2026-07-31
分类
模型
今天,我们正式发布新一代视频生成模型 Seedance 2.5。自 Seedance 2.0 发布以来,我们注意到用户对视频生成模型的期待正在发生转变:从仅仅生成一段片段,到完成一部完整的创意作品。在 Seedance 2.0 统一的多模态音视频联合生成架构基础上,Seedance 2.5 以基础生成和参考生成为核心,在长叙事、多模态参考和编辑方面实现了重大突破。它立足于真实使用场景,打开了更大的创意想象空间和可控性,进一步释放生产力。
核心亮点包括:
单次生成最长 30 秒,支持多轮续写:Seedance 2.5 可以一次生成高质量、30 秒的音视频片段,并支持多轮续写。它还改进了镜头切换和场景变化,使长视频的连贯性更强,并在图像、音频和运动质量方面带来显著提升,呈现出比常见 AI 生成视频更自然、更精致的画面质感。因此,用户可以制作出具有一致视听语言的高质量数分钟内容,一次成片,让完整故事跃然眼前。
多模态参考全面升级:用户现在可以一次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材。该模型还强化了一系列参考能力,包括黏土渲染、动作和创意参考,使其能够更好地理解创作者的意图,实现跨越多个主体、场景和镜头变化的复杂创意。
更精准、更稳定的编辑能力:Seedance 2.5 提供时间戳级控制,可对音视频内容进行精准编辑,显著提升效率与可控性。该模型还增强了高级编辑功能,如绿幕、镜头视角和基于参考的编辑,以满足影视、广告等专业复杂领域的严苛需求。
随着长叙事、多模态参考和编辑能力的进步,Seedance 2.5 已超越更长的单次视频生成。该模型能更好地理解创作意图,并以更强的控制力实现从创意到成片的完整流程。现在,我们邀请您观看一部由 Seedance 2.5 端到端制作的创意短片。
今天,Seedance 2.5 已在即梦 AI、豆包 Pro 等平台上线,API 访问即将通过火山方舟(BytePlus ModelArk)提供。我们诚邀您试用并分享反馈。
项目主页:
https://seed.bytedance.com/seedance2_5
访问方式:
即梦 Web -> 视频生成 -> 选择 Seedance 2.5
豆包 Pro -> 视频生成 -> 选择 Seedance 2.5
30 秒长叙事 + 多轮扩展:单次生成呈现完整故事
Seedance 2.5 将单次视频生成从 15 秒扩展到 30 秒,并进一步强化了长视频中的叙事能力。在 30 秒内,模型可以组织多个逻辑连贯的镜头,使故事通过开端、发展、转折和结局逐步展开,而非仅仅延长单一瞬间。例如,在一段歌手舞台表演的一镜到底片段中,模型呈现的是歌手在化妆间与工作人员互动、穿过后台走廊、与舞者会面、并一同登台表演的完整故事,而不仅仅是走上舞台的那一刻。
T2V 提示词:一镜到底的手持稳定器跟拍镜头。镜头缓缓穿过厚重红色幕布的缝隙推入,进入一间暖色调的后台化妆间。一位年轻女歌手背对镜头,正在调整耳返,一旁的工作人员提醒她该上场了。她转向镜头,开始演唱城市流行乐。镜头向后拉并跟拍她穿过幕布进入昏暗的后台走廊,途中与舞者们自然互动;一位工作人员递给她一支麦克风。随后她与舞者们踏上舞台,镜头绕到后方弧形移动,逐渐展现红黑配色的舞台设计、LED 屏幕、聚光灯、烟雾和反光地板。镜头最终拉远至场馆全景,展现座无虚席的观众、灯牌、荧光棒和欢呼的人群,捕捉演唱会青春奔放的高潮时刻。
得益于模型的多轮扩展能力,用户可以在已有视频输出的基础上流畅地追加后续镜头。在整个扩展过程中,模型保持主角、环境和叙事节奏的一致性。这让用户能够一次性输出长达数分钟的视频,减少了拆分片段、反复拼接素材和修补转场所需的工作量。
R2V 提示词:扩展视频。从 @Video 1 的画面和主体继续生成一段 30 秒的片段,保持人物主体、场景、视觉风格和音效一致。小男孩抱着足球沿着列车车厢奔跑。地铁到站后侧门打开,他立刻冲了出去,男主角在后面追赶。两人跑过站台来到街上,沿途惊扰了路人和车辆。男主角终于追上并抓住了他。男孩抬起头,一脸委屈。男主角的怒气渐渐消退,他拍了拍男孩的头,露出无奈的笑容。
在视觉呈现方面,该模型实现了镜头运动之间更平滑的过渡。主体在多个镜头切换中保持稳定,音画保持同步,从而生成高度连贯的长视频。例如,在一场京剧场景中,镜头跟随主角飘逸的水袖进行优雅的环形摇摄,而主体和背景始终保持完全一致。水袖的甩动在空中形成自然的弧线,高度贴合真实物理规律。
R2V 提示词:16:9 宽银幕,电影质感,单次连续拍摄,镜头运动平滑,无剪辑。场景参考:@Image 4。0–5秒:以 @Image 2 中霸王的特写开场。镜头缓慢环绕他的上半身,并过渡到中景。霸王旋转转身,他的身体和背后的靠旗迅速掠过镜头,形成自然的遮挡,镜头随之跟随到 @Image 1 中虞姬的身旁。6–10秒:镜头以中景稳定环绕 @Image 1 中的虞姬,跟随她的水袖划过弧线。她抬臂、抖腕、甩开水袖,并半转身。随后她收回水袖,定格姿态,侧目望向霸王。11–20秒:@Image 3 中的武生以空翻入场。霸王占据舞台中央,武生在对面进退攻防,形成打斗交锋。虞姬站在霸王身后稍侧的位置,穿插水袖动作,以柔衬刚。镜头从武生的中近景缓缓拉远至全景舞台。最后,三人面向观众,同时摆出京剧收势亮相。
此外,针对 AI 生成视频中常见的过度人工感问题,Seedance 2.5 系统性地优化了物体纹理、皮肤与眼部特征、光照以及色彩饱和度等细节。该模型还最大程度减少了字幕和背景音乐中不受控的意外情况,最终产出的成片在质感上高度接近实拍电影画面。
多模态参考能力全面升级,为复杂创意任务带来更强掌控力
Seedance 2.5 进一步强化了多模态参考生成能力。它允许用户在一次输入中上传最多 30 张图片、10 段视频片段和 10 段音频片段作为参考素材。更大数量、更多样化的参考内容能够更好地捕捉用户意图,生成包含更多主体、更丰富场景和更灵活镜头运动的复杂视频。
该模型能够全面理解所有素材中的视觉构图、场景、风格、角色和道具等元素,并按照指令将其应用到视频生成过程中。即使在多角色镜头或群体叙事等复杂场景中,它也能保留多个角色的外貌和声音,同时保持每个主体的特征稳定。
R2V 提示词:一段 30 秒的 16:9 横屏音乐会片段,电影级写实风格,真实的音乐厅灯光与阴影,温暖的金色舞台灯光,正式古典音乐会的氛围。场馆参考 @Image 1。钢琴家参考 @Image 2。大提琴参考 @Image 3。小提琴参考 @Image 4。主唱必须严格遵循 @Image 5。其余管弦乐队参考 @Images 6 至 10。合唱团参考 @Images 11 至 14。观众席参考 @Images 15 至 18。主唱从舞台中央走向台前。钢琴家位于钢琴旁。管弦乐队分列两侧并向后方延伸排列。合唱团站在舞台后方。开场为整个音乐厅的高角度全景镜头。钢琴家按下琴键,主唱步入聚光灯下开始演唱。镜头自然地掠过小提琴、大提琴和管弦乐队,他们共同演奏,小提琴音色明亮,大提琴音色温暖。后半段,合唱团加入。主唱与前排观众短暂对视,观众报以微笑和微微点头。结尾镜头,镜头拉远。演唱结束,观众席响起掌声。
Seedance 2.5 还增强了特定参考能力,包括黏土渲染、动作和创意参考,让用户能够更精细地控制画面中的主体、动作和运镜。例如,通过黏土渲染参考,用户可以使用无纹理的 3D 模型搭建场景的空间结构、角色姿态、运动轨迹和镜头角度。随后,模型利用这一结构生成视频,确保复杂镜头的构图和场面调度与创作者的预期高度吻合。此外,Seedance 2.5 还改进了光照控制。通过利用黏土渲染中的空间信息,它能够生成遵循物理规律的真实光照效果,例如光源方向、色温、强度和阴影投射。这使得最终输出中的光影更加自然。
R2V 提示词:参考 @Clay Render 1 的镜头运动、节奏、景别切换、主体轨迹和场面调度。参考 @Image 2 的角色设计、场景、材质、光照、色彩和童话氛围,将白色模型渲染成一部梦幻、温暖、带有童趣奇幻感的 3D 动画短片。故事展开如下:飞越幻想天空 → 神话生物在云海中伴飞 → 潜入海洋 → 与蝠鲼在深海穿梭 → 穿过时空镜像裂隙 → 从宇宙中摘取星辰 → 变回卧室 → 父亲掖好被角 → 绘本合上并定格在最后一帧。
更精准可靠的编辑能力,带来更高的创作效率
在视频创作中,用户通常需要在生成过程中控制节奏,并在后期细化细节。动作发生的精确秒数、镜头切换的准确时机,以及某个片段中角色动作是否需要调整,都会对最终结果产生深远影响。更精准可靠的编辑能力能让创作者准确地将想法变为现实,提高效率并降低重复生成的成本。
Seedance 2.5 支持通过时间戳进行精确的内容编辑。在生成阶段,用户可以使用提示词控制特定时间范围内的叙事、镜头视角、运动以及整体节奏,使输出更贴合创作意图。生成完成后,用户还可以对特定片段中的角色、动作或情节元素进行针对性修改,同时保持编辑前后的连续性和真实感。
Seedance 2.5 还提升了多项编辑功能,如绿幕编辑、镜头视角编辑和参考图编辑,以满足影视、广告等专业领域的严苛需求。以绿幕编辑为例,该模型可以在保持主体不变的情况下替换背景,讲述完全不同的故事。此外,它还能出色地渲染主体对新环境物理规则的响应,包括衣物的飘动方向、发丝状态、步态节奏以及光照交互,确保主体与场景和谐融合。
R2V 提示词:使用 @Video 1,渲染绿幕背景、障碍物、服装和配角。0–4秒:户外训练,将障碍物替换为石块、砖块、轮胎和木箱。4–10秒:更衣室,队友给予鼓励。10–15秒:国际比赛,将训练杆替换为原始防守队员和守门员,主角完成进球。整体写实风格,电影级画质。
R2V 提示词:编辑 @视频 1。保持角色、动作和视觉风格不变,仅调整镜头运动。15 秒分段运镜方案:0–4 秒,微型 FPV 镜头紧贴平底锅掠过,随后跟随弹起的吐司并甩镜至咖啡;4–7 秒,向前推进并沿锅沿横向跟拍,跟随煎蛋翻起后落回原位;7–11 秒,快速升至俯视视角,再匀速下降,扫过餐盘和键盘;11–15 秒,手持特写跟随双手快速横向甩镜,随后推进至早餐并拉出中景双人镜头。全程保持流畅、连贯、稳定。
深入更广泛的行业场景,持续探索真实世界价值
随着模型能力的演进,Seedance 2.5 正深入教育、制造等更广泛的行业场景。在教育领域,该模型已开始进入真实的学习环境。例如,Seedance 2.5 可以将课程背后的历史背景、人物和故事情节转化为更生动、更具沉浸感的视觉内容。它还能帮助教师更高效地制作教学视频,将抽象内容——科学原理、历史事件、实验步骤——转化为动态演示。这不仅降低了教学素材制作的门槛,还实现了高度灵活的内容定制。
豆包学习应用“豆包课堂”场景示例
R2V 提示词:富有表现力的东方绘画风格。南宋临安街头场景。几个孩童在熙攘的街道上奔跑呼喊,吟唱着“蓦然回首,那人却在,灯火阑珊处”。镜头跟随孩童奔跑,扫过热闹的街市。随后镜头上摇,显现出 @图片 1 中的辛弃疾。辛弃疾转头,远处灯火阑珊处站着一个人。全片镜头保持连贯。
在工业制造、具身智能和自动驾驶等领域,Seedance 2.5 正逐步融入高度专业化的生产流程。该模型能够生成高质量合成视频数据,帮助训练机器人的感知与操作技能。它还被用于工业仿真、工艺培训和设备演示。在自动驾驶方面,该模型可以模拟长尾场景,如极端天气和复杂交通状况,为系统测试和训练提供更多样化的样本。
R2V 提示词:参考 @Clay Render 1 的运镜、构图、景别、空间关系、部件位置、模型结构、装配顺序和运动路径。参考 @Image 1 的材质、光照、色彩、反射和氛围,将黏土渲染效果转化为高端、逼真的汽车装配流程。
总结与展望
Seedance 2.5 在理解和渲染真实世界方面迈出了重要一步,将视频生成从片段级输出提升为完整的创意工作流。与此同时,我们也认识到仍有改进空间,尤其是在复杂运动的物理合理性以及多主体交互场景的稳定性方面。
展望未来,Seed 团队将继续探索更连贯的叙事方式,提供更直观的生成和编辑体验,并进一步加深模型对真实世界物理规律的理解。我们希望 Seedance 系列模型能变得更加生动、更可控、更善于理解用户意图,帮助更多用户表达创意想法,同时持续探索并服务更广泛的行业需求。