
Seedance 2.5 发布:一次生成 30 秒视频,字节跳动的"一镜到底"视频创作模型
字节跳动 Seed 团队发布 Seedance 2.5:单次生成 30 秒高质量音视频、支持最多 30 张图+10 段视频+10 段音频的多模态参考、时间戳级精确编辑。视频生成从'出片段'进化到'完成一部作品'。
原文来源:ByteDance Seed Team Blog — 字节跳动 Seed 团队发布新一代视频生成模型 Seedance 2.5,主打 30 秒单次生成、多模态参考和时间戳级编辑,把视频生成从"出片段"推进到"完成一部作品"。
2026 年 7 月 31 日,字节跳动 Seed 团队正式发布 Seedance 2.5,新一代视频创作模型。官方博客开门见山地给出了一个判断:自从 Seedance 2.0 发布以来,用户对视频生成模型的期待已经从"生成一个片段"变成了"完成一部创作"。Seedance 2.5 正是顺着这个需求做的——它围绕基础生成和参考生成两条主线,在长叙事、多模态参考、编辑能力三个方向集中突破。
单次 30 秒:从片段到完整叙事
Seedance 2.5 最直观的升级是单次生成时长从 15 秒翻倍到 30 秒,并且支持多轮扩展。30 秒听起来不长,但对视频生成模型来说意义完全不同:模型可以在 30 秒内组织多个逻辑连贯的镜头,让故事经历起承转合,而不是简单地把一个瞬间拉长。
官方给出的例子很能说明问题。一个演唱会"一镜到底"的 prompt 里,镜头从红色帷幕的缝隙推进到后台化妆间,女歌手调整耳返,穿过走廊与舞者互动,接过话筒,最终走上舞台,镜头环绕到背面,露出整个场馆的观众席。这不是单一场面的延续,而是完整的起承转合。
多轮扩展(multi-round extension)让用户可以像剪辑一样在已有视频上继续追加镜头,过程中保持主角、环境、叙事节奏的一致性。官方演示了一个小男孩抱着足球追着男主角跑出地铁站的例子——追加的 30 秒里,角色、场景、视觉风格、音效全部保持一致。这意味着用户可以直接输出数分钟的长视频,省去反复切分片段、拼接素材、修补转场的功夫。
画质方面,Seedance 2.5 针对 AI 视频常见的"塑料感"做了系统性优化:物体纹理、皮肤和眼部特征、光照与色彩饱和度都被逐项打磨,字幕和背景音乐的出现也变得更可控,整体观感接近真实拍摄的电影质感。京剧场景的演示中,镜头跟随演员的水袖做环形摇移,主景和背景完全一致,水袖的摆动弧线贴合真实物理。
—— 广告 ——
多模态参考:30 张图 + 10 段视频 + 10 段音频
Seedance 2.5 的参考能力是一次全面的升级。单次生成最多可以输入 30 张图片、10 段视频片段、10 段音频作为参考素材。模型会综合理解所有素材中的视觉构图、场景、风格、角色和道具,并将它们应用到生成过程中。
这个能力的价值在多角色场景里体现得最充分。官方演示了一个 30 秒的古典音乐会场景:用 18 张参考图分别指定音乐厅场地、钢琴家、大提琴、小提琴、主唱、管弦乐队、合唱团和观众席的座位,然后模型按照这些参考生成完整的演出镜头。多角色的外观和声音都能保持稳定,每个主体各自的特征不会互相混淆。
除了常规参考,Seedance 2.5 还强化了几种特殊的参考方式:
粘土渲染参考(clay render)。用户可以用无纹理的 3D 模型搭建场景的空间结构、角色姿态、运动路径和机位,模型再基于这套结构生成视频,确保复杂镜头的构图和场面调度贴合创作者的预期。这相当于给了创作者一个"预演"工具——先摆好舞台,再让 AI 拍。
运动参考和创意参考。可以指定动作轨迹、镜头运动方式,也可以跨素材混搭创意风格。
光照控制。借助粘土渲染提供的空间信息,模型能生成遵循物理规律的光照——光源方向、色温、强度、阴影投射都会与场景匹配,光影比之前的模型自然得多。
时间戳级编辑:绿幕、机位、参考编辑
视频创作里,用户既要在生成阶段控制节奏,也要在生成后精修细节。某个动作发生的精确秒数、镜头切换的时机、某个片段里角色动作是否需要调整——这些都直接影响最终成片。
Seedance 2.5 支持通过时间戳进行精确的内容编辑。生成阶段,用户可以在 prompt 里针对特定时间段控制叙事、机位、运动和整体节奏;生成之后,可以对特定片段中的角色、动作或情节元素做定向修改,同时保持编辑前后的一致性和真实感。
官方还升级了几项面向专业场景的编辑功能。绿幕编辑可以替换背景讲一个完全不同的故事,同时保持主体不变——更重要的是,模型能渲染主体在新环境中的物理反应:衣服飘动的方向、头发的状态、步伐节奏、与光照的互动,让主体和场景融为一体。演示里,一段户外训练视频被替换成国际比赛现场,训练桩变成了防守球员和守门员,主角完成进球。
机位编辑则可以只改镜头运动,不动角色、动作和视觉风格。一个 15 秒的分段机位方案:0-4 秒微距 FPV 掠过平底锅,4-7 秒跟随煎蛋翻面,7-11 秒俯拍餐盘,11-15 秒手持特写跟手。整段保持流畅连续稳定。
行业场景:教育、制造、自动驾驶
Seedance 2.5 也在向更广泛的行业场景渗透。教育领域,它可以把历史背景、人物和故事线转成生动的可视化内容,帮老师把科学原理、历史事件、实验流程变成动态演示,降低教学视频的制作门槛。豆包学习应用的"豆包课堂"已经用上了这个能力,官方演示了一段南宋临安街景的动画。
工业和具身智能领域,模型可以生成高质量的合成视频数据,用来训练机器人的感知和操作技能,也用于工业仿真、工艺培训和设备演示。自动驾驶领域,它能够模拟极端天气、复杂交通等长尾场景,为系统测试和训练提供更多样化的样本。官方演示中,一段汽车装配序列的 prompt 同时引用了粘土渲染(决定机位、构图、装配顺序)和参考图(决定材质、光照、氛围),输出接近高端照片级渲染效果。
一句话总结
Seedance 2.5 标志着视频生成从"出片段"向"完整创作工作流"的进阶。它当然不是没有短板——官方自己承认,复杂运动的物理合理性、多主体交互场景的稳定性仍有提升空间。但单次 30 秒、多模态参考、时间戳级编辑这三板斧,确实把视频生成的可控性往上拉了一大截。目前 Seedance 2.5 已在即梦 AI、豆包 Pro 等平台上线,API 即将通过 BytePlus ModelArk 开放。
对做内容的人来说,这个方向值得关注:当"生成一段视频"变成"完成一部作品",视频创作的门槛和流程都会重新定义。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/seedance-2-5-video-model
相关文章
Black Forest Labs 发布 FLUX 3:统一图像、视频和音频的多模态流模型
Black Forest Labs 正式发布 FLUX 3,基于 Self-Flow 技术架构统一处理图像、视频和音频三种模态,支持生成最长 20 秒带原生音频的视频,早期评测在多款竞品中胜出
GPT-5.6 Sol / Terra / Luna:OpenAI 发布新一代模型家族,三档定价覆盖全场景
OpenAI 发布 GPT-5.6 系列,包含旗舰 Sol、均衡 Terra 和高速 Luna 三款模型,编码能力突破 Terminal-Bench 91.9%,并推出更透明的安全机制
MiniMax M3:首个将前沿编码、百万上下文和原生多模态集于一体的开源模型
MiniMax M3 于 2026 年 6 月 1 日正式发布,是首个将前沿级编码能力、百万 token 上下文窗口和原生多模态能力集于一体的开源权重模型。MSA 稀疏注意力架构将超长上下文推理成本降至传统的 1/20。