模型 / 官方
单次生成30秒视频,多模态参考全面升级
字节跳动Seed团队正式发布新一代视频创作模型Seedance 2.5,在长叙事、多模态参考和编辑能力三个维度实现重点突破。模型将单次视频生成时长从15秒提升至30秒,并支持多轮延长,可在单次生成中组织多个逻辑关联镜头,呈现完整叙事弧线。多模态参考方面,用户单次最多可输入30张图片、10段视频和10段音频作为参考素材,模型能综合理解不同素材中的构图、风格、人物等元素,实现多主体、多场景的复杂创意还原。编辑能力方面,Seedance 2.5支持时间戳精准控制,并强化了绿幕编辑、视角编辑等专业功能。目前模型已陆续上线即梦AI和豆包专业版,API服务将于近期登陆火山方舟平台。
Seedance 2.5延续了前代统一的多模态音视频联合生成架构,将单次视频生成时长从15秒提升至30秒,并支持多轮延长。模型能在30秒内组织多个具有逻辑关联的镜头,让故事从铺垫、推进、转折到收尾逐步展开,而非简单延续单一画面。凭借多轮延长能力,用户可在已有视频结果上自然衔接后续镜头,最终生成数分钟具有统一视听语言的连贯内容,大幅减少拆分镜头和反复拼接的成本。
在画面质量方面,Seedance 2.5对物体材质、人物肤质与眼神、光影及画面饱和度等细节进行了系统优化,有效弱化了视频生成中常见的「油腻感」。模型还减少了字幕与背景音乐不受控的情况,使成片更接近实拍的影视质感。在运镜衔接上,主体在多次切镜中仍保持稳定,音画始终对齐,长视频生成结果的连贯性得到显著提升。
多模态参考能力是Seedance 2.5的另一核心升级方向。模型支持用户单次输入最多30张图片、10段视频和10段音频作为参考素材,能综合理解不同素材中的画面构图、场景、风格、人物和道具等元素,并按指令将其用于视频生成。在多人同框、群像叙事等复杂场景中,模型可同时还原多个人物的形象与声音,保持各主体特征稳定。此外,白模参考、运动参考和创意参考等能力也得到全面提升,使复杂镜头的构图和调度更接近预期。
编辑能力方面,Seedance 2.5支持通过时间戳精准编辑音视频内容。在生成阶段,用户可通过提示词控制特定时间段内的故事走向、画面视角、运镜和整体节奏;在生成后,用户还能针对指定片段中的角色、动作、声音或剧情进行定向修改,同时保持修改前后的连贯性。模型还进一步提升了绿幕编辑、视角与运镜编辑等专业能力,能基于不同场景的物理规则渲染人物身上的光影、衣物飘动等细节效果。
在产业应用层面,Seedance 2.5已开始深入教育、工业制造、具身智能和自动驾驶等场景。在教育领域,模型可将课文背后的历史背景和人物情节转化为沉浸式视频内容,帮助教师更高效地制作教学素材。在工业和自动驾驶领域,模型可生成高质量合成视频数据,用于训练机器人感知与操作能力,以及模拟极端天气、复杂路况等低频场景,为系统测试提供更多样本支持。
Seedance 2.5目前已陆续上线即梦AI网页端和豆包专业版,用户可在视频生成功能中选择该模型进行体验,API服务也将于近期登陆火山方舟平台。字节跳动Seed团队表示,模型在复杂运动的物理合理性和极多主体交互场景的稳定性上仍有提升空间,未来将继续探索更长的连贯叙事、更智能的生成与编辑体验,并进一步增强模型对物理世界规律的理解。
要点
- 单次视频生成时长从15秒提升至30秒,并支持多轮延长,可生成数分钟具有统一视听语言的连贯内容
- 多模态参考能力大幅升级,单次最多支持30张图片、10段视频和10段音频输入,可还原多主体复杂创意
- 时间戳精准编辑功能上线,支持生成前后对指定时间段内容进行定向修改,同时保持前后连贯性
- 绿幕编辑能力增强,可基于不同场景物理规则渲染人物光影、衣物飘动等细节,主体与场景融合更自然
- 模型已进入教育、工业制造、自动驾驶等产业场景,可生成合成训练数据并支持低频场景模拟