产业 / 媒体
一次生成30秒视频与音频,广告制作流程或将重塑
字节跳动发布AI视频模型Seedance 2.5,能够在单次推理中同步生成视频与音频,单段时长最长可达30秒,并支持多次续接延伸。相比之下,谷歌Gemini Omni Flash的单次生成上限约为10秒,Seedance 2.5的时长优势达到三倍。用户可上传最多30张图片、10段视频和10个音频文件作为参考素材,模型能够据此构建包含多角色、多机位的完整场景,同时在材质渲染、光影处理和皮肤细节方面也有明显提升。该模型目前已在即梦AI和豆包Pro上线,API接口将通过BytePlus ModelArk后续开放。字节跳动还以Seedance 2.5全程制作了一部短片,展示其在广告和视觉内容领域的完整生产能力。
字节跳动于2026年8月正式推出AI视频生成模型Seedance 2.5。与上一代产品相比,新版本最核心的升级在于实现了视频与音频的一体化生成——用户无需分别处理画面和声音,模型在单次运行中即可输出两者合一的完整内容,单段视频时长最长可达30秒,且支持多次续接,理论上可构建更长的叙事序列。
在输入能力方面,Seedance 2.5支持用户同时上传多达30张参考图片、10段视频片段以及10个音频文件。这种多模态参考机制使模型能够理解并还原特定的视觉风格、角色形象和声音氛围,从而生成包含多个角色和多种摄像机角度的复杂场景,大幅降低了创作者在前期素材准备和后期剪辑拼接上的工作量。
与竞品相比,Seedance 2.5在生成时长上具有明显优势。谷歌Gemini Omni Flash目前单次生成上限约为10秒,而Seedance 2.5将这一数字提升至30秒,相当于三倍的内容密度。对于需要制作完整广告片或短视频的团队而言,这意味着可以在单一流水线内完成原本需要多次分段生成再手动拼接的工作,显著提升制作效率。
在画质层面,字节跳动表示新版本在材质渲染、光影表现和皮肤细节处理上均有所改进。为直观展示模型能力,字节跳动以Seedance 2.5全程制作了一部名为《The Missing Pair》的短片,整部作品完全由AI生成,无需传统拍摄流程。这一案例延续了上一代模型Seedance 2.0的路径——《第九区》导演尼尔·布洛姆坎普曾用2.0版本制作了长达13分钟的AI短片《Nightborne》。
Seedance 2.5目前已在即梦AI和豆包Pro两个平台正式上线,面向开发者的API接口将通过BytePlus ModelArk在后续阶段开放。根据Artificial Analysis的评测数据,上一代Seedance 2.0在带音频的图生视频排行榜上位居首位,新版本的发布有望进一步巩固字节跳动在AI视频生成领域的竞争地位。
对于广告和视觉内容行业而言,Seedance 2.5所代表的方向具有实质性意义。当一个模型能够在单次操作中输出包含音效的完整短片,传统制作流程中分镜拍摄、配音录制、后期剪辑等环节的边界将被重新定义。这不仅影响制作成本和周期,也对内容创作团队的工种分工和工具链选择提出了新的挑战与机遇。
要点
- Seedance 2.5单次可生成最长30秒的视频与音频合一内容,是谷歌Gemini Omni Flash同类产品时长的三倍
- 支持上传30张图片、10段视频、10个音频作为参考,能够生成多角色、多机位的复杂场景
- 字节跳动已用该模型全程制作短片,验证其在广告和视觉内容领域的完整生产能力
- 模型现已在即梦AI和豆包Pro上线,API接口将通过BytePlus ModelArk后续开放
- 前代Seedance 2.0在带音频图生视频排行榜排名第一,新版本有望进一步扩大领先优势
原始标题:ByteDance's Seedance 2.5 generates 30-second video clips with built-in audio
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。