产业 / 媒体
单次生成20秒视频并附带原生音频
Black Forest Labs于7月23日以Early Access方式发布FLUX 3多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于Self-Flow学习框架扩展,在FLUX.1和FLUX.2基础上实现多模态生成与理解。FLUX 3单次可生成最长20秒视频并附带原生音频,支持文生视频、图生视频、视频生视频、关键帧转视频、多语言对话及多镜头串联。在带声音的10秒720p视频人工评测中,FLUX 3对比Grok Imagine Video胜率69%,对比Seedance 2.0和Gemini Omni Flash胜率均为52%。此外,Black Forest Labs正与Mimic Robotics合作,探索将FLUX 3用于机器人行为预测。图像方面,该模型支持多种风格、宽高比和分辨率的生成与编辑。
Black Forest Labs昨日发布FLUX 3多模态基础模型,以Early Access方式上线。该模型采用统一架构,联合学习图像、视频和音频,标志着其在多模态AI领域的重要进展。FLUX 3基于Self-Flow自监督流匹配学习框架扩展,同步训练多种模态数据,在FLUX.1和FLUX.2系列基础上,将能力扩大至多模态生成与理解任务。
FLUX 3在单次生成中可输出最长20秒的视频,并附带原生音频,无需后期合成。官方表示,该模型支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话以及多镜头串联等多种功能,为用户提供多样化的创作工具。
在性能方面,Black Forest Labs进行了带声音的10秒720p视频人工评测。结果显示,FLUX 3对比Grok Imagine Video的胜率为69%,对比Seedance 2.0的胜率为52%,对比Gemini Omni Flash的胜率也为52%,展现了其在多模态视频生成领域的竞争力。
除了视频生成,FLUX 3在机器人领域也有应用潜力。Black Forest Labs正与Mimic Robotics合作,研究将FLUX 3用作机器人行为预测模型,探索其在物理世界中的实际用途。此外,该模型在图像生成与编辑方面同样出色,覆盖多种风格、宽高比和分辨率,满足不同场景需求。
要点
- FLUX 3采用统一架构联合学习图像、视频和音频,基于Self-Flow框架扩展。
- 单次生成最长20秒视频并附带原生音频,支持文生视频、图生视频等多种任务。
- 在10秒720p视频人工评测中,FLUX 3对比Grok Imagine Video胜率69%。
- 与Mimic Robotics合作,探索将FLUX 3用于机器人行为预测。
- 图像生成与编辑能力覆盖多种风格、宽高比和分辨率。
原始标题:FLUX 3 多模态 AI 模型登场:支持单次生成 20 秒多样化视频
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。