AI资讯 / 产业

产业 / 媒体

原生音频视频生成长达20秒,黑森林实验室首次实现

The Decoder

德国AI公司黑森林实验室发布Flux 3多模态基础模型,该模型同时学习图像、视频和音频,首次实现带原生音效的视频生成,最长可达20秒。在早期评估中,Flux 3在10秒720p视频片段上,以93%的偏好率超越Luma Ray 3.2,77%超越Runway Gen-4.5,69%超越Grok Imagine Video。面对更强对手,Flux 3以60%偏好率领先Kling v3 Pro,59%领先Happy Horse v1,57%领先Happy Horse 1.1,并与Seedance 2.0和Gemini Omni Flash持平(各52%)。公司还开发了用于机器人应用的视频动作模型Flux-mimic,已在奥迪进行测试。Flux 3基于Self-Flow方法,采用多模态Transformer架构,为构建世界模型迈出关键一步。

德国AI公司黑森林实验室正式发布Flux 3,这是一款多模态基础模型,能够同时从图像、视频和音频中学习。Flux 3首次实现了带原生音效的视频生成,最长可达20秒,支持文本到视频、图像到视频、视频到视频、关键帧过渡、多语言对话以及智能链接多个片段以生成长序列。公司表示,该模型在人类面部表情和音效与物理事件匹配方面表现尤为出色。

在早期评估中,黑森林实验室使用10秒720p视频片段进行对比测试,结果显示Flux 3在93%的对比中优于Luma Ray 3.2,77%优于Runway Gen-4.5,69%优于Grok Imagine Video。面对更强竞争对手,Flux 3以60%的偏好率领先Kling v3 Pro,59%领先Happy Horse v1,57%领先Happy Horse 1.1,并与Seedance 2.0和Gemini Omni Flash持平(各52%)。公司强调这些结果仍是初步的,尚未有独立测试验证。

Flux 3基于Self-Flow方法,这是一种让模型同时生成和理解内容的技术。其多模态Transformer架构使用专用编码器和解码器,将图像、视频和音频转换为共享内部表示,再转换回输出。此外,模型还包含一个动作组件,为机器人应用提供基础。黑森林实验室与Mimic Robotics合作开发了Flux-mimic视频动作模型,目前正在奥迪的生产任务中进行测试。

公司表示,Flux 3在图像生成方面也有望提升,特别是在复杂提示和多语言文本渲染上。Flux 3 Image将在未来几周内开放早期访问。黑森林实验室计划分阶段推出所有功能,包括开放权重访问的多模态骨干模型Flux 3 Dev。长期目标是构建能够在一个模型中结合感知、动作和语言预测的下一代模型。

黑森林实验室将Flux 3视为迈向“真实世界视觉智能”的一步,即能够“感知、预测并在物理和数字环境中行动”的模型。公司认为,单一模态无法完整捕捉现实,图像展示空间结构,视频捕捉时间变化,音频揭示机械事件与声音之间的联系。三者联合训练可以相互填补空白,提供比单独训练更丰富的信息。

要点

  • Flux 3首次实现带原生音效的视频生成,最长20秒,支持多种输入和过渡方式
  • 在早期测试中,Flux 3在视频生成上超越Luma Ray 3.2、Runway Gen-4.5等竞品,与Seedance 2.0和Gemini Omni Flash持平
  • 基于Self-Flow方法的多模态Transformer架构,同时处理图像、视频、音频和动作
  • 与Mimic Robotics合作开发Flux-mimic,已在奥迪进行机器人任务测试
  • 黑森林实验室计划分阶段开放Flux 3功能,包括开放权重访问的Flux 3 Dev
查看原始来源

原始标题:Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。