AI资讯 / Agent

Agent / 分析

多模态流模型超越 Seedance 2.0、Gemini Omni 和 Grok Imagine

Latent Space

Black Forest Labs 正式发布 FLUX 3,一个统一的多模态模型,覆盖图像、视频、音频和动作预测。FLUX 3 视频已开放早期访问,其性能在多项基准上超越 Seedance 2.0、Gemini Omni 和 Grok Imagine。同时,团队推出 FLUX-mimic,一个基于 FLUX 3 骨干网络的视频-动作机器人模型,已在真实工厂环境中与 Audi 合作测试。该模型通过联合训练架构实现跨模态能力,并计划发布开源权重 Dev 版本。

Black Forest Labs 今日宣布推出 FLUX 3,一个统一的多模态模型,涵盖图像、视频、音频和动作预测。该模型在文本到视频、图像到视频、视频到视频生成等任务上表现出色,并原生支持音频生成。FLUX 3 视频已开放早期访问,其性能在多个基准测试中超越了 Seedance 2.0、Gemini Omni 和 Grok Imagine,成为当前多模态领域的领先者。

FLUX 3 的核心技术基于 Self-Flow 研究,通过联合训练架构将多种模态统一在一个模型中。其能力包括文本到视频生成、图像到视频生成(支持动画或视觉参考)、视频到视频生成(保留源视频核心元素)、生成式视频音频延续、关键帧到视频生成、多语言对话、广泛视觉风格和长序列智能拼接。团队强调,所有输出均带有原生音频生成。

除了 FLUX 3,Black Forest Labs 还推出了 FLUX-mimic,一个基于 FLUX 3 骨干网络的视频-动作机器人模型。该模型与 mimic 机器人学习公司合作开发,训练于机器人和可穿戴数据,旨在实现通用灵巧操作,并可在单块本地 GPU 上部署。FLUX-mimic 已在 Audi 工厂进行测试,证明更好的视频世界模型能直接提升机器人控制质量和样本效率。

这一发布恰逢 AI 领域多模态竞争加剧之际。OpenAI 同日推出了 ChatGPT Voice 和 OpenAI Presence,但 BFL 的 FLUX 3 被认为更具里程碑意义。团队计划发布开源权重 Dev 版本,进一步推动社区创新。此外,The Stack v3 数据集的发布为开源代码模型提供了强大基础设施,而蒸馏技术的争议仍在持续。

FLUX 3 的发布不仅展示了多模态模型的统一潜力,还通过 FLUX-mimic 证明了视频世界模型在机器人领域的应用价值。Black Forest Labs 表示,这一架构可扩展至更广泛的机器人控制任务,为通用具身智能提供了新路径。

要点

  • FLUX 3 是统一的多模态模型,覆盖图像、视频、音频和动作预测,性能超越 Seedance 2.0、Gemini Omni 和 Grok Imagine。
  • FLUX-mimic 是基于 FLUX 3 的机器人模型,已在 Audi 工厂测试,证明视频世界模型可提升机器人控制质量。
  • FLUX 3 支持原生音频生成、多语言对话和长序列智能拼接,计划发布开源权重 Dev 版本。
  • The Stack v3 数据集发布,为开源代码模型提供 5T 令牌基础设施,推动社区创新。
  • 蒸馏技术争议持续,开源权重和数据集被视为应对封闭生态的关键策略。
查看原始来源

原始标题:[AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。