# Black Forest Labs 发布 FLUX 3 多模态模型，支持单次生成 20 秒视频与原生音频

- 来源：IT之家（RSS）
- 发布时间：2026-07-24 14:48
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmrykywyx026jrolgq06set4j
- 原文链接：https://www.ithome.com/0/981/137.htm

## 精选理由

FLUX 3 把图像、视频、音频塞进同一个架构，单次能出 20 秒带声视频，对比 Grok Video 胜率 69%，视频生成赛道的竞争又升温了。

## AI 摘要

Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型，采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展，可在单次生成中输出最长 20 秒视频并附带原生音频，支持文生视频、图生视频、多镜头串联等任务。

## 正文

IT之家 7 月 24 日消息，Black Forest Labs 昨日（7 月 23 日）发布博文，宣布以 Early Access 方式，上线推出 Flux 3 多模态基础模型，采用统一架构联合学习图像、视频和音频。

在训练方面，IT之家援引博文介绍，该模型基于 Self-Flow（自监督流匹配）学习框架扩展，同步训练视频、图像和音频，在 FLUX.1 和 FLUX.2 系列基础上，扩大至多模态生成与理解任务。

FLUX 3 可在单次生成中输出最长 20 秒的视频，并附带原生音频。官方表示该模型支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话，以及多镜头串联。

性能方面，在带声音的 10 秒、720p 视频人工评测方面，结果显示，FLUX 3 对比 Grok Imagine Video 的胜率为 69%，对比 Seedance 2.0 的胜率为 52%，对比 Gemini Omni Flash 的胜率也为 52%。

在机器人方向，Black Forest Labs 正与 Mimic Robotics 合作，研究将 FLUX 3 用作机器人行为预测模型。

图像能力方面，官方称 FLUX 3 可完成图像生成与编辑，覆盖多种风格、宽高比和分辨率。
