Black Forest Labs (BFL) 发布了 FLUX 3,这是一个多模态基础模型,能够在单一架构内从图像、视频和音频中学习。它也是首个通过同一组权重实现视频、音频和动作预测的 FLUX 模型。
Black Forest Labs (BFL) 研究团队认为,没有任何单一模态能够完整描述世界。图像捕捉某一瞬间的空间结构。视频恢复了时间维度并揭示了物理动态。音频则揭示了机械事件与声音之间的因果关系。每一种模态都被视为对同一底层现实的有损投影。
同时对所有模态进行训练,意味着这些模态会相互约束。声音必须与冲击相匹配。运动必须遵循质量规律。研究团队称 FLUX 3 是其完全基于这一原则构建的首个模型。
底层方法:Self-Flow
FLUX 3 建立在 Self-Flow 之上,这是 BFL 用于在单一架构中对齐多模态生成与理解的方法。Self-Flow 将流匹配目标与自监督特征重建目标相结合。GitHub 上的参考实现采用 Apache-2.0 许可,使用 SiT-XL/2 并采用逐 token 时间步条件化。它以 25% 的逐 token 掩码比例进行训练,并通过 EMA 教师模型在第 20 层向第 8 层的学生模型进行自蒸馏。
该发布的检查点是一个 ImageNet 256×256 研究模型,而非 FLUX 3。BFL 表示,他们基于相同方法“显著扩展了计算和数据资源”,以同时训练 FLUX 3 处理视频、图像和音频。Self-Flow 本身于 2026 年 3 月推出,因此并非本次发布的新内容。新的是其规模。
FLUX 3 Video 的功能
FLUX 3 Video 可在单次生成中生成最长 20 秒的片段,并自带原生音频。支持的模式包括:文本到视频、图像到视频、基于参考片段的视频到视频、用于受控过渡的关键帧到视频,以及基于输入视频和音频的生成式视频-音频延续。
BFL 还列出了多语言对话、将片段智能体式串联成多镜头序列,以及带有动画设计的强大文字生成能力。BFL 团队报告称,其在人类面部表情以及将声音与物理事件关联方面表现尤为突出。
性能表现
BFL 团队发布了初步的人类偏好测试结果。测试设置为 720p、带音频的 10 秒文生视频片段。FLUX 3 在 93% 的对比中优于 Luma Ray 3.2,在 77% 的对比中优于 Runway Gen-4.5。相较于 Grok Imagine Video,该比例高达 69%;随后是 Kling v3 Pro 的 60%、Happy Horse v1 的 59% 以及 Happy Horse 1.1 的 57%。与 Seedance 2.0 和 Gemini Omni Flash 相比,结果为 52%,接近抛硬币的概率。
交互式探索器
bfl@
flux-3
:~/real-world-models
早期访问
进入
关键要点
- FLUX 3 是一个在图像、视频和音频上联合训练的单一流匹配主干网络。
- FLUX 3 Video 可在单次生成中输出长达 20 秒且自带原生音频的视频。
- 视频预测消耗了超过 95% 的训练算力;音频的 token 占比不到 0.5%。
- 同一主干网络驱动着 FLUX-mimic,这是一个在单张 RTX 5090 上运行时间低于 80 毫秒的机器人策略。
- 访问权限是分级的:视频和动作功能处于早期访问阶段,图像功能随后开放,开放权重最后提供。
请查阅 FLUX 3 公告、FLUX 3 x mimic 技术文章以及 Self-Flow 论文。本研究的所有功劳归功于该项目的研究人员。