# Black Forest Labs 发布 FLUX 3：统一图像、视频、音频与机器人动作预测的多模态基础模型

- 来源：MarkTechPost（RSS）
- 作者：Michal Sutter
- 发布时间：2026-07-27 01:50
- AIHOT 分数：70
- AIHOT 链接：https://aihot.virxact.com/items/cms23ou2z022fro9fuxwjdsli
- 原文链接：https://www.marktechpost.com/2026/07/26/black-forest-labs-releases-flux-3-a-multimodal-flow-model-for-image-video-audio-and-robot-action-prediction

## AI 摘要

Black Forest Labs 发布 FLUX 3，这是首个在单一架构中联合学习图像、视频和音频，并从同一组权重输出视频、音频和动作预测的多模态基础模型。FLUX 3 Video 可单次生成长达 20 秒、带原生音频的视频，在 10 秒 720p 文本生成视频的人类偏好测试中，以 93% 的偏好率击败 Luma Ray 3.2。

## 正文

Black Forest Labs (BFL) 发布了 FLUX 3，这是一个多模态基础模型，能够在单一架构内从图像、视频和音频中学习。它也是首个通过同一组权重实现视频、音频和动作预测的 FLUX 模型。

Black Forest Labs (BFL) 研究团队认为，没有任何单一模态能够完整描述世界。图像捕捉某一瞬间的空间结构。视频恢复了时间维度并揭示了物理动态。音频则揭示了机械事件与声音之间的因果关系。每一种模态都被视为对同一底层现实的有损投影。

同时对所有模态进行训练，意味着这些模态会相互约束。声音必须与冲击相匹配。运动必须遵循质量规律。研究团队称 FLUX 3 是其完全基于这一原则构建的首个模型。

底层方法：Self-Flow

FLUX 3 建立在 Self-Flow 之上，这是 BFL 用于在单一架构中对齐多模态生成与理解的方法。Self-Flow 将流匹配目标与自监督特征重建目标相结合。GitHub 上的参考实现采用 Apache-2.0 许可，使用 SiT-XL/2 并采用逐 token 时间步条件化。它以 25% 的逐 token 掩码比例进行训练，并通过 EMA 教师模型在第 20 层向第 8 层的学生模型进行自蒸馏。

该发布的检查点是一个 ImageNet 256×256 研究模型，而非 FLUX 3。BFL 表示，他们基于相同方法“显著扩展了计算和数据资源”，以同时训练 FLUX 3 处理视频、图像和音频。Self-Flow 本身于 2026 年 3 月推出，因此并非本次发布的新内容。新的是其规模。

FLUX 3 Video 的功能

FLUX 3 Video 可在单次生成中生成最长 20 秒的片段，并自带原生音频。支持的模式包括：文本到视频、图像到视频、基于参考片段的视频到视频、用于受控过渡的关键帧到视频，以及基于输入视频和音频的生成式视频-音频延续。

BFL 还列出了多语言对话、将片段智能体式串联成多镜头序列，以及带有动画设计的强大文字生成能力。BFL 团队报告称，其在人类面部表情以及将声音与物理事件关联方面表现尤为突出。

性能表现

BFL 团队发布了初步的人类偏好测试结果。测试设置为 720p、带音频的 10 秒文生视频片段。FLUX 3 在 93% 的对比中优于 Luma Ray 3.2，在 77% 的对比中优于 Runway Gen-4.5。相较于 Grok Imagine Video，该比例高达 69%；随后是 Kling v3 Pro 的 60%、Happy Horse v1 的 59% 以及 Happy Horse 1.1 的 57%。与 Seedance 2.0 和 Gemini Omni Flash 相比，结果为 52%，接近抛硬币的概率。

交互式探索器

bfl@

flux-3

:~/real-world-models

早期访问

进入

关键要点

FLUX 3 是一个在图像、视频和音频上联合训练的单一流匹配主干网络。

FLUX 3 Video 可在单次生成中输出长达 20 秒且自带原生音频的视频。

视频预测消耗了超过 95% 的训练算力；音频的 token 占比不到 0.5%。

同一主干网络驱动着 FLUX-mimic，这是一个在单张 RTX 5090 上运行时间低于 80 毫秒的机器人策略。

访问权限是分级的：视频和动作功能处于早期访问阶段，图像功能随后开放，开放权重最后提供。

请查阅 FLUX 3 公告、FLUX 3 x mimic 技术文章以及 Self-Flow 论文。本研究的所有功劳归功于该项目的研究人员。
