# FLUX 3 统一图像视频音频与机器人动作预测

- 来源：Berryxia.AI (@berryxia)
- 发布时间：2026-07-24 07:13
- AIHOT 分数：56
- AIHOT 链接：https://aihot.virxact.com/items/cmry5yqgv009croeulwpmcunn
- 原文链接：https://x.com/berryxia/status/2080431253744968087

## AI 摘要

Black Forest Labs 发布 FLUX 3，一个统一多模态 backbone，同时处理图像生成、视频、原生音频，并扩展至机器人动作预测。视频已开放 early access，后续将开放权重，并已与 mimic、Audi 合作在真实机器人上测试。该模型旨在证明物理世界智能与内容创作可共享同一套视觉基础模型。

## 正文

好久没有看到Flux家更新模型了啊~

FLUX 3把图像、视频、音频和机器人动作预测塞进了同一个模型。

Black Forest Labs这次直接上统一架构，一个多模态backbone同时处理图像生成、视频、原生音频，甚至能扩展到机器人动作预测。

目前视频已经开放early access，后续还会开放权重，并已经和mimic、Audi合作在真实机器人上跑起来了。

这不是简单的"多加几个模态"，是他们明确提出：物理世界的智能和内容创作，本质上可以跑在同一套视觉基础模型上。

生成一段真实的视频，和预测机器人该怎么动手，共享的是同一套对世界的理解。
https://x.com/bfl_ai/status/2080308988961554582/video/1
