好久没有看到Flux家更新模型了啊~
FLUX 3把图像、视频、音频和机器人动作预测塞进了同一个模型。
Black Forest Labs这次直接上统一架构,一个多模态backbone同时处理图像生成、视频、原生音频,甚至能扩展到机器人动作预测。
目前视频已经开放early access,后续还会开放权重,并已经和mimic、Audi合作在真实机器人上跑起来了。
这不是简单的"多加几个模态",是他们明确提出:物理世界的智能和内容创作,本质上可以跑在同一套视觉基础模型上。
生成一段真实的视频,和预测机器人该怎么动手,共享的是同一套对世界的理解。 https://x.com/bfl_ai/status/2080308988961554582/video/1