Black Forest Labs 发布 Flux 3
Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态基础模型
报道时间线
- Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态基础模型
Black Forest Labs 发布 FLUX 3,这是首个在单一架构中联合学习图像、视频和音频,并从同一组权重输出视频、音频和动作预测的多模态基础模型。FLUX 3 Video 可单次生成长达 20 秒、带原生音频的视频,在 10 秒 720p 文本生成视频的人类偏好测试中,以 93% 的偏好率击败 Luma Ray 3.2。
- FLUX 3 x mimic:新一代视频动作模型
Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。
- Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频
Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。
- Black Forest Labs 发布 Flux 3:可生成带原生音频的 20 秒视频,并推出机器人动作模型 Flux-mimic
德国 AI 公司 Black Forest Labs 发布多模态基础模型 Flux 3,可同时从图像、视频和音频中学习,首次支持生成带原生音频、最长 20 秒的视频。
- FLUX 3 统一多模态,视频已开放早期访问
Black Forest Labs 发布 FLUX 3,一个统一架构的多模态模型,支持图像、视频、音频和动作预测。FLUX 3 Video 现已开放早期访问,模型还可扩展用于机器人动作预测。
- Flux 3 视频生成达前沿水平,支持音频与机器人动作预测
Black Forest Labs 发布 Flux 3,一个统一架构的多模态模型,覆盖图像、视频、音频和动作预测。其视频生成能力达到 Seedance 2 / Gemini Omni 级别,可生成约 20 秒带音频的视频,并已开放早期访问。Flux 3 还可扩展用于机器人动作预测,是当前唯一达到视频生成前沿水平的初创公司。