🎁Congrats! You've unlocked a limited-time exclusive 50% OFF!

Black Forest Labs

FLUX 3 — Real World Models

Black Forest Labs 全新多模态基础模型,在统一架构中联合学习图像、视频与音频——因为视觉智能需要理解物体如何保持完整、事物如何运动,以及事件如何发声。

FLUX 3 基于 Self-Flow 架构——在同一底层模型中高效对齐多模态生成与理解——并同步扩展视频、图像与音频的训练规模。

FLUX 3 为何改变多模态生成

一个模型,一个底层世界

图像、视频与音频是同一世界在不同传感器下的投影。FLUX 3 同时从三者中学习,使声音匹配撞击、运动遵循质量、未来由过去推导。

Self-Flow 架构

Self-Flow 架构

基于 Self-Flow,BFL 大幅扩展算力与数据,在同一底层模型中训练生成与理解能力,提升输出质量与下游任务表现。

自由混合模态

FLUX 3 可从文本联合生成图像与带音频视频,也可结合参考图像与视频片段,将角色、风格与上下文带入新场景。

迈向视觉智能

迈向视觉智能

FLUX 3 是 BFL 开发真实世界视觉智能的重要里程碑:能够感知、预测并在物理与数字环境中行动。

Black Forest Labs 分阶段推出 FLUX 3 能力——均基于同一多模态流匹配模型,并通过 Early Access 收集反馈与安全测试。

FLUX 3 发布计划

通过 API 与私有权重访问提供视频与音频生成及编辑。单次生成最长 20 秒、带原生音频的多样化视频——支持文生视频、图生视频、视频参考与关键帧控制。

FLUX 3 面向创作者、营销人员、设计师、机器人团队,以及任何需要智能创意伙伴而不仅是单一模态转换器的用户。

FLUX 3 适合谁

创作者与电影人

生成带原生音频、多语言对白与多样风格的电影级片段——从手持录像到动画。通过视觉参考在多镜头序列中保持角色一致,串联更长叙事。

营销与视觉团队

快速产出 campaign 概念、精修变体与 typography 设计。基于参考图迭代,在图像与视频工作流中加速创意探索。

Physical AI 与机器人

Physical AI 与机器人

利用 FLUX 3 的世界理解进行动作预测。FLUX-mimic 在有限任务数据上微调视频骨干,用于灵巧操作——连接内容创作与 physical AI。

视觉智能的下一根骨干

从交互式图像与视频编辑,到仿真、computer use 与 physical AI——FLUX 3 开启广阔前沿。视频生成现已开放 Early Access。

统一模型驱动视频、图像与动作——各模态共享跨图像、视频与音频训练的世界理解。

FLUX 3 核心能力

带原生音频的视频(最长 20 秒)

文生视频、图生视频动画、视频参考迁移、视频音频续写与关键帧控制——均支持同步原生音频生成。

多语言对白与音效

擅长捕捉人类面部表情、将声音与物理事件关联,并生成多语言对白——可组合成持续数分钟的长序列。

风格多样性与 typography

覆盖手持录像、动画与电影感等多种风格。支持强 typography 生成与动画设计,适配多种宽高比。

Agentic 多镜头串联

将单个片段串联为更长多镜头序列。视觉参考帮助在整个叙事中保持角色一致。

图像合成与编辑

以多种风格、宽高比与分辨率合成与编辑图像。复杂提示遵循与多语言高精度文字渲染显著改进。

动作预测

原生集成动作预测,并提供 FLUX-mimic 等专用微调模型——以预训练视频骨干作为动力学感知基础。

早期评测表现

在初步 720p 文生视频评测中,FLUX 3 在多项对比中优于多款领先模型——Early Access 阶段仍有进一步优化空间。

关于 FLUX 3 的常见问题

本页汇总 Black Forest Labs 公开发布的 FLUX 3 信息,与 BFL 无官方关联。