创作者与电影人
生成带原生音频、多语言对白与多样风格的电影级片段——从手持录像到动画。通过视觉参考在多镜头序列中保持角色一致,串联更长叙事。
Black Forest Labs
Black Forest Labs 全新多模态基础模型,在统一架构中联合学习图像、视频与音频——因为视觉智能需要理解物体如何保持完整、事物如何运动,以及事件如何发声。
FLUX 3 基于 Self-Flow 架构——在同一底层模型中高效对齐多模态生成与理解——并同步扩展视频、图像与音频的训练规模。
图像、视频与音频是同一世界在不同传感器下的投影。FLUX 3 同时从三者中学习,使声音匹配撞击、运动遵循质量、未来由过去推导。

基于 Self-Flow,BFL 大幅扩展算力与数据,在同一底层模型中训练生成与理解能力,提升输出质量与下游任务表现。
FLUX 3 可从文本联合生成图像与带音频视频,也可结合参考图像与视频片段,将角色、风格与上下文带入新场景。

FLUX 3 是 BFL 开发真实世界视觉智能的重要里程碑:能够感知、预测并在物理与数字环境中行动。
Black Forest Labs 分阶段推出 FLUX 3 能力——均基于同一多模态流匹配模型,并通过 Early Access 收集反馈与安全测试。
通过 API 与私有权重访问提供视频与音频生成及编辑。单次生成最长 20 秒、带原生音频的多样化视频——支持文生视频、图生视频、视频参考与关键帧控制。
FLUX 3 面向创作者、营销人员、设计师、机器人团队,以及任何需要智能创意伙伴而不仅是单一模态转换器的用户。
生成带原生音频、多语言对白与多样风格的电影级片段——从手持录像到动画。通过视觉参考在多镜头序列中保持角色一致,串联更长叙事。
快速产出 campaign 概念、精修变体与 typography 设计。基于参考图迭代,在图像与视频工作流中加速创意探索。

利用 FLUX 3 的世界理解进行动作预测。FLUX-mimic 在有限任务数据上微调视频骨干,用于灵巧操作——连接内容创作与 physical AI。
从交互式图像与视频编辑,到仿真、computer use 与 physical AI——FLUX 3 开启广阔前沿。视频生成现已开放 Early Access。
统一模型驱动视频、图像与动作——各模态共享跨图像、视频与音频训练的世界理解。
文生视频、图生视频动画、视频参考迁移、视频音频续写与关键帧控制——均支持同步原生音频生成。
擅长捕捉人类面部表情、将声音与物理事件关联,并生成多语言对白——可组合成持续数分钟的长序列。
覆盖手持录像、动画与电影感等多种风格。支持强 typography 生成与动画设计,适配多种宽高比。
将单个片段串联为更长多镜头序列。视觉参考帮助在整个叙事中保持角色一致。
以多种风格、宽高比与分辨率合成与编辑图像。复杂提示遵循与多语言高精度文字渲染显著改进。
原生集成动作预测,并提供 FLUX-mimic 等专用微调模型——以预训练视频骨干作为动力学感知基础。
在初步 720p 文生视频评测中,FLUX 3 在多项对比中优于多款领先模型——Early Access 阶段仍有进一步优化空间。
探索 Black Forest Labs 的 FLUX 3,以及我们平台上的相关创意工具。
本页汇总 Black Forest Labs 公开发布的 FLUX 3 信息,与 BFL 无官方关联。