
开发者与 API 集成者
通过 MiniMax API(`MiniMax-H3`)、Vercel AI Gateway、fal.ai 或自托管开源权重集成。单一架构处理 T2V、I2V、参考和编辑。
生成视频以在此区域查看预览
MiniMax H3 以开源权重、行业领先的性价比和面向开放生态的任务泛化架构,打破闭源模型的主导地位。
H3-Base 权重在 Hugging Face 上以 MiniMax 社区许可发布——年收入低于 2000 万美元的组织可商用。在多种 AI 硬件上构建定制版本。
330 亿参数稠密单流 Transformer,推理时约 200 亿参数激活。采用 Qwen3-VL-32B 编码器、3D 多模态 RoPE,理解/生成分离计算带来 30% 训练吞吐提升。
语言作为桥梁,将任务统一为开放式描述形式。用自然语言描述多模态上下文与目标视频的关系——H3 自行处理全模态理解。
不同于常规超分,H3 在上下文中将自身 768p 输出再生为 2K——恢复超分器无法还原的小字等精细细节。
按照以下步骤,在本页生成器或 MiniMax API 上开始使用 MiniMax H3。
文生视频用于纯提示词生成,首尾帧用于图生视频,参考生视频用于全模态参考工作流(最多 12 个混合输入文件)。

MiniMax H3 面向需要开放、可控、可用于制作的 AI 视频及多模态理解的开发者、工作室和创作者。

通过 MiniMax API(`MiniMax-H3`)、Vercel AI Gateway、fal.ai 或自托管开源权重集成。单一架构处理 T2V、I2V、参考和编辑。

擅长指令遵循、精准文字与品牌渲染和 V2V 动作迁移。适用于广告、产品设计、UI/UX 和游戏内容。

微调、定制并在自有硬件部署。兼容多种 AI 加速器——硬件兼容性是核心设计考量。
MiniMax H3 的任务泛化设计从预训练阶段即具备广泛的多模态能力。
单一 Transformer 处理文生视频、图生视频、参考生视频、视频编辑和音频生成——无需拼接独立的 T2V、I2V 和 TTS 模型。
一次前向传播联合生成视频和音频,32kHz 立体声。语音、音效和音乐联合建模——音频域不再分离。
输出时长 4 至 15 秒,24 帧/秒。宽高比 2:5 至 5:2,覆盖宽屏电影到竖屏社交格式。
全面升级的 tokenizer,重建质量全面提升。有效序列长度 4 倍增益——原生 2K 支持的关键技术。
支持阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语等——音频语言支持程度因语言而异。
2K 模式下每秒价格不到主流模型的三分之一(约 0.80 元/秒)。768p 模式下不到主流 720p 价格的一半。
在 Artificial Analysis 基准中位列全球最强 AI 视频编辑模型——纯 T2V 任务略逊于 Gemini 和 Seedance。
从 MiniMax H3 的开源全模态架构,到 Wan 3.0 的 30 秒生成和 Google Veo 的电影级画质。
还有疑问?我们随时为您解答。