🎁Congrats! You've unlocked a limited-time exclusive 50% OFF!

MiniMax H3 AI 视频模型

MiniMax H3 是通用全模态生成系统——330 亿参数模型在统一上下文中理解文本、图片、视频和音频,一次前向传播生成带原生立体声的 2K 视频。

Google Veo 3.1
提示词
0/2000
画面比例
时长
8s
生成模式
输出视频

您的视频将在此显示

生成视频以在此区域查看预览

MiniMax H3 以开源权重、行业领先的性价比和面向开放生态的任务泛化架构,打破闭源模型的主导地位。

开发者为何选择 MiniMax H3

社区许可下的开源权重

H3-Base 权重在 Hugging Face 上以 MiniMax 社区许可发布——年收入低于 2000 万美元的组织可商用。在多种 AI 硬件上构建定制版本。

H3-Omni Transformer 架构

330 亿参数稠密单流 Transformer,推理时约 200 亿参数激活。采用 Qwen3-VL-32B 编码器、3D 多模态 RoPE,理解/生成分离计算带来 30% 训练吞吐提升。

上下文全模态表示

语言作为桥梁,将任务统一为开放式描述形式。用自然语言描述多模态上下文与目标视频的关系——H3 自行处理全模态理解。

上下文内 2K 再生

不同于常规超分,H3 在上下文中将自身 768p 输出再生为 2K——恢复超分器无法还原的小字等精细细节。

按照以下步骤,在本页生成器或 MiniMax API 上开始使用 MiniMax H3。

如何使用 MiniMax H3 创作

文生视频用于纯提示词生成,首尾帧用于图生视频,参考生视频用于全模态参考工作流(最多 12 个混合输入文件)。

选择入口模式

MiniMax H3 面向需要开放、可控、可用于制作的 AI 视频及多模态理解的开发者、工作室和创作者。

MiniMax H3 适合谁

开发者与 API 集成者

开发者与 API 集成者

通过 MiniMax API(`MiniMax-H3`)、Vercel AI Gateway、fal.ai 或自托管开源权重集成。单一架构处理 T2V、I2V、参考和编辑。

广告与电商团队

广告与电商团队

擅长指令遵循、精准文字与品牌渲染和 V2V 动作迁移。适用于广告、产品设计、UI/UX 和游戏内容。

开源社区

开源社区

微调、定制并在自有硬件部署。兼容多种 AI 加速器——硬件兼容性是核心设计考量。

立即体验 MiniMax H3

编写提示或附加全模态参考,MiniMax H3 一次生成带原生立体声的 2K 视频——对话、音效和环境音同步输出。

MiniMax H3 的任务泛化设计从预训练阶段即具备广泛的多模态能力。

技术能力

统一多模态生成

单一 Transformer 处理文生视频、图生视频、参考生视频、视频编辑和音频生成——无需拼接独立的 T2V、I2V 和 TTS 模型。

原生 32kHz 立体声音频

一次前向传播联合生成视频和音频,32kHz 立体声。语音、音效和音乐联合建模——音频域不再分离。

4–15 秒片段,24 FPS

输出时长 4 至 15 秒,24 帧/秒。宽高比 2:5 至 5:2,覆盖宽屏电影到竖屏社交格式。

H3-VAE 高压缩

全面升级的 tokenizer,重建质量全面提升。有效序列长度 4 倍增益——原生 2K 支持的关键技术。

多语言提示支持

支持阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语等——音频语言支持程度因语言而异。

行业领先性价比

2K 模式下每秒价格不到主流模型的三分之一(约 0.80 元/秒)。768p 模式下不到主流 720p 价格的一半。

视频编辑基准领先

在 Artificial Analysis 基准中位列全球最强 AI 视频编辑模型——纯 T2V 任务略逊于 Gemini 和 Seedance。

常见问题

还有疑问?我们随时为您解答。