
Developers e integradores de API
Integre via MiniMax API (`MiniMax-H3`), Vercel AI Gateway, fal.ai ou self-host de pesos abertos. Uma única arquitetura gere T2V, I2V, reference e editing.
MiniMax H3 é um sistema generativo omni-modal de propósito geral — um modelo de 33B parâmetros que compreende texto, imagens, vídeo e áudio num contexto unificado, gerando vídeo 2K com som estéreo nativo num único forward pass.
Gere um vídeo para ver a prévia nesta área
MiniMax H3 quebra o domínio do código fechado com pesos abertos, relação preço-desempenho líder na indústria e arquitetura de generalização de tarefas construída para o ecossistema aberto.
Os pesos H3-Base são publicados no Hugging Face sob a MiniMax Community License — permitindo uso comercial para organizações com receita inferior a $20M. Construa versões personalizadas em diversos hardware de IA.
Um Transformer denso de fluxo único de 33B parâmetros com ~20B parâmetros ativos em inferência. Usa Qwen3-VL-32B como encoder, 3D multimodal RoPE e separa o compute de compreensão/geração para 30% mais throughput de treino.
A linguagem actua como ponte unificando tarefas numa forma aberta e descritiva. Descreva relações entre o contexto multimodal e o vídeo alvo em linguagem natural — H3 gere a compreensão full-modality.
Em vez de super-resolution convencional, H3 regenera a sua própria saída 768p in-context a 2K — recuperando detalhes finos como texto pequeno que upscalers não conseguem restaurar.
Siga estes passos para começar a gerar com MiniMax H3 usando o gerador desta página ou a MiniMax API.
Seleccione text-to-video para geração apenas com prompt, first/last-frame para image-to-video, ou reference-to-video para fluxos omni-reference com até 12 ficheiros de entrada mistos.

MiniMax H3 serve developers, estúdios e criadores que precisam de vídeo IA aberto, controlável e de grau produção com compreensão multimodal.

Integre via MiniMax API (`MiniMax-H3`), Vercel AI Gateway, fal.ai ou self-host de pesos abertos. Uma única arquitetura gere T2V, I2V, reference e editing.

Destaca-se em seguimento de instruções, renderização precisa de texto e marca, e V2V motion transfer. Construído para anúncios, product design, UI/UX e conteúdo gaming.

Fine-tune, personalize e implemente no seu próprio hardware. Compatível com uma ampla gama de aceleradores de IA — compatibilidade de hardware foi uma consideração chave de design.
Escreva um prompt ou anexe referências multimodais, e MiniMax H3 gera vídeo 2K com áudio estéreo nativo — diálogo, SFX e ambience num único passo.
O design de generalização de tarefas do MiniMax H3 oferece amplas capacidades multimodais desde a fase de pretraining.
Um transformer gere text-to-video, image-to-video, reference-to-video, video editing e audio generation — sem modelos T2V, I2V e TTS separados unidos.
Geração conjunta de vídeo e áudio num forward pass a 32kHz stereo. Voz, efeitos sonoros e música modelados conjuntamente — sem separação entre domínios de áudio.
Durações de saída de 4 a 15 segundos a 24 frames per second. Proporções de 2:5 a 5:2, cobrindo formatos cinematográficos widescreen e verticais para redes sociais.
Tokenizer completamente renovado com melhorias na qualidade de reconstrução em todos os aspectos. 4x de ganho em effective sequence length — tecnologia chave por trás do suporte nativo 2K.
Suporta Arabic, Chinese, English, French, German, Italian, Japanese, Korean, Portuguese, Russian e mais — com diferentes graus de suporte de idioma de áudio.
A 2K, o preço por segundo é menos de um terço dos modelos mainstream (~0.80 CNY/sec). A 768p, menos de metade do preço de ofertas mainstream 720p.
Classificado como o modelo IA mais poderoso do mundo em video editing nos benchmarks Artificial Analysis — apenas atrás em T2V puro face a Gemini e Seedance.
Da arquitetura omni-modal aberta do MiniMax H3 à geração de 30 segundos do Wan 3.0 e qualidade cinematográfica do Google Veo.

Modelo omni-modal open-weight de 33B com áudio estéreo 2K nativo e edição baseada em instruções.

Marca consumer da MiniMax para H3 — 2K nativo, áudio sincronizado e controlo omni-reference.

Modelo de vídeo multimodal de 30 segundos da Alibaba com conversão document-to-video.

Vídeo IA cinematográfico do Google DeepMind com 4K e áudio nativo.
Mergulhos profundos na arquitetura H3, integração API e fluxos criativos.
Ainda tem dúvidas? Estamos aqui para ajudar.