
Développeurs et intégrateurs API
Intégrez via MiniMax API (`MiniMax-H3`), Vercel AI Gateway, fal.ai ou self-host des poids ouverts. Une seule architecture gère T2V, I2V, reference et editing.
MiniMax H3 est un système génératif omni-modal à usage général — un modèle de 33B paramètres qui comprend texte, images, vidéo et audio dans un contexte unifié, générant de la vidéo 2K avec son stéréo natif en un seul forward pass.
Générez une vidéo pour voir l'aperçu dans cette zone
MiniMax H3 brise la domination du closed-source avec des poids ouverts, un rapport prix-performance leader et une architecture de généralisation de tâches conçue pour l'écosystème ouvert.
Les poids H3-Base sont publiés sur Hugging Face sous la MiniMax Community License — usage commercial autorisé pour les organisations de moins de 20 M$ de revenus. Construisez des versions personnalisées sur divers matériels IA.
Un Transformer dense à flux unique de 33B paramètres avec ~20B paramètres actifs en inférence. Utilise Qwen3-VL-32B comme encodeur, 3D multimodal RoPE et sépare le calcul compréhension/génération pour 30 % de gain de débit d'entraînement.
Le langage sert de pont unifiant les tâches sous forme ouverte et descriptive. Décrivez les relations entre le contexte multimodal et la vidéo cible en langage naturel — H3 gère la compréhension full-modality.
Au lieu de la super-résolution conventionnelle, H3 régénère sa propre sortie 768p in-context en 2K — récupérant des détails fins comme le petit texte que les upscalers ne peuvent pas restaurer.
Suivez ces étapes pour commencer à générer avec MiniMax H3 via le générateur de cette page ou la MiniMax API.
Sélectionnez text-to-video pour une génération par prompt uniquement, first/last-frame pour image-to-video, ou reference-to-video pour des workflows omni-reference avec jusqu'à 12 fichiers d'entrée mixtes.

MiniMax H3 s'adresse aux développeurs, studios et créateurs qui ont besoin de vidéo IA ouverte, contrôlable et de qualité production avec compréhension multimodale.

Intégrez via MiniMax API (`MiniMax-H3`), Vercel AI Gateway, fal.ai ou self-host des poids ouverts. Une seule architecture gère T2V, I2V, reference et editing.

Excellents en suivi d'instructions, rendu précis de texte et de marque, et V2V motion transfer. Conçu pour la pub, le product design, l'UI/UX et le contenu gaming.

Fine-tune, personnalisez et déployez sur votre propre matériel. Compatible avec une large gamme d'accélérateurs IA — la compatibilité matérielle était une considération clé de conception.
Rédigez un prompt ou joignez des références multimodales, et MiniMax H3 génère de la vidéo 2K avec audio stéréo natif — dialogue, SFX et ambience en un seul passage.
La conception de généralisation de tâches de MiniMax H3 offre de larges capacités multimodales dès la phase de pretraining.
Un transformer gère text-to-video, image-to-video, reference-to-video, video editing et audio generation — sans modèles T2V, I2V et TTS séparés assemblés.
Génération conjointe vidéo et audio en un forward pass à 32kHz stereo. Voix, effets sonores et musique modélisés conjointement — sans séparation entre domaines audio.
Durées de sortie de 4 à 15 secondes à 24 frames per second. Formats de 2:5 à 5:2, du cinéma widescreen aux formats verticaux pour les réseaux sociaux.
Tokenizer entièrement refondu avec des gains de qualité de reconstruction sur tous les axes. 4x de gain en effective sequence length — technologie clé derrière le support natif 2K.
Prend en charge Arabic, Chinese, English, French, German, Italian, Japanese, Korean, Portuguese, Russian et plus — avec des degrés variables de support des langues audio.
En 2K, le prix par seconde est inférieur à un tiers des modèles mainstream (~0.80 CNY/sec). En 768p, moins de la moitié du prix des offres mainstream 720p.
Classé comme le modèle IA le plus puissant au monde en video editing sur les benchmarks Artificial Analysis — seulement derrière en T2V pur face à Gemini et Seedance.
De l'architecture omni-modal ouverte de MiniMax H3 à la génération de 30 secondes de Wan 3.0 et la qualité cinématographique de Google Veo.

Modèle omni-modal open-weight 33B avec audio stéréo 2K natif et édition par instructions.

Marque consumer de MiniMax pour H3 — 2K natif, audio synchronisé et contrôle omni-reference.

Modèle vidéo multimodal de 30 secondes d'Alibaba avec conversion document-to-video.

Vidéo IA cinématographique Google DeepMind avec 4K et audio natif.
Plongées approfondies dans l'architecture H3, l'intégration API et les workflows créatifs.
Des questions ? Nous sommes là pour vous aider.