
Nhà phát triển & tích hợp API
Tích hợp qua MiniMax API (`MiniMax-H3`), Vercel AI Gateway, fal.ai, hoặc self-host open weights. Một kiến trúc xử lý T2V, I2V, reference và editing.
MiniMax H3 là hệ thống generative omni-modal đa năng — mô hình 33B tham số hiểu văn bản, hình ảnh, video và âm thanh trong ngữ cảnh thống nhất, tạo video 2K với âm thanh stereo gốc trong một forward pass.
Tạo video để xem bản xem trước trong khu vực này
MiniMax H3 phá vỡ sự thống trị closed-source với open weights, hiệu suất-giá hàng đầu ngành và kiến trúc task generalization cho hệ sinh thái mở.
Trọng số H3-Base phát hành trên Hugging Face theo MiniMax Community License — cho phép sử dụng thương mại với tổ chức doanh thu dưới $20M. Xây phiên bản tùy chỉnh trên phần cứng AI đa dạng.
Dense single-stream Transformer 33B tham số với ~20B tham số active inference. Dùng Qwen3-VL-32B làm encoder, 3D multimodal RoPE, và tách compute hiểu/tạo để tăng 30% training throughput.
Ngôn ngữ là cầu nối thống nhất nhiệm vụ dạng mở, mô tả. Mô tả quan hệ giữa ngữ cảnh đa phương thức và video mục tiêu bằng ngôn ngữ tự nhiên — H3 xử lý full-modality understanding.
Thay super-resolution thông thường, H3 tái tạo đầu ra 768p của chính nó in-context thành 2K — khôi phục chi tiết mịn như chữ nhỏ mà upscaler không thể khôi phục.
Làm theo các bước này để bắt đầu tạo với MiniMax H3 qua trình tạo trên trang này hoặc MiniMax API.
Chọn text-to-video cho tạo chỉ prompt, first/last-frame cho image-to-video, hoặc reference-to-video cho workflow omni-reference với tối đa 12 tệp input hỗn hợp.

MiniMax H3 phục vụ nhà phát triển, studio và nhà sáng tạo cần video AI mở, kiểm soát được, cấp production với hiểu biết đa phương thức.

Tích hợp qua MiniMax API (`MiniMax-H3`), Vercel AI Gateway, fal.ai, hoặc self-host open weights. Một kiến trúc xử lý T2V, I2V, reference và editing.

Xuất sắc theo hướng dẫn, render văn bản và thương hiệu chính xác, và V2V motion transfer. Xây cho quảng cáo, thiết kế sản phẩm, UI/UX và nội dung game.

Fine-tune, tùy chỉnh và deploy trên phần cứng riêng. Tương thích accelerator AI rộng — tương thích phần cứng là cân nhắc thiết kế chính.
Viết prompt hoặc đính kèm tham chiếu đa phương thức, MiniMax H3 tạo video 2K với âm thanh stereo gốc — hội thoại, SFX và ambience trong một lần.
Thiết kế task generalization của MiniMax H3 mang lại khả năng đa phương thức rộng từ giai đoạn pretraining.
Một transformer xử lý text-to-video, image-to-video, reference-to-video, video editing và audio generation — không ghép riêng mô hình T2V, I2V và TTS.
Generative video và audio cùng nhau trong một forward pass ở 32kHz stereo. Giọng, hiệu ứng và nhạc được mô hình hóa chung — không tách domain audio.
Thời lượng đầu ra 4 đến 15 giây ở 24 frames per second. Tỷ lệ khung hình 2:5 đến 5:2, từ widescreen điện ảnh đến định dạng social dọc.
Tokenizer được đại tu hoàn toàn với cải thiện chất lượng tái tạo toàn diện. Tăng 4x effective sequence length — công nghệ then chốt hỗ trợ 2K gốc.
Hỗ trợ Arabic, Chinese, English, French, German, Italian, Japanese, Korean, Portuguese, Russian và hơn nữa — với mức hỗ trợ ngôn ngữ audio khác nhau.
Ở 2K, giá mỗi giây thấp hơn một phần ba mô hình mainstream (~0.80 CNY/giây). Ở 768p, thấp hơn một nửa giá mainstream 720p.
Xếp hạng mô hình AI mạnh nhất thế giới trong video editing trên benchmark Artificial Analysis — chỉ thua thuần T2V so với Gemini và Seedance.
Từ kiến trúc omni-modal mở MiniMax H3 đến tạo 30 giây Wan 3.0 và chất lượng điện ảnh Google Veo.

Mô hình omni-modal open-weight 33B với âm thanh stereo 2K gốc và chỉnh sửa theo hướng dẫn.

Thương hiệu tiêu dùng MiniMax cho H3 — 2K gốc, audio đồng bộ và điều khiển omni-reference.

Mô hình video multimodal 30 giây Alibaba với chuyển đổi document-to-video.

Video AI điện ảnh Google DeepMind với 4K và âm thanh gốc.
Đi sâu kiến trúc H3, tích hợp API và workflow sáng tạo.
Vẫn còn thắc mắc? Chúng tôi sẵn sàng hỗ trợ.