MiniMax H3 được phát hành với trọng số mở ngày 3/8/2026, có thể kết hợp văn bản, hình ảnh, video và âm thanh để tạo clip dài khoảng 15 giây với âm thanh stereo gốc. FL2VA phù hợp với text to video và điều kiện hóa bằng khung hình đầu/cuối; Ref2VA dùng các tham chiếu hình ảnh, video và âm thanh để kiểm soát kết quả c...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 là mô hình tạo video omni-modal với trọng số mở, được MiniMax phát hành ngày 3/8/2026. Điểm đáng chú ý của H3 là mô hình tiếp nhận văn bản, hình ảnh, video và âm thanh trong cùng một ngữ cảnh, sau đó tạo ra video cùng âm thanh stereo tự nhiên trong một lượt sinh. 1
2
Cách tiếp cận này không biến H3 thành công cụ thay thế hoàn toàn cho biên tập viên, đạo diễn hay khâu kiểm duyệt. Nhưng nó có thể rút ngắn đáng kể phần việc trước đây thường bị chia nhỏ giữa nhiều ứng dụng: tìm tư liệu, tạo nhân vật, dựng chuyển động, tổng hợp lời thoại, thêm nhạc và đồng bộ âm thanh với hình ảnh.
Theo tài liệu ComfyUI, H3 hỗ trợ tạo video từ lời nhắc văn bản, khung hình đầu/cuối và nhiều loại tham chiếu đa phương thức. Hệ thống có thể tạo video tối đa khoảng 2K, 24 khung hình/giây và dài khoảng 15 giây, với giọng nói, hiệu ứng âm thanh và âm nhạc được sinh thành âm thanh stereo ngay trong cùng quy trình. 2
Điểm này giải quyết một trở ngại phổ biến của video AI: hình ảnh và âm thanh thường được tạo ở hai công đoạn riêng, rồi mới ghép và căn chỉnh trong hậu kỳ. Với H3, kết quả nghe nhìn được mô hình hóa cùng nhau. Dù vậy, các sản phẩm chuyên nghiệp vẫn có thể cần chỉnh sửa, làm sạch tiếng và kiểm tra đồng bộ bằng công cụ truyền thống.
Bản phát hành H3-Base gồm hai hướng chính.
FL2VA được thiết kế cho text-to-video, cũng như các quy trình dùng khung hình đầu, khung hình cuối hoặc cả hai để định hướng video. Đây là lựa chọn trực tiếp hơn khi người dùng muốn bắt đầu từ một mô tả, xác định điểm mở đầu/kết thúc hoặc tạo chuyển cảnh giữa các khung hình có sẵn. 1
5
8
Ref2VA phục vụ quy trình dựa trên tham chiếu. Mô hình có thể tiếp nhận kết hợp hình ảnh, video và âm thanh, giúp người dùng đưa các yếu tố như ngoại hình nhân vật, chuyển động, phong cách, giọng nói hoặc cách quay vào cùng một yêu cầu. 1
2
8
Nói ngắn gọn, FL2VA phù hợp với quy trình lấy lời nhắc và keyframe làm trung tâm; Ref2VA phù hợp khi nhiều tư liệu có sẵn cùng tham gia định hình kết quả.
Trước đây, một video ngắn có thể cần nhiều bước riêng biệt:
H3 gom nhiều bước trong số đó vào một lần tương tác. Người sáng tạo có thể cung cấp lời nhắc, khung hình bắt đầu hoặc kết thúc, tham chiếu chuyển động và tham chiếu âm thanh, rồi yêu cầu mô hình tạo ra một phiên bản nghe nhìn hoàn chỉnh hơn thay vì quản lý từng tệp độc lập. 2
8
Thay đổi lớn nhất nằm ở nơi con người dành thời gian. Họ có thể bớt công sức thu thập từng thành phần thô và tập trung hơn vào việc mô tả ý đồ, đặt ràng buộc, tạo nhiều biến thể, so sánh kết quả rồi biên tập phiên bản tốt nhất.
Tuy nhiên, đây là hệ quả tiềm năng từ thiết kế đa phương thức của H3, không phải lời đảm bảo rằng mọi clip đều có nhân vật nhất quán, nhịp thoại hoàn hảo hay âm thanh đủ tiêu chuẩn phát sóng.
Đây là điểm cần phân biệt rõ khi đánh giá H3.
Bản tải xuống bao gồm H3-Base, với hai biến thể FL2VA và Ref2VA. Các hướng dẫn cài đặt và tài liệu mô hình cho biết những checkpoint Base này tạo video ở 768p, trong khi giai đoạn H3-Regenerate-2K chưa được mở mã nguồn và hiện được cung cấp qua dịch vụ máy chủ của MiniMax. 6
9
12
Vì vậy, hai phát biểu “H3 hỗ trợ 2K” và “trọng số mở của H3 có thể tự chạy toàn bộ quy trình 2K trên máy cá nhân” không đồng nghĩa với nhau. Phát biểu đầu mô tả dịch vụ H3 nói chung; phát biểu sau đã diễn giải quá rộng những gì được phát hành.
Có, nhưng đây là một bài toán kỹ thuật với nhiều giới hạn, chứ không phải cài đặt đơn giản trên máy tính để bàn.
Nhờ lượng tử hóa, sử dụng RAM hệ thống và cơ chế chuyển từng lớp sang CPU, một số cấu hình H3 có thể hoạt động với GPU khoảng 12 GB VRAM theo các báo cáo cộng đồng. Tổ hợp nhỏ nhất được mô tả cần khoảng 42,5 GB dung lượng tệp, nên ổ đĩa và RAM hệ thống cũng quan trọng không kém VRAM. 7
10
43
RTX 5070 Ti có 16 GB VRAM, không phải 12 GB. Một số bản lượng tử hóa thử nghiệm của H3 đã được chạy trên GPU này, nhưng thời gian xử lý phụ thuộc mạnh vào cấu hình, độ phân giải, số bước, chiến lược offload và workflow cụ thể. 33
34
39
Chẳng hạn, một thử nghiệm cộng đồng ghi nhận khoảng 160 giây cho clip 5 giây ở 480p và khoảng 560 giây ở 720p trên hệ thống RTX 5070 Ti. Những nguồn khác lại cho kết quả khác hoặc nhấn mạnh rằng chưa có thời gian đo được xác minh cho mẫu GPU này. Vì thế, các con số trên chỉ nên được xem là trải nghiệm theo cấu hình, không phải benchmark chung cho mọi máy. 45
34
38
Nếu ưu tiên tốc độ hơn quyền kiểm soát cục bộ, API lưu trữ giúp người dùng không phải tải mô hình và vận hành quy trình offload lớn. ComfyUI cũng hỗ trợ workflow H3 qua API máy chủ, nên lựa chọn không chỉ giới hạn ở việc chạy hoàn toàn tại chỗ hoặc chuyển sang một ứng dụng sáng tạo khác. 48
ComfyUI đã bổ sung hỗ trợ H3 khi trọng số mở được phát hành, với các workflow cho text-to-video, điều kiện hóa bằng hình ảnh hoặc khung hình, và reference-to-video. 1
2
Cách tiếp cận dạng node cũng giúp H3 dễ kết nối với script và công cụ tự động hóa. Về nguyên tắc, một coding agent có thể gửi hàng loạt lời nhắc ngắn với seed hoặc tổ hợp tham chiếu khác nhau, sắp xếp tệp, tạo bảng xem nhanh rồi hỗ trợ con người đánh giá các ứng viên.
Tuy nhiên, khả năng tạo song song và đánh giá hàng loạt đến từ hệ thống tự động hóa bao quanh H3, không phải một tính năng khiến H3 tự biết clip nào tốt nhất. Con người vẫn cần kiểm tra tính liên tục, bố cục, chất lượng lời thoại và mức độ phù hợp của kết quả.
Tài liệu pay-as-you-go chính thức của MiniMax niêm yết H3 ở mức 0,08 USD mỗi giây cho đầu ra 768p và 0,13 USD mỗi giây cho đầu ra 2K. Tài liệu cũng ghi giá nâng cấp từ 768p lên 2K là 0,05 USD mỗi giây. 17
Như vậy, một video dài 10 giây có chi phí cơ bản là:
Claim thường được nhắc lại rằng một clip 2K dài 10 giây có giá khởi điểm khoảng 0,60 USD không được bảng giá chính thức được cung cấp ở đây chứng minh. Con số đó có thể đến từ chương trình khuyến mãi, cách quy đổi credit trong gói thuê bao hoặc một dịch vụ trung gian khác, nhưng không nên gọi là giá API tiêu chuẩn của MiniMax nếu thiếu bằng chứng mạnh hơn.
MiniMax Design cũng là một sản phẩm riêng, không phải tên gọi khác của bộ trọng số H3 có thể tải xuống. Các báo cáo bên thứ ba mô tả đây là công cụ sáng tạo đóng, xây dựng trên hoặc xoay quanh H3, với hệ thống credit và ưu đãi riêng. 18
Ý nghĩa của MiniMax H3 không nằm ở việc xóa bỏ mọi bước sản xuất video. Giá trị cốt lõi là hợp nhất những đầu vào trước đây thường bị chia tách giữa nhiều công cụ: văn bản mô tả cảnh, hình ảnh định hình ngoại hình, video hướng dẫn chuyển động và âm thanh tham chiếu cho giọng nói hoặc không khí. Từ đó, mô hình tạo ra một ứng viên nghe nhìn đã được đồng bộ ngay từ đầu. 2
Với nhà sáng tạo nội dung ngắn, điều này có thể giúp quá trình thử ý tưởng trở nên nhanh và dựa trên tham chiếu nhiều hơn. Với nhà phát triển, trọng số mở và hỗ trợ ComfyUI tạo nền tảng cho pipeline tùy biến, sinh hàng loạt và quy trình đánh giá có tác nhân hỗ trợ. Với người mua, câu hỏi thực tế là liệu quyền kiểm soát cục bộ và khả năng thử nghiệm có xứng đáng với chi phí phần cứng, dung lượng lưu trữ và thời gian thiết lập hay không; nếu không, dịch vụ máy chủ 2K có thể là lựa chọn cân bằng hơn.
Tóm lại, H3 giảm sự phân mảnh ở giai đoạn sinh nội dung, nhưng không loại bỏ nhu cầu phán đoán sản xuất. Đồng thời, bản phát hành trọng số mở chỉ là một phần của hệ thống H3 2K hoàn chỉnh được cung cấp qua máy chủ.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
MiniMax H3 được phát hành với trọng số mở ngày 3/8/2026, có thể kết hợp văn bản, hình ảnh, video và âm thanh để tạo clip dài khoảng 15 giây với âm thanh stereo gốc.
MiniMax H3 được phát hành với trọng số mở ngày 3/8/2026, có thể kết hợp văn bản, hình ảnh, video và âm thanh để tạo clip dài khoảng 15 giây với âm thanh stereo gốc. FL2VA phù hợp với text to video và điều kiện hóa bằng khung hình đầu/cuối; Ref2VA dùng các tham chiếu hình ảnh, video và âm thanh để kiểm soát kết quả chi tiết hơn.
Giá API chính thức là 0,08 USD mỗi giây ở 768p và 0,13 USD mỗi giây ở 2K, tương đương 0,80 USD hoặc 1,30 USD cho video dài 10 giây trước các khoản phát sinh.