MiniMax เปิดตัวน้ำหนักโมเดล H3 เมื่อวันที่ 3 สิงหาคม 2026 โดยรวมข้อความ ภาพ วิดีโอ และเสียงไว้ในเวิร์กโฟลว์เดียว และสร้างคลิปยาวได้สูงสุดประมาณ 15 วินาทีพร้อมเสียงสเตอริโอในตัว FL2VA เหมาะกับการสร้างวิดีโอจากข้อความและการกำหนดเฟรมต้นทางหรือปลายทาง ส่วน Ref2VA ใช้ภาพ วิดีโอ และเสียงอ้างอิงเพื่อควบคุมผลลัพธ์แบบหลายสื่...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is MiniMax H3, released with open weights in August 2026, and how does it address the fragmentation of AI video production by combining. Article summary: MiniMax H3 is an open-weight, omni-modal video-generation system released on August 3, 2026. Its main contribution is treating text, images, video, and audio as inputs to one generation workflow, producing synchronized v. Topic tags: general, education, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
MiniMax H3 คือโมเดลสร้างวิดีโอแบบ Open-Weight และเป็นระบบสร้างสื่อแบบออมนิโมดัล (omni-modal) ที่เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026 จุดเด่นคือการนำข้อความ ภาพ วิดีโอ และเสียงมาอยู่ในบริบทเดียวกัน จากนั้นสร้างวิดีโอพร้อมเสียงสเตอริโอในตัว แทนที่จะให้ผู้สร้างต้องแยกสร้างภาพเคลื่อนไหว เสียงพูด ดนตรี และเอฟเฟกต์เสียงในหลายเครื่องมือแล้วนำมาซิงก์ภายหลัง 1
2
อย่างไรก็ตาม H3 ไม่ได้เข้ามาแทนที่งานกำกับ ตัดต่อ หรือการตรวจสอบคุณภาพทั้งหมด สิ่งที่เปลี่ยนไปคือผู้สร้างอาจใช้เวลาน้อยลงกับการรวบรวมไฟล์ดิบ และใช้เวลามากขึ้นกับการอธิบายไอเดีย ใส่ข้อมูลอ้างอิง สร้างหลายเวอร์ชัน และเลือกผลลัพธ์ที่ดีที่สุด
H3 รองรับการสร้างวิดีโอจากพรอมป์ต์ข้อความ เฟรมสำคัญ และข้อมูลอ้างอิงแบบหลายสื่อ เอกสาร ComfyUI ระบุว่าสามารถสร้างวิดีโอได้สูงสุดราว 2K ที่ 24 เฟรมต่อวินาทีและยาวประมาณ 15 วินาที โดยเสียงพูด ดนตรี และเอฟเฟกต์เสียงถูกสร้างเป็นเสียงสเตอริโอไปพร้อมกับภาพในรอบเดียว 2
การรวมเสียงไว้ในขั้นตอนเดียวมีความสำคัญต่อเวิร์กโฟลว์ เพราะปัญหาที่พบได้บ่อยในงานวิดีโอ AI คือภาพและเสียงถูกสร้างจากคนละระบบ ทำให้ต้องแก้จังหวะ เสียงพูด และเอฟเฟกต์ในภายหลัง H3 พยายามสร้างผลลัพธ์ด้านภาพและเสียงร่วมกัน แม้งานระดับมืออาชีพยังอาจต้องผ่านการตัดต่อและเก็บรายละเอียดด้วยเครื่องมือปกติ
รุ่นที่เปิดให้ดาวน์โหลดอยู่ในกลุ่ม H3-Base และมีเส้นทางหลัก 2 แบบ ได้แก่ FL2VA และ Ref2VA
FL2VA ออกแบบมาสำหรับการสร้างวิดีโอจากข้อความ รวมถึงการใช้ภาพเป็นเฟรมแรก เฟรมสุดท้าย หรือใช้ทั้งสองเฟรมเพื่อกำหนดทิศทางของฉาก 1
5
8
จึงเหมาะกับงานที่ผู้สร้างต้องการเริ่มจากคำบรรยาย กำหนดภาพเปิดหรือภาพจบ หรือควบคุมการเปลี่ยนผ่านระหว่างเฟรมที่เตรียมไว้
Ref2VA เป็นโหมดที่เน้นข้อมูลอ้างอิง สามารถใช้ภาพ วิดีโอ และเสียงประกอบกันเป็นบริบทเดียว เพื่อช่วยกำหนดลักษณะตัวละคร การเคลื่อนไหว ตัวตน สไตล์ หรือเสียงของผลลัพธ์ 1
2
8
สรุปแบบใช้งานจริงคือ FL2VA เหมาะกับงานที่ขับเคลื่อนด้วยพรอมป์ต์และคีย์เฟรม ส่วน Ref2VA เหมาะกับงานที่มีไฟล์อ้างอิงหลายชนิดและต้องการให้โมเดลนำข้อมูลเหล่านั้นมาประกอบการสร้างวิดีโอ
ก่อนมีเวิร์กโฟลว์แบบออมนิโมดัล การทำคลิปสั้นหนึ่งชิ้นอาจต้องผ่านหลายขั้นตอน เช่น
H3 ยุบหลายขั้นตอนเหล่านี้ให้อยู่ในการโต้ตอบกับโมเดลครั้งเดียว ผู้สร้างสามารถส่งพรอมป์ต์ เฟรมเริ่มต้นหรือเฟรมจบ ข้อมูลอ้างอิงด้านการเคลื่อนไหว และเสียงอ้างอิง แล้วขอให้ระบบสร้างตัวอย่างวิดีโอพร้อมเสียงแทนการจัดการไฟล์แต่ละชิ้นแบบแยกกัน 2
8
ผลลัพธ์ไม่ได้หมายความว่าจะเป็นภาพยนตร์ที่พร้อมเผยแพร่ทันที การเปลี่ยนแปลงที่สำคัญกว่าคือจุดที่ใช้แรงสร้างสรรค์ ผู้สร้างอาจลดเวลาที่ต้องใช้หาองค์ประกอบดิบทุกชิ้น และหันไปกำหนดข้อจำกัด ปรับพรอมป์ต์ สร้างตัวเลือกหลายแบบ และตัดต่อผลงานที่คัดเลือกแล้วมากขึ้น ทั้งนี้ไม่ได้รับประกันว่าตัวละครจะคงที่ จังหวะจะสมบูรณ์ หรือเสียงจะพร้อมออกอากาศในทุกครั้งที่สร้าง
นี่คือข้อควรระวังที่สำคัญที่สุดสำหรับผู้ที่กำลังประเมิน H3
สิ่งที่เปิดให้ดาวน์โหลดคือ H3-Base ซึ่งประกอบด้วย FL2VA และ Ref2VA ขณะที่คู่มือการติดตั้งและเอกสารเกี่ยวกับโมเดลระบุว่าเช็กพอยต์ Base สร้างวิดีโอที่ 768p ส่วนขั้นตอน H3-Regenerate-2K ยังไม่ได้เปิดซอร์สและให้บริการผ่านระบบโฮสต์ของ MiniMax 6
9
12
ดังนั้นข้อความว่า “H3 รองรับ 2K” กับ “น้ำหนักโมเดล Open-Weight สามารถสร้างกระบวนการ 2K แบบครบชุดในเครื่องได้” จึงเป็นคนละเรื่องกัน ข้อความแรกหมายถึงบริการ H3 โดยรวม ส่วนข้อความหลังเกินกว่าขอบเขตของสิ่งที่เปิดให้ดาวน์โหลดในปัจจุบัน
ทำได้ในบางการตั้งค่า แต่การรันในเครื่องเป็นงานด้านวิศวกรรมที่มีข้อจำกัด ไม่ใช่การติดตั้งโปรแกรมบนเดสก์ท็อปแบบคลิกเดียวแล้วใช้งานได้ทันที
การใช้โมเดลแบบ Quantization การดึงหน่วยความจำระบบมาเสริม และการ Offload เลเยอร์ อาจทำให้เวิร์กโฟลว์บางรูปแบบทำงานบนการ์ดจอที่มี VRAM ประมาณ 12 GB ได้ ตามรายงานจากชุมชนผู้ใช้งาน แต่ชุดไฟล์ที่เล็กที่สุดที่มีการรายงานว่าใช้งานได้ยังมีขนาดราว 42.5 GB ดังนั้นพื้นที่จัดเก็บและ RAM ของระบบก็มีความสำคัญไม่แพ้ VRAM 7
10
สำหรับ RTX 5070 Ti ต้องย้ำว่าการ์ดรุ่นนี้มี VRAM 16 GB ไม่ใช่ 12 GB มีการทดสอบ Quantization ของ H3 บนการ์ดดังกล่าวแล้ว แต่ผลลัพธ์ขึ้นอยู่กับการตั้งค่าที่ใช้ เช่น ความละเอียด จำนวนสเต็ป วิธี Offload และเวิร์กโฟลว์โดยรวม 33
34
39
ตัวเลขเวลาเรนเดอร์จึงควรอ่านเป็นประสบการณ์เฉพาะการตั้งค่า ไม่ใช่ค่า Benchmark กลางของ H3 รายงานจากชุมชนหนึ่งระบุว่าใช้เวลาประมาณ 160 วินาทีสำหรับคลิป 480p ยาว 5 วินาที และประมาณ 560 วินาทีที่ 720p บนระบบ RTX 5070 Ti ขณะที่แหล่งอื่นรายงานผลต่างออกไปและระบุอย่างชัดเจนว่ายังไม่มีเวลาที่ตรวจสอบยืนยันได้สำหรับการ์ดรุ่นนี้ 45
34
38
ผู้สร้างที่ให้ความสำคัญกับความเร็วมากกว่าการควบคุมระบบในเครื่องอาจเลือกใช้ API แบบโฮสต์ ซึ่งไม่ต้องดาวน์โหลดโมเดลหรือจัดการเวิร์กโฟลว์ Offload ขนาดใหญ่ นอกจากนี้ ComfyUI ยังรองรับเวิร์กโฟลว์ H3 API แบบโฮสต์ด้วย จึงไม่จำเป็นต้องเลือกระหว่างการรันทุกอย่างในเครื่องกับการใช้แอปสร้างสรรค์คนละระบบเสมอไป 48
ComfyUI เพิ่มการรองรับ H3 ในช่วงที่มีการปล่อยน้ำหนักโมเดลแบบ Open-Weight โดยมีเวิร์กโฟลว์สำหรับ Text-to-Video การกำหนดภาพหรือเฟรม และ Reference-to-Video 1
2
การเข้าถึงผ่านระบบ Node ยังช่วยให้ H3 เชื่อมต่อกับสคริปต์และระบบอัตโนมัติด้านครีเอทีฟได้ง่ายขึ้น ในทางหลักการ Coding Agent อาจส่งพรอมป์ต์จำนวนมากที่ใช้ Seed หรือชุดอ้างอิงต่างกัน จัดระเบียบไฟล์ สร้าง Contact Sheet และช่วยให้มนุษย์ตรวจสอบตัวเลือกหลายสิบคลิปได้ การเปิดน้ำหนักโมเดลทำให้การประสานงานแบบรันในเครื่องและสั่งงานด้วยสคริปต์ทำได้สะดวกขึ้น
แต่ต้องแยกให้ออกว่า การสร้างหลายคลิปพร้อมกันและการประเมินผลเป็นความสามารถของระบบอัตโนมัติที่นำมาครอบ H3 ไม่ใช่ฟังก์ชันที่ H3 ตัดสินได้เองว่าคลิปใดดีที่สุด การตรวจสอบความต่อเนื่อง องค์ประกอบภาพ คุณภาพบทสนทนา และความเหมาะสมของเนื้อหายังต้องอาศัยมนุษย์
เอกสารราคาแบบจ่ายตามการใช้งานของ MiniMax ระบุว่า H3 คิดค่าบริการ 0.08 ดอลลาร์ต่อวินาทีสำหรับ 768p และ 0.13 ดอลลาร์ต่อวินาทีสำหรับ 2K ส่วนการสร้างใหม่จาก 768p เป็น 2K คิดที่ 0.05 ดอลลาร์ต่อวินาที 17
ดังนั้นคลิปยาว 10 วินาทีจะมีค่าใช้จ่ายโดยประมาณดังนี้
ข้ออ้างที่พบได้บ่อยว่าคลิป 2K มาตรฐานยาว 10 วินาทีเริ่มต้นที่ประมาณ 0.60 ดอลลาร์ ยังไม่สอดคล้องกับอัตรามาตรฐานในเอกสาร API ทางการที่มีให้ตรวจสอบ อาจเป็นราคาโปรโมชัน การคำนวณจากเครดิตแพ็กเกจ หรือบริการอื่น แต่ไม่ควรนำเสนอเป็นราคา API มาตรฐานของ MiniMax โดยไม่มีหลักฐานเพิ่มเติม
ส่วน MiniMax Design เป็นผลิตภัณฑ์ครีเอทีฟแบบปิดที่แยกจากน้ำหนักโมเดล H3 ที่ดาวน์โหลดได้ รายงานจากบุคคลที่สามอธิบายว่า Design สร้างขึ้นบนหรือเกี่ยวข้องกับ H3 แต่มีระบบเครดิตและแพ็กเกจของตัวเอง จึงไม่ควรถือว่าเป็นผลิตภัณฑ์เดียวกับการรัน H3-Base ในเครื่อง 18
ความสำคัญของ MiniMax H3 ไม่ได้อยู่ที่การลบทุกขั้นตอนของการผลิตวิดีโอ แต่คือการรวมอินพุตที่เคยแยกอยู่คนละเครื่องมือเข้าด้วยกัน ข้อความใช้บรรยายฉาก ภาพใช้กำหนดรูปลักษณ์ วิดีโอใช้นำทางการเคลื่อนไหว และเสียงใช้กำหนดเสียงพูดหรือบรรยากาศ จากนั้นโมเดลสร้างตัวอย่างภาพและเสียงที่ซิงก์กัน 2
สำหรับครีเอเตอร์ นี่อาจทำให้การทดลองไอเดียสำหรับวิดีโอสั้นเป็นงานที่ทำซ้ำและปรับแก้ได้เร็วขึ้น สำหรับนักพัฒนา น้ำหนักโมเดลแบบ Open-Weight และการรองรับ ComfyUI เป็นพื้นฐานสำหรับสร้าง Pipeline เฉพาะทาง การสร้างงานเป็นชุด และการใช้ Agent ช่วยคัดกรองผลงาน ส่วนผู้ซื้อบริการต้องชั่งน้ำหนักระหว่างการควบคุมและการทดลองในเครื่อง ซึ่งต้องใช้ฮาร์ดแวร์กับเวลาติดตั้งจำนวนมาก กับการใช้บริการโฮสต์ที่สร้างวิดีโอ 2K ได้สะดวกกว่า
สรุปให้ตรงที่สุดคือ H3 ช่วยลดความกระจัดกระจายในขั้นตอนการสร้างวิดีโอ แต่ไม่ได้กำจัดความจำเป็นในการตัดสินใจด้านการผลิต และน้ำหนักโมเดลที่เปิดให้ใช้งานก็ยังเป็นเพียงส่วนหนึ่งของระบบ H3 2K แบบโฮสต์ทั้งหมด
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
MiniMax เปิดตัวน้ำหนักโมเดล H3 เมื่อวันที่ 3 สิงหาคม 2026 โดยรวมข้อความ ภาพ วิดีโอ และเสียงไว้ในเวิร์กโฟลว์เดียว และสร้างคลิปยาวได้สูงสุดประมาณ 15 วินาทีพร้อมเสียงสเตอริโอในตัว
MiniMax เปิดตัวน้ำหนักโมเดล H3 เมื่อวันที่ 3 สิงหาคม 2026 โดยรวมข้อความ ภาพ วิดีโอ และเสียงไว้ในเวิร์กโฟลว์เดียว และสร้างคลิปยาวได้สูงสุดประมาณ 15 วินาทีพร้อมเสียงสเตอริโอในตัว FL2VA เหมาะกับการสร้างวิดีโอจากข้อความและการกำหนดเฟรมต้นทางหรือปลายทาง ส่วน Ref2VA ใช้ภาพ วิดีโอ และเสียงอ้างอิงเพื่อควบคุมผลลัพธ์แบบหลายสื่อ
ราคา API แบบจ่ายตามการใช้งานอยู่ที่ 0.13 ดอลลาร์ต่อวินาทีสำหรับเอาต์พุต 2K และ 0.08 ดอลลาร์ต่อวินาทีสำหรับ 768p ดังนั้นคลิป 10 วินาทีมีค่าใช้จ่าย 1.30 ดอลลาร์หรือ 0.80 ดอลลาร์ก่อนค่าใช้จ่ายเพิ่มเติมที่อาจเกิดขึ้น