แตกต่างจากโมเดลก่อนหน้าที่มองวิดีโอและเสียงเป็นงานแยกกัน H3 ตีความข้อความ รูปภาพ วิดีโอ และเสียงเป็นคอนเทกซ์สร้างสรรค์เดียวกัน อินเทอร์เฟซที่โฮสต์บางแห่งอนุญาตให้ส่งรูปภาพได้สูงสุด 9 รูป คลิปวิดีโอ 3 คลิป และแทร็กเสียง 3 แทร็กในการสร้างครั้งเดียว โมเดลจะอ่านข้อมูลประจำตัว การเคลื่อนไหวของกล้อง องค์ประกอบ ทัศนียภาพเสียง และจังหวะตัดต่อจากสิ่งที่คุณให้
เครื่องมือสร้างออนไลน์ (minimaxh3.org, minimax-h3.app และอื่น ๆ) ทำหน้าที่เป็นฟร้อนท์เอนด์บนเบราว์เซอร์: รวบรวมพรอมต์และข้อมูลอ้างอิงที่คุณอัปโหลด ส่งไปยังบริการ H3 ที่โฮสต์อยู่ และแสดงผลลัพธ์สื่อ เว็บไซต์เหล่านี้ไม่ได้ดำเนินการโมเดลด้วยตนเอง
นี่คือนวัตกรรมหลัก H3 สร้าง "เสียงสเตอริโอแบบเนทีฟ" (native stereo audio) — เสียงเป็นส่วนหนึ่งของเอาต์พุตของโมเดล ไม่ใช่แทร็กเสียงที่ถูกแนบมาทีหลัง ซึ่งหมายความว่าบทสนทนา เสียงฝีเท้า เสียงบรรยากาศ และดนตรีถูกสร้างขึ้นโดยสัมพันธ์กับภาพที่กำลังแสดงและตรงจังหวะกับการตัด
MiniMax อธิบายว่าเป็น "การสร้างแบบจำลองรวมของเสียงพูด เสียงประกอบ และดนตรี" ซึ่งบ่งบอกว่าโมเดลจัดการทั้งเสียง foley เสียงในห้อง และแม้แต่ดนตรีประกอบในการสร้างครั้งเดียว
โมเดลรองรับ:
อินเทอร์เฟซของบุคคลที่สามแต่ละแห่งอาจแสดงการควบคุมความละเอียด อัตราส่วนภาพ หรือระยะเวลาเพิ่มเติม
อินเทอร์เฟซเว็บจะคืนวิดีโอที่สร้างพร้อมกับเสียงสเตอริโอที่ฝังอยู่ในไฟล์เดียวกัน คุณสมบัติที่เครื่องมือสร้างที่โฮสต์โฆษณารวมถึงการควบคุมอัตราส่วนภาพ การเลือกระยะเวลาที่ยืดหยุ่น การอัปโหลดข้อมูลอ้างอิง และเวิร์กโฟลว์สำหรับข้อความเป็นวิดีโอ การทำให้ภาพเคลื่อนไหว และการสร้างแบบ multimodal
MiniMax-H3), แพลตฟอร์มการอนุมานแบบโฮสต์เช่น fal.ai และเป็นโอเพนเวทบน Hugging Face สำหรับการปรับใช้ด้วยตนเอง "เสียงสเตอริโอแบบเนทีฟ" (Native stereo audio) เป็นการอ้างสิทธิ์ความสามารถที่ชัดเจน แต่เอกสารสาธารณะไม่ได้เปิดเผยสถาปัตยกรรมประสาทที่แน่นอนที่บังคับใช้การซิงค์เฟรม-เสียง แหล่งข้อมูลยืนยันพฤติกรรมอินพุต/เอาต์พุตและความสามารถ แต่ไม่ได้เปิดเผยรายละเอียดการนำไปใช้มากพอที่จะอธิบายอย่างแม่นยำว่าโมเดลบรรลุความแม่นยำนั้นภายในได้อย่างไร — ไม่ว่าจะผ่านตารางการแพร่กระจาย (diffusion schedule) แบบเฉพาะ การแปลงโทเค็นของโค้กเสียง (audio-codec tokenization) ทรานส์ฟอร์มเมอร์ที่ได้รับการฝึกฝนร่วมกัน หรือแนวทางอื่น
สิ่งที่แน่นอนคือ: โมเดลส่งออกวิดีโอและเสียงที่ซิงค์กันอย่างต่อเนื่องในการสร้างครั้งเดียว วิศวกรรมที่ทำให้สิ่งนั้นเป็นไปได้ยังคงอยู่ — สำหรับตอนนี้ — ภายในเอกสารทางเทคนิคของ MiniMax