据动察 Beating ตรวจสอบ ทีม MiniMax H3 เปิดเผยใน Reddit AMA ว่ากำลังพัฒนาโมเดลภาพเฉพาะทาง และวางแผนที่จะเปิดเผยน้ำหนัก (open weights) โดยจะรวมการสร้างภาพจากข้อความและการแก้ไขภาพทั่วไปไว้ในโมเดลเดียวกัน ซึ่งขณะนี้อยู่ในขั้นตอนการปรับแต่งหลังการฝึก (post-training optimization)
โมเดลนี้ใช้แนวคิดสถาปัตยกรรมเดียวกันกับ H3 โดยจะใช้ VAE Encoder ของ H3 และออกแบบ VAE Decoder แยกต่างหากสำหรับการสร้างภาพ MiniMax วางแผนเวิร์กโฟลว์คือ ใช้โมเดลภาพสร้างเฟรมแรกก่อน แล้วส่งต่อให้ H3 ใช้สร้างวิดีโอต่อ
ทีมงานยังกล่าวอีกว่า H3 เองได้แสดงศักยภาพในการสร้างภาพและการแก้ไขภาพในระดับหนึ่งแล้ว ก่อนหน้านี้พวกเขาฝึกโมเดลให้ทำนายเฟรมสุดท้ายจาก "เฟรมแรก + คำอธิบายข้อความ" เท่านั้น โดยไม่ได้ฝึกเฉพาะด้านการแก้ไขภาพ แต่โมเดลยังแสดงความสามารถแบบ zero-shot ที่แข็งแกร่งในการประเมินการแก้ไขภาพหลายรายการ นี่คือเหตุผลสำคัญที่ MiniMax ยังคงขยายสถาปัตยกรรมนี้ไปยังโมเดลภาพต่อไป
