lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

MiniMax เปิดตัวโมเดลสร้างภาพ: ใช้สถาปัตยกรรม H3 รองรับทั้งการสร้างภาพและการแก้ไขภาพในโมเดลเดียว

动察 Beating ตรวจสอบ ทีม MiniMax H3 เปิดเผยใน Reddit AMA ว่ากำลังพัฒนาโมเดลภาพเฉพาะทาง และวางแผนที่จะเปิดเผยน้ำหนัก (open weights) โดยจะรวมการสร้างภาพจากข้อความและการแก้ไขภาพทั่วไปไว้ในโมเดลเดียวกัน ซึ่งขณะนี้อยู่ในขั้นตอนการปรับแต่งหลังการฝึก (post-training optimization)

โมเดลนี้ใช้แนวคิดสถาปัตยกรรมเดียวกันกับ H3 โดยจะใช้ VAE Encoder ของ H3 และออกแบบ VAE Decoder แยกต่างหากสำหรับการสร้างภาพ MiniMax วางแผนเวิร์กโฟลว์คือ ใช้โมเดลภาพสร้างเฟรมแรกก่อน แล้วส่งต่อให้ H3 ใช้สร้างวิดีโอต่อ

ทีมงานยังกล่าวอีกว่า H3 เองได้แสดงศักยภาพในการสร้างภาพและการแก้ไขภาพในระดับหนึ่งแล้ว ก่อนหน้านี้พวกเขาฝึกโมเดลให้ทำนายเฟรมสุดท้ายจาก "เฟรมแรก + คำอธิบายข้อความ" เท่านั้น โดยไม่ได้ฝึกเฉพาะด้านการแก้ไขภาพ แต่โมเดลยังแสดงความสามารถแบบ zero-shot ที่แข็งแกร่งในการประเมินการแก้ไขภาพหลายรายการ นี่คือเหตุผลสำคัญที่ MiniMax ยังคงขยายสถาปัตยกรรมนี้ไปยังโมเดลภาพต่อไป

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น