动察 Beating ข่าวด่วน AI โดยบริษัท AI สัญชาติอเมริกัน Reka ซึ่งก่อตั้งโดยอดีตนักวิจัยจาก DeepMind, Google Brain และ Meta FAIR ได้เปิดตัวโมเดลขนาด 19,000 ล้านพารามิเตอร์ชื่อ Rho-1它可以ในบทสนทนาเดียวประมวลผลข้อความ รูปภาพ และวิดีโอ อีกทั้งยังสามารถส่งออกการเคลื่อนไหวของหุ่นยนต์ได้ ตัวอย่างเช่น สร้างรูปภาพประภาคารก่อน จากนั้นให้ประภาคารเคลื่อนไหว แก้ไขสภาพอากาศในวิดีโอ และสุดท้ายถามต่อว่าวิดีโอสองคลิปแตกต่างกันอย่างไร เนื้อหาที่สร้างขึ้นก่อนหน้าจะยังคงอยู่ในบริบทตลอด ไม่จำเป็นต้องส่งให้โมเดลอื่นประมวลผลใหม่
ยังรองรับการรับคำสั่งต่อเนื่องในระหว่างการสร้างวิดีโอ ขณะที่วิดีโอกำลังสร้างไปข้างหน้า ผู้ใช้สามารถขอเปลี่ยนสภาพอากาศ ทิศทางการเคลื่อนไหว หรือเนื้อหาอื่นได้ชั่วคราว ภาพที่ตามมาจะปรับตามไปด้วย เวอร์ชันพื้นฐานมีความเร็วในการสร้างประมาณ 0.79 เท่าของเวลาจริง เวอร์ชันกลั่นกรองลดขั้นตอนการสร้างจาก 99 ขั้นเหลือ 8 ขั้น Reka วัดได้ว่าประมาณ 1 วินาทีสามารถสร้างวิดีโอได้ 5.3 วินาที
หุ่นยนต์ก็เชื่อมต่อในโมเดลเดียวกัน Rho-1 ทำนายสิ่งที่กล้องจะเห็นต่อไป พร้อมกับส่งสัญญาณการเคลื่อนไหวของหุ่นยนต์ ไม่จำเป็นต้องให้โมเดลวางแผนแยกต่างหากตัดสินใจว่าจะเคลื่อนไหวอย่างไร ปัจจุบันสิ่งที่ทางการแสดงยังเป็นภารกิจจำลอง LIBERO ยังไม่ได้เปิดเผยผลการทดสอบกับหุ่นยนต์จริง
โมเดลแบบรวมที่เป็นลักษณะคล้ายกันได้ปรากฏขึ้นแล้วในปีนี้ NVIDIA Cosmos 3 ก็สามารถประมวลผลข้อความ รูปภาพ วิดีโอ เสียง และการเคลื่อนไหวแบบรวมได้เช่นกัน Rho-1 เน้นไปที่การโต้ตอบต่อเนื่องมากกว่า โดยเน้นการแสดงการสร้าง แก้ไข และ推理ต่อเนื่องซ้ำ ๆ ในบริบทเดียวกัน
Rho-1 ฝึกจากศูนย์ ใช้ H100 จำนวน 320 ใบ ฝึกประมาณ 3 เดือน ปัจจุบันความละเอียดวิดีโออยู่ที่ 672×384 วิดีโอความยาวยังอาจเกิดการเลื่อนของโครงสร้างภาพ การระบุตำแหน่งวิดีโอและการแก้ไขเฉพาะจุดก็ยังไม่เสถียรพอ โมเดลในปัจจุบันเป็นเพียงตัวอย่างวิจัย น้ำหนักและ API ยังไม่เปิดให้ใช้งาน
