动察 Beating ข่าวด่วน AI ทีม Tencent Hunyuan และอื่นๆ ได้เปิดตัว EvolveScaler เพื่อทดสอบว่าโมเดลขนาดใหญ่สามารถติดตามข้อมูลที่เปลี่ยนแปลงตลอดเวลาได้หรือไม่ โดยจะเพิ่มข้อมูลที่ถูกแก้ไข ถอนกลับ เพิ่มเติม และยกเลิกอย่างต่อเนื่องในข้อความยาว จากนั้นให้โมเดลตอบคำถามตามสถานะล่าสุด
ตัวอย่างเช่น ให้โมเดลดูบันทึกเกม 40 วัน จากนั้นถามว่า: "ถ้าวันที่ 7 ไม่ได้ตีบอสเล็กตัวนั้น สุดท้ายจะยังชนะได้ไหม?" ซึ่งจะส่งผลต่ออุปกรณ์ พลังชีวิต และผลการต่อสู้ในภายหลัง โมเดลต้องเริ่มคำนวณใหม่ตั้งแต่วันที่ 7 ไปจนถึงหลายสิบวันถัดไป โดยในข้อความต้นฉบับไม่มีคำตอบสำเร็จรูป
ทีมได้ออกแบบงาน 117 ประเภท คำถาม 159 รูปแบบ เหตุการณ์ยาวสุดประมาณ 1200 เหตุการณ์ การตั้งค่าโมเดล 14 แบบ รวมถึง GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Preview Pro, GLM-5.2 และ Qwen3.5 Plus ในระดับที่ยากที่สุด ค่ามัธยฐานของคะแนนอยู่ที่เพียง 11.3% และ GPT-5.5-xhigh ที่ทำได้ดีที่สุดก็เพียง 59.3%
ชุดข้อมูลนี้ยังสามารถนำไปฝึกโมเดลได้ด้วย หลังจากโมเดล A3B ภายในเพิ่มข้อมูลประเภทนี้ 6000 รายการ ผลการทดสอบภายนอก 8 รายการดีขึ้นทั้งหมด เฉลี่ยเพิ่มขึ้น 5.25 คะแนน
