lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

ข้อมูลถูกแก้ไขซ้ำแล้วซ้ำอีก โมเดลขนาดใหญ่ก็สับสน: แม้แต่ GPT-5.5 ที่ทำผลงานได้ดีที่สุดก็ยังตอบถูกเพียง 59.3%

动察 Beating ข่าวด่วน AI ทีม Tencent Hunyuan และอื่นๆ ได้เปิดตัว EvolveScaler เพื่อทดสอบว่าโมเดลขนาดใหญ่สามารถติดตามข้อมูลที่เปลี่ยนแปลงตลอดเวลาได้หรือไม่ โดยจะเพิ่มข้อมูลที่ถูกแก้ไข ถอนกลับ เพิ่มเติม และยกเลิกอย่างต่อเนื่องในข้อความยาว จากนั้นให้โมเดลตอบคำถามตามสถานะล่าสุด


ตัวอย่างเช่น ให้โมเดลดูบันทึกเกม 40 วัน จากนั้นถามว่า: "ถ้าวันที่ 7 ไม่ได้ตีบอสเล็กตัวนั้น สุดท้ายจะยังชนะได้ไหม?" ซึ่งจะส่งผลต่ออุปกรณ์ พลังชีวิต และผลการต่อสู้ในภายหลัง โมเดลต้องเริ่มคำนวณใหม่ตั้งแต่วันที่ 7 ไปจนถึงหลายสิบวันถัดไป โดยในข้อความต้นฉบับไม่มีคำตอบสำเร็จรูป


ทีมได้ออกแบบงาน 117 ประเภท คำถาม 159 รูปแบบ เหตุการณ์ยาวสุดประมาณ 1200 เหตุการณ์ การตั้งค่าโมเดล 14 แบบ รวมถึง GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Preview Pro, GLM-5.2 และ Qwen3.5 Plus ในระดับที่ยากที่สุด ค่ามัธยฐานของคะแนนอยู่ที่เพียง 11.3% และ GPT-5.5-xhigh ที่ทำได้ดีที่สุดก็เพียง 59.3%


ชุดข้อมูลนี้ยังสามารถนำไปฝึกโมเดลได้ด้วย หลังจากโมเดล A3B ภายในเพิ่มข้อมูลประเภทนี้ 6000 รายการ ผลการทดสอบภายนอก 8 รายการดีขึ้นทั้งหมด เฉลี่ยเพิ่มขึ้น 5.25 คะแนน

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น