lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

โมเดล 25 ตัวแพ้มนุษย์แบบยกทีม: AI ยังไม่เข้าใจสามัญสำนึกในชีวิตประจำวันหลายอย่าง

动察 Beating ข่าวด่วน AI สถาบันวิจัย Scale Labs ภายใต้ Scale AI ร่วมกับ Elorian เปิดตัวแบบทดสอบใหม่ Humanity’s Sixth Sense (HSS) เพื่อทดสอบว่า AI สามารถมองเห็นข้อมูลแฝงจากภาพและวิดีโอได้หรือไม่ มีคำถามเปิด 522 ข้อ ครอบคลุมภาพ 288 ภาพและวิดีโอ 234 คลิป ตัวอย่างเช่น รถสองคันสามารถผ่านไปได้หรือไม่ ทำไมผู้หญิงที่วิ่งตามรถเมล์จึงชะลอฝีเท้าลงกะทันหัน และในสถานการณ์หนึ่งใครมีอำนาจในการพูดมากกว่า


ทีมวิจัยทดสอบโมเดลมัลติโมดัล 25 รุ่น และให้มนุษย์ 20 คนตอบคำถาม มนุษย์มีความแม่นยำถึง 93.1% ขณะที่ GPT-6 Astra ซึ่ง ranked ที่หนึ่งทำได้เพียง 53.6% แม้ใช้กำลังการอนุมานสูงสุด GPT-6.1 Sol และ Claude Opus 5.5 ได้ 46.6% และ 44.6% ตามลำดับ ค่ามัธยฐานคะแนนของทุกโมเดลอยู่ที่เพียง 30.9%


นักวิจัยวิเคราะห์ความล้มเหลวของโมเดล 8,573 ครั้ง พบว่า 94% เกี่ยวข้องกับการมองข้ามเบาะแสสำคัญ การระบุตัวตนผิด หรือการไม่สามารถอนุมานความสัมพันธ์แฝงในภาพ มีเพียงประมาณ 5% ที่จัดเป็นข้อผิดพลาดด้านการให้เหตุผลเชิงตรรกะ ความเข้าใจทางสังคมยากเป็นพิเศษ โดยโมเดล 25 รุ่นมี 21 รุ่นที่ทำได้แย่ที่สุดในคำถามประเภทนี้ คำถามวิดีโอก็ยากกว่าคำถามภาพโดยทั่วไป


การเพิ่มปริมาณการอนุมานก็未必ได้ผล โมเดลใช้โทเคนการอนุมานเฉลี่ยประมาณ 4,000 โทเคนต่อข้อ บางข้อคิดนานยิ่งขึ้นกลับได้คะแนนแย่ลง ทีมวิจัยยังลองให้ Agent ซูม ครอป และตรวจสอบภาพซ้ำ ผลคะแนนดีขึ้นแต่ยังห่างจากมนุษย์อย่างชัดเจน

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น