lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

OpenAI กล่าวว่าโครงสร้างการประเมินผลทำให้ประสิทธิภาพของ GPT-5.6 ลดลง แต่ Opus 5 ใช้โครงสร้างเดียวกันกลับมีคะแนนสูงกว่า 2.3 เท่า

ตามการติดตามของ Beating ทาง OpenAI ระบุว่า กรอบการประเมินทั่วไปของ ARC-AGI-3 ไม่ได้บันทึกการอนุมานก่อนหน้าของ GPT-5.6 Sol และจะลบบันทึกก่อนหน้าเมื่อบริบทยาวเกินไป ส่งผลให้โมเดลมักลืมกฎของเกมที่ค้นพบแล้ว และต้องคิดใหม่ทุกครั้งที่ดำเนินการแต่ละขั้นตอน

ต่อมา OpenAI ได้ใช้ Responses API ของตนเองสร้างกรอบการประเมินใหม่ โดยเก็บรักษาการอนุมานในอดีตและบีบอัดบริบทที่ยาวเกินไป ผลลัพธ์คือคะแนนของ GPT-5.6 Sol เพิ่มขึ้นจาก 13.3% เป็น 38.3% และ Token ที่ส่งออกลดลงเหลือประมาณหนึ่งในหก

แต่ปัญหาคือ Opus 5 ก็ใช้กรอบการประเมินทั่วไปนี้เช่นกัน โดยทำคะแนนได้ 30.2% ที่ระดับการอนุมาน High ขณะที่ GPT-5.6 Sol แม้ใช้ระดับ Max ที่สูงกว่า ก็ได้เพียง 13.3% กรอบดังกล่าวทำให้ GPT-5.6 ช้าลงจริง แต่ไม่ได้ส่งผลกระทบต่อ Opus 5 ในลักษณะเดียวกัน

ไม่ว่า OpenAI จะแก้ตัวอย่างไร Opus 5 ก็แข็งแกร่งกว่า GPT-5.6 อย่างชัดเจนในการประเมิน AI ที่ยากที่สุดในโลกนี้

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น