ตามการติดตามของ Beating ทาง OpenAI ระบุว่า กรอบการประเมินทั่วไปของ ARC-AGI-3 ไม่ได้บันทึกการอนุมานก่อนหน้าของ GPT-5.6 Sol และจะลบบันทึกก่อนหน้าเมื่อบริบทยาวเกินไป ส่งผลให้โมเดลมักลืมกฎของเกมที่ค้นพบแล้ว และต้องคิดใหม่ทุกครั้งที่ดำเนินการแต่ละขั้นตอน
ต่อมา OpenAI ได้ใช้ Responses API ของตนเองสร้างกรอบการประเมินใหม่ โดยเก็บรักษาการอนุมานในอดีตและบีบอัดบริบทที่ยาวเกินไป ผลลัพธ์คือคะแนนของ GPT-5.6 Sol เพิ่มขึ้นจาก 13.3% เป็น 38.3% และ Token ที่ส่งออกลดลงเหลือประมาณหนึ่งในหก
แต่ปัญหาคือ Opus 5 ก็ใช้กรอบการประเมินทั่วไปนี้เช่นกัน โดยทำคะแนนได้ 30.2% ที่ระดับการอนุมาน High ขณะที่ GPT-5.6 Sol แม้ใช้ระดับ Max ที่สูงกว่า ก็ได้เพียง 13.3% กรอบดังกล่าวทำให้ GPT-5.6 ช้าลงจริง แต่ไม่ได้ส่งผลกระทบต่อ Opus 5 ในลักษณะเดียวกัน
ไม่ว่า OpenAI จะแก้ตัวอย่างไร Opus 5 ก็แข็งแกร่งกว่า GPT-5.6 อย่างชัดเจนในการประเมิน AI ที่ยากที่สุดในโลกนี้
