ดงฉา Beating ข่าวด่วน AI หลัง OpenAI เปิดตัว GPT-6 Astra เมื่อวันที่ 3 กันยายน ข้อมูลเกณฑ์การประเมินโมเดลหลายรายการถูกปรับเปลี่ยนอย่างต่อเนื่อง บางส่วนทำให้ Astra มีผลงานดีขึ้น ขณะที่คะแนนของโมเดลคู่แข่งบางรายลดลง ก่อให้เกิดข้อกังขาจากภายนอกเกี่ยวกับการ "ปั่นคะแนน" ของ AI และความโปร่งใสของการประเมิน
โดยอัตราการหลอนของ Astra ถูกปรับลดจาก 4.2% เป็น 2% ส่วน GPT-5.6 Sol ลดจาก 12.2% เป็น 9.4% ต่อมาทั้งสองกลับคืนสู่ 4.2% และ 12.2% ตามลำดับ ในการประเมินคณิตศาสตร์ คะแนนของ Fable 5.1 จาก Anthropic เคยลดจาก 87.8% เป็น 78% ปัจจุบันกลับขึ้นมาอยู่ที่ 83% ส่วน GPT-5.6 Sol ลดจาก 83% เป็น 80.5% แล้วกลับคืนสู่ 83%
นอกจากนี้ คะแนนของ Astra ในการประเมิน ARC-AGI-3 เพิ่มขึ้นจากร่างก่อนเปิดตัวที่ 98.6% เป็น 99.99% ในหน้าสุดท้าย และคะแนนการประเมินการเขียนโปรแกรมก็ถูกปรับเพิ่มเล็กน้อยจาก 57.7% เป็น 57.9% OpenAI ระบุว่าผลการประเมินอาจได้รับผลกระทบจากปัจจัยต่างๆ เช่น เวอร์ชันโมเดล การกำหนดค่าเครื่องมือ ระดับการให้เหตุผล และการทดสอบรัน การปรับครั้งนี้มีวัตถุประสงค์เพื่อให้ข้อมูลสะท้อนประสิทธิภาพที่ดีที่สุดของโมเดลได้อย่างแม่นยำยิ่งขึ้น
อย่างไรก็ตาม นักวิจัยจากมหาวิทยาลัยสแตนฟอร์ดเห็นว่าการรันการประเมินซ้ำบ่อยครั้งอาจเกี่ยวข้องกับสิ่งที่เรียกว่า "Benchmaxxing" ซึ่งคือการปรับเงื่อนไขการทดสอบเพื่อเพิ่มคะแนนเกณฑ์มาตรฐานให้สูงสุด ผู้เชี่ยวชาญในอุตสาหกรรมชี้ว่า随着การแข่งขันของโมเดล AI ทวีความรุนแรงขึ้น ข้อมูลการประเมินกลายเป็นเครื่องมือสำคัญในการวัดความสามารถของโมเดลและแย่งชิงตลาด การเพิ่มความโปร่งใสและความสามารถในการทำซ้ำของการทดสอบเกณฑ์มาตรฐานกำลังได้รับความสนใจมากขึ้นเรื่อยๆ
