lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

มีรายงานว่า OpenAI ได้ปรับเปลี่ยนข้อมูลการประเมิน GPT-6 Astra อย่างเงียบๆ โดยบางตัวชี้วัดทำให้คู่แข่งดู "แย่ลง"

ดงฉา Beating ข่าวด่วน AI หลัง OpenAI เปิดตัว GPT-6 Astra เมื่อวันที่ 3 กันยายน ข้อมูลเกณฑ์การประเมินโมเดลหลายรายการถูกปรับเปลี่ยนอย่างต่อเนื่อง บางส่วนทำให้ Astra มีผลงานดีขึ้น ขณะที่คะแนนของโมเดลคู่แข่งบางรายลดลง ก่อให้เกิดข้อกังขาจากภายนอกเกี่ยวกับการ "ปั่นคะแนน" ของ AI และความโปร่งใสของการประเมิน


โดยอัตราการหลอนของ Astra ถูกปรับลดจาก 4.2% เป็น 2% ส่วน GPT-5.6 Sol ลดจาก 12.2% เป็น 9.4% ต่อมาทั้งสองกลับคืนสู่ 4.2% และ 12.2% ตามลำดับ ในการประเมินคณิตศาสตร์ คะแนนของ Fable 5.1 จาก Anthropic เคยลดจาก 87.8% เป็น 78% ปัจจุบันกลับขึ้นมาอยู่ที่ 83% ส่วน GPT-5.6 Sol ลดจาก 83% เป็น 80.5% แล้วกลับคืนสู่ 83%


นอกจากนี้ คะแนนของ Astra ในการประเมิน ARC-AGI-3 เพิ่มขึ้นจากร่างก่อนเปิดตัวที่ 98.6% เป็น 99.99% ในหน้าสุดท้าย และคะแนนการประเมินการเขียนโปรแกรมก็ถูกปรับเพิ่มเล็กน้อยจาก 57.7% เป็น 57.9% OpenAI ระบุว่าผลการประเมินอาจได้รับผลกระทบจากปัจจัยต่างๆ เช่น เวอร์ชันโมเดล การกำหนดค่าเครื่องมือ ระดับการให้เหตุผล และการทดสอบรัน การปรับครั้งนี้มีวัตถุประสงค์เพื่อให้ข้อมูลสะท้อนประสิทธิภาพที่ดีที่สุดของโมเดลได้อย่างแม่นยำยิ่งขึ้น


อย่างไรก็ตาม นักวิจัยจากมหาวิทยาลัยสแตนฟอร์ดเห็นว่าการรันการประเมินซ้ำบ่อยครั้งอาจเกี่ยวข้องกับสิ่งที่เรียกว่า "Benchmaxxing" ซึ่งคือการปรับเงื่อนไขการทดสอบเพื่อเพิ่มคะแนนเกณฑ์มาตรฐานให้สูงสุด ผู้เชี่ยวชาญในอุตสาหกรรมชี้ว่า随着การแข่งขันของโมเดล AI ทวีความรุนแรงขึ้น ข้อมูลการประเมินกลายเป็นเครื่องมือสำคัญในการวัดความสามารถของโมเดลและแย่งชิงตลาด การเพิ่มความโปร่งใสและความสามารถในการทำซ้ำของการทดสอบเกณฑ์มาตรฐานกำลังได้รับความสนใจมากขึ้นเรื่อยๆ

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น