lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

AI ในฐานะนักวิเคราะห์ยังไม่น่าเชื่อถือพอ: ทำโจทย์แต่ละข้อ 5 รอบ มีเพียง 54% ของโจทย์ที่ Claude Opus 5 ทำได้ถูกต้องทั้งหมด

จากข้อมูลการติดตามของ Beating เปิดเผยว่า Artificial Analysis ได้เปิดตัวการทดสอบความสามารถด้าน AI ใหม่ชื่อ AA-AnalystAgent ซึ่งให้โมเดลจัดการกับตารางและเอกสารจริง เพื่อทำงานด้านสถิติ การวิเคราะห์แนวโน้ม การสร้างแบบจำลองทางการเงิน เป็นต้น การทดสอบมีทั้งหมด 80 ข้อ แต่ละข้อให้โมเดลทำอิสระ 5 ครั้ง โดยต้องตอบถูกครบทั้ง 5 ครั้งจึงจะถือว่าผ่าน

ผลปรากฏว่าอันดับหนึ่งคือ Claude Opus 5 แต่ก็ทำได้เพียง 54% ของข้อที่ตอบถูกครบ 5 ครั้งติดต่อกัน GPT-5.5 อยู่อันดับสองด้วยอัตราผ่าน 50% ส่วน Claude Fable 5 ได้ 49% สำหรับโมเดลโอเพนเวตที่ทำได้ดีที่สุดคือ Kimi K3 ที่ 39%

หากดูเฉพาะค่าเฉลี่ยความถูกต้องในแต่ละครั้ง GPT-5.5 จริงๆ แล้วสูงที่สุดถึง 66% แต่เมื่อกำหนดให้ข้อเดียวกันตอบถูกติดต่อกัน 5 ครั้ง อัตราผ่านของมันกลับเหลือเพียง 50% ส่วน Claude Opus 5 มีความถูกต้องต่อครั้งต่ำกว่าเล็กน้อย แต่มีความเสถียรมากกว่า จึงได้อันดับหนึ่งในที่สุด

ปัญหาที่พบบ่อยที่สุดของ AI ไม่ใช่การคำนวณไม่ได้ แต่เป็นการเข้าใจโจทย์ผิดตั้งแต่แรก Artificial Analysis วิเคราะห์บันทึกความล้มเหลว 1,567 ครั้ง พบว่า 57% เกิดจากกรณีนี้: โมเดลสรุปการตีความที่ผิดตั้งแต่เนิ่นๆ แล้วดำเนินการไปในทิศทางนั้นตลอด

นักสืบบนบล็อกเชนเฝ้าติดตามอย่างต่อเนื่อง
แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น