动察 Beating ข่าวด่วน AI โครงการประเมินอิสระ Assistant Benchmark เริ่มใช้ภารกิจจริงในการเปรียบเทียบผู้ช่วย AI ส่วนบุคคล โดยให้ Agent จองโรงแรม เลือกร้านอาหาร ซื้อของ ตอบอีเมล เชื่อมต่อบริการบุคคลที่สาม แล้วให้คะแนนตามผลการดำเนินงานจริง แต่ละมิติการให้คะแนนมีภารกิจคงที่ที่เปิดเผย และต้องมีบันทึกการทำงานจริงจึงจะได้คะแนน
ปัจจุบัน Muse ได้คะแนนเฉลี่ย 9.1 จาก 7 มิติที่ประเมินเสร็จแล้ว อยู่อันดับหนึ่งชั่วคราว; Instinct ทดสอบครบ 11 มิติ เฉลี่ย 8.4 คะแนน; Grok Bot ทดสอบครบ 7 มิติ เฉลี่ย 7.3 คะแนน Muse ได้ 10 คะแนนเต็มในด้านการช้อปปิ้ง อีเมล และการเชื่อมต่อแอปบุคคลที่สาม
อย่างไรก็ตาม ควรมองว่านี่เป็นตารางประสบการณ์จริงที่อัปเดตต่อเนื่องมากกว่า คะแนน 9.1 ของ Muse ในตอนนี้เป็นเพียงค่าเฉลี่ยจาก 7 มิติที่ทดสอบแล้ว ไม่ใช่คะแนนสมบูรณ์ แต่ละมิติในตอนนี้ก็ใช้เพียงภารกิจคงที่หนึ่งภารกิจในการทดสอบ หลังจากทดสอบเพิ่มเติมในภายหลัง คะแนนและอันดับอาจเปลี่ยนแปลงได้
