动察 Beating ข่าวด่วน AI Nous Research เปิดตัว Hermes Index ซึ่งเป็นอันดับโมเดลสำหรับ Hermes Agent ใช้หลักในการเปรียบเทียบประสิทธิภาพของโมเดลต่างๆ ใน Hermes โมเดลทั้งหมดใช้กรอบการทำงาน Hermes Agent ชุดเดียวกัน และโมเดลที่รองรับการปรับความเข้มข้นของการอนุมานจะถูกตั้งเป็น high ทั้งหมด อันดับนี้ใช้คะแนนเฉลี่ยจากการทดสอบ 4 รายการ ได้แก่ Hermes Bench, Terminal-Bench 4, Terminal-Bench Science และ SkillsBench พร้อมทั้งสถิติต้นทุนเฉลี่ยต่องาน
โดย Hermes Bench เป็นการทดสอบใหม่ที่ Nous Research สร้างขึ้นเอง มีทั้งหมด 150 งาน 25 ประเภทสถานการณ์ ครอบคลุม Skills การวิจัย แผนภูมิและการสร้างสรรค์ หน่วยความจำ การเรียกใช้เครื่องมือ และความปลอดภัย Agent จะจัดการพื้นที่ทำงานและไฟล์จริงโดยตรง และให้คะแนนจากไฟล์ที่สร้างขึ้น สถานะงาน และบันทึกการใช้เครื่องมือ
เวอร์ชันแรกทดสอบทั้งหมด 14 โมเดล Claude Opus 5.5 ได้ 63.31 คะแนน เป็นอันดับหนึ่ง GPT 6 Astra ได้ 56.25 คะแนน เป็นอันดับสอง Claude Sonnet 5.5 ได้ 53.14 คะแนน เป็นอันดับสาม Astra มีค่าใช้จ่ายเฉลี่ยต่องาน 11.61 ดอลลาร์ สูงที่สุดในอันดับทั้งหมด Opus 5.5 อยู่ที่ 4.99 ดอลลาร์ และ Sonnet 5.5 อยู่ที่ 2.82 ดอลลาร์ โดยข้อมูลบางส่วนของทั้งสองยังถูกทางการระบุว่าเป็นข้อมูลชั่วคราว
ในกลุ่มโมเดลราคาถูก DeepSeek V4.1 Flash ได้ 36.91 คะแนน ค่าใช้จ่ายเฉลี่ยต่องาน 0.259 ดอลลาร์ GPT 6 Luna ได้ 33.89 คะแนน ต่องาน 0.141 ดอลลาร์ ทั้งสองอยู่ใน Pareto frontier ด้านต้นทุนและประสิทธิภาพ กล่าวคือไม่มีโมเดลที่มีราคาต่ำกว่าและได้คะแนนสูงกว่าในเวลาเดียวกัน
