lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

แตะเส้นแดงเมื่อไหร่ก็เป็นศูนย์: Zapier เปิดตัวการประเมิน AI อัตโนมัติใหม่ โมเดลที่แข็งแกร่งที่สุดก็ยังได้คะแนนลดลงครึ่งหนึ่ง

ตามการติดตามของ Beating แพลตฟอร์มระบบอัตโนมัติเวิร์กโฟลว์ Zapier ร่วมมือกับหน่วยงานประเมินผล Artificial Analysis เปิดตัวเกณฑ์มาตรฐานการประเมินระบบอัตโนมัติเวิร์กโฟลว์ SaaS แบบอิสระชื่อ AutomationBench-AA

เกณฑ์มาตรฐานนี้อิงจากข้อมูลจริงที่ถอดรหัสบนแพลตฟอร์ม Zapier โดยออกแบบชุดทดสอบส่วนตัวที่ประกอบด้วยงานหลายขั้นตอน 657 รายการและสภาพแวดล้อมซอฟต์แวร์ SaaS จำลอง 40 รายการ (รวมถึง Gmail, Slack, Salesforce, Jira ฯลฯ) เพื่อการประเมินโดยบุคคลที่สามอย่างเป็นกลาง

จุดที่เข้มงวดของการทดสอบคือการนำแนวป้องกันความปลอดภัยและข้อกำหนดด้านการปฏิบัติตามกฎระเบียบ (Guardrails) เข้ามาใช้ โมเดลขนาดใหญ่ต้องดำเนินการให้สำเร็จโดยไม่ละเมิดกฎทางธุรกิจขององค์กรที่กำหนดไว้ล่วงหน้า หากเกิดการละเมิดข้อกำหนดใดๆ ระหว่างการดำเนินการ คะแนนสุดท้ายของงานจะถูกปรับเป็นศูนย์ทันที ในการประเมินรอบแรก โมเดลขนาดใหญ่ส่วนใหญ่มีคะแนนลดลงอย่างรวดเร็วเนื่องจากการลงโทษจากแนวป้องกันการปฏิบัติตามกฎระเบียบ ส่งผลให้คะแนนสุดท้ายไม่มีโมเดลใดเกินครึ่ง

ในจำนวนนี้ Claude Fable 5 ซึ่งใช้กลไกลดระดับความปลอดภัยแบบ "ถอยกลับไปใช้ Opus 4.8 สำหรับงานยาก (ประมาณ 18%)" สามารถทำงานตามเป้าหมายได้จริง 73% ในขั้นตอนงานบริสุทธิ์ แต่คะแนนรวมอยู่ที่เพียง 48.6% ส่วน Gemini 3.5 Flash และ GPT-5.5 แม้จะทำงานสำเร็จเกือบเจ็ดในสิบ (68% และ 67% ตามลำดับ) แต่คะแนนสุดท้ายลดลงเหลือ 42.6% และ 42.1% ส่วนผู้นำโอเพนซอร์ส GLM-5.2 ได้เพียง 27.8%

การทดสอบชี้ให้เห็นว่า การที่โมเดลจะรักษาแนวป้องกันความปลอดภัยในการทำงานอัตโนมัติได้อย่างไร กลายเป็นความท้าทายสำคัญในการนำไปใช้งานจริง

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น