ตามการติดตามของ Beating แพลตฟอร์มระบบอัตโนมัติเวิร์กโฟลว์ Zapier ร่วมมือกับหน่วยงานประเมินผล Artificial Analysis เปิดตัวเกณฑ์มาตรฐานการประเมินระบบอัตโนมัติเวิร์กโฟลว์ SaaS แบบอิสระชื่อ AutomationBench-AA
เกณฑ์มาตรฐานนี้อิงจากข้อมูลจริงที่ถอดรหัสบนแพลตฟอร์ม Zapier โดยออกแบบชุดทดสอบส่วนตัวที่ประกอบด้วยงานหลายขั้นตอน 657 รายการและสภาพแวดล้อมซอฟต์แวร์ SaaS จำลอง 40 รายการ (รวมถึง Gmail, Slack, Salesforce, Jira ฯลฯ) เพื่อการประเมินโดยบุคคลที่สามอย่างเป็นกลาง
จุดที่เข้มงวดของการทดสอบคือการนำแนวป้องกันความปลอดภัยและข้อกำหนดด้านการปฏิบัติตามกฎระเบียบ (Guardrails) เข้ามาใช้ โมเดลขนาดใหญ่ต้องดำเนินการให้สำเร็จโดยไม่ละเมิดกฎทางธุรกิจขององค์กรที่กำหนดไว้ล่วงหน้า หากเกิดการละเมิดข้อกำหนดใดๆ ระหว่างการดำเนินการ คะแนนสุดท้ายของงานจะถูกปรับเป็นศูนย์ทันที ในการประเมินรอบแรก โมเดลขนาดใหญ่ส่วนใหญ่มีคะแนนลดลงอย่างรวดเร็วเนื่องจากการลงโทษจากแนวป้องกันการปฏิบัติตามกฎระเบียบ ส่งผลให้คะแนนสุดท้ายไม่มีโมเดลใดเกินครึ่ง
ในจำนวนนี้ Claude Fable 5 ซึ่งใช้กลไกลดระดับความปลอดภัยแบบ "ถอยกลับไปใช้ Opus 4.8 สำหรับงานยาก (ประมาณ 18%)" สามารถทำงานตามเป้าหมายได้จริง 73% ในขั้นตอนงานบริสุทธิ์ แต่คะแนนรวมอยู่ที่เพียง 48.6% ส่วน Gemini 3.5 Flash และ GPT-5.5 แม้จะทำงานสำเร็จเกือบเจ็ดในสิบ (68% และ 67% ตามลำดับ) แต่คะแนนสุดท้ายลดลงเหลือ 42.6% และ 42.1% ส่วนผู้นำโอเพนซอร์ส GLM-5.2 ได้เพียง 27.8%
การทดสอบชี้ให้เห็นว่า การที่โมเดลจะรักษาแนวป้องกันความปลอดภัยในการทำงานอัตโนมัติได้อย่างไร กลายเป็นความท้าทายสำคัญในการนำไปใช้งานจริง
