动察 Beating ข่าวด่วน AI เทนเซ็นต์ Hunyuan ร่วมกับมหาวิทยาลัยชิงหัวและมหาวิทยาลัยปักกิ่งเปิดตัว IWC-Bench สำหรับประเมินว่าเว็บเพจที่สร้างโดย AI ใช้งานได้จริงแค่ไหน
การประเมินการสร้างเว็บเพจหลายแห่งดูแค่โค้ดหรือภาพหน้าจอ หน้าอาจดูสวยงามและโค้ดก็เขียนฟังก์ชันไว้จริง แต่ปุ่มกดไม่ได้ ฟอร์มส่งไม่ได้ เปลี่ยนหน้าแล้ว error ปัญหาเหล่านี้ตรวจสอบแบบ static ได้ยาก
IWC-Bench เหมือนการตรวจรับแบบคนจริง มันให้ Agent เปิดเว็บเพจจริง คลิกปุ่ม พิมพ์เนื้อหา สลับหน้า แล้วตรวจว่าฟังก์ชันใดทำงานได้จริง สุดท้ายประเมินสามอย่างแยกกัน: หน้าสวยไหม ใช้งานลื่นไหม และฟังก์ชันที่ผู้ใช้ขอทำได้หรือไม่
基準รวบรวมความต้องการผู้ใช้จริง 369 รายการและเกณฑ์ตรวจรับ 5088 ข้อ โมเดล 17 ตัวสร้างเว็บแอปทั้งหมด 6273 แห่ง ในการเปรียบเทียบที่มนุษย์ตรวจซ้ำอีก 197 กลุ่ม IWC-Bench ตรงกับที่มนุษย์เลือก 168 กลุ่ม อัตราความสอดคล้อง 85.3%
ผลลัพธ์ยังชี้ว่าเว็บที่ "ดูดี" กับ "ใช้งานดีจริง" ไม่ใช่เรื่องเดียวกัน GPT-5.6-Sol มีความสวยงามของหน้าสูงสุด แต่ความง่ายในการใช้งานอยู่อันดับหก เมื่อดูเว็บแต่ละหน้า ความสวยงามแทบไม่บอกว่าใช้งานดีไหม ค่าสหสัมพันธ์ของสองอย่างนี้มีเพียง 0.36
