动察 Beating ข่าวด่วน AI เครื่องมือโอเพนซอร์ส Computer Use อย่าง Cua ได้เพิ่มส่วนขยาย Perception แบบเลือกได้ให้กับ Cua Driver โดยเดิมที Driver จะค้นหาปุ่มผ่านโครงสร้างเว็บเพจและ accessibility tree ของระบบก่อน แต่เมื่อเจอ Canvas เกม รีโมทเดสก์ท็อป หรือแอปที่วาดเอง โครงสร้างเหล่านี้อาจว่างเปล่า Perception จะอ่านภาพหน้าจอโดยตรง แล้วแบ่งภาพออกเป็นพื้นที่ที่มีข้อความ ชนิด และตำแหน่ง เพื่อให้ Agent ดำเนินการต่อได้
เวอร์ชันแรกใช้ OmniParser ตรวจจับไอคอนและ控件 ใช้ PP-OCR อ่านข้อความ กระบวนการแยกวิเคราะห์ทั้งหมดทำบน CPU ของเครื่องเอง ไม่ต้องใช้ GPU และไม่ส่งภาพหน้าจอออกเครือข่าย จากการทดสอบอย่างเป็นทางการ ภาพหน้าจอเดียวใช้เวลาประมาณ 2 ถึง 2.5 วินาทีบน macOS, 3.5 ถึง 4 วินาทีบน Linux และ 8 ถึง 9 วินาทีบน Windows โดยส่วนใหญ่ใช้เป็นตัวสำรองเมื่อโครงสร้างหน้าเว็บและ accessibility tree ใช้ไม่ได้ จะไม่รันการแยกวิเคราะห์ด้วยภาพทุกขั้นตอนเป็นค่าเริ่มต้น
Cua ยังจำกัดการนำภาพหน้าจอเก่ากลับมาใช้ซ้ำในการดำเนินการด้วยภาพ ทุกครั้งที่จดจำด้วยภาพจะผูกกับ `capture_id` ของภาพหน้าจอปัจจุบัน การคลิกที่ตามมาจะต้องมาจากภาพหน้าจอเดียวกัน หากภาพหน้าจอเกิน 60 วินาที หรือได้ดำเนินการไปแล้วหนึ่งครั้ง Driver จะปฏิเสธการใช้ต่อ เพื่อหลีกเลี่ยงการคลิกผิดตำแหน่งด้วยพิกัดเก่าหลังอินเทอร์เฟซเปลี่ยนแปลง
ที่จริงแล้ว Cua เคยสามารถระบุตำแหน่งด้วยภาพผ่าน `cua-som` และ OmniParser ได้แล้ว ตอนนี้ความสามารถนี้ถูกเชื่อมเข้าสู่ Cua Driver โดยตรง Agent ชั้นบนสามารถรับผลการจดจำผ่านอินเทอร์เฟซแบบรวม แม้โมเดลเองจะดูภาพไม่เป็น ก็สามารถตัดสินใจขั้นตอนถัดไปจากข้อมูลข้อความและพื้นที่เหล่านี้ได้
Perception ไม่ใช่คอมโพเนนต์เริ่มต้น โดยตัวตรวจจับ OmniParser ใช้สัญญาอนุญาต AGPL-3.0 ส่วน Cua Driver ยังคงใช้สัญญาอนุญาต MIT
