lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

Cua Driver เพิ่ม "ดวงตา" ให้ Agent: แม้แต่界面แบบพิกเซลล้วนก็ยังสามารถจดจำปุ่มและข้อความได้

动察 Beating ข่าวด่วน AI เครื่องมือโอเพนซอร์ส Computer Use อย่าง Cua ได้เพิ่มส่วนขยาย Perception แบบเลือกได้ให้กับ Cua Driver โดยเดิมที Driver จะค้นหาปุ่มผ่านโครงสร้างเว็บเพจและ accessibility tree ของระบบก่อน แต่เมื่อเจอ Canvas เกม รีโมทเดสก์ท็อป หรือแอปที่วาดเอง โครงสร้างเหล่านี้อาจว่างเปล่า Perception จะอ่านภาพหน้าจอโดยตรง แล้วแบ่งภาพออกเป็นพื้นที่ที่มีข้อความ ชนิด และตำแหน่ง เพื่อให้ Agent ดำเนินการต่อได้


เวอร์ชันแรกใช้ OmniParser ตรวจจับไอคอนและ控件 ใช้ PP-OCR อ่านข้อความ กระบวนการแยกวิเคราะห์ทั้งหมดทำบน CPU ของเครื่องเอง ไม่ต้องใช้ GPU และไม่ส่งภาพหน้าจอออกเครือข่าย จากการทดสอบอย่างเป็นทางการ ภาพหน้าจอเดียวใช้เวลาประมาณ 2 ถึง 2.5 วินาทีบน macOS, 3.5 ถึง 4 วินาทีบน Linux และ 8 ถึง 9 วินาทีบน Windows โดยส่วนใหญ่ใช้เป็นตัวสำรองเมื่อโครงสร้างหน้าเว็บและ accessibility tree ใช้ไม่ได้ จะไม่รันการแยกวิเคราะห์ด้วยภาพทุกขั้นตอนเป็นค่าเริ่มต้น


Cua ยังจำกัดการนำภาพหน้าจอเก่ากลับมาใช้ซ้ำในการดำเนินการด้วยภาพ ทุกครั้งที่จดจำด้วยภาพจะผูกกับ `capture_id` ของภาพหน้าจอปัจจุบัน การคลิกที่ตามมาจะต้องมาจากภาพหน้าจอเดียวกัน หากภาพหน้าจอเกิน 60 วินาที หรือได้ดำเนินการไปแล้วหนึ่งครั้ง Driver จะปฏิเสธการใช้ต่อ เพื่อหลีกเลี่ยงการคลิกผิดตำแหน่งด้วยพิกัดเก่าหลังอินเทอร์เฟซเปลี่ยนแปลง


ที่จริงแล้ว Cua เคยสามารถระบุตำแหน่งด้วยภาพผ่าน `cua-som` และ OmniParser ได้แล้ว ตอนนี้ความสามารถนี้ถูกเชื่อมเข้าสู่ Cua Driver โดยตรง Agent ชั้นบนสามารถรับผลการจดจำผ่านอินเทอร์เฟซแบบรวม แม้โมเดลเองจะดูภาพไม่เป็น ก็สามารถตัดสินใจขั้นตอนถัดไปจากข้อมูลข้อความและพื้นที่เหล่านี้ได้


Perception ไม่ใช่คอมโพเนนต์เริ่มต้น โดยตัวตรวจจับ OmniParser ใช้สัญญาอนุญาต AGPL-3.0 ส่วน Cua Driver ยังคงใช้สัญญาอนุญาต MIT

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น