lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

Laminar ลดต้นทุนการตรวจสอบข้อผิดพลาดของ Agent ลงเหลือ 1/23 ของ GPT-6-sol

动察 Beating ข่าวด่วน AI แพลตฟอร์มตรวจสอบ AI Agent Laminar เปิดตัวโมเดล flow-1 ที่ออกแบบมาเพื่อตรวจสอบเส้นทางการทำงานของ Agent โดยเฉพาะ มันจะอ่านการเรียกใช้โมเดล การเรียกใช้เครื่องมือ และผลลัพธ์ที่ส่งกลับ เพื่อค้นหาว่า Agent ผิดพลาดที่ขั้นตอนใด และเพราะเหตุใด


flow-1 ทำงานอยู่ภายใน Signals agent ของ Laminar โมเดลสามารถค้นหา trace ทั้งหมด (บันทึกการทำงานที่สมบูรณ์ของ Agent) และดูขั้นตอนเฉพาะได้ตามต้องการ ในการฝึก โมเดล Laminar เริ่มจากการปรับแต่งแบบมีผู้สอนด้วยข้อมูลการสอบสวนสังเคราะห์ จากนั้นฝึกด้วยการเรียนรู้แบบเสริมกำลังสำหรับการเรียกใช้เครื่องมือและการวิเคราะห์ trace ที่ซับซ้อน


ในการทดสอบ trace ยาก 523 รายการที่ Laminar สร้างขึ้นเอง flow-1 มีค่า F1 ในการตรวจจับข้อผิดพลาดอยู่ที่ 0.835 ขณะที่ GPT-6-sol อยู่ที่ 0.816 โดย sol มีค่า recall สูงกว่า สามารถค้นหาข้อผิดพลาดจริงได้มากกว่า ส่วน flow-1 มีค่า precision สูงกว่า มีการรายงานผลบวกลวงน้อยกว่า


สำหรับ trace ที่มี LLM tokens ต่ำกว่า 100,000 flow-1 มีค่าใช้จ่ายเฉลี่ยประมาณ 0.0011 ดอลลาร์ต่อการวิเคราะห์หนึ่งรายการ ขณะที่ GPT-6-sol อยู่ที่ประมาณ 0.026 ดอลลาร์ ตามการคำนวณของ Laminar เงิน 1 ดอลลาร์สามารถวิเคราะห์ได้ประมาณ 888 รายการและ 38 รายการตามลำดับ ต่างกันประมาณ 23 เท่า ค่าใช้จ่ายของ flow-1 ยังต่ำกว่า GPT-6-luna ประมาณ 25%


ปัจจุบันผลลัพธ์เหล่านี้ล้วนมาจาก benchmark ที่ Laminar สร้างขึ้นเอง ยังไม่มีการทดสอบซ้ำจากบุคคลที่สาม ข้อมูลการฝึกของ flow-1 ส่วนใหญ่มาจากเวิร์กโฟลว์สังเคราะห์ ซึ่งประมาณ 48% เป็นงานวิศวกรรมซอฟต์แวร์ ชุมชนได้ตั้งข้อสงสัยแล้วว่ามันจะรักษาประสิทธิภาพเดียวกันได้หรือไม่เมื่อเผชิญกับความผิดพลาดรูปแบบใหม่ที่ไม่ได้ออกแบบไว้ล่วงหน้าในสภาพแวดล้อมการผลิตจริง

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น