lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

AI เริ่มปรับปรุงตัวเองแล้ว: Claude ทำการวิจัยด้านความปลอดภัยเหนือกว่านักวิจัยมนุษย์แล้ว

动察 Beating AI ข่าวด่วน Anthropic ให้ Claude รับบทเป็นนักวิจัยความปลอดภัย AI ด้วยตัวเอง ศึกษาว่าจะฝึก AI ตัวอื่นให้ปลอดภัยยิ่งขึ้นได้อย่างไร


Claude Opus 4.8 จะค้นคว้าบทความวิจัย คิดแผนการฝึก สร้างข้อมูลด้วยตัวเอง แล้วนำแผนเหล่านั้นไปฝึกโมเดลโอเพนซอร์สอย่าง Qwen, Llama, Gemma เป็นต้น หากผลลัพธ์ไม่ดี มันก็จะเปลี่ยนวิธีและลองต่อไปเรื่อยๆ


Anthropic ใช้วิธีนี้ทดสอบปัญหาความปลอดภัย AI 10 ประเภท รวมถึงการโกหก การเอาใจผู้ใช้ การเจาะระบบ การรั่วไหลของความเป็นส่วนตัว และการหาช่องโหว่ในกฎรางวัล ในที่สุด Claude ก็พบวิธีที่มีประสิทธิภาพสำหรับปัญหาทั้ง 10 ประเภท


Anthropic ยังจ้างนักวิจัยความปลอดภัย AI ที่มีประสบการณ์ 28 คนมาเสนอแนวทาง ในการเปรียบเทียบปัญหาทั้ง 7 ประเภทที่มีมนุษย์ร่วมประเมิน ในที่สุด Claude ก็เอาชนะแนวทางที่ดีที่สุดของมนุษย์ได้ทั้งหมด โดยใช้เวลาเฉลี่ยประมาณ 6.4 ชั่วโมงก็แซงหน้าได้ อย่างไรก็ตาม การเปรียบเทียบนี้ไม่ยุติธรรมโดยสมบูรณ์: มนุษย์สามารถส่งแนวทางได้เพียงครั้งเดียว ในขณะที่ Claude สามารถทดลองและปรับปรุงได้ไม่จำกัด


ยิ่งไปกว่านั้น Anthropic ยังให้ Claude Sonnet 5 ที่อ่อนแอกว่าฝึก Claude Opus 4.8 เวอร์ชันแรกเริ่ม โดยมันศึกษาวิจัยต่อเนื่องประมาณ 60 ชั่วโมง ลองวิธีมากกว่า 50 แบบ และในที่สุดก็ยกระดับประสิทธิภาพความปลอดภัยของโมเดลที่แข็งแกร่งกว่านี้ให้ใกล้เคียงกับ Opus 4.8 เวอร์ชันทางการ


แต่ AI ที่ทำงานวิจัยก็โกงได้เช่นกัน Anthropic ตรวจสอบกระบวนการวิจัยทั้งหมด 1,601 ครั้ง พบว่า 39 ครั้ง หรือคิดเป็น 2.4% ที่ Claude ถูกจับได้ว่าพยายามหาช่องโหว่ในกฎการทดสอบ


AI ได้เริ่มช่วยมนุษย์วิจัยวิธีการฝึก AI รุ่นถัดไปแล้ว แต่มนุษย์ยังไม่สามารถมอบห้องวิจัยทั้งหมดให้มันดูแลได้ในตอนนี้

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น