lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

การป้องกันการกลั่นกรองของ Claude อาจไม่ได้ผล: โมเดลขนาดเล็กสามารถดึงห่วงโซ่ความคิดของโมเดลขนาดใหญ่ได้โดยตรง

动察 Beating ตรวจสอบพบว่า ผู้ผลิตโมเดลขนาดใหญ่เพื่อป้องกันไม่ให้ความสามารถถูกกลั่นกรอง (distill) จึงซ่อนห่วงโซ่การคิดแบบเต็มรูปแบบ และให้ผู้ใช้เพียงบทสรุปเท่านั้น แต่ผลวิจัยล่าสุดพบว่า การป้องกันชั้นนี้อาจไม่แข็งแกร่งอย่างที่คิด: การนำห่วงโซ่การคิดที่เข้ารหัสของ Opus ไปให้ Haiku ซึ่งเป็นโมเดลที่อ่อนแอกว่าในค่ายเดียวกัน แล้วทำการเจลเบรก (jailbreak) Haiku ก็สามารถทำให้มันท่องจำการให้เหตุผลดั้งเดิมของ Opus ออกมาได้โดยตรง นักวิจัยทดสอบสำเร็จบน Claude, GPT และ Gemini

เรื่องนี้จริงๆ แล้วมีการปูพื้นมาหลายเดือนแล้ว ในเดือนพฤษภาคม Matthew Green นักวิทยาการเข้ารหัสพบว่า ห่วงโซ่การคิดที่เข้ารหัสเหล่านี้สามารถเล่นซ้ำได้ข้ามเซสชันและข้ามบัญชี แต่ในตอนนั้นยังไม่พบวิธีอ่านเนื้อหาอย่างเสถียร บทความใหม่นี้เติมเต็มขั้นตอนสุดท้าย: ไม่ต้อง破解อัลกอริทึมการเข้ารหัส แต่ให้โมเดลของผู้ผลิตเองช่วย "ถอดรหัส" ให้

ก่อนหน้านั้นในเดือนมีนาคม John X. Morris ผู้ร่วมก่อตั้งและหัวหน้าฝ่ายวิจัยของ Engram ในปัจจุบัน พร้อมด้วยคนอื่นๆ ยังได้พิสูจน์อีกเส้นทางหนึ่ง: แม้จะไม่สามารถเข้าถึงห่วงโซ่การคิดดั้งเดิมได้เลย แต่เพียงดูคำตอบและบทสรุปการให้เหตุผล ก็สามารถย้อนกลับมาสร้างชุดการให้เหตุผลสังเคราะห์โดยละเอียด แล้วนำไปใช้ฝึกโมเดลขนาดเล็กได้

这使得此前流传的「国内 AI 公司早已找到办法获取 Claude、Codex 原始推理,再拿去训练模型」的说法,在技术上更说得通了。但这仍只能证明方法可行,不能证明任何国内 AI 实验室实际这么做过。

บทความยังทดสอบ Kimi K3 ด้วย เพียงป้อน Token การให้เหตุผลของ Opus สองสามตัวเข้าไป การให้เหตุผลของ K3 หลังจากนั้นก็จะโน้มเอียงไปทาง Opus อย่างชัดเจน; ชิ้นส่วนการให้เหตุผลดั้งเดิมบางส่วนของ Claude และ GPT ที่สกัดจาก Kimi K3 มีความง่ายกว่าถึงประมาณ 6 ลำดับขนาดเมื่อเทียบกับโมเดลอื่นๆ แต่ผู้เขียนระบุชัดเจนว่าไม่สามารถใช้เป็นหลักฐานยืนยันการกลั่นกรองได้

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น