動察 Beating AI ข่าวด่วน Boris Cherny หัวหน้าทีม Claude Code โพสต์ระบุว่า การป้องกันการฉีดพรอมpt์ของ GPT-6 Astra นั้น "ใกล้เคียง" กับ Gemini Flash และ Claude Opus 4.8 แล้ว พร้อมชมว่าโมเดล Claude ของตัวเองได้ "แก้ไขปัญหาในทางปฏิบัติ" ไปแล้วเมื่อประมาณสองเดือนก่อน การฉีดพรอมpt์คือการซ่อนคำสั่งอันตรายไว้ในเนื้อหา เช่น เว็บเพจหรือเอกสาร เพื่อหลอกให้ Agent รั่วไหลข้อมูลหรือดำเนินการที่เสี่ยงภัย
Boris ยังกล่าวอีกว่า การประเมินแบบเปิดเผยและเอ่ยชื่อห้องปฏิบัติการอื่นๆ เป็นวิธีที่ดีในการผลักดันให้พวกเขาฝึกโมเดลที่ปลอดภัยยิ่งขึ้น "เราจะทำแบบนี้ต่อไปจนกว่าห้องปฏิบัติการอื่นๆ จะให้ความสำคัญกับความปลอดภัยมากขึ้น"
โพสต์ดังกล่าวถูกโต้แย้งอย่างรวดเร็วด้วย Community Note บน X การประเมินอิสระจาก Gray Swan แสดงให้เห็นว่า ไม่มีโมเดลใดที่ถูกทดสอบสามารถป้องกันการฉีดพรอมpt์ได้อย่างสมบูรณ์ และ Claude ก็มีกรณีการโจมตีที่สำเร็จเช่นกัน นักวิจัยด้านความปลอดภัยอีกคนยังใช้เว็บเพจที่ออกแบบพิเศษโจมตี Claude Code Opus 5 Auto Mode โดยได้อัตราความสำเร็จ 60%–80% ในการทดสอบขนาดเล็ก
ต่อมา Thibault Sottiaux หัวหน้าฝ่ายผลิตภัณฑ์หลักของ OpenAI ได้เขียนโต้กลับโดยล้อเลียนรูปแบบประโยคของ Boris เขากล่าวว่าตนดีใจที่เห็นฟีเจอร์การควบคุมคอมพิวเตอร์เบื้องหลังใหม่ของ Claude Code ตามทัน Codex ได้ในที่สุด "และเป็นเวอร์ชันของเราเมื่อเดือนพฤษภาคมปีนี้ด้วย"
ต่อมา Boris ยอมรับว่า โพสต์ต้นฉบับ "ดูประชดประชันเกินกว่าที่ตั้งใจ" และย้ำว่าตนชื่นชมความก้าวหน้าของ Astra อย่างจริงจัง พร้อมชี้แจงว่าการกล่าวว่า "แก้ไข" การฉีดพรอมpt์แล้ว หมายถึงผลลัพธ์ของผลิตภัณฑ์ที่เกิดจากการผสมผสานระหว่างโมเดล Claude กลไกตรวจจับการฉีด และโหมด Auto Mode ไม่ใช่ตัวโมเดลเองที่ภูมิคุ้มกันแล้ว
