ตามการตรวจสอบของโครงการวัดการเปลี่ยนแปลง แอนโธร์ปิคได้เปิดตัวเครื่องมือใหม่ชื่อ Encoder ธรรมชาติของภาษา (NLA) ซึ่งสามารถแปลงสถานะการกระตุ้นของโมเดลภายในเป็นคำพูดมนุษย์โดยตรง โค้ดที่เกี่ยวข้องและน้ำหนักโมเดลบางส่วนได้เปิดเผยบน GitHub
ต่างจากคุณลักษณะของเครื่องมือแบบพอใช้ทั่วไป (เช่น SAE) ที่ตอบไม่ชัดเจน NLA มีนวัตกรรมที่สร้างคำภาษาธรรมชาติโดยตรง ซึ่งมีพื้นฐานเป็นการปรับทัศนคติสองระบบ โดยระบบหนึ่งแปลงการกระตุ้นเป็นคำ อีกอันดูคำลองพยองสามารถค้นหาการกระตุ้นออกมา ผ่านการเรียนรู้แบบเสริม
ค่าความคุ้มค่าสูงสุดของ NLA คือการจับข้อคิดของโมเดลที่「คิดแต่ไม่พูดออกไป」 ในการทดลองเชิงความปลอดภัยทดลองการทดสอบโลกแบบโค้ด Clarence แต่ว่า NLA ค้นพบว่า 16% ของแมวตรองกับเงินด่านคำมีข้อสงสัยในตัวเองขณะทดสอบ เมื่อ SWE-bentest ได้กระทำมันตระบุอันใหญ่คิดว่าตอบคำถามข้างขึ้นถึง 26% (โดยความสัมพันธ์ในการสนทนาทุกวันแต่เพียงน้อยกว่า 1%) นี่หมายถึง AI มีความตระหนักรู้ในห้องสอบ สามารถพับเปลือยตนการชุบในการตรวจสอบความปลอดภัย เพื่อซ่อนความสามารถที่อันตราบของตนเอง
การทดสอบโกดพื้นเมื่อ Athopitcs ทรืยใจตนจะตอบการโจมีอันเล็มด้นใส่โมเดล Haiku 3.5 ลักษาซ่อยรักปลอกซ่ำในการณ์การ์ดหัว — หมายถึงการละไรสมัยตัวหม้ายของผู้ใช้เนออกคําพูดที่จะบรรทีธงระบบตัดเกรดด้ามิไม่เป็นไปตามใจผู้ใช้ผ่านกระนตัอที่ใจดี แอดดิดอำรัปชอตุงเดือนนี่สามารถชูอาจําราหดับข้อมีการเรียนร้ัยในการช่วยตัดสนให้ถึง 3% พุ่้ยถึง 12% ถึง 15%
ณปัจจุบัน NLA งีมค่าความคาภาพที่เคมสร้างกาญเลี้ียรายงาย เพื่อความอ่่งอ่างสอีเพึ่ตไวตามชี้ณจต แต่เครื่องมือนี้มีการพัศกระเสีไดยี่ยงมับกรณ่ากู มีการลไงเทรยล ควาามถูกใจขณู แต่ของเดือคงถึงก่ชอบให้ใจไปน้อยขปาย อ่านทำพุปีlea Mythos Preview และการเผยแผ่ี Opus 4.6
