ตามการติดตามของ 动察 Beating การปรับปรุงตนเองแบบวนซ้ำกำลังถูกนำไปใช้กับ Harness อย่างเป็นรูปธรรมมากขึ้นเรื่อยๆ ล่าสุด การออกแบบสองชุดของ Pi และ DeepSeek Harness ได้เติมเต็มฐานรากสำคัญสองประการพอดี: หนึ่งทำให้ Agent ทำงานได้ยาวนานพอ อีกหนึ่งทำให้ตัว Agent เองแก้ไขได้ง่ายพอ
ข้อกำหนด Harness V3 ล่าสุดของ Pi ออกแบบ Agent ให้เป็นรันไทม์แบบถาวรที่กู้คืนได้ ก่อนการเรียกโมเดลและเครื่องมือ จะบันทึกเจตนาการดำเนินการก่อน เมื่อเสร็จสิ้นจึงเขียนผลลัพธ์และสถานะขั้นตอนถัดไป เมื่อกระบวนการล่ม ระบบจะรู้ว่างานหยุดอยู่ตรงไหน การดำเนินการใดสามารถรันซ้ำได้อย่างปลอดภัย และการดำเนินการใดมีผลข้างเคียงที่ไม่ควรทำซ้ำอีกครั้ง หาก Agent จะทำงานระยะยาว สิ่งแรกคือต้องไม่ล่มครั้งเดียวแล้วต้องเริ่มต้นใหม่ทั้งหมด
DeepSeek Harness เติมเต็มอีกครึ่งหนึ่ง Cordis ทำให้ตัวปรับ适配โมเดล ระบบเครื่องมือ Session Log และแม้แต่ Agent Loop กลายเป็นคอมโพเนนต์ที่ประกอบรวมกันได้ โหมดสร้างสรรค์ยังอนุญาตให้ Agent ตรวจสอบสภาพแวดล้อม Cordis ในระหว่างรันไทม์ กำหนด โหลด และยกเลิกคอมโพเนนต์ใหม่ได้ชั่วคราว
Pi ทำให้สถานะการดำเนินการสามารถสืบเนื่องได้ DeepSeek ทำให้โครงสร้างองค์ประกอบของ Agent สามารถจัดระเบียบใหม่ได้แบบไดนามิก
นี่คือทิศทางที่翁荔 คาดการณ์ไว้ในการอภิปรายเกี่ยวกับ Harness และการปรับปรุงตนเองแบบวนซ้ำเมื่อเดือนกรกฎาคม RSI ในระยะใกล้อาจไม่เริ่มจากการที่โมเดลเขียนน้ำหนักใหม่โดยตรง เส้นทางที่สมจริงกว่าคือการปรับปรุงบริบทและเวิร์กโฟลว์ก่อน จากนั้นเจาะลึกไปที่โค้ด Harness และสุดท้ายแม้แต่ "วิธีปรับปรุง Harness" เองก็กลายเป็นเป้าหมายของการปรับปรุง
ตอนนี้ยังขาดชิ้นส่วนที่สาม: การตรวจสอบที่แม่นยำ การวิจัย Agent ที่วิวัฒนาการตนเองได้ระบุการประเมินผลและความปลอดภัยเป็นปัญหาหลัก Agent สามารถทำงานระยะยาวและแก้ไขตัวเองได้ แต่หากแม้แต่ "สิ่งที่เรียกว่าความก้าวหน้า" ก็สามารถเปลี่ยนแปลงไปพร้อมกันได้ ก็ง่ายที่จะปรับให้เหมาะสมเพื่อผ่านการทดสอบของตัวเอง 翁荔 ยังเน้นย้ำเป็นพิเศษว่า verifier, tracer และขอบเขตความปลอดภัยควรอยู่นอกวงจรการแก้ไขตนเอง
ดังนั้น วงจรปิด RSI ที่แท้จริง อย่างน้อยต้องแก้สามสิ่ง: ทำงานได้นาน แก้ไขได้ และตรวจสอบได้แม่นยำ Pi กำลังเติมเต็มชิ้นแรก DeepSeek กำลังเติมเต็มชิ้นที่สอง และชิ้นที่สามเป็นตัวกำหนดว่า "วิวัฒนาการ" นี้ท้ายที่สุดคือการเติบโตของความสามารถจริง หรือแค่เรียนรู้ที่จะผ่านข้อสอบที่ตัวเองสร้างขึ้น
การแก้ไขตัวเองได้เป็นเพียงจุดเริ่มต้นของวิวัฒนาการ การพิสูจน์ว่าตัวเองแข็งแกร่งขึ้นจริงต่างหาก คือกิโลเมตรสุดท้ายที่ยากที่สุดของ RSI
