动察 Beating ข่าวด่วน AI Anthropic ได้เพิ่มชุดเวิร์กโฟลว์ปรับแต่งอัตโนมัติให้กับ claude-api Skill อย่างเป็นทางการของ Claude Code โดย build-eval จะสร้างชุดทดสอบและวิธีการให้คะแนนจากบทสนทนาจริง บั๊ก หรือเคสที่มนุษย์สร้างขึ้นก่อน จากนั้น hillclimb จะให้ Claude Code ปรับแก้ System Prompt คำอธิบายเครื่องมือ โมเดล และระดับการ推理ซ้ำแล้วซ้ำเล่า ทุกครั้งที่แก้เสร็จจะรันทดสอบใหม่ ถ้าผลลัพธ์ดีขึ้นก็เก็บไว้ ถ้าแย่ลงก็ย้อนกลับ
เพื่อหลีกเลี่ยงไม่ให้ Claude ปรับแต่งเฉพาะข้อสอบ มันจะไม่นำตัวอย่างทั้งหมดมาปรับพร้อมกัน เคสบางส่วนใช้สำหรับค้นหาปัญหาและแก้ไขการตั้งค่า อีกชุดหนึ่งเก็บไว้ตรวจสอบว่าการแก้ไขใช้ได้กับปัญหาที่ไม่เคยเห็นหรือไม่ ถ้าคะแนนข้างหน้าสูงขึ้นแต่ผลทดสอบที่เก็บไว้ไม่ดีขึ้น การแก้ไขครั้งนี้อาจถูกตัดสินว่า overfit และถูกถอนกลับ
Anthropic สาธิตกระบวนการนี้ด้วยตั๋วบริการลูกค้า 44 ใบ Claude Code ทำความสะอาด Prompt เสริมกฎทางธุรกิจ ลองใช้โมเดลต่างๆ และลดระดับการ推理 ลงเรื่อยๆ สุดท้ายพบชุดการตั้งค่า Sonnet 5 แบบ low effort บนตั๋ว 14 ใบที่ไม่ได้เข้าร่วมการปรับแต่ง ความแม่นยำเพิ่มจาก 78.6% ของการตั้งค่าเริ่มต้นเป็น 90.5% และต้นทุนลดลงเหลือประมาณหนึ่งในห้าของเดิม
