动察 Beating ข่าวด่วน AI เทนเซ็นต์นำ Qwen3.5-122B-A10B มาฝึกเฉพาะทางสำหรับ Terminal Agent จนได้ T1 โดยเน้นจัดการงานซับซ้อนใน Linux Terminal งานเดียวสามารถเรียกใช้เครื่องมือต่อเนื่องได้มากกว่า 300 รอบ คะแนน Terminal-Bench 2.1 เพิ่มจาก 43.8% ของโมเดลฐานเป็น 64.0% เพิ่มขึ้น 20.2 คะแนน
ใน 20.2 คะแนนนี้ ส่วนใหญ่มาจาก Reinforcement Learning SFT ดันคะแนนขึ้นเพียง 49.4% จากนั้น Reinforcement Learning เพิ่มอีก 14.6 คะแนน ทีมเตรียมงาน Terminal ประมาณ 15,000 งาน แต่ละงานมีชุดทดสอบอัตโนมัติ Agent ไม่จำเป็นต้องทำงานทั้งหมดเสร็จ หากทำบางข้อกำหนดสำเร็จก็ได้รับรางวัลตามส่วน
งานยาวยังมีปัญหาอีกอย่าง ตอนที่ Agent ทำงานจริงกับตอนนำประสบการณ์那段มาฝึก เนื้อหาเดียวกันอาจถูกตัดเป็น token ต่างกัน และ MoE อาจสลับผู้เชี่ยวชาญชุดใหม่ T1 จะบันทึก token ที่สร้างขึ้นและผู้เชี่ยวชาญที่เลือกไว้ในขณะนั้น แล้ว replay ตรงๆ ตอนฝึก ช่วยลดความคลาดเคลื่อนระหว่างการฝึกกับการอนุมานได้ประมาณหนึ่งในสาม
