ตามการติดตามของ Beating สื่อสังเกตการณ์ ทีมวิจัยของ Apple ได้ทำการทดลอง reinforcement learning กับโมเดล 9 รุ่นและ 11 ภาษา เพื่อต้องการหาคำตอบว่า หากข้อมูลฝึกอบรมมีเพียงภาษาเดียว ความสามารถในการแก้โจทย์ที่โมเดลเรียนรู้มาจะสามารถนำไปใช้กับโจทย์ในภาษาอื่นได้หรือไม่
คำตอบคือ ได้ และผลลัพธ์ค่อนข้างชัดเจน การฝึกด้วยภาษาเพียงภาษาเดียวทำให้โมเดลแข็งแกร่งขึ้นในหลายภาษาอื่นไปพร้อมกัน
ตัวอย่างเช่น ในการทดสอบภาษาฝรั่งเศส การฝึกด้วยภาษาฝรั่งเศสโดยตรงทำให้คะแนนเฉลี่ยเพิ่มขึ้น 25.6 จุดเปอร์เซ็นต์ ส่วนการฝึกโดยไม่ใช้ภาษาฝรั่งเศสเลย แต่ใช้โจทย์ภาษาสเปนฝึกแทน ผลสอบภาษาฝรั่งเศสก็เพิ่มขึ้น 24.6 จุดเปอร์เซ็นต์ ต่างกันเพียง 1 จุดเปอร์เซ็นต์เท่านั้น
สิ่งที่โมเดลเรียนรู้ไม่ใช่แค่โจทย์ในภาษาใดภาษาหนึ่ง แต่ยังรวมถึงวิธีการแก้โจทย์บางส่วนที่สามารถนำไปใช้ข้ามภาษาได้ ดังนั้นในอนาคต หากต้องการฝึกการให้เหตุผลภาษาจีนของโมเดลให้แข็งแกร่ง ไม่จำเป็นต้องสร้างข้อมูล reinforcement learning ทั้งหมดใหม่เป็นภาษาจีนเสมอไป
แต่ภาษาที่ใช้ฝึกก็ไม่สามารถเปลี่ยนได้ตามอำเภอใจ เพราะภาษาบางภาษาอาจกระตุ้นให้ความสามารถเฉพาะด้านถดถอยลงได้ ในการใช้ reinforcement learning ชุดเดียวกัน หากเปลี่ยนภาษาฝึก โมเดลบางรุ่นอาจถดถอยลงอย่างชัดเจนในภาษาและงานอื่นๆ ในการทดลองที่รุนแรงที่สุด Qwen3-4B หลังจากฝึกด้วยภาษาสวาฮีลี ผลการทดสอบภาษาอังกฤษที่ไม่เคยเห็นระหว่างฝึกตกลงถึง 19.2 จุดเปอร์เซ็นต์เมื่อเทียบกับโมเดลดั้งเดิม ขณะที่การฝึกแบบหลายภาษาพร้อมกันกลับทำให้การทดสอบนี้เพิ่มขึ้น 4.5 จุดเปอร์เซ็นต์
งานวิจัยนี้ส่วนใหญ่ยืนยันกับโจทย์ประเภท reasoning ที่สามารถตรวจสอบความถูกต้องได้โดยอัตโนมัติ เช่น คณิตศาสตร์ ตรรกะ กราฟ เรขาคณิต เป็นต้น โจทย์เหล่านี้เมื่อเปลี่ยนภาษา วิธีการแก้ในระดับพื้นฐานมักไม่เปลี่ยนแปลง แต่สำหรับงานที่พึ่งพาตัวภาษาเองจริงๆ เช่น การอ่านเพื่อความเข้าใจ อุปมา การตัดสินเชิงความหมาย หรือความรู้ทางวัฒนธรรม งานวิจัยนี้ไม่ได้ทำการยืนยัน
