动察 Beating AI ข่าวด่วน ถังเจี๋ย ผู้ร่วมก่อตั้งจื้อผู่ เปิดเผยบทความยาว复盘 Scaling Law ในช่วงไม่กี่ปีที่ผ่านมา ทุกครั้งที่มีการเปิดตัวโมเดลขนาดใหญ่ คำถามยอดฮิตคือ "มีพารามิเตอร์เท่าไหร่" แต่ในมุมมองของถังเจี๋ย พารามิเตอร์ไม่สามารถอธิบายความสามารถของโมเดลได้เพียงลำพังอีกต่อไป ข้อมูลมีเท่าไหร่ กำลังคำนวณใช้ไปที่ไหน และโมเดลจะถูกใช้งานอย่างไรในอนาคต ล้วนมีความสำคัญเท่าเทียมกัน
อุตสาหกรรมเคยเดินหลงทางมาแล้วครั้งหนึ่ง ในปี 2020 Scaling Law ของ Kaplan และคณะเชื่อว่า เมื่อเพิ่มกำลังคำนวณ พารามิเตอร์ควรเติบโตเร็วกว่าข้อมูลฝึกฝน GPT-3, Gopher, MT-NLG ต่างก็ขยายใหญ่ขึ้นเรื่อยๆ ตามแนวทางนี้ อุตสาหกรรมพุ่งไปสู่พารามิเตอร์ระดับล้านล้าน
ในปี 2022 Chinchilla ทดลองใหม่และพบว่าปัญหาอยู่ตรงนี้พอดี โมเดลขนาดใหญ่หลายตัวถูกสร้างให้ใหญ่เกินไป แต่ข้อมูลที่ป้อนกลับไม่เพียงพอ เมื่อเพิ่มกำลังคำนวณต่อไป พารามิเตอร์และข้อมูลควรเติบโตไปพร้อมกัน ถังเจี๋ยมองย้อนกลับไป การแข่งขันพารามิเตอร์ล้านล้านครั้งนั้น คือทางอ้อมที่อุตสาหกรรมทั้งหมดเดินผ่านด้วยกัน แล้วต่อมาก็หันหลังกลับ
แต่ที่ Chinchilla คำนวณยังเป็นเพียงบัญชีการฝึกฝนเท่านั้น เมื่อโมเดลถูกใช้งานจริง จะถูกเรียกใช้ซ้ำแล้วซ้ำเล่า ต้นทุนการอนุมานระยะยาวยิ่งสำคัญมากขึ้น เมื่อรวมส่วนนี้เข้าไปด้วย วิธีที่ดีที่สุดก็จะเปลี่ยนไป โมเดลอาจเล็กลงได้ แล้วใช้ข้อมูลมากขึ้นฝึกให้สมบูรณ์ยิ่งขึ้น ต่อมาโมเดลอย่าง Llama-2-7B, Gemma-2-9B ก็เริ่มเดินไปในทิศทางนี้แล้ว
ต่อจากนั้น MoE ก็ทำให้ปัญหาซับซ้อนยิ่งขึ้น พารามิเตอร์รวมที่มากขึ้น มักหมายถึงสามารถเก็บความรู้ได้มากขึ้น ส่วนพารามิเตอร์ที่คำนวณจริงและความลึกของการคำนวณในแต่ละครั้ง ส่งผลต่อความสามารถในการอนุมานมากกว่า ทั้งสองไม่ควรปะปนกัน ถึงปี 2025 งานวิจัยใหม่พบเพิ่มเติมว่า งานที่แตกต่างกัน แม้แต่วิธี Scaling ที่เหมาะสมที่สุดก็ไม่เหมือนกัน ความจำพึ่งพาพารามิเตอร์มากกว่า การอนุมานพึ่งพาข้อมูลมากกว่า ใน MoE การเพิ่มพารามิเตอร์รวมอย่างเดียวอาจฉุดรั้งการอนุมาน การเพิ่มผู้เชี่ยวชาญที่คำนวณจริงกลับมีประสิทธิภาพมากกว่า
การค้นหาช่องโหว่เป็นตัวอย่างที่เห็นได้ชัด การค้นพบช่องโหว่ใหม่ ไม่ใช่แค่ท่อง CVE เพิ่มอีกสองสามรายการ สิ่งที่ยากจริงคือการเดิน推理ยี่สิบขั้นให้ครบโดยไม่ขาดตอน พารามิเตอร์มาก ไม่ได้หมายความว่าจะคิดลึกกว่าเสมอไป
GLM-5.3 คือการพิสูจน์ที่ถังเจี๋ยนำออกมาครั้งนี้ มันใช้ฐานเดียวกัน สถาปัตยกรรมเดียวกันกับ GLM-5.2 พารามิเตอร์รวมและพารามิเตอร์ที่เปิดใช้งานไม่เปลี่ยนแปลง ทีมงานเพียงฝึกต่ออีกหนึ่งเดือน เน้นขยายสภาพแวดล้อมงานระยะยาวและการเรียนรู้เสริมแรง ความสามารถก็ยังเพิ่มขึ้นอย่างชัดเจน ครั้งนี้ที่เพิ่มไม่ใช่พารามิเตอร์ แต่เป็นการฝึกหลัง (post-training)
ข้อสรุปสุดท้ายของถังเจี๋ยชัดเจนมาก Scaling ยังไม่จบสิ้น ขนาดโมเดล ข้อมูลฝึกฝนล่วงหน้า กำลังคำนวณที่ใช้ในแต่ละครั้ง และความลึกของการฝึกหลัง ยังมีพื้นที่อีกมาก เพียงแต่คอขวดของโมเดลแต่ละรุ่นต่างกัน จุดที่ควรเพิ่มมากที่สุดก็จะเปลี่ยนไป
การแข่งขันรอบต่อไปของโมเดลขนาดใหญ่ อาจไม่ใช่ว่าใครมีพารามิเตอร์มากที่สุด แต่เป็นว่าใครรู้ดีกว่าว่ากำลังคำนวณควรใช้ไปที่ไหน
