lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

จื้อผู่ ถังเจี๋ย ทบทวน Scaling Law: พารามิเตอร์ล้านล้านเป็นเส้นทางอ้อมที่อุตสาหกรรมทั้งหมดเดินร่วมกัน

动察 Beating AI ข่าวด่วน ถังเจี๋ย ผู้ร่วมก่อตั้งจื้อผู่ เปิดเผยบทความยาว复盘 Scaling Law ในช่วงไม่กี่ปีที่ผ่านมา ทุกครั้งที่มีการเปิดตัวโมเดลขนาดใหญ่ คำถามยอดฮิตคือ "มีพารามิเตอร์เท่าไหร่" แต่ในมุมมองของถังเจี๋ย พารามิเตอร์ไม่สามารถอธิบายความสามารถของโมเดลได้เพียงลำพังอีกต่อไป ข้อมูลมีเท่าไหร่ กำลังคำนวณใช้ไปที่ไหน และโมเดลจะถูกใช้งานอย่างไรในอนาคต ล้วนมีความสำคัญเท่าเทียมกัน

อุตสาหกรรมเคยเดินหลงทางมาแล้วครั้งหนึ่ง ในปี 2020 Scaling Law ของ Kaplan และคณะเชื่อว่า เมื่อเพิ่มกำลังคำนวณ พารามิเตอร์ควรเติบโตเร็วกว่าข้อมูลฝึกฝน GPT-3, Gopher, MT-NLG ต่างก็ขยายใหญ่ขึ้นเรื่อยๆ ตามแนวทางนี้ อุตสาหกรรมพุ่งไปสู่พารามิเตอร์ระดับล้านล้าน

ในปี 2022 Chinchilla ทดลองใหม่และพบว่าปัญหาอยู่ตรงนี้พอดี โมเดลขนาดใหญ่หลายตัวถูกสร้างให้ใหญ่เกินไป แต่ข้อมูลที่ป้อนกลับไม่เพียงพอ เมื่อเพิ่มกำลังคำนวณต่อไป พารามิเตอร์และข้อมูลควรเติบโตไปพร้อมกัน ถังเจี๋ยมองย้อนกลับไป การแข่งขันพารามิเตอร์ล้านล้านครั้งนั้น คือทางอ้อมที่อุตสาหกรรมทั้งหมดเดินผ่านด้วยกัน แล้วต่อมาก็หันหลังกลับ

แต่ที่ Chinchilla คำนวณยังเป็นเพียงบัญชีการฝึกฝนเท่านั้น เมื่อโมเดลถูกใช้งานจริง จะถูกเรียกใช้ซ้ำแล้วซ้ำเล่า ต้นทุนการอนุมานระยะยาวยิ่งสำคัญมากขึ้น เมื่อรวมส่วนนี้เข้าไปด้วย วิธีที่ดีที่สุดก็จะเปลี่ยนไป โมเดลอาจเล็กลงได้ แล้วใช้ข้อมูลมากขึ้นฝึกให้สมบูรณ์ยิ่งขึ้น ต่อมาโมเดลอย่าง Llama-2-7B, Gemma-2-9B ก็เริ่มเดินไปในทิศทางนี้แล้ว

ต่อจากนั้น MoE ก็ทำให้ปัญหาซับซ้อนยิ่งขึ้น พารามิเตอร์รวมที่มากขึ้น มักหมายถึงสามารถเก็บความรู้ได้มากขึ้น ส่วนพารามิเตอร์ที่คำนวณจริงและความลึกของการคำนวณในแต่ละครั้ง ส่งผลต่อความสามารถในการอนุมานมากกว่า ทั้งสองไม่ควรปะปนกัน ถึงปี 2025 งานวิจัยใหม่พบเพิ่มเติมว่า งานที่แตกต่างกัน แม้แต่วิธี Scaling ที่เหมาะสมที่สุดก็ไม่เหมือนกัน ความจำพึ่งพาพารามิเตอร์มากกว่า การอนุมานพึ่งพาข้อมูลมากกว่า ใน MoE การเพิ่มพารามิเตอร์รวมอย่างเดียวอาจฉุดรั้งการอนุมาน การเพิ่มผู้เชี่ยวชาญที่คำนวณจริงกลับมีประสิทธิภาพมากกว่า

การค้นหาช่องโหว่เป็นตัวอย่างที่เห็นได้ชัด การค้นพบช่องโหว่ใหม่ ไม่ใช่แค่ท่อง CVE เพิ่มอีกสองสามรายการ สิ่งที่ยากจริงคือการเดิน推理ยี่สิบขั้นให้ครบโดยไม่ขาดตอน พารามิเตอร์มาก ไม่ได้หมายความว่าจะคิดลึกกว่าเสมอไป

GLM-5.3 คือการพิสูจน์ที่ถังเจี๋ยนำออกมาครั้งนี้ มันใช้ฐานเดียวกัน สถาปัตยกรรมเดียวกันกับ GLM-5.2 พารามิเตอร์รวมและพารามิเตอร์ที่เปิดใช้งานไม่เปลี่ยนแปลง ทีมงานเพียงฝึกต่ออีกหนึ่งเดือน เน้นขยายสภาพแวดล้อมงานระยะยาวและการเรียนรู้เสริมแรง ความสามารถก็ยังเพิ่มขึ้นอย่างชัดเจน ครั้งนี้ที่เพิ่มไม่ใช่พารามิเตอร์ แต่เป็นการฝึกหลัง (post-training)

ข้อสรุปสุดท้ายของถังเจี๋ยชัดเจนมาก Scaling ยังไม่จบสิ้น ขนาดโมเดล ข้อมูลฝึกฝนล่วงหน้า กำลังคำนวณที่ใช้ในแต่ละครั้ง และความลึกของการฝึกหลัง ยังมีพื้นที่อีกมาก เพียงแต่คอขวดของโมเดลแต่ละรุ่นต่างกัน จุดที่ควรเพิ่มมากที่สุดก็จะเปลี่ยนไป

การแข่งขันรอบต่อไปของโมเดลขนาดใหญ่ อาจไม่ใช่ว่าใครมีพารามิเตอร์มากที่สุด แต่เป็นว่าใครรู้ดีกว่าว่ากำลังคำนวณควรใช้ไปที่ไหน

นักสืบบนบล็อกเชนเฝ้าติดตามอย่างต่อเนื่อง
แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น