动察 Beating ข่าวด่วน AI,Shanghai AI Lab และ Shanghai Jiao Tong University เปิดตัวโมเดลขนาด 8.9 พันล้านพารามิเตอร์ NCP-ArchPreview โมเดลขนาดใหญ่ทั่วไปเน้นฝึก "เดาโทเคนถัดไป" แต่ NCP ยังคาดการณ์สัญญาณแนวคิดภายในที่สอดคล้องกับข้อความช่วงสั้นถัดไป แล้วใช้มันช่วยสร้างโทเคน ผลลัพธ์สุดท้ายยังคงส่งออกทีละโทเคน แต่ภายในโมเดลสามารถเดาเนื้อหาถัดไปล่วงหน้าได้แล้ว
สัญญาณชุดนี้ยังสามารถนำมาใช้เร่งความเร็วการถอดรหัสแบบคาดเดาได้ วิธีอย่าง DFlash, DSpark จะให้โมเดลเล็กเดาเนื้อหาถัดไปก่อน แล้วส่งให้โมเดลใหญ่ตรวจสอบรวม ทีม NCP ส่งสัญญาณแนวคิดภายในให้โมเดลเล็กนี้ด้วย เท่ากับให้คำใบ้ "เนื้อหาถัดไปน่าจะเขียนอย่างไร" แก่มันก่อน แล้วให้มันเดา 16 โทเคนพร้อมกันในครั้งเดียว
ด้วยวิธีนี้ โมเดลเล็กจะเดาถูกมากขึ้น ในการทดสอบสี่รายการ ทุกครั้งที่โมเดลใหญ่ตรวจสอบ จำนวนโทเคนที่ผ่านเฉลี่ยเพิ่มจาก 5.933 เป็น 6.180 เพิ่มขึ้น 4.17%; บน HumanEval เพิ่มขึ้น 7.59% การเชื่อมต่อสัญญาณชุดนี้เพิ่มพารามิเตอร์ให้โมเดลร่างเพียงประมาณ 4 หมื่นตัว
ด้วยพารามิเตอร์ 8.9 พันล้านเท่ากัน NCP ใช้ปริมาณการคำนวณในการฝึกประมาณ 85% ของ Transformer ทั่วไป ก็สามารถลดความคลาดเคลื่อนในการฝึกให้อยู่ในระดับใกล้เคียงกันได้
