lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

โมเดลขนาดใหญ่เริ่ม "ร่างแบบ" ด้วยตัวเอง: NCP ยัดการเดาคำถัดไปเข้าไปในโมเดล

动察 Beating ข่าวด่วน AI,Shanghai AI Lab และ Shanghai Jiao Tong University เปิดตัวโมเดลขนาด 8.9 พันล้านพารามิเตอร์ NCP-ArchPreview โมเดลขนาดใหญ่ทั่วไปเน้นฝึก "เดาโทเคนถัดไป" แต่ NCP ยังคาดการณ์สัญญาณแนวคิดภายในที่สอดคล้องกับข้อความช่วงสั้นถัดไป แล้วใช้มันช่วยสร้างโทเคน ผลลัพธ์สุดท้ายยังคงส่งออกทีละโทเคน แต่ภายในโมเดลสามารถเดาเนื้อหาถัดไปล่วงหน้าได้แล้ว


สัญญาณชุดนี้ยังสามารถนำมาใช้เร่งความเร็วการถอดรหัสแบบคาดเดาได้ วิธีอย่าง DFlash, DSpark จะให้โมเดลเล็กเดาเนื้อหาถัดไปก่อน แล้วส่งให้โมเดลใหญ่ตรวจสอบรวม ทีม NCP ส่งสัญญาณแนวคิดภายในให้โมเดลเล็กนี้ด้วย เท่ากับให้คำใบ้ "เนื้อหาถัดไปน่าจะเขียนอย่างไร" แก่มันก่อน แล้วให้มันเดา 16 โทเคนพร้อมกันในครั้งเดียว


ด้วยวิธีนี้ โมเดลเล็กจะเดาถูกมากขึ้น ในการทดสอบสี่รายการ ทุกครั้งที่โมเดลใหญ่ตรวจสอบ จำนวนโทเคนที่ผ่านเฉลี่ยเพิ่มจาก 5.933 เป็น 6.180 เพิ่มขึ้น 4.17%; บน HumanEval เพิ่มขึ้น 7.59% การเชื่อมต่อสัญญาณชุดนี้เพิ่มพารามิเตอร์ให้โมเดลร่างเพียงประมาณ 4 หมื่นตัว


ด้วยพารามิเตอร์ 8.9 พันล้านเท่ากัน NCP ใช้ปริมาณการคำนวณในการฝึกประมาณ 85% ของ Transformer ทั่วไป ก็สามารถลดความคลาดเคลื่อนในการฝึกให้อยู่ในระดับใกล้เคียงกันได้

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น