lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

สถาปัตยกรรม Transformer แบบวนซ้ำใหม่: RLT ทำให้ Token ต่างๆ "คำนวณต่อกัน"

动察 Beating ข่าวด่วน AI นักศึกษาปริญญาเอก Princeton ชื่อ Yifan Zhang เสนอ Recurrent Looped Transformer (RLT) โดยเพิ่มสถานะภายในที่ส่งต่อไปเรื่อย ๆ ให้กับ Transformer


Transformer ทั่วไปเมื่อสร้าง Token ถัดไป จะอ่านข้อความก่อนหน้าผ่าน Attention และ KV cache เป็นหลัก RLT นอกจากดูข้อความก่อนหน้าแล้ว ยังนำสถานะภายในที่เหลือจากการคำนวณ Token ก่อนหน้า ส่งต่อไปให้ Token ถัดไปใช้ต่อได้เลย


สามารถเข้าใจได้ว่าเป็นการเพิ่ม "ไม้ผลัดทางความคิด" ให้กับโมเดล เมื่อ Token แรกคำนวณเสร็จ ก็ส่งสถานะปัจจุบันไปยัง Token ที่สอง พอ Token ที่สองอัปเดตเสร็จก็ส่งต่อไปยัง Token ที่สาม จำนวนชั้นเครือข่ายที่แต่ละ Token รันเองนั้นไม่เปลี่ยน แต่สายโซ่สถานะนี้จะยาวขึ้นเรื่อย ๆ ตามข้อความ งานวิจัยเรียกสิ่งนี้ว่า "ความลึกแบบเวลาอนันต์" หมายถึงสายโซ่การคำนวณนี้ไม่มีขีดจำกัดความยาวที่แน่นอน


มันยังแตกต่างจากสถาปัตยกรรมแบบวนซ้ำประเภท Ouro, Astra ที่ถูกพูดถึงมากในช่วงหลังด้วย วิธีเหล่านั้นหลัก ๆ คือให้ Token เดียวกันรันซ้ำหลายรอบในเครือข่ายชุดเดียวกัน ส่วน RLT ให้ Token ต่าง ๆ ส่งสถานะภายในต่อกันไปเรื่อย ๆ แบบแรกเหมือนการตรวจทานโจทย์หลายรอบก่อนส่งกระดาษคำตอบ แบบหลังเหมือนไม้ผลัดที่วิ่งเสร็จแล้วส่งความคืบหน้าในมือให้ไม้ถัดไปเลย

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น