lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

Jev มีกำแพงจริงหรือไม่? OpenJEV ได้แบ่งออกเป็น 4 กลุ่มแล้ว: การไม่พูดไม่อธิบายเป็นเรื่องง่าย แต่ความน่าเชื่อถือของความน่าจะเป็นเป็นเรื่องยาก

动察 Beating ข่าวด่วน AI, Jev เปิดตัวยังไม่ถึงหนึ่งสัปดาห์ ชุมชนโอเพนซอร์สก็เริ่มทำการจำลองโมเดลแบบ "ไม่เขียนคำตอบ ให้ความน่าจะเป็นโดยตรง" นี้แล้ว


พวกมันทั้งหมดต้องการทำสิ่งเดียวกัน: ตัดการสร้างทีละโทเคนออก ให้ตัวเลือกและความน่าจะเป็นโดยตรง แต่ในแง่วิธีการทำนั้นได้แบ่งออกเป็นหลายเส้นทางที่แตกต่างกันโดยสิ้นเชิง


1. SemIf ง่ายที่สุด ไม่ต้องเทรนโมเดลใหม่ด้วยซ้ำ มันใช้ Qwen ที่มีอยู่แล้วโดยตรง เมื่อโมเดลเตรียมตอบ A, B, C ก็สกัดกั้นไม่ให้เขียนต่อไป อ่านคะแนนของแต่ละตัวเลือกโดยตรง แล้วแปลงเป็นความน่าจะเป็น


2. Simple Jev ก็ใช้โมเดลขนาดใหญ่ที่มีอยู่แล้ว แต่ลดการคำนวณซ้ำซ้อนลงอีก เนื้อหาเดียวกันอ่านเพียงครั้งเดียว คำถามหลายข้อที่ตามมาจะใช้ผลลัพธ์ส่วนนี้ร่วมกัน แล้วจึงตัดสินคำตอบแยกกัน ผู้เขียนยังระบุชัดเจนว่ามันจำลองวิธีการใช้งานของ Jev ความแม่นยำ ความเร็ว และการปรับความน่าจะเป็นยังไม่เทียบเท่า


3. Laya ไม่ใช้โมเดลขนาดใหญ่ที่สร้างข้อความได้เลย เปลี่ยนเป็นโมเดลเข้ารหัสที่เหมือนตัวจำแนกแบบดั้งเดิมมากกว่า ข้อดีคือเล็กและเร็ว ข้อเสียก็ชัดเจน ในการเลือกจาก 77 ตัวเลือกในครั้งเดียว Laya มีความแม่นยำเพียง 42.5% ขณะที่ Jev อยู่ที่ 87.0%


4. Von ก็เดินเส้นทางโมเดลตัดสินใจเฉพาะทางเช่นกัน มันมีพารามิเตอร์เพียงประมาณ 400 ล้าน ไม่สร้างข้อความ ในการส่งผ่านไปข้างหน้าครั้งเดียวทำ Choice, Noul และ Score ได้เสร็จสมบูรณ์ เหมือนตัวจำแนกรุ่นใหม่ที่อ่านภาษาธรรมชาติได้


5. Verdict เล็กกว่าอีก มีพารามิเตอร์เพียงประมาณ 150 ล้าน ผู้เขียนเน้นจัดการสองปัญหา: ตอบผิดแต่รายงานความมั่นใจสูง และสลับลำดับตัวเลือกแล้วผลลัพธ์เปลี่ยนตาม มันให้ความสำคัญกับการทำให้ความน่าจะเป็นและการตัดสินมีความเสถียร


6. Kev เลือกเก็บโมเดลขนาดใหญ่ไว้ ใช้ Qwen เป็นฐาน แล้วเพิ่มโครงสร้างการตัดสินใจเฉพาะทาง ทำให้ข้อมูลนำเข้าเดียวกันอ่านเพียงครั้งเดียว คำถามหลายข้อคำนวณความน่าจะเป็นแยกกัน ก่อนหน้านี้บุคคลที่สามที่ทำวิศวกรรมย้อนกลับ Jev ก็คาดเดาว่ามันอาจใช้การออกแบบที่คล้ายกัน


ในการทดสอบตัวเองของ Kev ใช้โจทย์ใหม่ที่ไม่เคยเห็นตอนเทรน เวอร์ชัน 8B มีความแม่นยำประมาณ 78% ขณะที่ Jev อยู่ที่ประมาณ 86% ช่องว่างที่ชัดเจนกว่าอยู่ที่ความมั่นใจ Kev ยังมีข้อที่ตอบผิดแต่ให้ความมั่นใจเกิน 90%


7. Nimble เน้นที่การเทรน ใช้ Qwen3.5-9B แล้วเตรียมชุดข้อมูล "แก้ข้อเท็จจริงเพียงหนึ่งอย่าง คำตอบที่ถูกก็พลิก" สำหรับการเทรนหลัง ในตัวอย่างทดสอบ 324 รายการที่ไม่ได้เข้าร่วมการเทรน Nimble เลือกคำตอบอ้างอิงได้ 90.1% ขณะที่ Jev อยู่ที่ 93.2% แต่ผู้เขียนก็เตือนว่าปัจจุบันยังไม่สามารถรับประกันได้ว่าโมเดล "รายงาน 90% จะถูกต้องจริง 90%"


8. OpenJev ไปได้ไกลที่สุด โดยเปลี่ยนไปใช้ DiffusionGemma โดยตรง มันเว้นตำแหน่งคำตอบไว้หลายตำแหน่งก่อน จากนั้นเติมทั้งหมดในครั้งเดียวเหมือนโมเดล diffusion ที่เติมภาพ บน RTX PRO 6000 ความหน่วงมัธยฐานต่อคำขออยู่ที่ประมาณ 94ms


ผ่านมาหลายวัน OpenJEV แยกออกเป็นสี่เส้นทางแล้ว: อ่านคะแนนคำตอบจากโมเดลสำเร็จรูปโดยตรง, ฝึกโมเดลตัดสินใจเฉพาะทาง, ดัดแปลงโมเดลขนาดใหญ่ให้เป็นโมเดลตัดสินใจ, และใช้โมเดล diffusion เติมคำตอบโดยตรง


เส้นทางของ Jev ดูเหมือนลอกกันได้ง่าย สิ่งที่สร้างความแตกต่างจริงๆ ยังคงเป็นความแม่นยำ การ généralisation และการปรับเทียบความน่าจะเป็น โมเดลกล้ารายงาน 90% แต่ 90% นี้เชื่อถือได้แค่ไหน นั่นคือส่วนที่ยากที่สุด

举报 แก้ไข/รายงาน
แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น