动察 Beating ข่าวด่วน AI, Jev เปิดตัวยังไม่ถึงหนึ่งสัปดาห์ ชุมชนโอเพนซอร์สก็เริ่มทำการจำลองโมเดลแบบ "ไม่เขียนคำตอบ ให้ความน่าจะเป็นโดยตรง" นี้แล้ว
พวกมันทั้งหมดต้องการทำสิ่งเดียวกัน: ตัดการสร้างทีละโทเคนออก ให้ตัวเลือกและความน่าจะเป็นโดยตรง แต่ในแง่วิธีการทำนั้นได้แบ่งออกเป็นหลายเส้นทางที่แตกต่างกันโดยสิ้นเชิง
1. SemIf ง่ายที่สุด ไม่ต้องเทรนโมเดลใหม่ด้วยซ้ำ มันใช้ Qwen ที่มีอยู่แล้วโดยตรง เมื่อโมเดลเตรียมตอบ A, B, C ก็สกัดกั้นไม่ให้เขียนต่อไป อ่านคะแนนของแต่ละตัวเลือกโดยตรง แล้วแปลงเป็นความน่าจะเป็น
2. Simple Jev ก็ใช้โมเดลขนาดใหญ่ที่มีอยู่แล้ว แต่ลดการคำนวณซ้ำซ้อนลงอีก เนื้อหาเดียวกันอ่านเพียงครั้งเดียว คำถามหลายข้อที่ตามมาจะใช้ผลลัพธ์ส่วนนี้ร่วมกัน แล้วจึงตัดสินคำตอบแยกกัน ผู้เขียนยังระบุชัดเจนว่ามันจำลองวิธีการใช้งานของ Jev ความแม่นยำ ความเร็ว และการปรับความน่าจะเป็นยังไม่เทียบเท่า
3. Laya ไม่ใช้โมเดลขนาดใหญ่ที่สร้างข้อความได้เลย เปลี่ยนเป็นโมเดลเข้ารหัสที่เหมือนตัวจำแนกแบบดั้งเดิมมากกว่า ข้อดีคือเล็กและเร็ว ข้อเสียก็ชัดเจน ในการเลือกจาก 77 ตัวเลือกในครั้งเดียว Laya มีความแม่นยำเพียง 42.5% ขณะที่ Jev อยู่ที่ 87.0%
4. Von ก็เดินเส้นทางโมเดลตัดสินใจเฉพาะทางเช่นกัน มันมีพารามิเตอร์เพียงประมาณ 400 ล้าน ไม่สร้างข้อความ ในการส่งผ่านไปข้างหน้าครั้งเดียวทำ Choice, Noul และ Score ได้เสร็จสมบูรณ์ เหมือนตัวจำแนกรุ่นใหม่ที่อ่านภาษาธรรมชาติได้
5. Verdict เล็กกว่าอีก มีพารามิเตอร์เพียงประมาณ 150 ล้าน ผู้เขียนเน้นจัดการสองปัญหา: ตอบผิดแต่รายงานความมั่นใจสูง และสลับลำดับตัวเลือกแล้วผลลัพธ์เปลี่ยนตาม มันให้ความสำคัญกับการทำให้ความน่าจะเป็นและการตัดสินมีความเสถียร
6. Kev เลือกเก็บโมเดลขนาดใหญ่ไว้ ใช้ Qwen เป็นฐาน แล้วเพิ่มโครงสร้างการตัดสินใจเฉพาะทาง ทำให้ข้อมูลนำเข้าเดียวกันอ่านเพียงครั้งเดียว คำถามหลายข้อคำนวณความน่าจะเป็นแยกกัน ก่อนหน้านี้บุคคลที่สามที่ทำวิศวกรรมย้อนกลับ Jev ก็คาดเดาว่ามันอาจใช้การออกแบบที่คล้ายกัน
ในการทดสอบตัวเองของ Kev ใช้โจทย์ใหม่ที่ไม่เคยเห็นตอนเทรน เวอร์ชัน 8B มีความแม่นยำประมาณ 78% ขณะที่ Jev อยู่ที่ประมาณ 86% ช่องว่างที่ชัดเจนกว่าอยู่ที่ความมั่นใจ Kev ยังมีข้อที่ตอบผิดแต่ให้ความมั่นใจเกิน 90%
7. Nimble เน้นที่การเทรน ใช้ Qwen3.5-9B แล้วเตรียมชุดข้อมูล "แก้ข้อเท็จจริงเพียงหนึ่งอย่าง คำตอบที่ถูกก็พลิก" สำหรับการเทรนหลัง ในตัวอย่างทดสอบ 324 รายการที่ไม่ได้เข้าร่วมการเทรน Nimble เลือกคำตอบอ้างอิงได้ 90.1% ขณะที่ Jev อยู่ที่ 93.2% แต่ผู้เขียนก็เตือนว่าปัจจุบันยังไม่สามารถรับประกันได้ว่าโมเดล "รายงาน 90% จะถูกต้องจริง 90%"
8. OpenJev ไปได้ไกลที่สุด โดยเปลี่ยนไปใช้ DiffusionGemma โดยตรง มันเว้นตำแหน่งคำตอบไว้หลายตำแหน่งก่อน จากนั้นเติมทั้งหมดในครั้งเดียวเหมือนโมเดล diffusion ที่เติมภาพ บน RTX PRO 6000 ความหน่วงมัธยฐานต่อคำขออยู่ที่ประมาณ 94ms
ผ่านมาหลายวัน OpenJEV แยกออกเป็นสี่เส้นทางแล้ว: อ่านคะแนนคำตอบจากโมเดลสำเร็จรูปโดยตรง, ฝึกโมเดลตัดสินใจเฉพาะทาง, ดัดแปลงโมเดลขนาดใหญ่ให้เป็นโมเดลตัดสินใจ, และใช้โมเดล diffusion เติมคำตอบโดยตรง
เส้นทางของ Jev ดูเหมือนลอกกันได้ง่าย สิ่งที่สร้างความแตกต่างจริงๆ ยังคงเป็นความแม่นยำ การ généralisation และการปรับเทียบความน่าจะเป็น โมเดลกล้ารายงาน 90% แต่ 90% นี้เชื่อถือได้แค่ไหน นั่นคือส่วนที่ยากที่สุด
