ตามการติดตามของ Beating ทีม Sina Weibo ได้เปิดซอร์สโมเดลการอนุมาน VibeThinker-3B ที่มีพารามิเตอร์ 3 พันล้านตัวเมื่อเร็วๆ นี้
โมเดลนี้ทำผลงานระดับ前沿ในงานต่างๆ เช่น คณิตศาสตร์และการเขียนโปรแกรม โดยบางตัวชี้วัดใกล้เคียงหรือเหนือกว่าโมเดล旗舰ขนาดใหญ่ เช่น DeepSeek V3.2, GLM-5 และ Gemini 3 Pro
VibeThinker-3B ดัดแปลงมาจาก Qwen2.5-Coder-3B โดยใช้กระบวนการ Spectrum-to-Signal ในการฝึกอบรมครั้งที่สอง: โมเดลจะเริ่มจากโจทย์ง่ายไปยากเพื่อสะสม谱系การแก้ปัญหา จากนั้นใช้การเรียนรู้แบบเสริมกำลังเพื่อขยายสัญญาณของวิธีแก้ที่ถูกต้อง ตลอดการฝึกใช้พื้นที่คิดขนาด 64K เพื่อป้องกันการขัดจังหวะขั้นตอนการอนุมาน
สำหรับคณิตศาสตร์และการเขียนโปรแกรม โมเดลจะรวบรวมขั้นตอนที่ดีที่ตัวเองทำถูกต้องเพื่อทำการ蒸馏模仿ด้วยตนเอง และในขณะตอบคำถามจะนำการประเมินระดับขั้นตอนมาใช้ในการตรวจสอบตนเอง กลไกการตรวจสอบตนเองนี้ทำให้คะแนนการทดสอบคณิตศาสตร์ AIME26 เพิ่มขึ้นจาก 94.3 เป็น 97.1
ทีมวิจัยเสนอ "สมมติฐานการบีบอัดพารามิเตอร์-การครอบคลุม" ในรายงาน โดยเชื่อว่าการใช้เหตุผลเชิงตรรกะเป็นความสามารถที่บีบอัดได้สูง ขึ้นอยู่กับกฎและการแก้ไขข้อผิดพลาดเป็นหลัก การใช้โมเดลขนาดเล็ก 3B ก็สามารถให้ผลลัพธ์ที่ยอดเยี่ยมได้ ในขณะที่ความรู้แบบเปิดต้องใช้พารามิเตอร์จำนวนมากในการท่องจำ เนื่องจากข้อจำกัดด้านขนาดพารามิเตอร์ VibeThinker-3B จึงยังด้อยกว่าโมเดลขนาดใหญ่ในด้านการครอบคลุมความรู้ทั่วไปแบบเปิด
ทีมงานเน้นย้ำว่าจุดประสงค์ของการพัฒนาไม่ใช่การแทนที่โมเดลขนาดใหญ่ด้วยโมเดลขนาดเล็ก แต่เป็นการสำรวจขีดจำกัดความสามารถของโมเดลขนาดกะทัดรัดภายใต้กลไกการตรวจสอบที่ชัดเจน
