動察 Beating AI ข่าวด่วน หลังจาก Hy4 preview เพิ่งเปิดตัวโอเพนซอร์ส Tencent Hunyuan ก็ปล่อยเวอร์ชัน量化สุดขีดออกมาอีกตัว น้ำหนักโมเดลดั้งเดิมใกล้เคียง 1.5TB แต่เวอร์ชัน GGUF ใหม่มีเพียงประมาณ 214GB ซึ่งช่วยลดเกณฑ์การติดตั้งในเครื่องสำหรับโมเดล MoE ขนาด 770B นี้ลงอย่างมาก
มันไม่ได้บีบอัดทั้งโมเดลให้เป็น 1.25-bit ทั้งหมด Tencent ทำการควอนไทซ์ตามความไวต่อความแม่นยำของแต่ละเลเยอร์ ส่วนที่รับได้ถูกบีบต่ำสุดประมาณ 1.31-bit ส่วนที่ไวต่อความแม่นยำคงไว้ที่ 2-bit หรือสูงกว่า สุดท้ายไฟล์ทั้งหมดเฉลี่ยประมาณ 2.38 bpw ในการทดสอบสี่รายการที่ Tencent ให้มา เมื่อเทียบกับเวอร์ชัน BF16 ดั้งเดิม คะแนนลดลงเพียง 0.2 ถึง 1.6 คะแนน
หลังจากบีบอัดให้เล็กลง Tencent ยังได้ทดสอบการอนุมานร่วมกันบนอุปกรณ์ต่างชนิดกับ prima.cpp โน้ตบุ๊ก RTX 4090 หนึ่งเครื่องบวกกับเซิร์ฟเวอร์การ์ด A4000 สี่ใบ รวมมีหน่วยความจำกราฟิกเพียง 80GB และแรม 64GB สุดท้ายรันโมเดลได้ที่ 1.02 token/s ซึ่งเร็วกว่าการออฟโหลดบนโน้ตบุ๊กเครื่องเดียวประมาณ 6 เท่า อุปกรณ์หลายเครื่องที่มีการกำหนดค่าต่างกันก็สามารถช่วยแบ่งเบาการอนุมานโมเดลร่วมกันได้
