动察 Beating ข่าวด่วน AI แอปเปิลได้เปิดโอเพนซอร์สโมเดลภาษาภาพ LensVLM-9B ที่ออกแบบมาเฉพาะสำหรับประมวลผลเอกสารยาว โดยโมเดลนี้ฝึกจาก Qwen3.5-9B-Base เมื่อประมวลผลเอกสารยาว มันจะบีบอัดเอกสารทั้งฉบับให้เป็นหน้าความละเอียดต่ำเพื่อสแกนอย่างรวดเร็วก่อน เมื่อระบุหน้าส่วนที่เกี่ยวข้องได้แล้ว จึงอ่านข้อความต้นฉบับหรือภาพความละเอียดสูงจากหน้านั้น
วิธีนี้ทำให้ไม่ต้องยัดข้อความทั้งหมดเข้าไปในบริบทของโมเดล ในการทดสอบของบทความวิจัยกับเอกสาร 100 หน้า การอ่านข้อความทั้งหมดโดยตรงต้องใช้ 51,273 โทเคน แต่ LensVLM ใช้เพียง 8,090 โทเคน KV cache ที่เกี่ยวข้องลดจากประมาณ 1.6GB เหลือ 253MB ลดลง 84.2%
หลังการบีบอัด ความแม่นยำก็ไม่ได้ลดลงอย่างมีนัยสำคัญ ในการทดสอบถามตอบจากเอกสาร 7 รายการ ความแม่นยำเฉลี่ยของการอ่านข้อความทั้งหมดโดยตรงอยู่ที่ 72.4% ขณะที่ LensVLM ยังคงได้ 68.9% ภายใต้การบีบอัดประมาณ 4.3 เท่า เมื่อเทียบกับการย่อข้อความให้เป็นภาพแล้วให้โมเดลจดจำ ภายใต้การบีบอัดประมาณ 5 เท่าเช่นเดียวกัน ความแม่นยำเพิ่มจาก 31.3% เป็น 68.9%
อย่างไรก็ตาม ปัจจุบันมันทำงานช้ากว่า หลังจาก LensVLM หาหน้าที่เกี่ยวข้องเจอแล้ว ยังต้องเรียกใช้เครื่องมืออีกครั้งเพื่ออ่านข้อความต้นฉบับ จึงต้องรันการอนุมานสองรอบติดต่อกัน ในการทดสอบของบทความวิจัย การตอบหนึ่งครั้งใช้เวลาประมาณ 17 วินาที หากไม่ใช้วิธีการบีบอัดนี้และป้อนเอกสารทั้งฉบับเป็นข้อความเข้า Qwen3.5-9B โดยตรง การสร้างคำตอบหนึ่งครั้งใช้เวลาประมาณ 8 วินาที
