lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

แอปเปิลเปิดซอร์ส LensVLM-9B: บีบเอกสาร 100 หน้าให้เป็นรูปภาพก่อน ประหยัด KV cache ได้ 84%

动察 Beating ข่าวด่วน AI แอปเปิลได้เปิดโอเพนซอร์สโมเดลภาษาภาพ LensVLM-9B ที่ออกแบบมาเฉพาะสำหรับประมวลผลเอกสารยาว โดยโมเดลนี้ฝึกจาก Qwen3.5-9B-Base เมื่อประมวลผลเอกสารยาว มันจะบีบอัดเอกสารทั้งฉบับให้เป็นหน้าความละเอียดต่ำเพื่อสแกนอย่างรวดเร็วก่อน เมื่อระบุหน้าส่วนที่เกี่ยวข้องได้แล้ว จึงอ่านข้อความต้นฉบับหรือภาพความละเอียดสูงจากหน้านั้น


วิธีนี้ทำให้ไม่ต้องยัดข้อความทั้งหมดเข้าไปในบริบทของโมเดล ในการทดสอบของบทความวิจัยกับเอกสาร 100 หน้า การอ่านข้อความทั้งหมดโดยตรงต้องใช้ 51,273 โทเคน แต่ LensVLM ใช้เพียง 8,090 โทเคน KV cache ที่เกี่ยวข้องลดจากประมาณ 1.6GB เหลือ 253MB ลดลง 84.2%


หลังการบีบอัด ความแม่นยำก็ไม่ได้ลดลงอย่างมีนัยสำคัญ ในการทดสอบถามตอบจากเอกสาร 7 รายการ ความแม่นยำเฉลี่ยของการอ่านข้อความทั้งหมดโดยตรงอยู่ที่ 72.4% ขณะที่ LensVLM ยังคงได้ 68.9% ภายใต้การบีบอัดประมาณ 4.3 เท่า เมื่อเทียบกับการย่อข้อความให้เป็นภาพแล้วให้โมเดลจดจำ ภายใต้การบีบอัดประมาณ 5 เท่าเช่นเดียวกัน ความแม่นยำเพิ่มจาก 31.3% เป็น 68.9%


อย่างไรก็ตาม ปัจจุบันมันทำงานช้ากว่า หลังจาก LensVLM หาหน้าที่เกี่ยวข้องเจอแล้ว ยังต้องเรียกใช้เครื่องมืออีกครั้งเพื่ออ่านข้อความต้นฉบับ จึงต้องรันการอนุมานสองรอบติดต่อกัน ในการทดสอบของบทความวิจัย การตอบหนึ่งครั้งใช้เวลาประมาณ 17 วินาที หากไม่ใช้วิธีการบีบอัดนี้และป้อนเอกสารทั้งฉบับเป็นข้อความเข้า Qwen3.5-9B โดยตรง การสร้างคำตอบหนึ่งครั้งใช้เวลาประมาณ 8 วินาที

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น