动察 Beating ข่าวด่วน AI,Perplexity เปิดโอเพนซอร์สโมเดล embedding แบบหลายรูปแบบสองรุ่น คือ pplx-embed-v2-late ขนาด 0.6B และ 9B เวกเตอร์ของทั้งสองโมเดลเข้ากันได้ นักพัฒนาสามารถใช้โมเดลขนาดใหญ่ 9B สร้างฐานข้อมูล แล้วใช้โมเดลขนาดเล็ก 0.6B จัดการการค้นหาประจำวัน ไม่จำเป็นต้องรันโมเดลขนาดใหญ่ทุกครั้งที่ค้นหา
โมเดลใหม่ยังรองรับการค้นหาข้อความ รูปภาพ และหน้า PDF โมเดล embedding ทั่วไปมักบีบอัดเนื้อหาเป็นเวกเตอร์เดียว ทำให้สูญเสียรายละเอียด โมเดลใหม่เก็บเวกเตอร์ 128 มิติไว้สำหรับแต่ละ token ทำให้คำค้นหาแต่ละคำจับคู่กับเนื้อหาที่เกี่ยวข้องในเอกสาร เมื่อจัดการ PDF, PPT และเอกสารสแกน สามารถแปลงภาพหน้าเอกสารเป็นเวกเตอร์ได้โดยตรง ไม่ต้องใช้ OCR สกัดข้อความก่อน และยังคงเก็บข้อมูลแผนภูมิ ตาราง และรูปแบบการจัดหน้าไว้ได้
ทั้งสองโมเดลฝึกจากโมเดลครูขนาด 18B เดียวกัน ใช้พื้นที่เวกเตอร์ร่วมกัน จากการทดสอบค้นหารูปภาพ ViDoRe v3 อย่างเป็นทางการพบว่า การใช้โมเดล 0.6B สร้างฐานข้อมูลและค้นหาได้คะแนน 62.3% เปลี่ยนเป็นใช้ 9B สร้างฐานข้อมูลและ 0.6B ค้นหา คะแนนเพิ่มเป็น 63.5% หากใช้โมเดล 9B ทั้งหมดจะได้คะแนน 65.2%
น้ำหนักของทั้งสองโมเดลเปิดให้ใช้งานแล้วบน Hugging Face ภายใต้สัญญาอนุญาต MIT
