lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

DeepSeek ในที่สุดก็จะเปิดตัว multimodal หรือไม่? โมเดลวิทัศน์ใหม่ได้เข้าสู่ Harness อย่างเป็นทางการแล้ว

动察 Beating AI ข่าวด่วน โมเดลวิชันใหม่ของ DeepSeek อย่าง deepseek-v4-flash-vision-exp เริ่มปรากฏขึ้นมา ชุมชนมีบางคนทดสอบผ่าน API สำเร็จแล้ว สามารถส่งรูปภาพและถามคำถามได้โดยตรง สัญญาณที่ชัดเจนยิ่งขึ้นคือ วันนี้ DeepSeek Harness ได้เพิ่มโมเดลนี้เข้าไปในรายการโมเดลเริ่มต้นแล้ว และระบุอย่างชัดเจนว่ารองรับการป้อนข้อมูลรูปภาพ ชื่อของ PR โค้ดที่เกี่ยวข้องก็คือ "publish the vision model" ในตอนนี้ DeepSeek ยังไม่ได้ประกาศอย่างเป็นทางการ และในเอกสาร API อย่างเป็นทางการก็ยังไม่ปรากฏ

จริงๆ แล้ว DeepSeek สามารถ識รูปได้มานานแล้ว เว็บและแอปได้เปิดโหมด識รูปไว้แล้ว ก่อนหน้านี้ทีมวิจัยวิชันของ DeepSeek ได้เผยแพร่งานวิจัยที่อิงจาก V4-Flash โดยให้โมเดลแทรกจุดและ bounding box ลงในห่วงโซ่การอนุมานโดยตรง เปรียบเสมือนการ "ชี้" ไปที่รูปภาพพร้อมกับทำการอนุมานแบบ Visual CoT ไปพร้อมกัน

การเปิดตัวครั้งนี้ก็มีปม线索ไว้ล่วงหน้าแล้ว สองวันก่อน DeepSeek Harness RC.8 เพิ่งเพิ่มการป้อนข้อมูลรูปภาพแบบเนทีฟให้กับอะแดปเตอร์ DeepSeek อย่างเป็นทางการ บันทึกการใช้งานในตอนนั้นได้เขียนถึง deepseek-v4-flash-vision-exp ไว้แล้ว แต่ตั้งใจไม่ใส่เข้าไปในรายการโมเดลเริ่มต้น โดยให้เหตุผลว่ารอให้ endpoint ของโมเดลพร้อมก่อน

สองวันต่อมา ข้อจำกัดนี้ถูกยกเลิกอย่างเป็นทางการ Harness v0.1.1-rc.1 ได้ระบุ deepseek-v4-flash-vision-exp เป็นโมเดลวิชันเริ่มต้นแล้ว ก่อนหน้านี้ยังเป็น "รอให้ endpoint พร้อม" แต่ตอนนี้ได้เข้าสู่รายการโมเดลอย่างเป็นทางการแล้ว โมเดลวิชันใหม่กำลังจะเปิดตัว

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น