BlockBeats ข่าวสาร วันที่ 15 สิงหาคม ช่วงนี้ชุมชน AI ถกเถียงกันว่า DeepSeek-V4-Pro อาจมีหลายเวอร์ชัน ผู้ใช้บางคนพบว่า เมื่อเรียกใช้อินเทอร์เฟซ deepseek-v4-pro เดียวกัน หลังจากเปลี่ยน IP หรือสร้างเซสชันใหม่ โมเดลจะแสดง "รูปแบบการให้เหตุผล" ที่แตกต่างกันสามแบบ:
แบบหนึ่งมักเริ่มต้นด้วย "Let me" ใกล้เคียงกับ V4 Pro Preview ก่อนหน้านี้ อีกแบบมักปรากฏ "The user wants me" คล้ายกับ V4 Flash และอีกแบบใช้ "we" จำนวนมาก ซึ่งผู้ใช้บางส่วนเรียกว่า "V4 Pro เวอร์ชันเทพ" ที่มีความสามารถสูงกว่า
เนื่องจากเมื่อเซสชันเดียวกันเข้าสู่โหมดใดโหมดหนึ่งแล้ว ผลลัพธ์ที่ตามมามักจะคงที่ ชุมชนจึงเคยคาดเดาว่า DeepSeek อาจซ่อนโมเดลหลายตัวไว้เบื้องหลัง API และกระจายผ่านกลไกการกำหนดเส้นทาง อย่างไรก็ตาม หลังจากการวิเคราะห์ซอร์สโค้ด DeepSeek Harness เพิ่มเติม ก็มีคำอธิบายอีกแบบเกิดขึ้น: ความแตกต่างอาจไม่ได้มาจากน้ำหนักโมเดลที่ต่างกัน แต่มาจากสภาพแวดล้อมการทำงานของ Agent
ชุมชนพบว่า เมื่อวันที่ 10 สิงหาคม คลังเก็บอย่างเป็นทางการของ DeepSeek Harness อัปเดต commit ที่สำคัญหนึ่งรายการ:
"fix(preset): align minimal agent with RL composition"
การอัปเดตนี้มีจุดประสงค์เพื่อให้ Minimal Agent สอดคล้องกับสภาพแวดล้อม Agent ที่ใช้ในการฝึกอบรม Reinforcement Learning (RL)
เอกสารอย่างเป็นทางการระบุว่า Minimal preset ประกอบด้วย system prompt ที่เรียบง่ายมาก สภาพแวดล้อม Bash แบบถาวร เครื่องมือแก้ไขที่ระบุ นโยบายการบีบอัดที่ใช้ในการฝึก RL และลบคำแนะนำเกี่ยวกับตัวตนเพิ่มเติม คำแนะนำเว็บ และคำอธิบายเครื่องมือออก
นี่หมายความว่า DSH Minimal อาจไม่ใช่ "เวอร์ชันตัดทอน" ของ Standard แต่เป็นการจำลองสภาพแวดล้อม Agent ที่โมเดลสัมผัสจริงในช่วงการฝึกอบรม
การทดสอบของชุมชนก็สนับสนุนมุมมองนี้เช่นกัน DeepSeek V4 Pro ตัวเดียวกันในสภาพแวดล้อม Harness ที่แตกต่างกันให้ผลลัพธ์:
DSH Standard: 91 คะแนน;
DSH PTC: 92 คะแนน;
DSH Minimal: 99/96 คะแนน
ต่อมา ผู้ทดสอบได้พัฒนาปลั๊กอิน "Anchored Standard": การร้องขอครั้งแรกจำลองสภาพแวดล้อม Minimal โดยเปิดเฉพาะเครื่องมือ shell และ read เมื่อการเรียกใช้เครื่องมือครั้งแรกเสร็จสิ้น จึงค่อยกู้คืนชุดเครื่องมือ Standard เต็มรูปแบบ ผลลัพธ์ที่ได้คือคะแนน 98/99 ติดต่อกัน
ผู้ทดสอบเห็นว่า ปัจจัยสำคัญที่กำหนดความสามารถของ V4 Pro Agent อาจไม่ใช่จำนวนเครื่องมือที่มีในตอนท้าย แต่เป็นสิ่งที่โมเดลเห็นเป็นครั้งแรก: System Prompt + Tool Schema + Agent Scaffold
ดังนั้น สิ่งที่เรียกว่า "โมเดล DeepSeek สามตัว" อาจแท้จริงแล้วเป็นการทับซ้อนของปัจจัยสองชั้น:
ด้านหนึ่งคือความแตกต่างของสภาพแวดล้อมบริการ API การกำหนดค่าการปรับใช้ หรืออินสแตนซ์灰度 อีกด้านหนึ่งคือว่าโมเดลเข้าสู่สภาพแวดล้อม Agent ที่ใกล้เคียงกับการกระจายการฝึก RL หรือไม่
อย่างไรก็ตาม ในปัจจุบัน ข้อกล่าวอ้างนี้ยังไม่ได้รับการยืนยันอย่างเป็นทางการจาก DeepSeek เอกสาร API อย่างเป็นทางการระบุว่า deepseek-v4-pro สอดคล้องกับเวอร์ชันทางการ DeepSeek-V4-Pro-0813 และไม่ได้เปิดเผยกลไกการกำหนดเส้นทางอัตโนมัติแบบหลายโมเดล
ในมุมมองปัจจุบัน ความแตกต่างของประสิทธิภาพของ DeepSeek-V4-Pro น่าจะเป็นผลมาจากการทำงานร่วมกันของน้ำหนักโมเดล สภาพแวดล้อมการอนุมาน และเฟรมเวิร์ก Agent มากกว่าการมีโมเดลที่ซ่อนอยู่สามตัว
