动察 Beating ข่าวด่วน AI ทีม Seed ของ ByteDance ค้นพบว่า DeepSeek-V4 มีจุดอ่อนที่เป็นรูปแบบเฉพาะในการประมวลผลข้อความยาว นักวิจัยให้โมเดลเติมโค้ดให้สมบูรณ์ โดยตัวโค้ดเองไม่มีการเปลี่ยนแปลง เพียงแค่ขยายคอมเมนต์ที่ไม่เกี่ยวข้องด้านหน้าให้ยาวขึ้น คำตอบของโมเดลก็จะสลับไปมาระหว่างถูกและผิด เวอร์ชันพื้นฐาน V4-Flash เกิดซ้ำเป็นรอบทุก 4 Token ส่วน V4.1-Flash ก็มีปรากฏการณ์คล้ายกัน โดยรอบเปลี่ยนเป็น 2 Token
ปัญหานี้เกี่ยวข้องกับ «การบีบอัด KV Cache แบบแบ่งบล็อก» ของ DeepSeek ที่ช่วยประหยัดหน่วยความจำ โมเดลจะรวมข้อมูลของ Token หลายตัวที่ต่อเนื่องกันเข้าด้วยกันเพื่อลดต้นทุนในการประมวลผลข้อความยาว แต่การบีบอัดนี้ทำให้ข้อมูลในตำแหน่งต่างๆ ถูกเก็บรักษาในระดับที่แตกต่างกัน เนื้อหาในบางตำแหน่งจึงถูกเรียกคืนกลับมาได้อย่างแม่นยำยากกว่าในภายหลัง ByteDance เรียกความแตกต่างในการเรียกคืนข้อมูลแบบเป็นรอบนี้ว่า «ความไวต่อเฟส»
ในการทดสอบการเรียกคืนข้อมูลประมาณ 128,000 Token เวอร์ชันพื้นฐาน V4-Flash มีความแม่นยำต่างกันสูงสุดถึง 40.2 จุดเปอร์เซ็นต์ในตำแหน่งต่างๆ หลังการฝึกเพิ่มเติม ช่องว่างลดลงเหลือ 19.1 จุดเปอร์เซ็นต์ และ V4.1-Flash ลดลงอีกเหลือ 6.1 จุดเปอร์เซ็นต์ แต่ความผันผวนแบบเป็นรอบยังคงอยู่ ByteDance ยังฝึกโมเดลเปรียบเทียบหลายกลุ่มตั้งแต่เริ่มต้น และพบว่ารอบของความผันผวนสอดคล้องกับขนาดก้าวของการบีบอัด โดยโมเดลเปรียบเทียบที่ไม่ได้ใช้การบีบอัดแบบแบ่งบล็อกไม่ปรากฏรูปแบบเดียวกันนี้
