ตามการค้นวัดของดีพชาต บีทติ้ง พบว่าเร็วที่มีข่าวลือหนึ่งหากในกล่องโต้ตอบของ DeepSeek ป้อนป้ายสัญลักษณ์พิเศษเช่น
สถานการณ์จริงกับปัญหาการกีดกันระหว่างผู้เช่าหลายรายไม่เกี่ยวข้อง หลังจากป้อนป้ายแท็กอย่าง think หรือ <|begin_of_sentence|> เมื่อแล้วโมเดลจะถูกหลอกให้เข้าสู่แบบรูปแบบการฝึกอบรมในขณะฝึกอบรม จากนั้นมีขึ้นจากความจำของตนเองและคำแนะนำของระบบปัจจุบัน (รวมถึงวันที่ของวันนั้น) สร้างเนื้อหาที่ดูเหมือนสนทนาจริง ๆ มากขึ้น ข้อมูลเหล่านี้เป็นเนื้อหาที่โมเดลสร้างขึ้นเองไม่ได้มาจากการดึงออกจากการสนทนาของผู้ใช้คนอื่นเรียลไทม์
ปรากฏการณ์เช่นนี้เรียกว่าการสกัดถามข้อมูลการฝึกอบรม (Training Data Extraction) ซึ่งเป็นปัญหาที่เฉพาะของโมเดลขนาดใหญ่ทั้งหมดไม่ใช่เฉพาะเจา DeepSeek Google DeepMind ได้ทำการวิจัยเฉพาะโดยละเอียดเมื่อปี 2023 แสดงให้เห็นว่าสามารถใช้ข้อมูลฝึกอบรมที่สกัดได้จากตัวจินตภาพทั้งหลาย เช่น GPT และ PaLM ICLR 2025 มีการรวบรวมโครงงาน Magpie และเอกสารที่นี้ที่ตำรวจวิจารณ์เคล็ดลับโมเดลนี้สามารถใช้เป็นเครื่องมือสำหรับโมเดลที่ถูกปรับปรุงด้วยโทเค็นเทมเพลตเพียงแค่ป้อนเครื่องเข้าไปเจียมได้ข้อมูลการฝึก FTBA
มีคนใช้ "ข้อมูลการรั่วไหลประกอบด้วยวันที่วันนี้" มาโต้เถียงว่าข้อมูลการฝึกอบรมไม่สามารถเป็นของวันนี้ได้ แต่ในทุกสนทนาของ DeepSeek คำแนะนำของระบบในแต่ละสนทนาจะมีวันที่ของวันนั้น จึงทำให้เนื้อหาที่โมเดลสร้างมีประกอบด้วยวันที่นี้ ซึ่งไม่สามารถพิสูจน์ได้ว่าเนื้อหามาจากผู้ใช้คนอื่นโหรือไม่หากต้องการพิสูจน์ว่าเป็นปัญหาการกีดกันระหว่างผู้เช่าหลายรายจำเป็นต้องยืนยันว่าข้อมูลที่รั่วออกมีต้นฉบับจริงจากผู้ใช้อื่น ๆ ที่มีการเชื่อง์เจ้าง่ายตอนนี้ไม่มีหลักฐานใด ๆ ที่รองรองข้อนี้
