ตามข่าว 1M AI ในวันที่ 4 มีนาคม โก้เกิ้ลได้เปิดตัว Gemini 3.1 Flash-Lite Preview ซึ่งเป็นโมเดลที่มีความเร็วสูงสุดและต้นทุนต่ำที่สุดในชุด Gemini 3 โมเดล โดยโมเดลนี้ใช้งานบน Gemini 3 Pro Architecture โดยใช้การออกแบบโมเดลเนื้อหาไม่ครบ (MoE) โดยเปิดใช้งานเพียงบางส่วนของพารามิเตอร์เพื่อลดค่า Inference ราคา API คือ Input $0.25/ล้าน token และ Output $1.50/ล้าน token ที่มีมูลค่าประมาณ 1/8 ของ Gemini 3.1 Pro ($2/$18)。
ในเรื่องประสิทธิภาพ โดยเปรียบเทียบกับ Gemini 2.5 Flash ความล่าช้าของ Token แรกลดลง 2.5 เท่า ความเร็ว Output เพิ่มขึ้น 45% ไปถึง 363 token ต่อวินาที รองรับข้อมูล Input สูงสุด 1 ล้าน token และ Output 6.4 หมื่น token สนับสนุนข้อมูลแบบข้อความ รูปภาพ เสียง และวิดีโอไว้ใน 11 รายการเทสเบนช์ภายใน Flash-Lite ได้ดีกว่า GPT-5 mini และ Claude 4.5 Haiku ี GPQA Diamond (ตอบคำถามทางวิทยาศาสตร์ระดับดีกรี) ถึง 86.9% MMMU-Pro (การออกแบบตามหลายรูปแบบ) 76.8% LiveCodeBench (การสร้างโค้ด) 72.0%
โมเดลนี้มี "ระดับความคิด" (thinking levels) ที่สามารถปรับได้ นักพัฒนาสามารถควบคุมความลึกในการอ่านข้อมูลของโมเดลในฉากสูงให้สมดุลระหว่างคุณภาพและต้นทุน ณ ขณะนี้สามารถเข้าถึงได้ผ่าน Gemini API (Google AI Studio) และ Vertex AI ในรูปแบบ Preview Version
