动察 Beating AI ข่าวด่วน Google เปิดตัว Agentic Video Understanding สำหรับ Gemini API มันให้โมเดลตัดสินใจเองว่าจะดูวิดีโอส่วนไหนและตรวจสอบอย่างไร โหมดปกติจะสุ่มเฟรมแบบคงที่ที่ 1 FPS แล้วใส่เข้าไปในบริบททั้งหมดในครั้งเดียว โหมดใหม่จะค้นหาช่วงตามไทม์ไลน์ด้วยตัวเอง และเลือกภาพ เสียง หรือข้อความถอดเสียงตามคำถาม เมื่อเจอการเคลื่อนไหวที่รวดเร็ว ก็สามารถเพิ่มอัตราเฟรมเพื่อตรวจสอบใหม่ได้
Google ทดสอบเองว่าเมื่อเปิดใช้ Gemini 3.7 Flash การใช้ Token ลดลงสูงสุด 88% ต้นทุนการวิเคราะห์ลดลงสูงสุด 66% และความแม่นยำเพิ่มขึ้นสัมพัทธ์สูงสุดประมาณ 7% มันสามารถระบุช่วงเวลาที่สั้นกว่า 1 วินาที และค้นหารายละเอียดหนึ่งในวิดีโอยาวหลายชั่วโมงได้
ในเชิงเทคนิค มันคือการนำขั้นตอนที่นักพัฒนาเคยต้องสร้างเองอย่าง "ค้นหาก่อน แล้วค่อยดูละเอียด" ใส่เข้าไปในภายในของ Gemini ตอนนี้ Gemini 3.7 Flash, 3.6 Flash และ 3.5 Flash-Lite รองรับทั้งหมด ใช้ได้ทั้งวิดีโอที่อัปโหลดและวิดีโอ YouTube โดยไม่มีค่าใช้จ่ายฟีเจอร์เพิ่มเติม ต่อไปจะเชื่อมต่อกับ Gemini App และ Ask YouTube ของ YouTube ด้วย
