จาก 动察 Beating ตรวจสอบพบว่า Vals AI บริษัทประเมินโมเดล AI ได้ระดมทุนรอบ Series A มูลค่า 40 ล้านดอลลาร์สหรัฐ โดยมีมูลค่าบริษัทถึง 400 ล้านดอลลาร์สหรัฐ นำโดย a16z ขณะที่นักลงทุนเดิมอย่าง 8VC, Pear VC, Bloomberg Beta ยังคงร่วมลงทุนต่อเนื่อง
Vals ทำหน้าที่เป็นผู้ประเมินโมเดลขนาดใหญ่จากบุคคลที่สาม ปัจจุบันโมเดลหลายตัวที่เปิดตัวยังคงให้ผู้ผลิตเป็นผู้ทดสอบและรายงานผลด้วยตัวเอง แต่ Vals ใช้โจทย์จริงจากสายงานเขียนโปรแกรม การเงิน กฎหมาย การแพทย์ ฯลฯ เพื่อทดสอบโมเดลต่างๆ อย่างเป็นมาตรฐานเดียวกัน ทางบริษัทระบุว่าผลการประเมินของตนถูกอ้างอิงในโมเดลการ์ดของ OpenAI, Anthropic, Google, Meta และ xAI แล้ว และรายได้ปีนี้ก็สูงถึง 8 เท่าของทั้งปี 2025 แล้ว
สิ่งที่ a16z มองเห็นคือคุณค่าของการเป็น "กรรมการบุคคลที่สาม" นี้ เพราะ Benchmark แบบเปิดเผยถูกทำคะแนนให้สูงขึ้นได้ง่ายขึ้นเรื่อยๆ มีการปนข้อมูลฝึก และแม้แต่ถูกผู้ผลิตปรับแต่งให้เหมาะกับชุดทดสอบโดยเฉพาะ คะแนนสูงในลิสต์จึงไม่จำเป็นต้องหมายถึงใช้งานจริงได้ดีเสมอไป
ครั้งนี้ Vals ยังเปิดให้ใช้งาน Vals Smith อย่างเต็มรูปแบบ ซึ่งสามารถแปลง GitHub repository ใดก็ได้ให้เป็น Coding Benchmark ได้ทันที ระบบจะดึงโจทย์พัฒนาจริงจาก PR ในอดีต จากนั้นใช้การทดสอบแบบซ่อนเพื่อตรวจสอบว่าโมเดลสามารถทำงานได้สำเร็จหรือไม่ ทำให้องค์กรสามารถทดสอบได้โดยตรงว่าโมเดลใดเหมาะกับโค้ดเบสของตัวเองมากที่สุด แทนที่จะดูเพียงลิสต์คะแนนสาธารณะ
