lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

OpenAI ลงทุนในยูนิคอร์น AI ด้านกฎหมายมูลค่า 11,000 ล้านดอลลาร์ เริ่มใช้โมเดลโอเพนซอร์สจากจีนเป็นฐาน

อ่านบทความนี้ใน 58 นาที
ธุรกิจอีกแขนงหนึ่งของบริษัทโมเดล
หัวข้อต้นฉบับ: 《สตาร์ทอัพ AI ด้านกฎหมายมูลค่า 11,000 ล้านดอลลาร์ที่ OpenAI ลงทุน เริ่ม "ใช้เปลือก" โมเดลโอเพนซอร์สจากจีน》
ผู้เขียนต้นฉบับ: 動察Beating


วันที่ 20 สิงหาคม Harvey บริษัท AI ด้านกฎหมายที่ OpenAI ลงทุน เปิดตัว Tenet บริษัทที่ก่อตั้งในปี 2022 นี้มีมูลค่าประเมิน 11,000 ล้านดอลลาร์สหรัฐ ถือเป็นบริษัท AI ด้านกฎหมายที่มีมูลค่าสูงสุดในโลก ให้บริการองค์กรหลายพันแห่ง โดยมี Sequoia, a16z และ GIC อยู่ในรายชื่อผู้ถือหุ้นด้วย


Tenet คือชุดโมเดล proprietary ชุดแรกของบริษัท โดยใช้ Kimi K3 จาก Moonshot AI ที่เปิดเผยน้ำหนักโมเดลในเดือนกรกฎาคมเป็นฐาน ปัจจุบัน Tenet ยังอยู่ในขั้นตอนการวิจัยและพัฒนา Harvey วางแผนที่จะค่อยๆ นำความสามารถที่ผ่านการพิสูจน์แล้วไปใช้ในผลิตภัณฑ์


Winston Weinberg ผู้ก่อตั้ง Harvey เดิมเป็นทนายความด้านคดีความของ O'Melveny & Myers ส่วน Gabe Pereyra เคยทำงานวิจัยโมเดลขนาดใหญ่ที่ Google Brain และ Meta OpenAI ลงทุนในบริษัทนี้ตั้งแต่ช่วงแรก และหลังจากนั้นทั้งสองฝ่ายได้ร่วมกันฝึกโมเดลกฎหมายกรณีศึกษา โดยเพิ่มข้อมูลกฎหมายกรณีศึกษาของสหรัฐฯ ประมาณ 10,000 ล้าน token ในการฝึก ในกรณีศึกษาลูกค้าที่ OpenAI เผยแพร่ในขณะนั้น Pereyra กล่าวว่า Harvey ได้ประเมินแนวทางต่างๆ และสุดท้ายไว้วางใจเฉพาะการฝึกอบรมแบบกำหนดเองร่วมกับ OpenAI เท่านั้น


ในช่วงหลายปีที่ผ่านมา Harvey เกือบจะเป็นลูกค้าที่เป็นตัวแทนมากที่สุดของโมเดล closed-source ในอุตสาหกรรมบริการวิชาชีพ และสามารถเข้าถึงโมเดล closed-source ที่แข็งแกร่งที่สุดในโลกได้ตลอด แต่เมื่อตัดสินใจครั้งแรกที่จะนำงานด้านกฎหมาย เกณฑ์การประเมินของทนายความ และพลังคำนวณสองเดือนมาเขียนลงในชุดน้ำหนักโมเดลจริงๆ ฐานที่เลือกกลับเป็นโมเดล open-weight จากจีน


หลังจากโมเดลหนึ่งถูกเผยแพร่ อุตสาหกรรมจะรู้สองสิ่งอย่างรวดเร็ว: มันฉลาดแค่ไหน และความสามารถเหล่านี้ขายในราคาเท่าไร ภายในไม่กี่ชั่วโมง การอัปเดต benchmark การเปลี่ยนแปลงอันดับ Arena และกราฟพิกัดระหว่างความฉลาดและราคาจะเริ่มแพร่กระจาย โมเดลที่ฝึกมาหลายเดือนและใช้พลังคำนวณมหาศาล ถูกบีบอัดให้กลายเป็นจุดหนึ่งบนกราฟ


สำหรับนักพัฒนาส่วนใหญ่ วิธีนี้ยังคงมีประสิทธิภาพ สมมติฐานเบื้องหลังคือ เมื่อโมเดลถูกส่งถึงมือผู้ใช้ ความสามารถได้ถูกกำหนดไว้แล้ว เมื่อ closed-source API เป็นกระแสหลัก สมมติฐานนี้ก็เป็นจริง บริษัทโมเดลทำ pretraining และ post-training เสร็จ แล้วห่อหุ้มความสามารถเป็น API องค์กรปลายน้ำสามารถปรับ prompt ทำ retrieval สร้าง agent ได้ แต่ยากที่จะเปลี่ยนแปลงตัวโมเดลเองต่อไป


Open-weight ทำลายสมมติฐานนี้ เมื่อองค์กรได้รับน้ำหนักโมเดลแล้ว พวกเขาสามารถใส่ข้อมูลและความคิดเห็นจากผู้เชี่ยวชาญของตนเองต่อไป นำงานจริงและเกณฑ์การประเมินเข้าสู่การฝึก โมเดลสองตัวที่ได้คะแนน 90 คะแนนเท่ากันเมื่อเผยแพร่ หากใช้ข้อมูลและพลังคำนวณชุดเดียวกันฝึกต่อ ตัวหนึ่งอาจหยุดที่ 91 คะแนน แต่อีกตัวอาจไปถึง 97 คะแนน สำหรับบริษัทที่วางแผนจะลงทุนเวลา พลังคำนวณ และทรัพยากรผู้เชี่ยวชาญหลายเดือน คะแนน 90 ที่เท่ากันตอนเผยแพร่ กลับกลายเป็นความแตกต่างอย่างสิ้นเชิงแล้ว


อย่างไรก็ตาม เรื่องนี้มีเงื่อนไข前提อยู่ บริษัทจะยอมทุ่มเวลาหลายเดือนและชุดพลังประมวลผลเพื่อฝึกต่อนั้น ก่อนอื่นต้องมีชุดน้ำหนักที่คุ้มค่าต่อการฝึกเสียก่อน ในช่วงหลายปีที่ผ่านมา ระหว่างโมเดลเปิดกับโมเดลปิดที่ล้ำหน้าที่สุดยังคงมีช่องว่างอยู่เสมอ ในด้านการตอบคำถามทั่วไปและการเขียนโค้ดในชีวิตประจำวัน ความแตกต่างไม่มากนัก แต่เมื่อเข้าสู่สถานการณ์เฉพาะทางที่ต้นทุนของความผิดพลาดสูงมาก ช่องว่างนี้ก็จะถูกขยายให้ใหญ่ขึ้น กฎหมายเป็นหนึ่งในประเภทที่มีข้อกำหนดสูงที่สุด ในอดีต โมเดลที่สามารถเข้าสู่ธุรกิจหลักของบริษัทอย่าง Harvey ได้จริง ๆ นั้น ล้วนเป็นโมเดลปิดที่มีความสามารถแข็งแกร่งที่สุดในยุคนั้น น้ำหนักเปิดย่อมควบคุมและปรับแต่งได้ง่ายกว่า แต่หากแม้แต่งานเฉพาะทางขั้นพื้นฐานยังทำไม่ได้ พื้นที่สำหรับการฝึกในภายหลังก็ไม่ต้องพูดถึง



Kimi K3 ทำให้เกณฑ์ที่ยืนหยัดมานานนี้ถูกข้ามผ่านเป็นครั้งแรก พารามิเตอร์รวมของมันสูงถึง 2.8 ล้านล้าน รองรับบริบท 1 ล้านโทเคน และมีความสามารถพื้นฐานที่ดีอยู่แล้วในงานระยะยาว การใช้เครื่องมือ และการให้เหตุผลที่ซับซ้อน สำหรับ Harvey แล้ว โมเดลน้ำหนักเปิดเป็นครั้งแรกที่ไม่ใช่แค่ทางเลือกที่มีต้นทุนต่ำกว่าและควบคุมได้มากกว่า แต่เริ่มเข้าสู่ขอบเขตที่สามารถประเมินอย่างจริงจังร่วมกับโมเดล前沿ได้


ดังนั้น พวกเขาจึงเริ่มสนใจคำถามที่แทบไม่เคยถูกหยิบยกมาพูดคุยแยกกันในอดีต นั่นคือ ชุดน้ำหนักนี้ฝึกต่อได้ง่ายแค่ไหน


ตอนที่ Cursor ฝึก Composer 2 พวกเขาไม่ได้เลือกโมเดลตามอันดับในลีดเดอร์บอร์ดของเอเจนต์เขียนโค้ดทั่วไป การตัดสินใจของพวกเขาคือ ความสามารถของเอเจนต์และงานระยะยาวจะเปลี่ยนแปลงอย่างมากในระหว่างกระบวนการเรียนรู้แบบเสริมแรง อันดับก่อนเริ่มฝึกอาจไม่สามารถทำนายผลลัพธ์สุดท้ายได้ เมื่อเทียบกับคะแนนในลีดเดอร์บอร์ด Cursor ให้ความสำคัญกับความรู้ด้านการเขียนโค้ดของโมเดล ความสามารถในการติดตามสถานะ ค่าความสับสนบนโค้ดเบสภายใน และประสิทธิภาพการทำงานในโครงสร้างพื้นฐานของตัวเองมากกว่า สุดท้าย ฐานที่ถูกเลือกคือโมเดล Kimi K2.5


Cognition ซึ่งอยู่เบื้องหลัง Devin ก็มีการตัดสินใจแบบเดียวกัน หลังจากที่ K3 เปิดน้ำหนัก พวกเขารีบเชื่อมต่อโมเดลเข้ากับ Devin Desktop และ CLI อย่างรวดเร็ว บนชุดทดสอบ FrontierCode 1.1 Extended ของตัวเอง K3 ได้คะแนน 58.2% และอัตราผ่าน 63.6% ชุดทดสอบนี้ประเมินงานวิศวกรรมจริง ไม่ว่าจะเป็นโค้ดที่ผสานเข้ากับ主干ได้หรือไม่ และคุณภาพเพียงพอหรือไม่ ล้วนถูกนำมาคิดคำนวณ Cognition ยังกล่าวอีกว่า K3 ทำได้ดีเป็นพิเศษในการจำลองบั๊กและการจัดการสภาพแวดล้อมการทำงานของตัวเอง ซึ่งสองสิ่งนี้เป็นจุดที่มักจะล้มเหลวได้ง่ายที่สุดในงานเขียนโค้ดระยะยาว หลังจากนั้น พวกเขาก็ทำ post-training บนชุดน้ำหนักนี้ด้วย


สิ่งที่หายากอย่างแท้จริงไม่ใช่ข้อมูลกฎหมาย


Harvey เติบโตเร็วมาก เดือนมีนาคมปีนี้ พวกเขาให้บริการหน่วยงานประมาณ 1,300 แห่งและทนายความกว่า 100,000 คน ห้าเดือนต่อมา จำนวนลูกค้าเพิ่มขึ้นเกือบเท่าตัว ครอบคลุม 70 ประเทศ และสำนักงานกฎหมายมากกว่าสามในสี่ใน AmLaw 100 ต่างใช้ Harvey อยู่


มูลค่าโครงการบริการทางกฎหมายสูง และความอดทนต่อข้อผิดพลาดต่ำมาก รายงานการตรวจสอบสถานะสำหรับการควบรวมกิจการอาจต้องค้นหาข้อกำหนดการเปลี่ยนแปลงการควบคุมจากเอกสารหลายร้อยหรือหลายพันฉบับ เพื่อประเมินว่าธุรกรรมนั้นเข้าข่ายเงื่อนไขหรือไม่ จากนั้นจึงระบุความเสี่ยงและแนบหลักฐานต้นฉบับ ในกระบวนการนี้มักมีการตัดสินใจหลายสิบครั้งที่ต้องต่อเนื่องกัน หากพลาดเพียงประเด็นเดียวที่ส่งผลกระทบต่อธุรกรรมจริง ๆ งานส่วนใหญ่ที่ทำถูกต้องก่อนหน้านี้ก็แทบจะไร้ความหมาย


เมื่อมีสำนักงานกฎหมายที่ใช้บริการมากขึ้นเรื่อย ๆ Harvey ก็สะสมข้อมูลประเภทหนึ่งที่บริษัทโมเดลพื้นฐานทั่วไป很难ได้มาด้วยตัวเอง มันรู้ว่าทนายความจะจัดวางงานอย่างไร และรู้ว่าหุ้นส่วนที่ได้รับผลลัพธ์สุดท้ายจะตรวจสอบข้อผิดพลาดจากจุดใด



ประสบการณ์เหล่านี้ถูกนำมาสร้างเป็น Legal Agent Benchmark ภายในมีงานกฎหมายระยะยาวมากกว่า 1,200 รายการ ครอบคลุม 24 สาขาการปฏิบัติงาน คำอธิบายของแต่ละงานเฉลี่ยเพียงประมาณ 50 คำ จากนั้นโมเดลจะเข้าสู่สภาพแวดล้อมของคดีลูกค้าแบบปิด เอกสารที่เกี่ยวข้องและวัสดุที่ไม่เกี่ยวข้องจำนวนมากถูกปะปนกัน โมเดลต้องค้นหา อ่าน และตัดสินใจด้วยตัวเอง สุดท้ายส่งมอบผลงานที่สามารถตรวจสอบได้ทีละรายการ


แต่ละงานมีเกณฑ์การให้คะแนนเฉลี่ยประมาณ 50 ข้อ งานที่ซับซ้อนอาจมีถึงหลายร้อยข้อ ข้อเท็จจริงครบถ้วนหรือไม่ ข้อสรุปสามารถยืนยันได้หรือไม่ การอ้างอิงตรงกับต้นฉบับหรือไม่ ระดับความเสี่ยงและคำแนะนำสมเหตุสมผลหรือไม่ ล้วนถูกแยกเป็นรายการคะแนนที่สามารถตัดสินได้อิสระ งานหนึ่งรายการอาจดำเนินต่อเนื่องยาวนานกว่า 1,000 รอบ ใช้โทเค็นหลายแสนหน่วย


ทนายความรุ่นใหม่หลังจากทำงานหลายปีจะค่อย ๆ รู้ว่าลูกค้ากังวลอะไรจริง ๆ และจดจำว่าข้อกำหนดเล็ก ๆ ที่ดูไม่สำคัญไม่ควรพลาด ประสบการณ์เหล่านี้ในอดีตยากที่จะเขียนลงในตำราเรียนได้ครบถ้วน ส่วนใหญ่ยังคงอยู่ในการแก้ไขของหุ้นส่วน นิสัยการทำงานภายในทีม และในเอกสารที่ส่งมอบไปแล้วหลายฉบับ


Harvey แยกส่วนหนึ่งของสิ่งเหล่านี้ออกเป็นงาน วัสดุ และเกณฑ์การให้คะแนน ทุกครั้งที่โมเดลทำงานเสร็จ ก็จะมีผลตอบรับที่สามารถคำนวณและเปรียบเทียบได้


พรอมต์และการค้นหาสามารถบอกโมเดลได้ว่าต้องไปหาที่ไหน ส่วนเกณฑ์การให้คะแนนเริ่มตอบคำถามอีกข้อหนึ่งว่า งานกฎหมายหนึ่งชิ้นต้องทำถึงระดับใดจึงจะถือว่าเสร็จสมบูรณ์ สิ่งที่ Harvey สะสมได้จริงในช่วงหลายปีที่ผ่านมา นอกจากข้อมูลลูกค้าและข้อมูลกฎหมายแล้ว ยังมีระบบการประเมินเชิงวิชาชีพที่สามารถใช้ฝึกโมเดลได้โดยตรง


เขียนประสบการณ์กฎหมายลงในน้ำหนัก


งานและเกณฑ์การให้คะแนนเหล่านั้นเริ่มเข้าสู่การฝึกจริง ข้อมูลมาจากเอกสารกฎหมายสาธารณะ ข้อมูลสังเคราะห์ และข้อมูลจากผู้เชี่ยวชาญมนุษย์ ทนายความที่ปฏิบัติงานมีส่วนร่วมในการสร้างงาน การให้คะแนน และการตรวจสอบข้อมูลสังเคราะห์ Harvey เตรียมสภาพแวดล้อมงานสำหรับเอเจนต์กฎหมายทั้งหมดประมาณ 1,750 รายการ


เมื่อโมเดลเข้าสู่พื้นที่ทำงานที่มีเอกสารและเครื่องมือแล้ว จะต้องอ่านไฟล์ เรียกใช้เครื่องมือ และส่งผลลัพธ์ด้วยตัวเอง จากนั้นระบบจะตรวจสอบเส้นทางการทำงานทั้งหมดตามมาตรฐานที่ทนายความกำหนด เพื่อดูว่าข้อกำหนดเฉพาะสำเร็จไปเท่าใด และปัญหาทางกฎหมายได้รับการแก้ไขในระดับใด หากข้อกำหนดสำคัญทั้งหมดผ่านเกณฑ์ จะได้รับรางวัลพิเศษเพิ่มเติม


ในแต่ละรอบการฝึกจะสร้างเส้นทางงานมากกว่าหมื่นรายการ Harvey ใช้กลยุทธ์การปรับให้เหมาะสมแบบกลุ่มลำดับ หรือ GSPO เพื่อให้โมเดลสร้างวิธีการที่หลากหลายสำหรับงานเดียวกัน จากนั้นอัปเดตน้ำหนักตามความแตกต่างของคุณภาพระหว่างผลลัพธ์ หากคะแนนของสองเส้นทางใกล้เคียงกันเกินไป ระบบจะทำการให้คะแนนใหม่ เพื่อลดผลกระทบของสัญญาณรบกวนจากการประเมินต่อการฝึก


กระบวนการทั้งหมดใช้เวลาประมาณสองเดือน โดยใช้ NVIDIA B300 ประมาณ 150 ตัว การฝึกโมเดล前沿ระดับแนวหน้าปกติต้องใช้การ์ดหลายหมื่นตัว แต่การลงทุนด้านพลังประมวลผลของ Harvey ในครั้งนี้เป็นคนละระดับ Harvey ใช้ LoRA แบบ rank-64 ครอบคลุมเลเยอร์ความสนใจ เครือข่ายฟีดฟอร์เวิร์ด และน้ำหนักผู้เชี่ยวชาญแบบเส้นทางของ Kimi K3 เกี่ยวข้องกับเทนเซอร์ผู้เชี่ยวชาญประมาณ 500,000 ตัว


การฝึกด้วยเส้นทางยาวยังเผชิญกับปัญหาทางวิศวกรรม งานทางกฎหมายหนึ่งรายการอาจดำเนินต่อเนื่องหลายร้อยรอบ ขณะที่โมเดลยังคงสร้างเส้นทางงาน น้ำหนักที่ฝั่งฝึกได้อัปเดตไปแล้ว เมื่อเทรนเนอร์ย้อนกลับมาคำนวณเส้นทางนี้ หากสถานะโมเดลทั้งสองฝั่งไม่ตรงกัน ความน่าจะเป็นของการกระทำแต่ละขั้นตอนในตอนนั้นก็จะเปลี่ยนแปลงไป ทำให้รางวัลยากที่จะส่งผลอย่างแม่นยำต่อการตัดสินใจเดิม



โครงสร้างผู้เชี่ยวชาญแบบผสมของ Kimi K3 ทำให้ปัญหานี้ซับซ้อนยิ่งขึ้น เมื่อแต่ละ token เข้าสู่โมเดล เราเตอร์จะเลือกผู้เชี่ยวชาญ 16 จาก 896 รายเพื่อเข้าร่วมการคำนวณ หากฝั่งฝึกและฝั่งปฏิบัติการมีความแตกต่างเล็กน้อยในเรื่องความแม่นยำเชิงตัวเลขหรือวิธีการประมวลผลแบบแบตช์ token เดียวกันอาจถูกจัดสรรให้ผู้เชี่ยวชาญต่างกัน ทำให้เส้นทางเดิมไม่สามารถสร้างซ้ำได้อย่างสมบูรณ์


ดังนั้น Harvey และผู้ให้บริการจึงทำการจัดตำแหน่งเชิงตัวเลขระหว่างเทรนเนอร์และสภาพแวดล้อมการปฏิบัติการในระดับเคอร์เนล ทุกครั้งที่น้ำหนักอัปเดตเสร็จ จะโหลดเข้าสู่สภาพแวดล้อมการปฏิบัติการแบบร้อนทันที โดยไม่ต้องหยุดการสร้างงานซ้ำแล้วซ้ำเล่า ระบบยังบันทึกผลการเลือกเส้นทางผู้เชี่ยวชาญของแต่ละ token เพื่อให้เทรนเนอร์เมื่อคำนวณใหม่สามารถกลับไปยังเส้นทางที่โมเดลใช้ในการสร้างเส้นทางนี้ได้มากที่สุด


เมื่อทำถึงจุดนี้ Tenet ก็ไม่เหมือนการปรับแต่งละเอียดทั่วไปที่เพิ่มคลังข้อมูลกฎหมายเข้าไปในโมเดลอีกต่อไป สิ่งที่ Harvey สร้างขึ้นคือกระบวนการฝึกที่สามารถรันซ้ำได้อย่างต่อเนื่อง งานกฎหมายเข้าสู่สภาพแวดล้อมอย่างไม่หยุดยั้ง โมเดลทำงานเสร็จ มาตรฐานที่ทนายความกำหนดประเมินเส้นทางทั้งหมด น้ำหนักถูกอัปเดต จากนั้นโมเดลใหม่กลับเข้าสู่สภาพแวดล้อมเพื่อทำงานรอบถัดไป


ความสามารถของ Kimi K3 ในการถูกฝึกต่ออย่างเสถียร ก็ถูกทดสอบจริงในวงจรเช่นนี้


หลังการฝึกฝน มัน更像เอเจนต์ทางกฎหมาย


สิ่งที่ Harvey ต้องการปรับปรุงจริงๆ คือความสามารถของโมเดลในการทำงานด้านกฎหมายระยะยาว มันใช้เกณฑ์แบบ all-pass ที่เข้มงวด โดยคะแนนมาตรฐานสำคัญในงานหนึ่งๆ ต้องผ่านทั้งหมด ตามผลลัพธ์ภายในที่ Harvey เปิดเผย บนชุดข้อมูล LAB ที่เก็บไว้ซึ่งไม่ได้เข้าร่วมการฝึก Tenet ทำงานที่เสร็จสมบูรณ์ได้ใกล้เคียงสองเท่าของ Kimi K3 ดั้งเดิม อัตรา all-pass เพิ่มขึ้นจากประมาณ 11% เป็น 19.7% เพิ่มขึ้นประมาณ 9 จุดเปอร์เซ็นต์


ใน LAB Contracts ที่ทดสอบการร่าง สอบทาน และเจรจาสัญญาโดยเฉพาะ จำนวนงานที่เสร็จสมบูรณ์เพิ่มขึ้นประมาณ 20% อัตรา all-pass ถึง 11.3% เพิ่มขึ้นประมาณ 2 จุดเปอร์เซ็นต์ ตามอันดับของ Harvey เอง Tenet อยู่อันดับหนึ่งใน LAB Contracts และอันดับสองใน LAB เต็มรูปแบบ


จากนั้นมันนำ Tenet ไปทดสอบภายนอกสองชุด ได้แก่ APEX Agents Corporate Law ของ Mercor และ Redline Bench ของ Crosby ชุดแรกทดสอบงานเฉพาะทางระยะยาวในสภาพแวดล้อมการทำงานจำลอง ส่วนชุดหลังให้โมเดลแก้ไขสัญญาอย่างต่อเนื่อง แล้วให้คะแนนตามมาตรฐานที่ทนายความกำหนด



Tenet ไม่เคยเห็นข้อมูลฝึกของสองชุดทดสอบนี้ แต่ผลลัพธ์ยังสูงกว่า Kimi K3 ดั้งเดิมอย่างชัดเจน แสดงให้เห็นว่าความสามารถที่ฝึกในสภาพแวดล้อมงานของ Harvey สามารถถ่ายโอนไปยังงานกฎหมายใหม่ได้


อย่างไรก็ตาม อีกปัญหาหนึ่งคือ การฝึกเฉพาะทางหลังการฝึกมักทำให้โมเดลเก่งขึ้นในงานประเภทหนึ่ง แต่สูญเสียความรู้และความสามารถในการให้เหตุผลเดิมบางส่วนไป


บน LegalBench, CUAD และ MAUD Tenet ไม่แสดงการถดถอยอย่างชัดเจน ในชุดย่อยยากของ Scale Professional Reasoning Benchmark คะแนนยังเพิ่มขึ้นเล็กน้อยจาก 36.0% เป็น 36.8% อย่างน้อยจากผลลัพธ์ชุดนี้ หลังจาก Kimi K3 แข็งแกร่งขึ้นในงานกฎหมาย ก็ไม่พบปัญหาการลืมความสามารถอย่างชัดเจน


การออกแบบรางวัลของ Harvey จะ偏向เส้นทางที่สั้นกว่าเมื่อคุณภาพผลลัพธ์ใกล้เคียงกัน เพราะเอเจนต์กฎหมายยิ่งอ่านเอกสารเพิ่มหนึ่งไฟล์หรือเรียกใช้เครื่องมือเพิ่มหนึ่งครั้ง ก็จะเพิ่มการใช้ token และเวลารอคอย หลังการฝึก Tenet ลดขั้นตอนที่ไม่มีประสิทธิภาพบางส่วนลง ขณะที่คุณภาพงานดีขึ้น ต้นทุนการทำงานให้เสร็จก็คงที่โดยพื้นฐาน


การปรับแต่งหลังการฝึกครั้งนี้เปลี่ยนแปลงมากขึ้นในวิธีที่ Kimi K3 จัดการงานด้านกฎหมายที่ซับซ้อน มันสามารถวางขั้นตอนและเรียกใช้เครื่องมือได้ดีขึ้น และพลาดข้อกำหนดสำคัญในงานน้อยลง


Harvey เริ่มใช้กลยุทธ์หลายโมเดลตั้งแต่ปี 2025 และในปีนี้ยังคงเชื่อมต่อโมเดลใหม่จาก OpenAI และ Anthropic อย่างต่อเนื่อง Tenet ทำให้ระบบนี้มีโมเดลน้ำหนักเปิดที่ Harvey ฝึกเองและควบคุมเองเป็นครั้งแรก


สิ่งที่ต้องการคือโมเดลที่มีฐานรองรับที่ผ่านเกณฑ์อยู่แล้ว งานกฎหมายของ Harvey อาจต้องจัดการเอกสารจำนวนมาก ดำเนินการต่อเนื่องหลายร้อยหรือหลายพันรอบ และโมเดลต้องรักษาสถานะระหว่างกระบวนการทำงานที่ยาวนาน การฝึกหลังการฝึกสามารถปรับแต่งวิธีจัดการงานกฎหมายได้ แต่ยากที่จะเสริมความสามารถที่ฐานไม่ได้มีตั้งแต่แรก


อีกเงื่อนไขหนึ่งคือการควบคุม Harvey สามารถเรียกใช้ GPT และ Claude ผ่าน API แต่ไม่สามารถเขียนสภาพแวดล้อมงานกฎหมาย 1,750 รายการและเกณฑ์การประเมินของทนายความลงในโมเดลปิดเหล่านี้ได้ น้ำหนักเปิดทำให้มันสามารถตัดสินใจเองได้ว่าจะฝึกอย่างไร ออกแบบรางวัลอย่างไร และยังสามารถเก็บความสามารถเฉพาะทางที่ฝึกไว้ในน้ำหนักที่ตัวเองควบคุม


อย่างไรก็ตาม หลังจากได้น้ำหนักมาแล้ว ยังต้องตรวจสอบว่าโมเดลนี้เหมาะสำหรับการฝึกต่อหรือไม่ การเรียนรู้เสริมแรงแบบเส้นทางยาวจะทำงานได้อย่างเสถียรหรือไม่ การกำหนดเส้นทางของโมเดลผสมผู้เชี่ยวชาญจะทำซ้ำได้แม่นยำหรือไม่ ความสามารถเฉพาะทางที่เพิ่มขึ้นจะทำให้ความรู้เดิมหายไปหรือไม่ และต้นทุนการอนุมานยังอยู่ในช่วงที่ใช้งานจริงได้หรือไม่ สิ่งเหล่านี้ต้องทดลองจริงสักครั้งจึงจะรู้


หลังจาก Tenet ทำงานครบสองเดือน Kimi K3 ก็ให้คำตอบในรอบนี้ กระบวนการฝึกทำงานได้อย่างเสถียร ความสามารถด้านงานกฎหมายเพิ่มขึ้นอย่างชัดเจน ไม่พบการลืมความสามารถอย่างมีนัยสำคัญ และต้นทุนก็ไม่失控ไปพร้อมกับผลลัพธ์


สำหรับ Harvey ผลลัพธ์เหล่านี้สำคัญกว่า "น้ำหนักเปิด" เอง การดาวน์โหลดน้ำหนักได้เพียงแสดงว่าองค์กรมีสิทธิ์ฝึกต่อ แต่ความสามารถที่เหลืออยู่หลังการฝึกต่างหากที่決定ว่าโมเดลนี้คุ้มค่าที่จะลงทุนในพลังประมวลผล ข้อมูล และเวลาของผู้เชี่ยวชาญต่อไปหรือไม่


ธุรกิจอีกแขนงของบริษัทโมเดล


Harvey กล่าวว่าเป้าหมายของมันคือการให้สำนักงานกฎหมายสามารถฝึกโมเดลเฉพาะทางของตัวเองบนน้ำหนักเปิด และมีความสามารถที่เกิดขึ้นหลังการฝึก สิ่งที่ Tenet ส่งมอบไม่ใช่แค่ชุดโมเดล แต่เป็นแนวทางปฏิบัติ


ในอดีต ธุรกิจของบริษัทโมเดลพื้นฐานส่วนใหญ่เกิดขึ้นในการเรียกใช้หลังการเปิดตัวโมเดล น้ำหนักเปิดนำมาซึ่งความสัมพันธ์อีกรูปแบบหนึ่ง บริษัทสามารถนำโมเดลพื้นฐานที่มีอยู่มาฝึกต่อ เก็บความรู้เฉพาะอุตสาหกรรมของตัวเองลงในน้ำหนัก และสุดท้ายได้โมเดลที่ใกล้เคียงกับธุรกิจของตัวเองมากขึ้น


ความต้องการประเภทนี้ในอดีตยากที่จะก่อตัวเป็นตลาดจริงได้ เมื่อโมเดลทั่วไปยังไม่แข็งแกร่งพอ บริษัทแนวตั้งแม้จะได้น้ำหนักโมเดลมา ก็ยากที่จะ补齐การให้เหตุผลระยะยาว การเรียกใช้เครื่องมือ และการจัดการงานที่ซับซ้อนด้วยการฝึกเพิ่มเติมเพียงอย่างเดียว การฝึกจากศูนย์ด้วยตัวเองก็แพงเกินไป บริษัทส่วนใหญ่ไม่จำเป็นต้องทำเลย



Cursor ฝึก Composer 2 ในด้านการเขียนโปรแกรม Cognition ก็ฝึกโมเดลที่ใช้ใน Devin บนน้ำหนักชุดเดียวกัน Harvey ก็สร้าง Tenet ในด้านกฎหมาย การเขียนโปรแกรมและกฎหมายห่างไกลกันมาก แต่ทั้งคู่เลือกที่จะเริ่มจากความสามารถทั่วไปที่ Kimi ฝึกไว้แล้ว แล้วนำงานเฉพาะทางที่ตัวเองถนัดที่สุดใส่เข้าไปต่อ


Tenet ยังทำให้อุปสรรคของเรื่องนี้ชัดเจนเป็นรูปธรรม สองเดือน การ์ดประมาณ 150 ใบ บวกกับชุดเกณฑ์การประเมินที่ทนายความผู้มีใบอนุญาตกำหนดไว้ บริษัทหนึ่งก็สามารถผลักดันน้ำหนักทั่วไปชุดหนึ่งไปสู่แนวหน้าของอุตสาหกรรมตัวเองได้ อุปสรรคด้านพลังคำนวณลดลงไปหนึ่งระดับแล้ว ส่วนที่ยากต่อการลอกเลียนแบบเริ่มตกไปอยู่อีกด้านหนึ่ง นั่นคือมีใครบ้างที่สามารถอธิบายได้ชัดเจนว่างานเฉพาะทางหนึ่งๆ ทำถึงระดับไหนถึงจะถือว่าเสร็จสมบูรณ์


การพัฒนาซอฟต์แวร์และกฎหมายเป็นเพียงสองกรณีที่เกิดขึ้นแล้ว การเงิน การให้คำปรึกษา เภสัชกรรม การบัญชี และอุตสาหกรรมบริการเฉพาะทางอีกมากมาย ต่างมีข้อมูล เวิร์กโฟลว์ และดุลยพินิจของผู้เชี่ยวชาญของตัวเอง อุตสาหกรรมเหล่านี้本身就是ตลาดงานความรู้ที่มีขนาดเป็นล้านล้านดอลลาร์ บริษัทชั้นนำในนั้นอาจไม่จำเป็นต้องฝึกโมเดลพื้นฐานด้วยตัวเอง แต่มีเงื่อนไขมากขึ้นเรื่อยๆ ที่จะฝึกโมเดลของตัวเองต่อจากน้ำหนักที่成熟แล้วชุดหนึ่ง


หากเส้นทางนี้ยังคงใช้ได้ต่อไป ตลาดที่ Kimi เผชิญจะไม่ใช่แค่จำนวนคนที่เรียกใช้มันอีกต่อไป สิ่งที่น่าจับตามองต่อไปคือ หลังจาก Harvey, Cursor และ Devin แล้ว จะมีอีกกี่บริษัทที่เลือกฝึกโมเดลของตัวเองบน Kimi


ลิงก์ต้นฉบับ


ยินดีต้อนรับสู่ชุมชนทางการของ BlockBeats:

กลุ่ม Telegram สมัครสมาชิก: https://t.me/theblockbeats

กลุ่ม Telegram พูดคุย: https://t.me/BlockBeats_App

บัญชี Twitter ทางการ: https://twitter.com/BlockBeatsAsia

举报 แก้ไข/รายงาน
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
แก้ไข/รายงาน
ส่ง