lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

Hugging Face เปิดให้ Claude Code และ Codex เข้าร่วมการฝึก RL โดยตรง

动察 Beating ข่าวด่วน AI, Hugging Face ได้เปิดโอเพนซอร์สชุดโซลูชัน Multi-harness RL ซึ่งสามารถนำ Claude Code, Codex, OpenCode และ Coding Agent สำเร็จรูปอื่นๆ เชื่อมต่อเข้ากับกระบวนการเรียนรู้แบบเสริมกำลังได้โดยตรง เพื่อใช้ฝึกโมเดลโอเพนซอร์สที่เชื่อมต่ออยู่ โดยไม่จำเป็นต้องสร้างสภาพแวดล้อมการฝึกใหม่สำหรับแต่ละ Agent


บริษัทโมเดลขนาดใหญ่อย่าง OpenAI ฝึกโมเดลในสภาพแวดล้อม Agent ของตัวเองมานานแล้ว Hugging Face ครั้งนี้ได้สร้างความสามารถที่คล้ายกันให้เป็นเครื่องมือโอเพนซอร์สทั่วไป ทำให้ทีมอื่นๆ สามารถใช้ Agent สำเร็จรูปทำ RL ได้โดยตรง


และโมเดลไม่จำเป็นต้องฝึกใน Agent เพียงประเภทเดียว การฝึกหนึ่งครั้งสามารถสลับรันภารกิจใน Claude Code, Codex, OpenCode และ Mini-SWE-Agent ได้ ทำให้โมเดลเดียวกันปรับตัวเข้ากับพรอมต์ เครื่องมือ และตรรกะการทำงานที่แตกต่างกัน ลดการ "เรียนไม่สมดุล" ที่เก่งเพียง Harness ประเภทเดียว


พวกเขาใช้โมเดลขนาดเล็ก 2.6 พันล้านพารามิเตอร์ของ Liquid AI ในการทดสอบ น้ำหนักเดียวกันเพียงเปลี่ยน Agent อัตราความสำเร็จของภารกิจก็ลดลงจากประมาณ 62% เหลือ 33% หลังจากฝึกในสภาพแวดล้อม Agent ทั้งสี่พร้อมกัน อัตราความสำเร็จเฉลี่ยเพิ่มขึ้นจาก 42.2% เป็น 54.2% และการปรับปรุงใน Agent ต่างๆ ก็สมดุลกว่าการฝึกในสภาพแวดล้อมเดียว

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น