lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
หน้าแรก
AI
OPRR
ด่วน
ความลึก
กิจกรรม
BlockBeats Pro
เพิ่มเติม
การเงิน
พิเศษ
ระบบนิเวศบล็อกเชน
รายการ
พอดแคสต์
ข้อมูล
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%

Nvidia เปิดตัวโมเดลระดับเรือธง Nemotron 3 Ultra ขนาด 550B แบบโอเพนซอร์สอย่างเป็นทางการ: นำเสนอสถาปัตยกรรม MoE แบบผสมผสาน Mamba-Transformer เป็นครั้งแรก ออกแบบมาเพื่อเอเจนต์ระยะยาวโดยเฉพาะ

ตามการติดตามของ Beating เมื่อวันที่ 4 มิถุนายน NVIDIA ได้เปิดเผยโมเดลภาษาขนาดใหญ่ระดับเรือธง Nemotron 3 Ultra ซึ่งมีพารามิเตอร์ 550 พันล้านตัวและเปิดใช้งาน 55 พันล้านตัว โดยได้รับการปรับให้เหมาะสมสำหรับงานเอเจนต์ระยะยาว เช่น การวางแผนที่ซับซ้อน การให้เหตุผล และการเรียกใช้เครื่องมือ


ในดัชนีความฉลาดของแพลตฟอร์มมาตรฐานบุคคลที่สาม Artificial Analysis Nemotron 3 Ultra ได้คะแนน 47.7 คะแนน ถือเป็นโมเดลโอเพนซอร์สที่มีประสิทธิภาพสูงสุดในสหรัฐอเมริกาในปัจจุบัน แต่ยังคงตามหลังโมเดลโอเพนซอร์สของจีนหลายรุ่น เช่น Kimi K2.6 (53.9 คะแนน), MiMo-V2.5-Pro (53.8 คะแนน) และ DeepSeek V4 Pro (51.5 คะแนน) ในระดับโลก

ในด้านสถาปัตยกรรมทางเทคนิค โมเดลนี้ใช้สถาปัตยกรรมผู้เชี่ยวชาญแบบผสม Mamba-Transformer MoE โดยสลับชั้นโมเดลพื้นที่สถานะ Mamba-2 กับชั้นความสนใจตนเองของ Transformer เพื่อหลีกเลี่ยงปัญหาคอขวดของหน่วยความจำที่เกิดจากการเพิ่มขึ้นแบบกำลังสองของแคช KV ในบริบทที่ยาวมาก รองรับหน้าต่างบริบท 1 ล้านโทเค็นโดยใช้หน่วยความจำต่ำมาก สถาปัตยกรรมแบบผสมนี้ช่วยเพิ่มปริมาณงานสูงสุด 5 เท่าและลดต้นทุนการอนุมาน 30% ในงานเอเจนต์


ในด้านระบบนิเวศ NVIDIA ได้เปิดตัวชุดเครื่องมือเอเจนต์ Agent Toolkit พร้อมกัน ซึ่งรวมถึงแผนผังการจัดเรียง NemoClaw และรันไทม์ OpenShell เนื้อหาที่เปิดเผยโดยตรงประกอบด้วยน้ำหนักโมเดล ชุดข้อมูล และสูตรการฝึก โมเดลดังกล่าวได้เปิดให้บริการบน Hugging Face, NVIDIA NIM และ OpenRouter แล้ว โดยผู้ให้บริการค้นหาข้อมูลระดับองค์กรอย่าง Glean ได้ประกาศเชื่อมต่อเพื่อใช้เป็นทางเลือกแทนโมเดลปิดเชิงพาณิชย์

แก้ไข/รายงาน
ส่ง
เพิ่มคลัง
เห็นได้เฉพาะตัวเอง
สาธารณะ
บันทึก
เลือกคลัง
เพิ่มคลัง
ยกเลิก
เสร็จสิ้น