Meta เปิดตัว Llama 4 Scout โมเดล Open-Weights 105B
Meta FAIR เปิดตัว Llama 4 Scout โมเดล Open-Weights ขนาด 105 พันล้านพารามิเตอร์ ใช้สถาปัตยกรรม MoD และรองรับบริบท 1M โทเค็น ทำงานบน dual-GPU ได้ทันที

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Meta FAIR เปิดตัว Llama 4 Scout โมเดล Open-Weights ตัวแรกที่ใช้ระบบ MoD
- มีพารามิเตอร์รวม 105 พันล้าน แต่ทำงานจริงเพียง 24 พันล้านพารามิเตอร์ต่อโทเค็น
- รองรับความยาวบริบทระดับ 1 ล้านโทเค็นโดยไม่มีการลดทอนความแม่นยำ
- ใช้หน่วยความจำ VRAM เพียง 24GB สามารถรันบนการ์ดจอ NVIDIA RTX 4090 หรือ 5090 เดี่ยวได้
ทีมวิจัย Fundamental AI Research หรือ FAIR ของ Meta ได้เปิดตัว Llama 4 Scout ซึ่งเป็นโมเดลพื้นฐานระดับแนวหน้ารุ่นแรกของชุมชนโอเพนซอร์สที่สร้างขึ้นบนระบบกำหนดเส้นทางแบบ dynamic Mixture-of-Depths หรือ MoD โดยโมเดลนี้มีความจุพารามิเตอร์รวม 105 พันล้านพารามิเตอร์ แต่ใช้งานพารามิเตอร์จริงเพียง 24 พันล้านพารามิเตอร์ต่อหนึ่งโทเค็น ส่งผลให้ Llama 4 Scout สามารถทำคะแนนเทียบเท่ากับเอนจิ้นการให้เหตุผลแบบปิดชั้นนำ ทั้งในด้านการเขียนโค้ดจำลอง คณิตศาสตร์ และการสังเคราะห์บริบทขนาดยาว ขณะที่ยังคงใช้ทรัพยากรฮาร์ดแวร์ได้อย่างมีประสิทธิภาพบนเวิร์กสเตชันระดับองค์กรที่ใช้ dual-GPU
สถาปัตยกรรมแบบ Transformer ทั่วไปมักจะใช้งบประมาณการประมวลผลเท่ากันในทุกๆ โทเค็น โดยประเมินเครื่องหมายวรรคตอนและคำเชื่อมทั่วไปด้วยความลึก 80 เลเยอร์เท่ากับการพิสูจน์ทางคณิตศาสตร์ที่ซับซ้อน แต่สำหรับ Llama 4 Scout ได้ยกเลิกการจัดสรรทรัพยากรแบบเท่ากันนี้ด้วยระบบเกตเราท์ติ้งแบบ top-k ที่ผสานอยู่ในบล็อก Transformer ทุกบล็อก

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในระหว่างการประมวลผล ตัวเราท์ติ้งจะประเมินความซับซ้อนของโทเค็นและจัดสรรการคำนวณแบบไดนามิก โดยโทเค็นทั่วไปจะข้ามเลเยอร์ Self-Attention และ Feed-Forward เชิงลึกผ่านเส้นทางลัด ขณะที่โทเค็นที่มีความสำคัญสูงจะได้รับการประมวลผลสูงสุดผ่านบล็อกการให้เหตุผลเฉพาะทาง การจัดสรรความลึกแบบไดนามิกนี้ช่วยลดความหน่วงในการสร้างข้อความลงถึง 58% เมื่อเทียบกับโมเดลแบบ Dense ขนาด 70B พร้อมกับขยายความจุรวมของโมเดลไปถึง 105 พันล้านพารามิเตอร์
ด้านกลไกการทำงาน โมเดลนี้ผสานการทำงานของ RingAttention เข้ากับ Sliding-window multi-head latent attention หรือ MLA พร้อมทั้งรองรับการแปลงปริมาณข้อมูลระดับ FP8 และ INT4 AWQ ที่สามารถดาวน์โหลดเช็คพอยต์ได้โดยตรงจาก Hugging Face อีกทั้งยังมีฟุตพริ้นต์หน่วยความจำสำหรับการอนุมานเพียง 24GB ในโหมด 4-bit

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
สำหรับการทดสอบความยาวบริบท 1 ล้านโทเค็นอย่างไร้รอยต่อ โมเดลโอเพนซอร์สก่อนหน้านี้ที่อ้างว่ารองรับบริบทหลายแสนโทเค็นมักจะต้องพึ่งพาการแทรกสอด RoPE ภายหลังการฝึกอบรม ซึ่งทำให้เกิดปัญหา Perplexity พุ่งสูงและสูญเสียข้อมูลตรงกลางเมื่อเกิน 64K โทเค็น แต่ Llama 4 Scout ได้รับการฝึกฝนตั้งแต่วันแรกด้วยหลักสูตรการขยายบริบทแบบก้าวหน้า 8 ขั้นตอนจนถึง 1,048,576 โทเค็น
การนำสถาปัตยกรรม Mixture-of-Depths (MoD) มาใช้ร่วมกับความสามารถในการประมวลผลบริบทขนาด 1 ล้านโทเค็นตั้งแต่เริ่มต้นฝึกฝน ถือเป็นก้าวสำคัญของวงการ Open-Weights AI เพราะช่วยแก้ปัญหาคอขวดด้านพลังงานและการสูญเสียความแม่นยำในเอกสารยาวๆ ทำให้องค์กรขนาดกลางและนักพัฒนาอิสระสามารถรันโมเดลระดับแนวหน้าได้เองโดยไม่ต้องพึ่งพา API คลาวด์ราคาแพง
ในการทดสอบมาตรฐาน Needle In A Haystack หรือ NIAH ตลอดช่วง 1 ล้านโทเค็น Llama 4 Scout ทำความแม่นยำในการดึงข้อมูลได้สูงถึง 99.8% จากความลึกของเอกสารที่แตกต่างกันถึง 2,500 จุด ทำให้โมเดลสามารถประมวลผลชุดข้อมูลทางกฎหมายขนาดใหญ่ คลังซอฟต์แวร์ทั้งระบบ และเอกสารทางวิทยาศาสตร์จำนวนมากได้ภายในคำสั่งเดียว นอกจากนี้ Meta ยังได้ตีพิมพ์ผลการประเมินโดยทีมผู้ตรวจสอบอิสระภายนอก ซึ่งบน SWE-bench Verified โมเดลสามารถแก้ไขปัญหา GitHub ในโลกจริงได้ 48.6%
สำหรับผู้ที่สนใจใช้งาน เช็คพอยต์สำหรับรุ่นฐาน รุ่นปรับแต่งคำสั่ง และรุ่นควอนตาร์ย์ มีให้บริการแล้วบน Hugging Face Hub และพอร์ทัลจัดจำหน่ายของ Meta โดยระบบรันไทม์ได้ผสานรวมเข้ากับ vLLM, Ollama, LM Studio และ Hugging Face TGI เรียบร้อยแล้ว เพื่อให้นักพัฒนาสามารถปรับ ใช้งานอินสแตนซ์แบบโฮสต์เองบนคลัสเตอร์ Kubernetes ขององค์กรได้ทันที
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น