IBM เปิดตัว Granite 4.2: โมเดลโอเพนซอร์สพร้อมการให้เหตุผล
IBM ปล่อย Granite 4.2 สามขนาด รองรับการให้เหตุผลระดับเนทีฟและ Agentic RL ใต้สัญญาอนุญาต Apache 2.0 พร้อมเทรนด้วยข้อมูลกว่า 15 ล้านล้านโทเค็น

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- IBM เปิดตัวภาษาตระกูล Granite 4.2 สามขนาด ได้แก่ 3B, 8B และ 30B ภายใต้สัญญาอนุญาต Apache 2.0 ไม่มีข้อจำกัดด้านลิขสิทธิ์
- สถาปัตยกรรมเป็นแบบ decoder-only dense transformer รองรับความยาวบริบทมาตรฐาน 131,072 โทเค็นและขยายได้ถึง 512K
- รุ่น 8B และ 30B รองรับบล็อก Agentic RL เต็มรูปแบบ ขณะที่รุ่น 3B รองรับเฉพาะ foundational RL และ alignment
- ขับเคลื่อนการฝึกอบรมบนคลัสเตอร์ NVIDIA GB200 NVL72 ของ CoreWeave ผ่านระบบ NeMo-RL และ NeMo-Gym
IBM ได้ประกาศเปิดตัวชุดโมเดลภาษาขนาดใหญ่ตระกูล Granite 4.2 อย่างเป็นทางการ โดยโมเดลทั้งสามขนาดเปิดให้ดาวน์โหลด ปรับจูน (fine-tuning) และใช้งานเชิงพาณิชย์ได้ทันทีภายใต้สัญญาอนุญาต Apache 2.0 โดยไม่มีข้อจำกัดด้านลิขสิทธิ์ใดๆ ขัดขวาง
ในด้านสถาปัตยกรรม Granite 4.2 ถูกออกแบบมาให้เป็น decoder-only dense transformer แบบดั้งเดิม ไม่ใช่ระบบไฮบริดหรือ Mixture of Experts (MoE) องค์ประกอบหลักประกอบด้วย Grouped Query Attention ที่ใช้ 8 KV heads, RoPE ที่ตั้งค่า θ = 10,000,000, SwiGLU MLPs, RMSNorm ที่ ε = 1e-5, การแยก input และ output embeddings ออกจากกัน และใช้ความแม่นยำระดับ bfloat16
รายละเอียดขนาดของโมเดลทั้งสามรุ่นประกอบด้วย:
- รุ่น 3B ใช้ 40 เลเยอร์ ที่ขนาด embedding 2560
- รุ่น 8B ใช้ 40 เลเยอร์ ที่ขนาด embedding 4096
- รุ่น 30B ขยายไปถึง 64 เลเยอร์ พร้อมขนาด MLP hidden ที่ 32,768
ตารางสถาปัตยกรรมระบุความยาวลำดับโทเค็นไว้ที่ 131,072 (128K) โทเค็น ขณะที่กระบวนการ pre-training ทั้ง 5 เฟสมีระยะยาวบริบทที่ขยายไปถึง 512K โทเค็น ผ่านการประมวลผลข้อมูลจากจุดเริ่มต้นประมาณ 15 ล้านล้านโทเค็น
การที่ IBM เลือกใช้สถาปัตยกรรม dense transformer ล้วนร่วมกับการผสาน Agentic RL เข้าไปโดยตรงในรุ่นขนาดใหญ่ ช่วยให้โมเดลมีความสามารถในการวางแผนและทำงานซับซ้อนได้ดีขึ้นโดยไม่ต้องพึ่งพาโครงสร้าง MoE ที่ซับซ้อนในการจัดการระบบ ซึ่งถือเป็นก้าวสำคัญของโมเดลโอเพนซอร์สระดับองค์กร
กระบวนการ Supervised fine-tuning ใช้ตัวอย่างประมาณ 7.2 ล้านรายการ หรือคิดเป็นข้อมูลราว 100 พันล้านโทเค็น โดยมีโทเค็นที่ฝึกอบรมได้ประมาณ 65 พันล้านโทเค็น สัดส่วนข้อมูลประกอบด้วยงาน agentic 31.6% และ non-agentic 68.4% โดยงานด้านวิศวกรรมซอฟต์แวร์คิดเป็น 69% ของกลุ่ม agentic ทั้งหมด เส้นทางการฝึกถูกสร้างขึ้นผ่านเครื่องมือต่างๆ เช่น OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex และ Goose

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
บล็อก Agentic RL จะทำงานเฉพาะในรุ่น 8B และ 30B เท่านั้น ส่วนรุ่น 3B จะรองรับเฉพาะ foundational RL และ alignment ซึ่งความแตกต่างของการออกแบบนี้เป็นตัวอธิบายช่องว่างความสามารถระหว่างขนาดของโมเดล การฝึกอบรมทั้งหมดดำเนินการบน NeMo-RL และ NeMo-Gym บนคลัสเตอร์ NVIDIA GB200 NVL72 ที่โฮสต์โดย CoreWeave
"All three Granite 4.2 language models ship under Apache 2.0, so download, fine-tuning, and commercial production use carry no licensing gate."
IBM Research
นอกจากนี้ยังมีองค์ประกอบเสริมที่สำคัญ ได้แก่ โค้ดสังเคราะห์จำนวน 1 ล้านล้านโทเค็นจากไปป์ไลน์ CodeAlchemy ของ IBM และชั้น speculative decoding สำหรับการให้บริการที่รวดเร็วยิ่งขึ้น ในส่วนของรุ่น Turbo CTC มีพารามิเตอร์ 470 ล้านตัว ตัดโครงสร้าง LLM ออกทั้งหมดโดยใช้ connectionist temporal classification เพื่อแปลงเสียงเป็นข้อความ พร้อมรายงานอัตรา throughput ของ RTFx ใกล้เคียง 12,600 บน H200 ตัวเดียว
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น