สร้าง MoE LLM 188 ล้านพารามิเตอร์บน GPU ฟรีด้วยงบ 0 บาท
Shivam Kumar นักวิจัย AI และผู้ก่อตั้ง VisionQuantech สร้างสถาปัตยกรรม Mixture-of-Experts ขนาด 188M บน Tesla T4 ฟรี โดยใช้โทเค็นราว 215 ล้านโทเค็น

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Shivam Kumar พัฒนา MoE LLM ขนาด 188 ล้านพารามิเตอร์บน Tesla T4 ฟรี
- ใช้ระบบ Main Researcher System v4 ค้นหาและออกแบบสถาปัตยกรรม
- โมเดลแบ่งผู้เชี่ยวชาญย่อย 64 ตัว ช่วยประหยัดต้นทุนการประมวลผลต่อโทเค็น
- ขั้นตอนฝึกฝนใช้โทเค็นรวมกว่า 215 ล้านโทเค็นด้วยงบ 0 บาท
การพัฒนาโมเดลภาษาขนาดใหญ่ (LLM) มักผูกติดอยู่กับการใช้ทรัพยากรการประมวลผลมหาศาลระดับพันล้านพารามิเตอร์ ซึ่งเกินกว่าที่นักพัฒนาระดับเริ่มต้นจะเข้าถึงได้บน GPU ฟรีของ Google Colab ทว่าแนวคิดสถาปัตยกรรมแบบ Mixture-of-Experts (MoE) เปิดความเป็นไปได้ใหม่ เนื่องจากโมเดลไม่ต้องเปิดการทำงานของพารามิเตอร์ทั้งหมดในทุกคำที่ประมวลผล
แนวคิดนี้ผลักดันให้ Shivam Kumar ผู้ก่อตั้ง VisionQuantech ตัดสินใจสร้างโมเดล MoE ขนาด 188 ล้านพารามิเตอร์ขึ้นมาใหม่ทั้งหมดบนการ์ดจอ Tesla T4 แบบใช้งานฟรี โดยตั้งเป้าใช้งบประมาณ 0 ดอลลาร์สหรัฐฯ เพื่อพิสูจน์ว่าสถาปัตยกรรมขนาดเล็กสามารถออกแบบได้อย่างมีหลักการและมีความน่าเชื่อถือ ไม่ใช่แค่การลองผิดลองถูกทั่วไป

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในกระบวนการออกแบบ Kumar ใช้ระเบียบวิธีที่เรียกว่า Main Researcher System v4 ซึ่งผสมผสานรูปแบบทางความคิดและการสกัดแพทเทิร์นจากวรรณกรรมด้าน MoE ถึง 12 รูปแบบ รวมถึงเครื่องมือเมตาแพทเทิร์น 11 รูปแบบ เช่น ทฤษฎี TRIZ และการวิเคราะห์เชิงสัณฐานวิทยา เพื่อแก้ไขข้อขัดแย้งระหว่างการเพิ่มความจุของโมเดลกับการควบคุมต้นทุนการเราต์ข้อมูล
การใช้สถาปัตยกรรม MoE ขนาดเล็กบนฮาร์ดแวร์จำกัดถือเป็นความท้าทายที่น่าสนใจ เพราะโดยปกติโมเดล MoE จะต้องอาศัยคลัสเตอร์การ์ดจอราคาสูง การที่ผู้พัฒนาเลือกใช้ระบบไมโครเอ็กซ์เพิร์ตจำนวนมากแทนที่จะแบ่งเป็นกลุ่มใหญ่ ช่วยให้โมเดลมีความยืดหยุ่นในการจับแพทเทิร์นภาษาเชิงลึกได้ดีขึ้นโดยไม่ต้องแบกรับภาระการประมวลผลที่สูงเกินไปบนฮาร์ดแวร์ระดับล่าง
จากการทดลองเบื้องต้นบนซีพียู 300 สเตป สถาปัตยกรรมที่ผ่านการคัดเลือกสามารถฝึกฝนได้อย่างเสถียร ค่า Loss ลดลงจาก 41.5 เหลือ 7.6 โดยไม่มีอาการโมเดลล่มหรือค่า NaN เกิดขึ้น ตัวเลือกที่ชนะการคัดเลือกทำคะแนนบาลานซ์ได้ดีที่สุดด้วยค่า aux loss 2.03 และไม่มีผู้เชี่ยวชาญตัวใดถูกปล่อยให้ร้างไร้งาน
"This is the honest version — what's proven, what's measured, and what's still running."
Shivam Kumar
กระบวนการฝึกฝนจริงแบ่งออกเป็นสองเฟสหลักบน Colab T4 ฟรี ได้แก่ เฟสแรกใช้ชุดข้อมูล TinyStories ประมาณ 200 ล้านโทเค็นเพื่อให้โมเดลมีความคล่องแคล่วทางภาษา และเฟสที่สองใช้ชุดข้อมูลคำสั่งผสมอีกประมาณ 15 ล้านโทเค็น รวมเป็นโทเค็นทั้งหมดราว 215 ล้านโทเค็น ใช้เวลาประมวลผลราว 2.5 ถึง 3 ชั่วโมง
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น