ข้ามไปเนื้อหาหลัก

สร้าง MoE LLM 188 ล้านพารามิเตอร์บน GPU ฟรีด้วยงบ 0 บาท

Shivam Kumar นักวิจัย AI และผู้ก่อตั้ง VisionQuantech สร้างสถาปัตยกรรม Mixture-of-Experts ขนาด 188M บน Tesla T4 ฟรี โดยใช้โทเค็นราว 215 ล้านโทเค็น

เรียบเรียงโดย AI
Inewgen
07 Oct 2026ที่มา: Dev.to2 นาทีอ่าน (0 ครั้ง)
แชร์
สร้าง MoE LLM 188 ล้านพารามิเตอร์บน GPU ฟรีด้วยงบ 0 บาท

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Shivam Kumar พัฒนา MoE LLM ขนาด 188 ล้านพารามิเตอร์บน Tesla T4 ฟรี
  • ใช้ระบบ Main Researcher System v4 ค้นหาและออกแบบสถาปัตยกรรม
  • โมเดลแบ่งผู้เชี่ยวชาญย่อย 64 ตัว ช่วยประหยัดต้นทุนการประมวลผลต่อโทเค็น
  • ขั้นตอนฝึกฝนใช้โทเค็นรวมกว่า 215 ล้านโทเค็นด้วยงบ 0 บาท

การพัฒนาโมเดลภาษาขนาดใหญ่ (LLM) มักผูกติดอยู่กับการใช้ทรัพยากรการประมวลผลมหาศาลระดับพันล้านพารามิเตอร์ ซึ่งเกินกว่าที่นักพัฒนาระดับเริ่มต้นจะเข้าถึงได้บน GPU ฟรีของ Google Colab ทว่าแนวคิดสถาปัตยกรรมแบบ Mixture-of-Experts (MoE) เปิดความเป็นไปได้ใหม่ เนื่องจากโมเดลไม่ต้องเปิดการทำงานของพารามิเตอร์ทั้งหมดในทุกคำที่ประมวลผล

แนวคิดนี้ผลักดันให้ Shivam Kumar ผู้ก่อตั้ง VisionQuantech ตัดสินใจสร้างโมเดล MoE ขนาด 188 ล้านพารามิเตอร์ขึ้นมาใหม่ทั้งหมดบนการ์ดจอ Tesla T4 แบบใช้งานฟรี โดยตั้งเป้าใช้งบประมาณ 0 ดอลลาร์สหรัฐฯ เพื่อพิสูจน์ว่าสถาปัตยกรรมขนาดเล็กสามารถออกแบบได้อย่างมีหลักการและมีความน่าเชื่อถือ ไม่ใช่แค่การลองผิดลองถูกทั่วไป

server room data center no logo

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในกระบวนการออกแบบ Kumar ใช้ระเบียบวิธีที่เรียกว่า Main Researcher System v4 ซึ่งผสมผสานรูปแบบทางความคิดและการสกัดแพทเทิร์นจากวรรณกรรมด้าน MoE ถึง 12 รูปแบบ รวมถึงเครื่องมือเมตาแพทเทิร์น 11 รูปแบบ เช่น ทฤษฎี TRIZ และการวิเคราะห์เชิงสัณฐานวิทยา เพื่อแก้ไขข้อขัดแย้งระหว่างการเพิ่มความจุของโมเดลกับการควบคุมต้นทุนการเราต์ข้อมูล

การใช้สถาปัตยกรรม MoE ขนาดเล็กบนฮาร์ดแวร์จำกัดถือเป็นความท้าทายที่น่าสนใจ เพราะโดยปกติโมเดล MoE จะต้องอาศัยคลัสเตอร์การ์ดจอราคาสูง การที่ผู้พัฒนาเลือกใช้ระบบไมโครเอ็กซ์เพิร์ตจำนวนมากแทนที่จะแบ่งเป็นกลุ่มใหญ่ ช่วยให้โมเดลมีความยืดหยุ่นในการจับแพทเทิร์นภาษาเชิงลึกได้ดีขึ้นโดยไม่ต้องแบกรับภาระการประมวลผลที่สูงเกินไปบนฮาร์ดแวร์ระดับล่าง

จากการทดลองเบื้องต้นบนซีพียู 300 สเตป สถาปัตยกรรมที่ผ่านการคัดเลือกสามารถฝึกฝนได้อย่างเสถียร ค่า Loss ลดลงจาก 41.5 เหลือ 7.6 โดยไม่มีอาการโมเดลล่มหรือค่า NaN เกิดขึ้น ตัวเลือกที่ชนะการคัดเลือกทำคะแนนบาลานซ์ได้ดีที่สุดด้วยค่า aux loss 2.03 และไม่มีผู้เชี่ยวชาญตัวใดถูกปล่อยให้ร้างไร้งาน

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

"This is the honest version — what's proven, what's measured, and what's still running."

Shivam Kumar

กระบวนการฝึกฝนจริงแบ่งออกเป็นสองเฟสหลักบน Colab T4 ฟรี ได้แก่ เฟสแรกใช้ชุดข้อมูล TinyStories ประมาณ 200 ล้านโทเค็นเพื่อให้โมเดลมีความคล่องแคล่วทางภาษา และเฟสที่สองใช้ชุดข้อมูลคำสั่งผสมอีกประมาณ 15 ล้านโทเค็น รวมเป็นโทเค็นทั้งหมดราว 215 ล้านโทเค็น ใช้เวลาประมวลผลราว 2.5 ถึง 3 ชั่วโมง

ที่มา: Dev.to

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้