CetinLM 3.8B: โมเดลภาษาปัญญาประดิษฐ์ฝึกบนการ์ดจอเดี่ยว
Mert Çetin นักวิจัยอิสระฝึกโมเดล CetinLM Base-v1 ขนาด 1.18B บนการ์ดจอ RTX 4070 Ti SUPER ทะลุ 3.8 พันล้านโทเค็นโดยไม่ต้องพึ่งคลัสเตอร์ไอทีราคาแพง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Mert Çetin ฝึกโมเดล CetinLM Base-v1 ขนาด 1.18B บนการ์ดจอ RTX 4070 Ti SUPER ทะลุ 3.8 พันล้านโทเค็น
- ผลการทดสอบแสดงค่า Loss ลดลงต่อเนื่องถึง 2.577079 ที่ 3.8B โทเค็นโดยไม่มีอาการสะดุด
- โมเดลรันบน Local Web UI ความเร็ว ~48 โทเค็นต่อวินาที ตอบโต้ด้วยตรรกะเชิงโครงสร้างได้เองโดยไม่ต้องผ่านการจูน
- ความสำเร็จนี้ทำลายความเชื่อเดิมที่ว่าการสร้างโมเดลภาษาต้องใช้คลัสเตอร์ชิป H100 หลายพันตัวเท่านั้น
วงการปัญญาประดิษฐ์ต้องสะเทือนเมื่อกำแพงเงินทุนมหาศาลถูกทำลายลงในห้องทำงานส่วนตัว โดย Mert Çetin นักวิจัยอิสระจาก Me Force Technology สามารถผลักดันโมเดลภาษาพื้นฐาน CetinLM Base-v1 ขนาด 1.18 พันล้านพารามิเตอร์ ให้ผ่านหลัก 3.8 พันล้านโทเค็นได้สำเร็จ โดยใช้เพียงการ์ดจอเดสก์ท็อปสำหรับผู้บริโภคทั่วไปรุ่น RTX 4070 Ti SUPER ในการฝึกตั้งแต่เริ่มต้น
ความก้าวหน้านี้ท้าทายกฎการลดลงของสเกลมาตรฐานอย่างชัดเจน ตัวเลขการตรวจสอบความถูกต้องแสดงให้เห็นเส้นกราฟดิ่งลงอย่างไร้รอยต่อ โดยในช่วง 3.60 พันล้านโทเค็น ค่า Validation Loss อยู่ที่ 2.592976 และลดลงเหลือ 2.577079 เมื่อถึง 3.80 พันล้านโทเค็น ซึ่งห่างกันเพียง 200 ล้านโทเค็นเท่านั้นโดยไม่มีทีท่าว่าจะเกิดอาการนิ่งนอนใจหรือระบบฝึกสะดุดแต่อย่างใด

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ค่ายเทคโนโลยียักษ์ใหญ่เคยผูกขาดการแข่งขันผ่านสิ่งที่เรียกว่า Benchmark Theatre ด้วยการแอบป้อนข้อสอบเข้าในชุดข้อมูลฝึกนับล้านล้านโทเค็นเพื่อโฆษณาตัวเลขที่สวยหรูบนสไลด์นำเสนอ แต่ CetinLM ได้พลิกโฉมหน้าตารางด้วยการเปิดตัว Local Web UI ที่รันบน localhost (127.0.0.1) แบบใช้งานได้จริงและมีความหน่วงเป็นศูนย์ ทำความเร็วได้สูงถึงประมาณ 48 โทเค็นต่อวินาที
ผลลัพธ์พฤติกรรมจากโมเดลฐานดิบที่ยังไม่ได้ผ่านการปรับแต่ง SFT หรือการจัดแนวใดๆ สร้างความประหลาดใจให้กับสถาปนิกพัฒนาระบบเป็นอย่างมาก เมื่อป้อนคำถามทางคณิตศาสตร์อย่าง "2+2 เท่ากับเท่าไร" โมเดลไม่ได้พ่นเสียงรบกวนจากอินเทอร์เน็ตออกมา แต่กลับประเมินความเท่าเทียมกันแล้วย้อนถามกลับด้วยประโยคโวหารเชิงตรรกะว่า "3+1 เท่ากับเท่าไร" แทน
"3+1 kaç eder?"
CetinLM Output
เบื้องหลังความสำเร็จของ CetinLM ที่สามารถแสดงตรรกะระดับนี้ได้ตั้งแต่ช่วงต้นของการฝึก เกิดจากการละทิ้งแนวคิดการอัดข้อมูลปริมาณมหาศาลแบบไร้ทิศทาง โดยหันมาสร้างชุดข้อมูลหลักที่เป็นกรรมสิทธิ์ผ่านกระบวนการวิศวกรรมนานนัปการตลอดสัปดาห์ ทำหน้าที่เป็นไกด์นำทางสถาปัตยกรรมและบีบอัดความหมายเชิงความหมายให้มีความหนาแน่นสูงสุดต่อหนึ่งโทเค็น
แม้ว่า CetinLM จะยังไม่ได้อ้างว่าสามารถเอาชนะโมเดลเรือธงรุ่นใหญ่ที่ผ่านการฝึกขั้นสูงในชุดการทดสอบปลายทางได้ทั้งหมด แต่ความสำเร็จในการสร้างท่อส่งข้อมูลการฝึกที่ผิดพลาดได้ยากด้วยการจัดการโทเค็นเฉพาะตัวบนทรัพยากร VRAM ขนาด 16GB ได้พิสูจน์ให้เห็นแล้วว่าการวิจัย AI พื้นฐานสามารถลดต้นทุนโครงสร้างพื้นฐานลงจนเกือบเป็นศูนย์ได้จริง
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น