webAI เปิดตัว TwIL-LM ตระกูลโมเดลตรรกะเชิงรูปแบบขนาด 1.7B และ 3B สำหรับใช้งานบนฮาร์ดแวร์ท้องถิ่น
webAI เปิดตัวตระกูลโมเดล TwIL-LM ขนาด 1.7B และ 3B เน้นการแปลงภาษาธรรมชาติเป็นตรรกะเชิงรูปแบบ รองรับการใช้งานฮาร์ดแวร์ท้องถิ่น พร้อมข้อจำกัดการใช้งานเชิงพาณิชย์

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- webAI เปิดตัวโมเดลตระกูล TwIL-LM ขนาด 1.7B และ 3B สำหรับการแปลงตรรกะเชิงรูปแบบบนฮาร์ดแวร์ท้องถิ่น
- กระบวนการฝึกอบรมผ่าน 4 ขั้นตอนสำคัญ รวมถึงการทำ LoRA และ WiSE-FT interpolation ที่ค่าแรมดา 0.25
- รุ่น TwIL-LM3 ทำคะแนนเฉลี่ยหกเลนได้ 0.4488 และมาโครเกตที่ 0.4218 เหนือกว่ารุ่นที่มีพารามิเตอร์มากกว่าในบางด้าน
- รุ่น TwIL-LM3 สร้างโทเค็นสั้นที่สุดด้วยจำนวน 482 โทเค็นบนแทร็ก B และทำความเร็ว 32.9 คำตอบต่อวินาที
webAI ได้เปิดตัวตระกูลโมเดลใหม่ในชื่อ TwIL-LM ซึ่งประกอบด้วยรุ่นขนาด 1.7B และ 3B สำหรับงาน autoformalization บนฮาร์ดแวร์ท้องถิ่น โดยโมเดลทั้งสองขนาดนี้อยู่ภายใต้สัญญาอนุญาต webAI Non-Commercial License เวอร์ชัน 1.0 ซึ่งอนุญาตให้ใช้งานได้เฉพาะที่ไม่ใช่เชิงพาณิชย์เท่านั้น หากต้องการนำไปปรับใช้เพื่อสร้างรายได้จำเป็นต้องทำข้อตกลงแยกต่างหากกับทาง webAI
กระบวนการสร้างโมเดลนี้ประกอบด้วย 4 ขั้นตอนหลักที่วางอยู่บนโมเดลฐาน เริ่มจากการทำ LoRA supervised fine-tuning บนชุดข้อมูลสังเคราะห์ตรรกะเชิงรูปแบบ ต่อด้วยการทำ checkpoint fusion โดยเฉลี่ยพารามิเตอร์ของจุดตรวจสอบระดับกลาง ตามด้วยการทำ WiSE-FT interpolation กลับไปยังฐานที่ฝึกไว้ล่วงหน้าด้วยค่าแรมดาเท่ากับ 0.25 และขั้นตอนสุดท้ายคือ MGPO ซึ่งเป็นกระบวนการ entropy-weighted GRPO ที่รันเทียบกับตัวตรวจสอบเชิงโปรแกรม โดยจุดตรวจสอบที่เผยแพร่นั้นอยู่ที่สเตป 2071
ค่าแรมดามีความสำคัญอย่างยิ่งเนื่องจากมีการคงส่วนต่างที่ผ่านการปรับแต่งไว้เพียงหนึ่งในสี่เท่านั้น โดยฝั่งพี่น้องที่ข้ามขั้นตอนการทำ interpolation ทำคะแนนในโดเมนได้สูงกว่าที่มาโครเกต 0.515 แต่ต้องแลกมาด้วยการสูญเสียความสามารถในส่วนของ held-out capability ไปประมาณ 12 คะแนน ซึ่งทาง webAI ไม่ได้เผยแพร่โมเดลสายนั้นออกมา

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในส่วนของประสิทธิภาพ ตัวโมเดลการ์ดระบุไว้อย่างชัดเจนว่า TwIL-LM3 สามารถสร้างข้อความที่มีความสั้นที่สุดเมื่อเทียบกับโมเดลสายอื่นๆ โดยใช้เวลาสร้างเพียง 482 โทเค็นบนแทร็ก B ส่งผลให้สามารถสร้างคำตอบได้มากที่สุดถึง 32.9 คำตอบต่อวินาที เมื่อเทียบกับโมเดลขนาดใหญ่อย่าง 120B ที่ทำได้เพียง 4.2 คำตอบต่อวินาทีเท่านั้น
การพัฒนาโมเดลขนาดเล็กอย่าง 1.7B และ 3B ที่เน้นตรรกะเชิงรูปแบบ (Formal Logic) สะท้อนให้เห็นถึงความพยายามของ webAI ในการผลักดัน AI ไปสู่ขอบเขตการคำนวณที่ประหยัดพลังงานและสามารถรันบนอุปกรณ์ส่วนบุคคลหรือฮาร์ดแวร์ท้องถิ่นได้โดยไม่ต้องพึ่งพาดาต้าเซ็นเตอร์ขนาดใหญ่ การใช้เทคนิคอย่าง WiSE-FT เพื่อรักษาสสมดุลระหว่างความสามารถเฉพาะทางและความสามารถทั่วไป ถือเป็นแนวทางสำคัญในการแก้ปัญหา Catastrophic Forgetting ที่มักเกิดขึ้นกับการ fine-tuning โมเดลขนาดเล็ก
สำหรับการประเมินผลในรุ่น 1.7B พบว่าให้ผลลัพธ์การค้าขายที่แตกต่างออกไป โดยคะแนนมาโครไพรม์อยู่ที่ 0.361 เทียบกับ 0.185 ของโมเดลฐานที่ยังไม่ปรับแต่ง ผลลัพธ์นอกเหนือการกระจายตัวมีทั้งส่วนที่เพิ่มขึ้นและลดลง เช่น LogicBench BQA เพิ่มขึ้นเป็น 0.590 จาก 0.563 แต่ GSM8K ลดลงเหลือ 0.380 จาก 0.413 และ ARC-C chain-of-thought ลดลงเหลือ 0.463 จาก 0.587
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น