ข้ามไปเนื้อหาหลัก

webAI เปิดตัว TwIL-LM ตระกูลโมเดลตรรกะเชิงรูปแบบขนาด 1.7B และ 3B สำหรับใช้งานบนฮาร์ดแวร์ท้องถิ่น

webAI เปิดตัวตระกูลโมเดล TwIL-LM ขนาด 1.7B และ 3B เน้นการแปลงภาษาธรรมชาติเป็นตรรกะเชิงรูปแบบ รองรับการใช้งานฮาร์ดแวร์ท้องถิ่น พร้อมข้อจำกัดการใช้งานเชิงพาณิชย์

เรียบเรียงโดย AI
Inewgen
11 Aug 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)อัปเดตล่าสุด 29 Aug 2026
แชร์
webAI เปิดตัว TwIL-LM ตระกูลโมเดลตรรกะเชิงรูปแบบขนาด 1.7B และ 3B สำหรับใช้งานบนฮาร์ดแวร์ท้องถิ่น

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • webAI เปิดตัวโมเดลตระกูล TwIL-LM ขนาด 1.7B และ 3B สำหรับการแปลงตรรกะเชิงรูปแบบบนฮาร์ดแวร์ท้องถิ่น
  • กระบวนการฝึกอบรมผ่าน 4 ขั้นตอนสำคัญ รวมถึงการทำ LoRA และ WiSE-FT interpolation ที่ค่าแรมดา 0.25
  • รุ่น TwIL-LM3 ทำคะแนนเฉลี่ยหกเลนได้ 0.4488 และมาโครเกตที่ 0.4218 เหนือกว่ารุ่นที่มีพารามิเตอร์มากกว่าในบางด้าน
  • รุ่น TwIL-LM3 สร้างโทเค็นสั้นที่สุดด้วยจำนวน 482 โทเค็นบนแทร็ก B และทำความเร็ว 32.9 คำตอบต่อวินาที

webAI ได้เปิดตัวตระกูลโมเดลใหม่ในชื่อ TwIL-LM ซึ่งประกอบด้วยรุ่นขนาด 1.7B และ 3B สำหรับงาน autoformalization บนฮาร์ดแวร์ท้องถิ่น โดยโมเดลทั้งสองขนาดนี้อยู่ภายใต้สัญญาอนุญาต webAI Non-Commercial License เวอร์ชัน 1.0 ซึ่งอนุญาตให้ใช้งานได้เฉพาะที่ไม่ใช่เชิงพาณิชย์เท่านั้น หากต้องการนำไปปรับใช้เพื่อสร้างรายได้จำเป็นต้องทำข้อตกลงแยกต่างหากกับทาง webAI

กระบวนการสร้างโมเดลนี้ประกอบด้วย 4 ขั้นตอนหลักที่วางอยู่บนโมเดลฐาน เริ่มจากการทำ LoRA supervised fine-tuning บนชุดข้อมูลสังเคราะห์ตรรกะเชิงรูปแบบ ต่อด้วยการทำ checkpoint fusion โดยเฉลี่ยพารามิเตอร์ของจุดตรวจสอบระดับกลาง ตามด้วยการทำ WiSE-FT interpolation กลับไปยังฐานที่ฝึกไว้ล่วงหน้าด้วยค่าแรมดาเท่ากับ 0.25 และขั้นตอนสุดท้ายคือ MGPO ซึ่งเป็นกระบวนการ entropy-weighted GRPO ที่รันเทียบกับตัวตรวจสอบเชิงโปรแกรม โดยจุดตรวจสอบที่เผยแพร่นั้นอยู่ที่สเตป 2071

ค่าแรมดามีความสำคัญอย่างยิ่งเนื่องจากมีการคงส่วนต่างที่ผ่านการปรับแต่งไว้เพียงหนึ่งในสี่เท่านั้น โดยฝั่งพี่น้องที่ข้ามขั้นตอนการทำ interpolation ทำคะแนนในโดเมนได้สูงกว่าที่มาโครเกต 0.515 แต่ต้องแลกมาด้วยการสูญเสียความสามารถในส่วนของ held-out capability ไปประมาณ 12 คะแนน ซึ่งทาง webAI ไม่ได้เผยแพร่โมเดลสายนั้นออกมา

neural network graph visualization data architecture

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

96.4คะแนนด้าน Rule Induction
87.6คะแนนด้าน Semantic Parsing
64.6คะแนนด้าน Lean Formalization

ในส่วนของประสิทธิภาพ ตัวโมเดลการ์ดระบุไว้อย่างชัดเจนว่า TwIL-LM3 สามารถสร้างข้อความที่มีความสั้นที่สุดเมื่อเทียบกับโมเดลสายอื่นๆ โดยใช้เวลาสร้างเพียง 482 โทเค็นบนแทร็ก B ส่งผลให้สามารถสร้างคำตอบได้มากที่สุดถึง 32.9 คำตอบต่อวินาที เมื่อเทียบกับโมเดลขนาดใหญ่อย่าง 120B ที่ทำได้เพียง 4.2 คำตอบต่อวินาทีเท่านั้น

การพัฒนาโมเดลขนาดเล็กอย่าง 1.7B และ 3B ที่เน้นตรรกะเชิงรูปแบบ (Formal Logic) สะท้อนให้เห็นถึงความพยายามของ webAI ในการผลักดัน AI ไปสู่ขอบเขตการคำนวณที่ประหยัดพลังงานและสามารถรันบนอุปกรณ์ส่วนบุคคลหรือฮาร์ดแวร์ท้องถิ่นได้โดยไม่ต้องพึ่งพาดาต้าเซ็นเตอร์ขนาดใหญ่ การใช้เทคนิคอย่าง WiSE-FT เพื่อรักษาสสมดุลระหว่างความสามารถเฉพาะทางและความสามารถทั่วไป ถือเป็นแนวทางสำคัญในการแก้ปัญหา Catastrophic Forgetting ที่มักเกิดขึ้นกับการ fine-tuning โมเดลขนาดเล็ก

สำหรับการประเมินผลในรุ่น 1.7B พบว่าให้ผลลัพธ์การค้าขายที่แตกต่างออกไป โดยคะแนนมาโครไพรม์อยู่ที่ 0.361 เทียบกับ 0.185 ของโมเดลฐานที่ยังไม่ปรับแต่ง ผลลัพธ์นอกเหนือการกระจายตัวมีทั้งส่วนที่เพิ่มขึ้นและลดลง เช่น LogicBench BQA เพิ่มขึ้นเป็น 0.590 จาก 0.563 แต่ GSM8K ลดลงเหลือ 0.380 จาก 0.413 และ ARC-C chain-of-thought ลดลงเหลือ 0.463 จาก 0.587

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้