Nokia เปิดตัว AnyJev เลเยอร์แปลงโมเดลภาษาให้เป็นโมเดลตัดสินใจ
Nokia เปิดซอร์ส AnyJev เลเยอร์แบบไม่ต้องฝึกฝนใหม่ ช่วยเปลี่ยนโมเดลภาษาแบบเปิดให้เป็นโมเดลตัดสินใจที่มีความน่าเชื่อถือสูง รองรับแบ็กเอนด์ transformers และ vLLM

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Nokia เปิดซอร์ส AnyJev เลเยอร์เสริมสำหรับแปลงโมเดลภาษาโอเพนซอร์สให้เป็นโมเดลตัดสินใจ
- ทำงานโดยอ่านความน่าจะเป็นจากโทเค็นถัดไปโดยตรง ไม่ต้องฝึกฝนโมเดลใหม่หรือทำการแปลงข้อความ
- รองรับการใช้งานผ่าน PyPI ภายใต้สัญญาอนุญาต Apache-2.0 พร้อมแบ็กเอนด์ transformers และ vLLM
โนเกีย (Nokia) ได้เปิดซอร์สโครงการใหม่ที่มีชื่อว่า AnyJev ซึ่งทำหน้าที่เป็นเลเยอร์เสริมแบบไม่ต้องผ่านกระบวนการฝึกฝนใหม่ (training-free layer) ออกแบบมาเพื่อเปลี่ยนโมเดลภาษาขนาดใหญ่แบบเปิด (open LLM) ให้กลายเป็นโมเดลสำหรับการตัดสินใจที่มีการปรับเทียบค่าความน่าเชื่อถืออย่างแม่นยำ เครื่องมือนี้ถูกพัฒนาขึ้นเพื่อช่วยให้เหล่านักพัฒนาสามารถนำโมเดลภาษาไปประยุกต์ใช้ในงานตัดสินใจเชิงธุรกิจได้อย่างมั่นใจมากยิ่งขึ้น
ในแง่ของการใช้งานจริง AnyJev สามารถติดตั้งได้อย่างง่ายดายผ่าน PyPI และเผยแพร่ภายใต้สัญญาอนุญาตแบบ Apache-2.0 โดยตัวระบบมาพร้อมกับแบ็กเอนด์สำหรับ transformers และ vLLM ที่รองรับการประเมินคะแนนด้วยพรีฟิกซ์ร่วมกัน (shared-prefix scoring) ทำให้การประมวลผลมีความรวดเร็วและมีประสิทธิภาพสูง เหมาะสำหรับการนำไปปรับใช้ในระบบจริงที่ต้องการความเร็วในการตอบสนอง
รูปแบบการทำงานของ AnyJev ได้รับแนวคิดอินเทอร์เฟซมาจาก Jev ซึ่งเป็นโมเดลตัดสินใจระบบหนึ่งที่เปิดตัวโดย TypeSafe AI เมื่อเดือนกันยายน 2026 หลักการทำงานคือผู้ใช้งานจะป้อนคำถามที่มีการกำหนดประเภท (typed question) เข้าไป จากนั้นระบบจะส่งผลลัพธ์การตัดสินใจพร้อมกับค่าความน่าเชื่อถือที่สามารถตั้งค่าเกณฑ์ (threshold) ได้ โดยค่าความน่าเชื่อถือนี้จะถูกอ่านโดยตรงจากการกระจายตัวของโทเค็นถัดไป (next-token distribution) ของตัวโมเดล โดยไม่มีขั้นตอนการสร้างข้อความ การแยกวิเคราะห์ หรือการฝึกฝนเพิ่มเติมแต่อย่างใด
การที่ AnyJev ไม่จำเป็นต้องผ่านกระบวนการเทรนซ้ำถือเป็นจุดเด่นสำคัญ เพราะช่วยลดต้นทุนด้านการประมวลผลได้อย่างมหาศาล อีกทั้งการอ่านค่าความน่าเชื่อถือจากโทเค็นถัดไปโดยตรงยังช่วยแก้ปัญหาเรื่องความแปรปรวนของผลลัพธ์ที่มักเกิดขึ้นในโมเดลภาษาทั่วไปเมื่อสลับลำดับตัวเลือก
ทางทีมวิจัยของ Nokia ได้ชี้ให้เห็นถึงจุดอ่อนสองประการในโครงการโอเพนซอร์สเดิมที่มักใช้วิธีจำกัดโทเค็นถัดไปให้อยู่เฉพาะป้ายกำกับตัวเลือกแล้วอ่านค่าคะแนนออกมา ประการแรกคือคำตอบมักจะเปลี่ยนแปลงไปเมื่อมีการสลับลำดับของตัวเลือก ประการที่สองคือค่าความน่าเชื่อถือที่ได้นั้นยังไม่มีการปรับเทียบมาตรฐานที่ถูกต้อง ทำให้ไม่สามารถนำไปใช้ตัดสินใจในกรณีที่ต้องการความแม่นยำสูงได้
เพื่อแก้ไขปัญหาดังกล่าว AnyJev จึงได้นำเสนอระบบการทำงานออกเป็นสองระดับหลัก ได้แก่ L0 และ L1 โดยมีรายละเอียดดังนี้:
- L0 (Zero Labels): เป็นค่าเริ่มต้นที่ใช้การแก้ไข 2 จุดเพื่อแก้ปัญหาเรื่องการสลับลำดับและปรับเทียบความน่าเชื่อถือ มีต้นทุนการประมวลผลอยู่ที่ K prefills ต่อการตัดสินใจ โดยใช้เวลาประมาณ 0.25 วินาทีต่อการตัดสินใจเมื่อรันบนแบตช์ขนาด 32 บนชิป H100 เดี่ยว ด้วยค่า K เท่ากับ 20
- L1 (100 ถึง 500 Labels): เพิ่มกระบวนการปรับเทียบอุณหภูมิ (temperature scaling) เข้าไปบนพื้นฐานของ L0 โดยค่าที่ได้จะถูกบันทึกไว้เป็นไฟล์ JSON ขนาดเล็ก ซึ่งช่วยปรับรูปร่างของระดับความมั่นใจโดยไม่ไปเปลี่ยนแปลงลำดับความสำคัญของคำตอบ
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น