Perplexity ปล่อย pplx-embed-v2-context-9b-preview โมเดลฝังตัว
Perplexity เปิดตัวโมเดล pplx-embed-v2-context-9b-preview ขนาด 9B บน Hugging Face พร้อมจุดเด่นเรื่องการดึงคำตอบและหลักฐานสนับสนุนผ่านเทคนิค Late Chunking

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Perplexity เปิดตัวโมเดล pplx-embed-v2-context-9b-preview ขนาด 9B ใช้งานแบบ self-hosted ได้
- เผยแพร่ weights บน Hugging Face ภายใต้สัญญาอนุญาต MIT โดยต้องใช้ไลบรารี transformers>=5.4.0
- แก้ปัญหา RAG แบบเดิมด้วยเทคนิค Late Chunking และใช้ครูสอนบีบอัดบริบทเพื่อสร้าง soft targets
- รองรับมิติข้อมูล 2048 หรือ 1024 (Matryoshka) พร้อมการฝึกอบรมแบบ Quantization-aware สำหรับ int8
Perplexity ได้สร้างความฮือฮาให้กับวงการปัญญาประดิษฐ์อีกครั้งด้วยการปล่อยโมเดลใหม่ล่าสุดที่มีชื่อว่า pplx-embed-v2-context-9b-preview ซึ่งเป็นโมเดล Embedding เชิงบริบทที่ออกแบบมาเพื่อช่วยดึงข้อมูลคำตอบพร้อมกับหลักฐานสนับสนุนได้อย่างแม่นยำยิ่งขึ้น โดยในขณะนี้ตัวโมเดลได้เปิดให้ใช้งานในรูปแบบ self-hosted preview แล้ว และมีการเผยแพร่ weights บนแพลตฟอร์ม Hugging Face ภายใต้สัญญาอนุญาตแบบ MIT
สำหรับนักพัฒนาที่สนใจนำไปทดลองใช้งาน จำเป็นต้องเรียกใช้งานผ่านไลบรารี transformers เวอร์ชัน 5.4.0 ขึ้นไป พร้อมกับตั้งค่าพารามิเตอร์ trust_remote_code เป็น True อย่างไรก็ตาม ทาง Perplexity ได้ระบุไว้ใน model card ว่าทั้งตัว weights และอินเทอร์เฟซอาจมีการเปลี่ยนแปลงได้ในอนาคตโดยไม่มีการรับประกันความเข้ากันได้ย้อนหลัง (backward compatibility) และในตอนนี้ยังไม่มีการเปิดให้บริการผ่านทาง Perplexity API แต่อย่างใด

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในระบบ Retrieval-Augmented Generation (RAG) แบบดั้งเดิม เอกสารยาวๆ มักจะถูกแบ่งออกเป็นส่วนย่อยๆ หรือที่เรียกว่า chunks ซึ่งเนื้อหาในแต่ละส่วนมักจะต้องพึ่งพาบริบทจากส่วนอื่น เช่น ชื่อเฉพาะ คำนิยาม หรือหัวข้อที่กล่าวถึงในจุดอื่นของเอกสาร โมเดลเชองบริบทจึงเข้ามาแก้ปัญหานี้ด้วยเทคนิคที่เรียกว่า Late Chunking โดยตัวเอกสารจะถูกเข้ารหัสในรวดเดียว (one pass) ก่อนจะนำมาทำ pooling แยกตามแต่ละ chunk
การทำ Late Chunking ถือเป็นก้าวสำคัญในการพัฒนา RAG เนื่องจากโมเดลแบบดั้งเดิมมักจะตัดแบ่งข้อความอย่างไร้บริบท ทำให้ความหมายของคำสรรพนามหรือข้อมูลอ้างอิงสูญหายไป การที่ Perplexity นำเสนอแนวทางนี้ช่วยให้ตัวแทนเวกเตอร์ยังคงรักษาความสัมพันธ์ของบริบทข้ามส่วนย่อยไว้ได้ ซึ่งเป็นประโยชน์อย่างยิ่งสำหรับเอกสารทางกฎหมายหรือรายงานทางวิชาการที่มีความซับซ้อนสูง
กระบวนการฝึกอบรมโมเดลทั่วไปมักจะกำหนดให้มี chunk ที่ถูกต้องเพียงหนึ่งเดียวต่อหนึ่งคำถาม (gold chunk) ในขณะที่ส่วนอื่นๆ จะถูกมองว่าเป็น negative ทั้งหมด รวมถึงประโยคที่ทำหน้าที่ตรวจสอบความถูกต้องของคำตอบด้วย ซึ่ง Perplexity ชี้ให้เห็นว่าแนวทางเดิมมีข้อจำกัดอยู่ 3 ประการ ได้แก่:
- สัญญาณจากป้ายกำกับแบบไบนารี (binary labels) มีความหยาบเกินไป
- ต้นทุนในการใช้ LLM เพื่อทำ annotation เพิ่มขึ้นเป็นเส้นตรงตามขนาดของชุดข้อมูล
- ป้ายกำกับถูกผูกติดอยู่กับกลยุทธ์การแบ่ง chunk เพียงรูปแบบเดียวเท่านั้น
เพื่อแก้ปัญหาดังกล่าว Perplexity จึงใช้โมเดลบีบอัดบริบทที่รู้เท่าทันคำถาม (query-aware context compression model) ทำหน้าที่เป็นครู (teacher) คอยอ่านคำถามและเอกสารไปพร้อมกัน พร้อมทั้งให้คะแนนในทุกๆ token โดยในแต่ละชุดข้อมูลจะมีการสุ่มกลยุทธ์การแบ่ง chunk และคั่นแต่ละส่วนด้วย token พิเศษที่เรียนรู้ได้ ก่อนจะนำมาทำ mean-pooling ซึ่งโมเดลครูนี้จะทำงานเฉพาะในช่วงฝึกอบรมเท่านั้น จึงไม่ส่งผลกระทบต่อความหน่วง (latency) หรือพื้นที่จัดเก็บในขั้นตอนการอนุมาน (inference)
โมเดลนี้มีจุดเริ่มต้นมาจากโมเดลเรียกค้นข้อมูล ColBERT ขนาด 9B ที่พัฒนาขึ้นเองภายในองค์กร ผ่านการฉายภาพเชิงเส้น (linear projection) ให้ได้มิติข้อมูล 2048 และยังรองรับมิติข้อมูล 1024 ผ่านการฝึกแบบ Matryoshka รวมถึงการทำ Quantization-aware training เพื่อให้ได้ native int8 embeddings โดยตัวโมเดลที่ปล่อยออกมานี้เป็นแบบ model soup ที่รวมเอา checkpoint หลายตัวเข้าไว้ด้วยกัน ผ่านการฝึกฝนด้วยชุดข้อมูลกว่า 430 ชุด ครอบคลุมมากกว่า 50 ภาษา โดยไม่มีการใช้ข้อมูลจาก ConTEB แต่อย่างใด

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในส่วนของการประเมินผล ทาง Perplexity ได้อ้างอิงผลลัพธ์จากชุดทดสอบ context-bench ซึ่งจัดทำและถือครองโดย turbopuffer เพื่อจำกัดการปนเปื้อนของข้อมูล โดยชุดทดสอบนี้ประกอบด้วยคำถาม 2,099 ข้อ เอกสาร 38,894 ฉบับ ใน 21 โดเมน และมีการแบ่งประโยคเป็น chunks กว่า 2,458,072 ส่วน ซึ่งทดสอบความสามารถเชิงบริบทถึง 12 ด้าน ตั้งแต่การแก้คำสรรพนามไปจนถึงโครงสร้างตาราง
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น