ข้ามไปเนื้อหาหลัก

Perplexity ปล่อย pplx-embed-v2-context-9b-preview โมเดลฝังตัว

Perplexity เปิดตัวโมเดล pplx-embed-v2-context-9b-preview ขนาด 9B บน Hugging Face พร้อมจุดเด่นเรื่องการดึงคำตอบและหลักฐานสนับสนุนผ่านเทคนิค Late Chunking

เรียบเรียงโดย AI
Inewgen
01 Oct 2026ที่มา: MarkTechPost4 นาทีอ่าน (0 ครั้ง)
แชร์
Perplexity ปล่อย pplx-embed-v2-context-9b-preview โมเดลฝังตัว

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Perplexity เปิดตัวโมเดล pplx-embed-v2-context-9b-preview ขนาด 9B ใช้งานแบบ self-hosted ได้
  • เผยแพร่ weights บน Hugging Face ภายใต้สัญญาอนุญาต MIT โดยต้องใช้ไลบรารี transformers>=5.4.0
  • แก้ปัญหา RAG แบบเดิมด้วยเทคนิค Late Chunking และใช้ครูสอนบีบอัดบริบทเพื่อสร้าง soft targets
  • รองรับมิติข้อมูล 2048 หรือ 1024 (Matryoshka) พร้อมการฝึกอบรมแบบ Quantization-aware สำหรับ int8

Perplexity ได้สร้างความฮือฮาให้กับวงการปัญญาประดิษฐ์อีกครั้งด้วยการปล่อยโมเดลใหม่ล่าสุดที่มีชื่อว่า pplx-embed-v2-context-9b-preview ซึ่งเป็นโมเดล Embedding เชิงบริบทที่ออกแบบมาเพื่อช่วยดึงข้อมูลคำตอบพร้อมกับหลักฐานสนับสนุนได้อย่างแม่นยำยิ่งขึ้น โดยในขณะนี้ตัวโมเดลได้เปิดให้ใช้งานในรูปแบบ self-hosted preview แล้ว และมีการเผยแพร่ weights บนแพลตฟอร์ม Hugging Face ภายใต้สัญญาอนุญาตแบบ MIT

สำหรับนักพัฒนาที่สนใจนำไปทดลองใช้งาน จำเป็นต้องเรียกใช้งานผ่านไลบรารี transformers เวอร์ชัน 5.4.0 ขึ้นไป พร้อมกับตั้งค่าพารามิเตอร์ trust_remote_code เป็น True อย่างไรก็ตาม ทาง Perplexity ได้ระบุไว้ใน model card ว่าทั้งตัว weights และอินเทอร์เฟซอาจมีการเปลี่ยนแปลงได้ในอนาคตโดยไม่มีการรับประกันความเข้ากันได้ย้อนหลัง (backward compatibility) และในตอนนี้ยังไม่มีการเปิดให้บริการผ่านทาง Perplexity API แต่อย่างใด

machine learning code screen workspace

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในระบบ Retrieval-Augmented Generation (RAG) แบบดั้งเดิม เอกสารยาวๆ มักจะถูกแบ่งออกเป็นส่วนย่อยๆ หรือที่เรียกว่า chunks ซึ่งเนื้อหาในแต่ละส่วนมักจะต้องพึ่งพาบริบทจากส่วนอื่น เช่น ชื่อเฉพาะ คำนิยาม หรือหัวข้อที่กล่าวถึงในจุดอื่นของเอกสาร โมเดลเชองบริบทจึงเข้ามาแก้ปัญหานี้ด้วยเทคนิคที่เรียกว่า Late Chunking โดยตัวเอกสารจะถูกเข้ารหัสในรวดเดียว (one pass) ก่อนจะนำมาทำ pooling แยกตามแต่ละ chunk

การทำ Late Chunking ถือเป็นก้าวสำคัญในการพัฒนา RAG เนื่องจากโมเดลแบบดั้งเดิมมักจะตัดแบ่งข้อความอย่างไร้บริบท ทำให้ความหมายของคำสรรพนามหรือข้อมูลอ้างอิงสูญหายไป การที่ Perplexity นำเสนอแนวทางนี้ช่วยให้ตัวแทนเวกเตอร์ยังคงรักษาความสัมพันธ์ของบริบทข้ามส่วนย่อยไว้ได้ ซึ่งเป็นประโยชน์อย่างยิ่งสำหรับเอกสารทางกฎหมายหรือรายงานทางวิชาการที่มีความซับซ้อนสูง

กระบวนการฝึกอบรมโมเดลทั่วไปมักจะกำหนดให้มี chunk ที่ถูกต้องเพียงหนึ่งเดียวต่อหนึ่งคำถาม (gold chunk) ในขณะที่ส่วนอื่นๆ จะถูกมองว่าเป็น negative ทั้งหมด รวมถึงประโยคที่ทำหน้าที่ตรวจสอบความถูกต้องของคำตอบด้วย ซึ่ง Perplexity ชี้ให้เห็นว่าแนวทางเดิมมีข้อจำกัดอยู่ 3 ประการ ได้แก่:

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

  • สัญญาณจากป้ายกำกับแบบไบนารี (binary labels) มีความหยาบเกินไป
  • ต้นทุนในการใช้ LLM เพื่อทำ annotation เพิ่มขึ้นเป็นเส้นตรงตามขนาดของชุดข้อมูล
  • ป้ายกำกับถูกผูกติดอยู่กับกลยุทธ์การแบ่ง chunk เพียงรูปแบบเดียวเท่านั้น

เพื่อแก้ปัญหาดังกล่าว Perplexity จึงใช้โมเดลบีบอัดบริบทที่รู้เท่าทันคำถาม (query-aware context compression model) ทำหน้าที่เป็นครู (teacher) คอยอ่านคำถามและเอกสารไปพร้อมกัน พร้อมทั้งให้คะแนนในทุกๆ token โดยในแต่ละชุดข้อมูลจะมีการสุ่มกลยุทธ์การแบ่ง chunk และคั่นแต่ละส่วนด้วย token พิเศษที่เรียนรู้ได้ ก่อนจะนำมาทำ mean-pooling ซึ่งโมเดลครูนี้จะทำงานเฉพาะในช่วงฝึกอบรมเท่านั้น จึงไม่ส่งผลกระทบต่อความหน่วง (latency) หรือพื้นที่จัดเก็บในขั้นตอนการอนุมาน (inference)

9Bขนาดพารามิเตอร์เริ่มต้น (ColBERT)
2048มิติข้อมูลสูงสุด (รองรับ 1024 ด้วย)
430+ชุดข้อมูลที่ใช้ฝึกอบรมกว่า 50 ภาษา

โมเดลนี้มีจุดเริ่มต้นมาจากโมเดลเรียกค้นข้อมูล ColBERT ขนาด 9B ที่พัฒนาขึ้นเองภายในองค์กร ผ่านการฉายภาพเชิงเส้น (linear projection) ให้ได้มิติข้อมูล 2048 และยังรองรับมิติข้อมูล 1024 ผ่านการฝึกแบบ Matryoshka รวมถึงการทำ Quantization-aware training เพื่อให้ได้ native int8 embeddings โดยตัวโมเดลที่ปล่อยออกมานี้เป็นแบบ model soup ที่รวมเอา checkpoint หลายตัวเข้าไว้ด้วยกัน ผ่านการฝึกฝนด้วยชุดข้อมูลกว่า 430 ชุด ครอบคลุมมากกว่า 50 ภาษา โดยไม่มีการใช้ข้อมูลจาก ConTEB แต่อย่างใด

neural network graph analytics dashboard

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในส่วนของการประเมินผล ทาง Perplexity ได้อ้างอิงผลลัพธ์จากชุดทดสอบ context-bench ซึ่งจัดทำและถือครองโดย turbopuffer เพื่อจำกัดการปนเปื้อนของข้อมูล โดยชุดทดสอบนี้ประกอบด้วยคำถาม 2,099 ข้อ เอกสาร 38,894 ฉบับ ใน 21 โดเมน และมีการแบ่งประโยคเป็น chunks กว่า 2,458,072 ส่วน ซึ่งทดสอบความสามารถเชิงบริบทถึง 12 ด้าน ตั้งแต่การแก้คำสรรพนามไปจนถึงโครงสร้างตาราง

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้