ข้ามไปเนื้อหาหลัก

Perplexity ฝึกคอมพิวเตอร์เอเจนต์จากข้อผิดพลาดจริงด้วยเทคนิค OPSD

Perplexity พัฒนาวิธีฝึกคอมพิวเตอร์เอเจนต์รุ่น GLM 5.2 ด้วยเทคนิค hint-guided self-distillation เพื่อแก้ไขข้อผิดพลาดโดยเฉพาะ

เรียบเรียงโดย AI
Inewgen
26 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Perplexity ฝึกคอมพิวเตอร์เอเจนต์จากข้อผิดพลาดจริงด้วยเทคนิค OPSD

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Perplexity พัฒนาวิธีฝึกคอมพิวเตอร์เอเจนต์โดยใช้ข้อผิดพลาดจริงมาปรับปรุงโมเดล
  • โมเดลพื้นฐานที่ใช้คือ GLM 5.2 ซึ่งเปิดให้ใช้งานบน Hugging Face แต่ยังไม่ปล่อยน้ำหนักโมเดลฝึกสอน
  • ใช้เทคนิค On-Policy Self-Distillation (OPSD) ร่วมกับการจำกัดขอบเขตงานที่ผ่านการตรวจสอบจาก LLM judge

Perplexity ได้พัฒนาระบบฝึกอบรมคอมพิวเตอร์เอเจนต์ด้วยแนวทางใหม่ที่มุ่งเน้นการเรียนรู้จากข้อผิดพลาดที่เกิดขึ้นจริง แทนที่จะเลือกเลียนแบบเฉพาะเซสชันที่ประสบความสำเร็จทั้งหมด โดยในปัจจุบันโมเดลดังกล่าวเปิดให้ใช้งานเฉพาะภายใน Perplexity Computer เท่านั้น และยังไม่มีการปล่อยโค้ดฝึกสอนหรือน้ำหนักโมเดลหลังการฝึก (post-trained weights) ออกมาแต่อย่างใด

ในกระบวนการเรียนรู้แบบมาตรฐานหรือ Rejection Sampling Fine-Tuning (RFT) มักจะคัดเลือกเฉพาะเซสชันที่สำเร็จมาเลียนแบบ แต่ในความเป็นจริงผลลัพธ์ที่สำเร็จไม่ได้แปลว่าทุกขั้นตอนมีความถูกต้องเสมอไป เอเจนต์อาจทำผิดพลาดในการเรียกใช้เครื่องมือแต่ยังคงแก้ไขจนได้คำตอบที่ถูกต้อง การเลียนแบบทั้งกระบวนการจึงอาจเป็นการตอกย้ำข้อผิดพลาดนั้น ขณะเดียวกันการทิ้งเซสชันที่ล้มเหลวก็ทำให้สูญเสียหลักฐานสำคัญของความผิดพลาดที่สามารถป้องกันได้

software code screen data center

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ทีมงานของ Perplexity จึงได้แยกการตัดสินใจออกเป็นสองส่วน ได้แก่ เซสชันใดที่มีพฤติกรรมควรค่าแก่การเลียนแบบ และจุดใดที่มีความผิดพลาดที่ควรแก้ไข โดยแต่ละรอบการทำงานของระบบผู้ช่วย (assistant turn) จะได้รับการจัดการใน 3 รูปแบบที่แตกต่างกัน

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

  • เซสชันที่สำเร็จสามารถให้ทั้งเป้าหมายการเลียนแบบและเป้าหมายการแก้ไข
  • เซสชันที่ไม่สำเร็จจะให้เฉพาะเป้าหมายการแก้ไขเท่านั้น
4-5ระดับความยากที่ LLM judge คัดเลือก
50%โอกาสที่ข้อความสุดท้ายก่อนร้องเรียนจะเป็นสาเหตุที่แท้จริง

ในส่วนของการแก้ไขจะใช้เทคนิค On-Policy Self-Distillation (OPSD) โดยเทรนเนอร์จะรันตัวตรวจสอบ GLM 5.2 สองครั้งในรอบการทำงานเดียวกัน ครั้งแรกครู (teacher pass) จะเห็นคำใบ้ (hint) ส่วนครั้งที่สองนักเรียน (student pass) จะมองไม่เห็น ซึ่งทั้งสองครั้งใช้ teacher forcing ทำให้ไม่มีการสร้างคำตอบใหม่ขึ้นมา ความน่าจะเป็นของโทเค็นถัดไปจากครูจะถูกแยกออกและทำหน้าที่เป็น soft target ผ่าน forward KL

การใช้เทคนิค OPSD ช่วยให้เอเจนต์ปัญญาประดิษฐ์สามารถเรียนรู้จากข้อผิดพลาดในอดีตได้อย่างแม่นยำยิ่งขึ้น เนื่องจากกระบวนการทำงานทั่วไปมักมองข้ามรายละเอียดปลีกย่อยในระหว่างขั้นตอนการทำงาน การแยกแยะระหว่างผลลัพธ์ที่สำเร็จกับขั้นตอนที่ผิดพลาดช่วยลดโอกาสที่โมเดลจะเรียนรู้นิสัยที่ไม่ถูกต้องจากการกู้คืนสถานการณ์ได้

ท่อส่งข้อมูล (pipeline) นี้ดึงข้อมูลมาจากเซสชันคอมพิวเตอร์ที่มีคุณสมบัติเหมาะสมซึ่งให้บริการโดย GLM 5.2 โดยจะมีการคัดกรองข้อมูลส่วนบุคคล (PII) และผู้ใช้ที่เลือกปฏิเสธออกไป นอกจากนี้ LLM judge จะคัดเลือกงานที่มีระดับความยากอยู่ที่ระดับ 4 หรือ 5 จากสเกล 5 ระดับ และต้องได้รับการอนุมัติจาก LLM judge ถึงสองคนจึงจะถือว่าเซสชันนั้นประสบความสำเร็จ

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้