ข้ามไปเนื้อหาหลัก

เจาะลึก Multi-Reward RL: เปรียบเทียบ PPO, GRPO, DAPO, GDPO

เปรียบเทียบอัลกอริทึมฝึก RL สำหรับ LLM agent ทั้ง 4 แบบ เผยปัญหา Scale Dominance และวิธีแก้ด้วย Normalize-then-Sum ของ GDPO

เรียบเรียงโดย AI
Inewgen
สด26 Sep 2026ที่มา: Dev.to3 นาทีอ่าน (0 ครั้ง)
แชร์
เจาะลึก Multi-Reward RL: เปรียบเทียบ PPO, GRPO, DAPO, GDPO

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • การเทรดแอฟเจนต์ด้วยรางวัลแบบ Scalar เดี่ยวใช้งานจริงไม่ได้เพราะความขัดแย้งของเป้าหมาย
  • GRPO ช่วยลดภาระหน่วยความจำ GPU ได้ครึ่งหนึ่งแต่เจอจุดบอด Scale Dominance และ Dead Groups
  • DAPO แก้ปัญหา Dead Groups ด้วยระบบ Dynamic Sampling ตัดข้อมูลที่สูญเปล่าทิ้งทันที
  • GDPO ใช้แนวทาง Normalize-then-Sum แยก normalize แต่ละรางวัลก่อนรวมกันเพื่อความแม่นยำ

การศึกษาเชิงประจักษ์ภาคที่ 2 เปรียบเทียบการกำหนดค่าเทรนเนอร์ 7 แบบบนโมเดล Qwen3-14B และ DEX gym ของนักพัฒนา โดยมีการทดสอบทั้งแบบ no-think และ thinking holdouts พร้อมกราฟรางวัลแบบอินเทอร์แอกทีฟ ข้อมูลชุดนี้มาจากการทดลองแยกต่างหากจากตาราง 27B และไม่ได้จัดอันดับเทรนเนอร์ในภาพรวมทั้งหมด

หากฝึกโมเดลภาษาด้วยโจทย์คณิตศาสตร์จำลอง การเรียนเสริมกำลัง (Reinforcement Learning) จะดูเป็นเรื่องง่ายคือ โมเดลตอบ 42 ได้รางวัลเป็น 1 หากไม่ใช่จะได้รางวัลเป็น 0 แต่ทันทีที่พัฒนาเอเจนต์อัตโนมัติสำหรับงานองค์กรในโลกจริง รางวัลเดี่ยวแบบ Scalar กลายเป็นสิ่งลวงตาอย่างสิ้นเชิง

ในระบบจริง เอเจนต์ต้องรับมือกับความสำคัญหลายด้านที่แข่งขันและขัดแย้งกันเองพร้อมๆ กัน:

  • ความถูกต้องของคำตอบ
  • ประสิทธิภาพการใช้โทเค็น
  • ความปลอดภัยและการปฏิบัติตามกฎ
deep learning neural network visualization

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ความลับเบื้องหลังการฝึกหลังจบกระบวนการหลักคือ หากนำคะแนนทั้งสามด้านมารวมกันแบบธรรมดาในอัลกอริทึมมาตรฐานอย่าง PPO หรือ GRPO ดั้งเดิม การฝึกจะล่มสลาย ช่องสัญญาณรางวัลที่ดังที่สุดจะกลืนช่องที่ละเอียดอ่อน เอเจนต์เรียนรู้ที่จะเอาชนะระบบ และมากถึงหนึ่งในสามของชุดข้อมูล GPU ราคาแพงจะสร้างเกรเดียนต์เป็นศูนย์

การเข้าใจกลไกเบื้องหลังการรวมรางวัลหลายช่องเข้ากับนโยบายเอเจนต์ช่วยให้เห็นว่าเหตุใดการบวกด้วยน้ำหนักธรรมดาจึงเกิดปัญหา Scale Dominance ทำไม GDPO ถึงแยกการ normalize แต่ละช่องรางวัลออกจากกัน และเหตุใดข้อจำกัดที่เข้มงวดจึงต้องมีการบังคับใช้แทนที่จะใช้น้ำหนักรางวัลเฉยๆ

บทความนี้พาไปสำรวจวิวัฒนาการของตัวประมาณค่าพอลิซีเกรเดียนต์เพื่อทำความเข้าใจการฝึกเอเจนต์หลายรางวัลในปัจจุบัน:

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

  • Proximal Policy Optimization (Schulman et al., 2017) ใช้สถาปัตยกรรม Actor-Critic โดย Actor สร้างโทเค็นและ Critic คาดการณ์รางวัลอนาคต
  • DeepSeekMath (2024) นำเสนอ Group Relative Policy Optimization (GRPO) ที่ตัดโครงข่าย Critic ทิ้งไป

แทนที่จะใช้ตาข่ายประสาททำนายค่าฐาน GRPO จะสุ่มตัวอย่างกลุ่มคำตอบผู้สมัคร G ชุด {o₁, o₂, ..., o_G} สำหรับพรอมต์เดียวกัน ให้คะแนนทั้งหมด และ normalize แอดวานซ์เทียบกับค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานของกลุ่ม

30%-40%อัตราขั้นตอนการฝึกที่กลายเป็น Dead Groups ในงานยาก

เมื่อรัน GRPO กับปัญหาทางวิศวกรรมที่ยาก จะพบกับคำสาปของ Dead Groups หากงานเขียนโค้ดมีความยากและโรลเอาต์ทั้ง 8 ตัวในกลุ่มล้มเหลวด้วยข้อผิดพลาดไวยากรณ์ รางวัลของทุกโรลเอาต์จะเป็น 0 และส่วนเบี่ยงเบนมาตรฐานของกลุ่มจะเป็น 0 ทำให้การอัปเดตเกรเดียนต์ว่างเปล่าในงานที่ยากลำบาก

"A group where all 8 attempts fail has zero variance and gives no gradient. DAPO's dynamic sampling replaces it with a prompt whose attempts differ."

Dev.to

DAPO นำเสนอระบบ dynamic sampling ระหว่างการให้คะแนนโรลเอาต์ หากกลุ่มมีความแปรปรวนเป็นศูนย์ จะทิ้งข้อมูลที่ตายแล้วทันทีและดึงพรอมต์แอกทีฟใหม่จนกว่าทุกแบตช์จะให้สัญญาณการเรียนรู้ที่แท้จริง ช่วยลดรอบ GPU ที่สูญเปล่าเกือบเป็นศูนย์

GDPO ซึ่งเปิดตัวในปี 2026 (arXiv:2601.05242) และถูกผสานลงในไลบรารีสมัยใหม่เช่น TRL 1.7 แก้ไขข้อบกพร่องเรื่องรางวัลหลายช่องของ GRPO โดยใช้ Normalize-then-Sum แทนการบวกคะแนนดิบเข้าด้วยกันก่อน normalize

ที่มา: Dev.to

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้