เจาะลึก Multi-Reward RL: เปรียบเทียบ PPO, GRPO, DAPO, GDPO
เปรียบเทียบอัลกอริทึมฝึก RL สำหรับ LLM agent ทั้ง 4 แบบ เผยปัญหา Scale Dominance และวิธีแก้ด้วย Normalize-then-Sum ของ GDPO

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- การเทรดแอฟเจนต์ด้วยรางวัลแบบ Scalar เดี่ยวใช้งานจริงไม่ได้เพราะความขัดแย้งของเป้าหมาย
- GRPO ช่วยลดภาระหน่วยความจำ GPU ได้ครึ่งหนึ่งแต่เจอจุดบอด Scale Dominance และ Dead Groups
- DAPO แก้ปัญหา Dead Groups ด้วยระบบ Dynamic Sampling ตัดข้อมูลที่สูญเปล่าทิ้งทันที
- GDPO ใช้แนวทาง Normalize-then-Sum แยก normalize แต่ละรางวัลก่อนรวมกันเพื่อความแม่นยำ
การศึกษาเชิงประจักษ์ภาคที่ 2 เปรียบเทียบการกำหนดค่าเทรนเนอร์ 7 แบบบนโมเดล Qwen3-14B และ DEX gym ของนักพัฒนา โดยมีการทดสอบทั้งแบบ no-think และ thinking holdouts พร้อมกราฟรางวัลแบบอินเทอร์แอกทีฟ ข้อมูลชุดนี้มาจากการทดลองแยกต่างหากจากตาราง 27B และไม่ได้จัดอันดับเทรนเนอร์ในภาพรวมทั้งหมด
หากฝึกโมเดลภาษาด้วยโจทย์คณิตศาสตร์จำลอง การเรียนเสริมกำลัง (Reinforcement Learning) จะดูเป็นเรื่องง่ายคือ โมเดลตอบ 42 ได้รางวัลเป็น 1 หากไม่ใช่จะได้รางวัลเป็น 0 แต่ทันทีที่พัฒนาเอเจนต์อัตโนมัติสำหรับงานองค์กรในโลกจริง รางวัลเดี่ยวแบบ Scalar กลายเป็นสิ่งลวงตาอย่างสิ้นเชิง
ในระบบจริง เอเจนต์ต้องรับมือกับความสำคัญหลายด้านที่แข่งขันและขัดแย้งกันเองพร้อมๆ กัน:
- ความถูกต้องของคำตอบ
- ประสิทธิภาพการใช้โทเค็น
- ความปลอดภัยและการปฏิบัติตามกฎ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ความลับเบื้องหลังการฝึกหลังจบกระบวนการหลักคือ หากนำคะแนนทั้งสามด้านมารวมกันแบบธรรมดาในอัลกอริทึมมาตรฐานอย่าง PPO หรือ GRPO ดั้งเดิม การฝึกจะล่มสลาย ช่องสัญญาณรางวัลที่ดังที่สุดจะกลืนช่องที่ละเอียดอ่อน เอเจนต์เรียนรู้ที่จะเอาชนะระบบ และมากถึงหนึ่งในสามของชุดข้อมูล GPU ราคาแพงจะสร้างเกรเดียนต์เป็นศูนย์
การเข้าใจกลไกเบื้องหลังการรวมรางวัลหลายช่องเข้ากับนโยบายเอเจนต์ช่วยให้เห็นว่าเหตุใดการบวกด้วยน้ำหนักธรรมดาจึงเกิดปัญหา Scale Dominance ทำไม GDPO ถึงแยกการ normalize แต่ละช่องรางวัลออกจากกัน และเหตุใดข้อจำกัดที่เข้มงวดจึงต้องมีการบังคับใช้แทนที่จะใช้น้ำหนักรางวัลเฉยๆ
บทความนี้พาไปสำรวจวิวัฒนาการของตัวประมาณค่าพอลิซีเกรเดียนต์เพื่อทำความเข้าใจการฝึกเอเจนต์หลายรางวัลในปัจจุบัน:
- Proximal Policy Optimization (Schulman et al., 2017) ใช้สถาปัตยกรรม Actor-Critic โดย Actor สร้างโทเค็นและ Critic คาดการณ์รางวัลอนาคต
- DeepSeekMath (2024) นำเสนอ Group Relative Policy Optimization (GRPO) ที่ตัดโครงข่าย Critic ทิ้งไป
แทนที่จะใช้ตาข่ายประสาททำนายค่าฐาน GRPO จะสุ่มตัวอย่างกลุ่มคำตอบผู้สมัคร G ชุด {o₁, o₂, ..., o_G} สำหรับพรอมต์เดียวกัน ให้คะแนนทั้งหมด และ normalize แอดวานซ์เทียบกับค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานของกลุ่ม
เมื่อรัน GRPO กับปัญหาทางวิศวกรรมที่ยาก จะพบกับคำสาปของ Dead Groups หากงานเขียนโค้ดมีความยากและโรลเอาต์ทั้ง 8 ตัวในกลุ่มล้มเหลวด้วยข้อผิดพลาดไวยากรณ์ รางวัลของทุกโรลเอาต์จะเป็น 0 และส่วนเบี่ยงเบนมาตรฐานของกลุ่มจะเป็น 0 ทำให้การอัปเดตเกรเดียนต์ว่างเปล่าในงานที่ยากลำบาก
"A group where all 8 attempts fail has zero variance and gives no gradient. DAPO's dynamic sampling replaces it with a prompt whose attempts differ."
Dev.to
DAPO นำเสนอระบบ dynamic sampling ระหว่างการให้คะแนนโรลเอาต์ หากกลุ่มมีความแปรปรวนเป็นศูนย์ จะทิ้งข้อมูลที่ตายแล้วทันทีและดึงพรอมต์แอกทีฟใหม่จนกว่าทุกแบตช์จะให้สัญญาณการเรียนรู้ที่แท้จริง ช่วยลดรอบ GPU ที่สูญเปล่าเกือบเป็นศูนย์
GDPO ซึ่งเปิดตัวในปี 2026 (arXiv:2601.05242) และถูกผสานลงในไลบรารีสมัยใหม่เช่น TRL 1.7 แก้ไขข้อบกพร่องเรื่องรางวัลหลายช่องของ GRPO โดยใช้ Normalize-then-Sum แทนการบวกคะแนนดิบเข้าด้วยกันก่อน normalize
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น