NVIDIA เปิดตัว Nemotron 3 Diarization โมเดลแยกเสียง 8 คน
NVIDIA เปิดตัว Nemotron 3 Diarization โมเดล Open-Weight ขนาด 100M พารามิเตอร์ รองรับการแยกเสียงผู้พูดสูงสุด 8 คนพร้อมกันแบบเรียลไทม์บน GPU แพลตฟอร์ม NVIDIA

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- NVIDIA เปิดตัว Nemotron 3 Diarization โมเดล Open-Weight ขนาด 100M พารามิเตอร์
- รองรับการแยกแยะเสียงผู้พูดสูงสุด 8 คนพร้อมกัน เพิ่มขึ้นจากรุ่นเดิมที่รองรับ 4 คน
- ทำคะแนนอันดับ 1 ในการทดสอบ Diarization-Bench ของ Voice Arena จาก 12 ระบบ
- เปิดให้ใช้งานเชิงพาณิชย์ภายใต้สัญญาอนุญาต OpenMDW License 1.1 บนระบบ Linux
การแปลงเสียงพูดเป็นข้อความหรือ ASR (Automatic Speech Recognition) ช่วยให้เราได้คำพูดออกมา แต่ไม่สามารถบอกได้ว่าใครเป็นผู้พูด การถอดเสียงแบบไม่มีการระบุตัวตนทำให้เครื่องมือสรุปผลไม่สามารถทราบได้ว่าใครเป็นผู้ให้คำมั่นสัญญาหรือใครเป็นผู้คัดค้าน โมเดลการแยกแยะผู้พูดหรือ Diarization จึงเข้ามาทำหน้าที่ระบุช่วงเวลาที่ผู้พูดแต่ละคนเริ่มออกเสียงและสิ้นสุดลง เพื่อนำไปผสานเข้ากับผลลัพธ์จาก ASR กลายเป็นบทสนทนาที่มีการระบุตัวตนของผู้พูดในแต่ละช่วง ซึ่งเป็นหัวใจสำคัญสำหรับเครื่องมือการประชุม ระบบวิเคราะห์การโทร พอดแคสต์ และหน่วยความจำของตัวแทนเสียง
ก่อนหน้านี้ NVIDIA มีรุ่น Streaming Sortformer รหัส diar_streaming_sortformer_4spk-v2.1 ที่รองรับผู้พูดได้ 4 คน แต่ล่าสุด Nemotron 3 Diarization ได้ยกระดับขีดความสามารถขึ้นเท่าตัวด้วยการรองรับผู้พูดสูงสุด 8 คน โดยพุ่งเป้าไปที่การจัดการเสียงสนทนามีความซับซ้อนและมีผู้พูดหลายคนทับซ้อนกัน โมเดลนี้รับไฟล์เสียงโมโนช่องสัญญาณเดียวความถี่ 16 kHz ในรูปแบบ .wav, .flac, .opus หรือ .mp3 แล้วแปลงเป็นฟีเจอร์ Mel-spectrogram ก่อนจะประมวลผลผ่าน Transformer 31 ชั้น ที่มาพร้อมระบบ Rotary Positional Embeddings (RoPE)

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
สถาปัตยกรรมของโมเดลถูกออกแบบมาเพื่อจัดการกับการพูดทับซ้อนโดยตรง หากมีผู้พูด 2 คนในเวลาเดียวกัน ระบบจะเปิดใช้งาน 2 ช่องสัญญาณในเฟรมเดียวกัน พร้อมใช้กลไก Sortformer จัดลำดับผู้พูดตามเวลาที่เข้ามา เพื่อรักษาความเสถียรของป้ายกำกับตลอดการสตรีม และใช้หน่วยความจำ Arrival-Order Speaker Cache (AOSC) ร่วมกับคิว FIFO เพื่อเก็บรักษาบริบทของเฟรมล่าสุด โดยความหน่วงของบัฟเฟอร์อินพุตเริ่มต้นที่ระดับ 0.32 วินาที
การพัฒนาโมเดล Diarization ให้รองรับการพูดทับซ้อนหลายคนแบบเรียลไทม์ถือเป็นโจทย์ที่ท้าทายมากในทางวิศวกรรมเสียง เนื่องจากเสียงสนทนามนุษย์มักมีความก้ำกึ่งและตัดสลับกันรวดเร็ว การที่ NVIDIA เลือกใช้สถาปัตยกรรม Transformer ร่วมกับ RoPE และแคชลำดับการมาถึงของผู้พูด ช่วยให้ระบบรักษาสถานะของแต่ละเสียงได้ดีขึ้นโดยไม่ต้องคำนวณจับคู่ใหม่ทุกเฟรม ซึ่งส่งผลอย่างมากต่อประสิทธิภาพในสภาพแวดล้อมการประชุมทางธุรกิจจริง
ในการประเมินผลเบื้องต้นบน Diarization-Bench ของ Voice Arena โมเดลนี้ทำคะแนน Diarization Error Rate (DER) ได้ที่ 14.72% เหนือกว่าระบบอื่น ๆ และลดอัตราความผิดพลาดลงราว 24% เมื่อเทียบกับอันดับรองลงมา นอกจากนี้ ในแง่ของประสิทธิภาพการประมวลผล (Throughput) ที่ความยาว 30.4 วินาที บนการทดสอบด้วยค่า BF16 บนการ์ดจอ NVIDIA RTX PRO 5000 โมเดลทำความเร็วได้ถึง 15,113× RTFx เพิ่มขึ้นอย่างก้าวกระโดดจากรุ่นก่อนหน้าที่ทำได้ 2,619×
โมเดลนี้ผ่านการฝึกฝนด้วยชุดข้อมูลการสนทนาจริงรวมประมาณ 10,000 ชั่วโมง ผสมผสานกับข้อมูลเสียงจำลองการสนทนาหลายคนอีก 82,611 ชั่วโมง ซึ่งรวมถึงเสียงจากแหล่งที่ได้รับอนุญาตอย่างเป็นทางการจาก David AI ครอบคลุมภาษากว่า 21 ภาษา นักพัฒนาสามารถติดตั้งใช้งานผ่าน Python 3.12 ขึ้นไป พร้อมชุดคำสั่ง uv pip install 'nemo-toolkit[asr]' และเรียกใช้งานผ่านคลาส SortformerEncLabelModel จากไลบรารี NVIDIA NeMo
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น