ข้ามไปเนื้อหาหลัก

NVIDIA เปิดตัว Nemotron 3 Diarization โมเดลแยกเสียง 8 คน

NVIDIA เปิดตัว Nemotron 3 Diarization โมเดล Open-Weight ขนาด 100M พารามิเตอร์ รองรับการแยกเสียงผู้พูดสูงสุด 8 คนพร้อมกันแบบเรียลไทม์บน GPU แพลตฟอร์ม NVIDIA

เรียบเรียงโดย AI
Inewgen
24 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
NVIDIA เปิดตัว Nemotron 3 Diarization โมเดลแยกเสียง 8 คน

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • NVIDIA เปิดตัว Nemotron 3 Diarization โมเดล Open-Weight ขนาด 100M พารามิเตอร์
  • รองรับการแยกแยะเสียงผู้พูดสูงสุด 8 คนพร้อมกัน เพิ่มขึ้นจากรุ่นเดิมที่รองรับ 4 คน
  • ทำคะแนนอันดับ 1 ในการทดสอบ Diarization-Bench ของ Voice Arena จาก 12 ระบบ
  • เปิดให้ใช้งานเชิงพาณิชย์ภายใต้สัญญาอนุญาต OpenMDW License 1.1 บนระบบ Linux

การแปลงเสียงพูดเป็นข้อความหรือ ASR (Automatic Speech Recognition) ช่วยให้เราได้คำพูดออกมา แต่ไม่สามารถบอกได้ว่าใครเป็นผู้พูด การถอดเสียงแบบไม่มีการระบุตัวตนทำให้เครื่องมือสรุปผลไม่สามารถทราบได้ว่าใครเป็นผู้ให้คำมั่นสัญญาหรือใครเป็นผู้คัดค้าน โมเดลการแยกแยะผู้พูดหรือ Diarization จึงเข้ามาทำหน้าที่ระบุช่วงเวลาที่ผู้พูดแต่ละคนเริ่มออกเสียงและสิ้นสุดลง เพื่อนำไปผสานเข้ากับผลลัพธ์จาก ASR กลายเป็นบทสนทนาที่มีการระบุตัวตนของผู้พูดในแต่ละช่วง ซึ่งเป็นหัวใจสำคัญสำหรับเครื่องมือการประชุม ระบบวิเคราะห์การโทร พอดแคสต์ และหน่วยความจำของตัวแทนเสียง

ก่อนหน้านี้ NVIDIA มีรุ่น Streaming Sortformer รหัส diar_streaming_sortformer_4spk-v2.1 ที่รองรับผู้พูดได้ 4 คน แต่ล่าสุด Nemotron 3 Diarization ได้ยกระดับขีดความสามารถขึ้นเท่าตัวด้วยการรองรับผู้พูดสูงสุด 8 คน โดยพุ่งเป้าไปที่การจัดการเสียงสนทนามีความซับซ้อนและมีผู้พูดหลายคนทับซ้อนกัน โมเดลนี้รับไฟล์เสียงโมโนช่องสัญญาณเดียวความถี่ 16 kHz ในรูปแบบ .wav, .flac, .opus หรือ .mp3 แล้วแปลงเป็นฟีเจอร์ Mel-spectrogram ก่อนจะประมวลผลผ่าน Transformer 31 ชั้น ที่มาพร้อมระบบ Rotary Positional Embeddings (RoPE)

chromebook notebook computer office desk workspace

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

8 คนรองรับผู้พูดสูงสุดพร้อมกัน
15,113xอัตราความเร็ว Throughput สูงสุด
14.72%คะแนน DER ใน Diarization-Bench

สถาปัตยกรรมของโมเดลถูกออกแบบมาเพื่อจัดการกับการพูดทับซ้อนโดยตรง หากมีผู้พูด 2 คนในเวลาเดียวกัน ระบบจะเปิดใช้งาน 2 ช่องสัญญาณในเฟรมเดียวกัน พร้อมใช้กลไก Sortformer จัดลำดับผู้พูดตามเวลาที่เข้ามา เพื่อรักษาความเสถียรของป้ายกำกับตลอดการสตรีม และใช้หน่วยความจำ Arrival-Order Speaker Cache (AOSC) ร่วมกับคิว FIFO เพื่อเก็บรักษาบริบทของเฟรมล่าสุด โดยความหน่วงของบัฟเฟอร์อินพุตเริ่มต้นที่ระดับ 0.32 วินาที

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การพัฒนาโมเดล Diarization ให้รองรับการพูดทับซ้อนหลายคนแบบเรียลไทม์ถือเป็นโจทย์ที่ท้าทายมากในทางวิศวกรรมเสียง เนื่องจากเสียงสนทนามนุษย์มักมีความก้ำกึ่งและตัดสลับกันรวดเร็ว การที่ NVIDIA เลือกใช้สถาปัตยกรรม Transformer ร่วมกับ RoPE และแคชลำดับการมาถึงของผู้พูด ช่วยให้ระบบรักษาสถานะของแต่ละเสียงได้ดีขึ้นโดยไม่ต้องคำนวณจับคู่ใหม่ทุกเฟรม ซึ่งส่งผลอย่างมากต่อประสิทธิภาพในสภาพแวดล้อมการประชุมทางธุรกิจจริง

ในการประเมินผลเบื้องต้นบน Diarization-Bench ของ Voice Arena โมเดลนี้ทำคะแนน Diarization Error Rate (DER) ได้ที่ 14.72% เหนือกว่าระบบอื่น ๆ และลดอัตราความผิดพลาดลงราว 24% เมื่อเทียบกับอันดับรองลงมา นอกจากนี้ ในแง่ของประสิทธิภาพการประมวลผล (Throughput) ที่ความยาว 30.4 วินาที บนการทดสอบด้วยค่า BF16 บนการ์ดจอ NVIDIA RTX PRO 5000 โมเดลทำความเร็วได้ถึง 15,113× RTFx เพิ่มขึ้นอย่างก้าวกระโดดจากรุ่นก่อนหน้าที่ทำได้ 2,619×

โมเดลนี้ผ่านการฝึกฝนด้วยชุดข้อมูลการสนทนาจริงรวมประมาณ 10,000 ชั่วโมง ผสมผสานกับข้อมูลเสียงจำลองการสนทนาหลายคนอีก 82,611 ชั่วโมง ซึ่งรวมถึงเสียงจากแหล่งที่ได้รับอนุญาตอย่างเป็นทางการจาก David AI ครอบคลุมภาษากว่า 21 ภาษา นักพัฒนาสามารถติดตั้งใช้งานผ่าน Python 3.12 ขึ้นไป พร้อมชุดคำสั่ง uv pip install 'nemo-toolkit[asr]' และเรียกใช้งานผ่านคลาส SortformerEncLabelModel จากไลบรารี NVIDIA NeMo

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้