S1-mini โมเดลแปลงข้อความ ASR เป็นข้อความเขียนขนาด 462 MB
ทำความรู้จัก S1-mini โมเดล Open-Weights ขนาด 462 MB จาก Superwhisper ที่พัฒนาต่อยอดจาก Qwen3-0.6B สำหรับทำความสะอาดเสียงพูดให้เป็นข้อความพร้อมใช้งาน พร้อมผลการทดสอบความแม่นยำสูงถึง 94.8%

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- S1-mini เป็นโมเดล Open-Weights ขนาด 462 MB สำหรับแปลงเสียงพูดดิบให้เป็นข้อความเขียนที่สะอาด
- พัฒนาต่อยอดจาก Qwen3-0.6B มีพารามิเตอร์รวม 596 ล้านพารามิเตอร์ และรองรับเฉพาะภาษาอังกฤษในเวอร์ชัน v1
- ทำคะแนนความแม่นยำของโทเค็น (Token accuracy) สูงถึง 94.8% จากการประเมินบนชุดข้อมูลทดสอบภายใน
- เปิดให้ใช้งานบน Hugging Face ภายใต้สัญญาอนุญาต Apache 2.0 พร้อมเงื่อนไขการตั้งชื่อ
ในแวดวงปัญญาประดิษฐ์และการประมวลผลเสียง Superwhisper ได้เปิดตัว S1-mini ซึ่งเป็นโมเดล Open-Weights ขนาด 462 MB สำหรับทำหน้าที่เป็น Text Normalizer หรือตัวปรับแต่งข้อความ โดยโมเดลนี้ไม่ได้ทำหน้าที่ถอดเสียงพูด (Transcriber) หรือเป็นโมเดลแชท แต่จะทำหน้าที่อยู่ถัดจากระบบแปลงเสียงพูดเป็นข้อความอัตโนมัติ (ASR) เพื่อแปลงเสียงดิบให้กลายเป็นข้อความเขียนที่เรียบร้อยและพร้อมใช้งาน
ขั้นตอนการทำงานของโมเดลนี้จะอยู่หลังระบบ ASR เช่น Whisper หรือ Parakeet โดยมีเส้นทางการทำงานจากเสียงออดิโอ ไปยัง ASR จากนั้นจึงส่งต่อมายัง S1-mini เพื่อแปลงเป็นข้อความที่สะอาดเรียบร้อยสำหรับการนำไปใช้งานต่อในรูปแบบต่างๆ
การใช้งาน Text Normalizer ที่อยู่หลังระบบ ASR ถือเป็นแนวทางสำคัญในการแก้ปัญหาข้อความดิบจากการแปลงเสียงพูด ซึ่งมักจะมีคำฟุ่มเฟือย การเว้นวรรคที่ไม่ถูกต้อง หรือรูปแบบที่ไม่เป็นทางการ การใช้โมเดลเฉพาะทางขนาดเล็กอย่าง S1-mini จึงช่วยประหยัดทรัพยากรประมวลผลเทียบกับการใช้โมเดลภาษาขนาดใหญ่ทั่วไป
ในด้านโครงสร้างทางเทคนิค S1-mini ได้รับการ fine-tune มาจาก Qwen/Qwen3-0.6B โดยมีพารามิเตอร์ที่ไม่รวม embedding อยู่ที่ 0.44B และพารามิเตอร์รวม 596 ล้านพารามิเตอร์ มีจำนวน 28 เลเยอร์ ใช้ 16 query heads และ 8 key/value heads พร้อมระบบ GQA และน้ำหนักแบบ BF16 โดยในส่วนของแถบข้างบน Hugging Face อาจแสดงผลเป็น 0.8B เนื่องจากมีการจัดเก็บ tied embedding สองครั้ง ซึ่งทางผู้พัฒนาได้ชี้แจงรายละเอียดนี้ไว้ใน card เรียบร้อยแล้ว ทั้งนี้ เวอร์ชัน v1 รองรับเฉพาะภาษาอังกฤษเท่านั้น และแนะนำให้ใช้ขนาดอินพุตประมาณ 1,000 โทเค็น

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
การออกแบบโมเดลนี้มีความจำกัดอย่างตั้งใจเพื่อความปลอดภัยและความถูกต้อง โดยโมเดลจะไม่ทำการเพิ่มเนื้อหาที่ผู้พูดไม่ได้กล่าวถึง ไม่แก้ไขข้อเท็จจริง ไม่ลดความรุนแรงของคำหยาบ และไม่เขียนเรียบเรียงสำเนียงภาษาใหม่ หากอินพุตมีแต่คำฟุ่มเฟือย โมเดลจะส่งค่าเป็นสตริงว่างกลับมา ซึ่งระบบที่นำไปบูรณาการควรปฏิบัติเสมือนว่าเป็นผลลัพธ์ที่ถูกต้อง
สำหรับการประเมินประสิทธิภาพ Superwhisper ได้ทดสอบ S1-mini บนชุดข้อมูลทดสอบที่แยกไว้ (held-out set) จำนวน 7,519 เคส จากทั้งหมด 104 ทรานสคริปต์ โดยให้ผลลัพธ์ดังนี้:
- ความแม่นยำของโทเค็น (Token accuracy) อยู่ที่ 94.8% วัดแบบ greedy บนบิลด์ Q4_K_M
- อัตราความผิดพลาดในการแก้ไขข้อความ (Text-edit error rate) อยู่ที่ 11.6%
- การระบุบรรทัดคำทักทายในอีเมลทำได้ 99.3% และบรรทัดลงชื่อ 97.9%
- จับคู่โครงสร้างผลลัพธ์ที่ถูกต้องระหว่างรายการ (List) กับย่อหน้า (Paragraph) ได้ 97.6%
- สร้างที่อยู่อีเมลที่ถูกต้องแม่นยำใน 92% ของเคส
- พบการวนลูปหรือการตัดข้อความ (Looping or truncation) น้อยกว่า 1%
- ละเว้นการแสดงผลได้อย่างถูกต้อง 98.6% เมื่อไม่มีข้อความที่ควรต้องถอดเสียง
อย่างไรก็ตาม ตัวเลขเหล่านี้เป็นตัวเลขที่ทางผู้ขายรายงานจากการทดสอบบนชุดข้อมูลภายใน ไม่ใช่ผลลัพธ์จากการประเมินของบุคคลที่สาม นอกจากนี้ยังมีบริการอื่นๆ ในระบบของ Superwhisper ได้แก่ S1-Voice ซึ่งเป็นโมเดลแปลงเสียงพูดเป็นข้อความบนคลาวด์ที่มีความเร็วสูงกว่าความเร็วในการพูดถึง 46 เท่า และ S1-Language ซึ่งเป็นโมเดลคลาวด์สำหรับการทำความสะอาด จัดรูปแบบ และสรุปผล
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น