ข้ามไปเนื้อหาหลัก

S1-mini โมเดลแปลงข้อความ ASR เป็นข้อความเขียนขนาด 462 MB

ทำความรู้จัก S1-mini โมเดล Open-Weights ขนาด 462 MB จาก Superwhisper ที่พัฒนาต่อยอดจาก Qwen3-0.6B สำหรับทำความสะอาดเสียงพูดให้เป็นข้อความพร้อมใช้งาน พร้อมผลการทดสอบความแม่นยำสูงถึง 94.8%

เรียบเรียงโดย AI
Inewgen
21 Aug 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)อัปเดตล่าสุด 29 Aug 2026
แชร์
S1-mini โมเดลแปลงข้อความ ASR เป็นข้อความเขียนขนาด 462 MB

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • S1-mini เป็นโมเดล Open-Weights ขนาด 462 MB สำหรับแปลงเสียงพูดดิบให้เป็นข้อความเขียนที่สะอาด
  • พัฒนาต่อยอดจาก Qwen3-0.6B มีพารามิเตอร์รวม 596 ล้านพารามิเตอร์ และรองรับเฉพาะภาษาอังกฤษในเวอร์ชัน v1
  • ทำคะแนนความแม่นยำของโทเค็น (Token accuracy) สูงถึง 94.8% จากการประเมินบนชุดข้อมูลทดสอบภายใน
  • เปิดให้ใช้งานบน Hugging Face ภายใต้สัญญาอนุญาต Apache 2.0 พร้อมเงื่อนไขการตั้งชื่อ

ในแวดวงปัญญาประดิษฐ์และการประมวลผลเสียง Superwhisper ได้เปิดตัว S1-mini ซึ่งเป็นโมเดล Open-Weights ขนาด 462 MB สำหรับทำหน้าที่เป็น Text Normalizer หรือตัวปรับแต่งข้อความ โดยโมเดลนี้ไม่ได้ทำหน้าที่ถอดเสียงพูด (Transcriber) หรือเป็นโมเดลแชท แต่จะทำหน้าที่อยู่ถัดจากระบบแปลงเสียงพูดเป็นข้อความอัตโนมัติ (ASR) เพื่อแปลงเสียงดิบให้กลายเป็นข้อความเขียนที่เรียบร้อยและพร้อมใช้งาน

ขั้นตอนการทำงานของโมเดลนี้จะอยู่หลังระบบ ASR เช่น Whisper หรือ Parakeet โดยมีเส้นทางการทำงานจากเสียงออดิโอ ไปยัง ASR จากนั้นจึงส่งต่อมายัง S1-mini เพื่อแปลงเป็นข้อความที่สะอาดเรียบร้อยสำหรับการนำไปใช้งานต่อในรูปแบบต่างๆ

การใช้งาน Text Normalizer ที่อยู่หลังระบบ ASR ถือเป็นแนวทางสำคัญในการแก้ปัญหาข้อความดิบจากการแปลงเสียงพูด ซึ่งมักจะมีคำฟุ่มเฟือย การเว้นวรรคที่ไม่ถูกต้อง หรือรูปแบบที่ไม่เป็นทางการ การใช้โมเดลเฉพาะทางขนาดเล็กอย่าง S1-mini จึงช่วยประหยัดทรัพยากรประมวลผลเทียบกับการใช้โมเดลภาษาขนาดใหญ่ทั่วไป

ในด้านโครงสร้างทางเทคนิค S1-mini ได้รับการ fine-tune มาจาก Qwen/Qwen3-0.6B โดยมีพารามิเตอร์ที่ไม่รวม embedding อยู่ที่ 0.44B และพารามิเตอร์รวม 596 ล้านพารามิเตอร์ มีจำนวน 28 เลเยอร์ ใช้ 16 query heads และ 8 key/value heads พร้อมระบบ GQA และน้ำหนักแบบ BF16 โดยในส่วนของแถบข้างบน Hugging Face อาจแสดงผลเป็น 0.8B เนื่องจากมีการจัดเก็บ tied embedding สองครั้ง ซึ่งทางผู้พัฒนาได้ชี้แจงรายละเอียดนี้ไว้ใน card เรียบร้อยแล้ว ทั้งนี้ เวอร์ชัน v1 รองรับเฉพาะภาษาอังกฤษเท่านั้น และแนะนำให้ใช้ขนาดอินพุตประมาณ 1,000 โทเค็น

Hugging Face logo open source code screen

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การออกแบบโมเดลนี้มีความจำกัดอย่างตั้งใจเพื่อความปลอดภัยและความถูกต้อง โดยโมเดลจะไม่ทำการเพิ่มเนื้อหาที่ผู้พูดไม่ได้กล่าวถึง ไม่แก้ไขข้อเท็จจริง ไม่ลดความรุนแรงของคำหยาบ และไม่เขียนเรียบเรียงสำเนียงภาษาใหม่ หากอินพุตมีแต่คำฟุ่มเฟือย โมเดลจะส่งค่าเป็นสตริงว่างกลับมา ซึ่งระบบที่นำไปบูรณาการควรปฏิบัติเสมือนว่าเป็นผลลัพธ์ที่ถูกต้อง

94.8%Token Accuracy
11.6%Text-Edit Error Rate
92%Exact Email Addresses

สำหรับการประเมินประสิทธิภาพ Superwhisper ได้ทดสอบ S1-mini บนชุดข้อมูลทดสอบที่แยกไว้ (held-out set) จำนวน 7,519 เคส จากทั้งหมด 104 ทรานสคริปต์ โดยให้ผลลัพธ์ดังนี้:

  • ความแม่นยำของโทเค็น (Token accuracy) อยู่ที่ 94.8% วัดแบบ greedy บนบิลด์ Q4_K_M
  • อัตราความผิดพลาดในการแก้ไขข้อความ (Text-edit error rate) อยู่ที่ 11.6%
  • การระบุบรรทัดคำทักทายในอีเมลทำได้ 99.3% และบรรทัดลงชื่อ 97.9%
  • จับคู่โครงสร้างผลลัพธ์ที่ถูกต้องระหว่างรายการ (List) กับย่อหน้า (Paragraph) ได้ 97.6%
  • สร้างที่อยู่อีเมลที่ถูกต้องแม่นยำใน 92% ของเคส
  • พบการวนลูปหรือการตัดข้อความ (Looping or truncation) น้อยกว่า 1%
  • ละเว้นการแสดงผลได้อย่างถูกต้อง 98.6% เมื่อไม่มีข้อความที่ควรต้องถอดเสียง

อย่างไรก็ตาม ตัวเลขเหล่านี้เป็นตัวเลขที่ทางผู้ขายรายงานจากการทดสอบบนชุดข้อมูลภายใน ไม่ใช่ผลลัพธ์จากการประเมินของบุคคลที่สาม นอกจากนี้ยังมีบริการอื่นๆ ในระบบของ Superwhisper ได้แก่ S1-Voice ซึ่งเป็นโมเดลแปลงเสียงพูดเป็นข้อความบนคลาวด์ที่มีความเร็วสูงกว่าความเร็วในการพูดถึง 46 เท่า และ S1-Language ซึ่งเป็นโมเดลคลาวด์สำหรับการทำความสะอาด จัดรูปแบบ และสรุปผล

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้