SayItVid เปิดตัวเครื่องมือค้นหาการออกเสียงวิดีโอเรียลไทม์
SayItVid เอ็นจิ้นค้นหาการออกเสียงวิดีโอแบบเรียลไทม์ ใช้เวลาตอบสนองไม่ถึง 50 มิลลิวินาที พร้อมซิงโครไนซ์ซับไตเติลและวิเคราะห์พยางค์เน้นเสียง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- SayItVid ค้นหาการออกเสียงวิดีโอเรียลไทม์ในเวลาไม่ถึง 50 มิลลิวินาที
- ใช้ซับไตเติลซิงโครไนซ์ ร่วมกับการแปลงสัทอักษร IPA และการวิเคราะห์พยางค์
- จัดการกับคำพูดในชีวิตจริงที่มีการเชื่อมเสียงและการลดทอนเสียงสระ
- ขับเคลื่อนด้วยระบบฐานข้อมูลน้ำหนักเบา SQLite FTS5 สำหรับการสืบค้นคำ
พจนานุกรมออนไลน์แบบดั้งเดิมมักมองการออกเสียงเป็นหน่วยเสียงที่แยกส่วน เมื่อผู้ใช้ค้นหาคำจะพบอักษรสัทอักษรสากลหรือ IPA แบบคงที่ พร้อมปุ่มกดฟังเสียงบันทึกความยาว 1.5 วินาทีจากห้องอัดที่เงียบสงบ
แม้รูปแบบนี้จะมีประโยชน์สำหรับคำศัพท์พื้นฐาน แต่กลับใช้ไม่ได้ผลกับการสนทนาจริง เพราะภาษาอังกฤษพูดจริงเป็นกระแสเสียงที่มีการเน้นจังหวะและการเชื่อมเสียง เจ้าของภาษา มักจะตัดเสียงสระที่ไม่เน้นเสียง เปลี่ยนเสียงพยัญชนะกึ่งกลางคำ และเชื่อมเสียงพยัญชนะกับสระข้ามวลีเสมอ
การเข้าใจกลไกสัทศาสตร์เช่นนี้มีความสำคัญอย่างยิ่ง เนื่องจากสำเนียงและการออกเสียงในบทสนทนาจริงมักแตกต่างจากเสียงสังเคราะห์ในตำราเรียน การพัฒนาเอ็นจิ้นที่ดึงเอาตัวอย่างจากวิดีโอธรรมชาติมาให้ผู้เรียนได้เห็นบริบท สีหน้า ท่าทาง และจังหวะการพูดที่แท้จริง จึงช่วยลดช่องว่างระหว่างภาษาในตำรากับภาษาที่ใช้สื่อสารในชีวิตประจำวันได้อย่างมีประสิทธิภาพ
เพื่อแก้ปัญหานี้ ทีมงานจึงได้พัฒนา SayItVid ซึ่งเป็นเอ็นจิ้นค้นหาวิดีโอออกเสียงแบบเรียลไทม์ที่จัดทำดัชนีวิดีโอบทสนทนาจริงนับพันรายการ พร้อมซับไตเติลซิงโครไนซ์ การถอดเสียง IPA ตัวบ่งชี้พยางค์เน้นเสียงแบบภาพ และที่มาของคำภายในเวลาไม่ถึง 50 มิลลิวินาที

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในบทความนี้ ทีมงานได้แจกแจงสถาปัตยกรรมเบื้องหลังของ SayItVid ตั้งแต่การจัดตำแหน่งซับไตเติลตามเวลาและการแมปเสียง ไปจนถึงการทำดัชนีการค้นหาในเสี้ยววินาทีและการซิงโครไนซ์วิดีโอที่ส่วนหน้า (front-end)
โครงสร้างของระบบการนำเข้าและดึงข้อมูลของ SayItVid ประกอบด้วยระบบย่อยหลัก 4 ส่วน โดยไปป์ไลน์จะทำการคำนวณหน้าต่างบริบททางเสียงรอบๆ แต่ละโทเค็นเพื่อให้ครอบคลุมธรรมชาติของการออกเสียงจริง
การทำความเข้าใจการออกเสียงต้องอาศัยมากกว่าการฟังเสียง แต่ต้องมองเห็นจุดที่พลังงานเสียงถูกเน้นย้ำด้วย ในทางสัทศาสตร์ภาษาอังกฤษ พยางค์ที่มีการเน้นเสียงหลักจะมีระยะเวลาสระที่ยาวนานขึ้น ระดับเสียงที่สูงขึ้น และความเข้มข้นที่มากกว่า ขณะที่พยางค์ที่ไม่เน้นเสียงจะเกิดการลดทอนเสียงสระไปเป็นเสียงชวา (/ə/)
เพื่อแสดงสิ่งนี้ให้ผู้เรียนเห็นอย่างชัดเจน ตัวแยกวิเคราะห์ทางสัทศาสตร์ของระบบจะแปลงรายการพจนานุกรมดิบให้เป็นชุดป้ายกำจัดภาพ
เพื่อให้ระบบยังคงตอบสนองได้อย่างรวดเร็ว ทีมงานจึงได้ปรับแต่งฐานข้อมูลและคำค้นหาโดยใช้ดัชนีผกผันน้ำหนักเบาอย่าง SQLite FTS5 (Full-Text Search 5)
ภาษาถือเป็นปรากฏการณ์ของมนุษย์ที่มีหลายมิติ การจัดทำดัชนีช่วงเวลาการพูดจริงและจับคู่บริบทวิดีโอกับข้อมูลสัทอักษร IPA ที่เข้มข้น พร้อมการแยกแยะพยางค์เน้นเสียง ช่วยให้ผู้เรียนภาษาได้รับมุมมองที่แท้จริงว่าภาษาอังกฤษที่พูดกันในชีวิตจริงดำเนินไปอย่างไร
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น