ByteDance เปิดตัว SeedRealtime โมเดล LLM เสียง-ภาพ สตรีมมิ่งสด
ByteDance เผยโฉม SeedRealtime โมเดลภาษาขนาดใหญ่แบบ Full-Duplex ที่ผสานภาพและเสียงเข้าด้วยกัน พร้อมเปิดให้ใช้งานแล้วบนแอปพลิเคชัน Doubao

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- ByteDance เปิดตัว SeedRealtime โมเดล AI แบบ Native Audio-Visual Full-Duplex
- ใช้งานจริงแล้วภายในแอปพลิเคชันผู้ช่วย AI สำหรับผู้บริโภคที่ชื่อว่า Doubao
- ยังไม่มีการเผยแพร่รายงานทางเทคนิค จำนวนพารามิเตอร์ หรือเปิดให้นักพัฒนาภายนอกใช้งาน
- นำเสนอ 7 Use Cases โดยมี 4 สถานการณ์หลักที่เป็นหัวใจสำคัญในการใช้งานจริง
วงการปัญญาประดิษฐ์ต้องตื่นตัวอีกครั้งเมื่อทีม Seed จาก ByteDance ได้ประกาศเปิดตัวโมเดลใหม่ล่าสุดในชื่อ SeedRealtime ซึ่งเป็นโมเดลภาษาขนาดใหญ่ (LLM) แบบ Full-Duplex ที่ทำงานร่วมกันทั้งภาพและเสียงได้อย่างแท้จริงภายในโมเดลเดียว ทำให้ AI สามารถมองเห็น ฟังเสียง และตอบสนองด้วยคำพูดได้แบบเรียลไทม์
ในปัจจุบัน โมเดล SeedRealtime นี้ได้ถูกนำไปติดตั้งและเปิดให้บริการจริงแล้วภายในแอปพลิเคชัน Doubao ซึ่งเป็นผู้ช่วยอัจฉริยะสำหรับผู้บริโภคของ ByteDance อย่างไรก็ตาม ทางผู้พัฒนาจะยังไม่ได้เผยแพร่เอกสารรายงานทางเทคนิค จำนวนพารามิเตอร์ของโมเดล น้ำหนักโมเดลแบบ Open Weights รวมถึงยังไม่มีการเปิดใช้งานผ่านช่องทาง Volcano Engine หรือ BytePlus endpoint แต่อย่างใด
สำหรับทีมนักพัฒนาภายนอกหรือบุคคลที่สาม จึงยังไม่สามารถนำโมเดลนี้ไปบูรณาการเข้ากับระบบของตนเองได้ในขณะนี้ สิ่งที่ทางทีมพัฒนาภายนอกสามารถนำไปต่อยอดได้ทันทีในตอนนี้คือแนวคิดสถาปัตยกรรมอ้างอิงที่ได้รับการพิสูจน์แล้ว ซึ่งเป็นการยกระดับมาตรฐานใหม่ให้กับผู้พัฒนาผลิตภัณฑ์กลุ่มเสียงผสมกล้องแบบเรียลไทม์รายอื่นๆ ในตลาด

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
การที่ ByteDance เลือกเปิดใช้งาน SeedRealtime บนแอปพลิเคชัน Doubao ก่อนที่จะเปิดให้นักพัฒนาภายนอกเข้าถึง สะท้อนให้เห็นถึงกลยุทธ์การทดสอบผลิตภัณฑ์ในตลาดจริงกับผู้ใช้จำนวนมาก (Consumer-first) สถาปัตยกรรมแบบ Full-Duplex ที่รองรับทั้งภาพและเสียงพร้อมกันในโมเดลเดียวนั้น ช่วยลดความหน่วง (Latency) ในการสื่อสารระหว่างมนุษย์และ AI ได้อย่างมหาศาล ซึ่งถือเป็นความท้าทายสำคัญของเทคโนโลยีสนทนาด้วยเสียงและภาพในปัจจุบัน
ทางทีมงาน Seed ได้เผยแพร่กรณีศึกษาการใช้งาน (Scenarios) ออกมาทั้งหมด 7 รูปแบบด้วยกัน โดยมีสถานการณ์การใช้งานที่สำคัญและเป็นแกนหลักอยู่ 4 รูปแบบ ซึ่งแสดงให้เห็นถึงขีดความสามารถในการประมวลผลสถานการณ์จริงผ่านภาพและเสียงพร้อมกัน
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น