ข้ามไปเนื้อหาหลัก

SpaceXAI เปิดตัว Grok Voice Transcribe 2.0 API ถอดเสียงแม่นยำขึ้น 2 เท่า

SpaceXAI ปล่อย Grok Voice Transcribe 2.0 API แปลงเสียงเป็นข้อความ ชูจุดเด่นแม่นยำกว่ารุ่นแรก 2 เท่า ราคาเริ่มต้น 0.10 ดอลลาร์ต่อชั่วโมง พร้อมรองรับการใช้งานผ่าน Atlassian Loom

เรียบเรียงโดย AI
Inewgen
19 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
SpaceXAI เปิดตัว Grok Voice Transcribe 2.0 API ถอดเสียงแม่นยำขึ้น 2 เท่า

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • SpaceXAI เปิดตัว Grok Voice Transcribe 2.0 API ในฐานะโฮสต์สตรีมมิ่ง API รหัสรุ่น grok-voice-transcribe-2.0
  • ให้ความแม่นยำสูงกว่ารุ่น 1.0 ถึง 2 เท่า พร้อมอัตราความผิดพลาดคำ (WER) ลดลงฮวบในวลีสั้น
  • คิดค่าบริการเท่าเดิมคือแบบแบตช์ 0.10 ดอลลาร์/ชั่วโมง และแบบสตรีมมิ่ง 0.20 ดอลลาร์/ชั่วโมง
  • Atlassian Loom นำไปประเดิมใช้งานจริงเพื่อถอดเสียงวิดีโอคู่กับ Cursor

SpaceXAI ประกาศเปิดตัวโมเดลแปลงเสียงพูดเป็นข้อความรุ่นล่าสุด Grok Voice Transcribe 2.0 โดยเปิดให้บริการแล้วในรูปแบบโฮสต์ API ภายใต้รหัสโมเดล grok-voice-transcribe-2.0 ซึ่งพัฒนาต่อยอดมาจากโมเดลรากฐานเสียง (audio foundation model) ที่อยู่เบื้องหลัง Grok Voice ระบบที่ปัจจุบันรองรับการจัดการสายบริการลูกค้าหลายหมื่นสายต่อวัน ถอดเสียงวิดีโอนานนับล้านชั่วโมง และรันระบบผู้ช่วย Grok ในรถยนต์ Tesla

โมเดลใหม่นี้ผ่านการฝึกฝนจากชุดข้อมูลเสียงสด เสียงรบกวนสูง และหลายภาษาจากสภาพแวดล้อมที่หลากหลาย ก่อนจะถูกนำมาปรับแต่งเพิ่มเติมหลังการฝึก (post-training) โดยทาง SpaceXAI ระบุว่า ผลลัพธ์จากการทดสอบบนกระดานผู้นำสาธารณะ Artificial Analysis (AA-WER Streaming) ซึ่งใช้เสียงความยาวประมาณ 8 ชั่วโมง โมเดลนี้คว้าอันดับ 1 จากโมเดลสตรีมมิ่งทั้งหมด 32 รุ่น

software code development interface screen

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

2xความแม่นยำสูงกว่ารุ่น 1.0
$0.10ค่าบริการแบตช์ต่อชั่วโมง
6.8%อัตราข้อผิดพลาดในวลีสั้น

ในด้านประสิทธิภาพการถอดเสียงหลายภาษา โมเดลรุ่น 2.0 สามารถตรวจจับภาษาได้อัตโนมัติและรองรับการเปลี่ยนภาษา1 ครั้งระหว่างการบันทึกเสียงได้ทันที โดยจุดที่พัฒนาขึ้นอย่างก้าวกระโดดคือชุดข้อมูลวลีสั้น เช่น คำสั่งในรถยนต์ ซึ่งโมเดลมีบริบทจำกัดในการระบุภาษา ส่งผลให้อัตราความผิดพลาดของคำ (WER) ลดลงจาก 20.6% เหลือเพียง 6.8% หรือคิดเป็นความผิดพลาดที่ลดลงราว 67% นอกจากนี้ระบบยังรองรับการจัดรูปแบบตัวเลข สกุลเงิน และหน่วยวัดเป็นลายลักษณ์อักษรถึง 25 ภาษา

การเปิดตัว API ถอดเสียงรุ่นใหม่ของ SpaceXAI สะท้อนให้เห็นถึงการผลักดันเทคโนโลยีเสียงพูดให้มีความแม่นยำระดับใช้งานจริงในภาคอุตสาหกรรม โดยเฉพาะการลดอัตราความผิดพลาดในกลุ่มคำสั่งสั้นๆ ที่มักเป็นจุดบอดของระบบ Speech-to-Text ทั่วไป การที่โมเดลนี้สามารถสลับภาษาได้แบบเรียลไทม์ในสตรีมเดียวยังช่วยลดข้อจำกัดในการพัฒนาแอปพลิเคชันระดับโลกที่ผู้ใช้งานมักพูดปนภาษา

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

สำหรับด้านสถาปัตยกรรมและฟีเจอร์การใช้งาน เอ็นด์พอยต์แบบแบตช์รองรับไฟล์ขนาดสูงสุด 500 MB ครอบคลุมรูปแบบเสียง 12 ฟอร์แมต ส่วนสตรีมมิ่งรองรับ Opus ที่ความเร็วราว 4 KB/s เทียบกับ 48 KB/s ของ PCM ดิบที่ 24 kHz โดยฟีเจอร์การแบ่งแยกลำโพง (diarization) การประทับเวลา (timestamps) และคำสำคัญ (key terms) ถูกรวมมาให้ในชุด API ทั้งหมด

"closing the loop from context to code."

Sanchan Saxena, SVP of Teamwork Collection at Atlassian

แพ็กเกจราคาของ Grok Voice Transcribe 2.0 ยังคงราคาเดิมเทียบเท่ารุ่น 1.0 โดยการถอดเสียงแบบแบตช์คิดค่าบริการ 0.10 ดอลลาร์ต่อชั่วโมง และแบบสตรีมมิ่ง 0.20 ดอลลาร์ต่อชั่วโมง หรือคิดเป็นประมาณ 1.67 ดอลลาร์ และ 3.33 ดอลลาร์ต่อ 1,000 นาที ตามลำดับ

นอกจากการเปิดให้บริการ API แล้ว Atlassian Loom ได้ประกาศนำ Grok Voice Transcribe 2.0 ไปใช้งานจริงเพื่อถอดเสียงวิดีโอทุกคลิปเนื่องจากพบว่ามีความแม่นยำสูงกว่าระบบเดิม โดยเวิร์กโฟลว์ที่ใช้คือการบันทึกแผนงานใน Loom ส่งสคริปต์เข้าสู่ Cursor เพื่ออัปเดตโค้ดอัตโนมัติ ซึ่ง Sanchan Saxena รองประธานอาวุโสฝ่าย Teamwork Collection ของ Atlassian ได้กล่าวถึงความร่วมมือนี้ว่าเป็นการปิดวงจรตั้งแต่บริบทจนกลายเป็นโค้ด

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้