ข้ามไปเนื้อหาหลัก

Microsoft เปิดโอเพนซอร์ส TauGrid แพลตฟอร์มรัน AI บน Kubernetes

Microsoft เปิดตัว TauGrid สแตกแบบ Kubernetes-native สำหรับรันภาระงาน GPU AI แบบ Self-hosted พร้อมสัญญาอนุญาตแบบ MIT และรองรับคลัสเตอร์เวอร์ชัน 1.30 ขึ้นไป

เรียบเรียงโดย AI
Inewgen
สด18 Sep 2026ที่มา: MarkTechPost4 นาทีอ่าน (0 ครั้ง)
แชร์
Microsoft เปิดโอเพนซอร์ส TauGrid แพลตฟอร์มรัน AI บน Kubernetes

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Microsoft เปิดโอเพนซอร์ส TauGrid แพลตฟอร์มจัดการ AI บน Kubernetes
  • รวม 5 เครื่องมือหลักไว้ด้วยกัน ทั้ง CLI, Kueue, KubeRay และระบบมอนิเตอร์
  • เขียนด้วยภาษา Go และใช้ไฟล์ tau.yaml ในการกำหนดค่าภาระงาน
  • รองรับการติดตั้งผ่าน Helm chart จาก Microsoft Container Registry

Microsoft สร้างความฮือฮาให้กับวงการคลาวด์และปัญญาประดิษฐ์อีกครั้งด้วยการเปิดตัวโอเพนซอร์สที่มีชื่อว่า TauGrid ซึ่งเป็นแพลตฟอร์มแบบ Self-hosted สำหรับการรันภาระงานปัญญาประดิษฐ์ (AI Workloads) บน Kubernetes โดยแพลตฟอร์มนี้ถูกออกแบบมาเพื่อช่วยให้ทีมพัฒนาและนักวิจัยสามารถจัดการระบบประมวลผล GPU ที่มีความซับซ้อนได้อย่างมีประสิทธิภาพมากขึ้น โดยใช้งานสัญญาอนุญาตแบบ MIT และเผยแพร่คอนเทนเนอร์อิมเมจรวมถึง Helm charts เป็นสาธารณะบน Microsoft Container Registry (MCR)

ในแง่ของข้อกำหนดเบื้องต้น ระบบต้องการคลัสเตอร์ Kubernetes 1.30 ขึ้นไปที่มีโหนด GPU, เครื่องมือ kubectl และ Helm 3.0 หรือใหม่กว่า เพื่อให้สามารถติดตั้งและใช้งานได้อย่างเต็มประสิทธิภาพ ตัวสแตกของ TauGrid ถูกออกแบบมาเพื่อควบรวม 5 องค์ประกอบสำคัญที่ปกติแล้วทีมแพลตฟอร์มมักจะต้องนำมาบูรณาการเข้าด้วยกันเอง ได้แก่ เครื่องมือ tau CLI, ระบบคิวและการรับเข้าภาระงานผ่าน Kueue, การจัดการคลัสเตอร์ Ray ผ่าน KubeRay, ระบบมอนิเตอร์สุขภาพ GPU ระดับโหนด และระบบติดตามการทำงานของคลัสเตอร์กับภาระงาน

server room data center office meeting no logo

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

การแบ่งแยกหน้าที่การทำงานถือเป็นจุดเด่นสำคัญในการออกแบบ โดยทีมแพลตฟอร์มจะมีหน้าที่ดูแลในส่วนของพื้นที่ทำงาน (Workspaces) คิว โปรไฟล์การประมวลผล พื้นจัดเก็บข้อมูล ตัวตน และระบบมอนิเตอร์ ในขณะที่นักวิจัยสามารถทำงานผ่านที่เก็บโค้ด (Repository) และคอมมานด์ไลน์ (CLI) ได้โดยตรง โดยไม่ต้องเข้ามาตั้งค่าระบบ Kubernetes ด้วยตนเอง โค้ดเบสหลักของแพลตฟอร์มนี้พัฒนาขึ้นด้วยภาษา Go และอธิบายภาระงานผ่านไฟล์การตั้งค่าประเภท tau.yaml

การเปิดโอเพนซอร์ส TauGrid ของ Microsoft สะท้อนให้เห็นถึงความพยายามในการแก้ปัญหาความซับซ้อนของการจัดการโครงสร้างพื้นฐานสำหรับ AI ที่มักต้องใช้เครื่องมือหลากหลายตัวมาประกอบกัน การผสาน Kubernetes เข้ากับเครื่องมือจัดการภาระงานเฉพาะทางอย่าง Kueue และ KubeRay ช่วยลดภาระของทีมวิศวกรในการสร้างระบบจัดการคิวและการประมวลผลแบบกระจายด้วยตนเอง ซึ่งถือเป็นก้าวสำคัญในการทำให้ระบบประมวลผล AI ขนาดใหญ่เข้าถึงได้ง่ายและเป็นมาตรฐานเดียวกันมากขึ้นสำหรับองค์กรทั่วไป

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

ตัวอย่างการฝึกอบรมโมเดล GPU ที่ทาง Microsoft เผยแพร่นั้น ใช้สำหรับการรันงาน PyTorch บนชิปประมวลผล A100 เพียงตัวเดียว โดยกำหนดค่าผ่านไฟล์ tau.yaml ซึ่งเมื่อผู้ใช้พิมพ์คำสั่ง tau run ระบบจะทำการประมวลผลนโยบายของแพลตฟอร์ม แปลงเป็น Kubernetes Job หรือ KubeRay RayJob และส่งต่อไปยัง Kueue ทันที กระบวนการทำงานทั้งหมดแบ่งออกเป็น 6 ขั้นตอนหลัก ได้แก่ การส่งงาน (Submission) การเข้าคิว (Queueing) การประมวลผล (Execution) การเฝ้าระวัง (Monitoring) การกู้คืนระบบ (Recovery) และการจัดเก็บหลักฐานการทำงาน (Evidence) เพื่อให้สามารถตรวจสอบย้อนหลังและทำซ้ำได้

สำหรับการติดตั้ง ผู้ใช้สามารถดึง Helm chart จาก MCR ได้โดยตรงผ่านคำสั่งติดตั้ง พร้อมระบุเนมสเปซที่ต้องการ โดยทาง Microsoft แนะนำให้ระบุแท็กเวอร์ชันหรือไดเจสต์ที่เจาะจงแทนการใช้ป้ายกำกับล่าสุด (latest) สำหรับตัว CLI นั้นสามารถติดตั้งได้จาก GitHub Releases ทั้งบนระบบปฏิบัติการ Linux, macOS รวมถึงโปรแกรมติดตั้ง PowerShell สำหรับ Windows amd64 ที่มีการตรวจสอบผลรวมเช็คซัมเพื่อความปลอดภัย

ในส่วนของการประเมินการใช้งานนอกสภาพแวดล้อมของ Azure มีรายละเอียดสำคัญสองประการคือ TauGrid จะไม่ส่งข้อมูลทางไกล (Telemetry) กลับไปยัง Microsoft เป็นค่าเริ่มต้น และระบบส่งออกข้อมูลระยะไกลจะถูกปิดไว้จนกว่าผู้ดูแลระบบจะกำหนดปลายทาง นอกจากนี้ยังมีบางส่วนที่ยังผูกติดกับ Azure โดยเฉพาะ เช่น ระบบมอนิเตอร์ผ่าน Azure Data Explorer แม้ว่าความตั้งใจหลักคือการรองรับ Kubernetes ทั้งบนคลาวด์ทั่วไปและระบบภายในองค์กร (On-premises) โดยไม่พึ่งพา Azure และเปิดกว้างสำหรับการร่วมพัฒนาจากชุมชนนักพัฒนา

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้