Microsoft เปิดโอเพนซอร์ส TauGrid แพลตฟอร์มรัน AI บน Kubernetes
Microsoft เปิดตัว TauGrid สแตกแบบ Kubernetes-native สำหรับรันภาระงาน GPU AI แบบ Self-hosted พร้อมสัญญาอนุญาตแบบ MIT และรองรับคลัสเตอร์เวอร์ชัน 1.30 ขึ้นไป

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Microsoft เปิดโอเพนซอร์ส TauGrid แพลตฟอร์มจัดการ AI บน Kubernetes
- รวม 5 เครื่องมือหลักไว้ด้วยกัน ทั้ง CLI, Kueue, KubeRay และระบบมอนิเตอร์
- เขียนด้วยภาษา Go และใช้ไฟล์ tau.yaml ในการกำหนดค่าภาระงาน
- รองรับการติดตั้งผ่าน Helm chart จาก Microsoft Container Registry
Microsoft สร้างความฮือฮาให้กับวงการคลาวด์และปัญญาประดิษฐ์อีกครั้งด้วยการเปิดตัวโอเพนซอร์สที่มีชื่อว่า TauGrid ซึ่งเป็นแพลตฟอร์มแบบ Self-hosted สำหรับการรันภาระงานปัญญาประดิษฐ์ (AI Workloads) บน Kubernetes โดยแพลตฟอร์มนี้ถูกออกแบบมาเพื่อช่วยให้ทีมพัฒนาและนักวิจัยสามารถจัดการระบบประมวลผล GPU ที่มีความซับซ้อนได้อย่างมีประสิทธิภาพมากขึ้น โดยใช้งานสัญญาอนุญาตแบบ MIT และเผยแพร่คอนเทนเนอร์อิมเมจรวมถึง Helm charts เป็นสาธารณะบน Microsoft Container Registry (MCR)
ในแง่ของข้อกำหนดเบื้องต้น ระบบต้องการคลัสเตอร์ Kubernetes 1.30 ขึ้นไปที่มีโหนด GPU, เครื่องมือ kubectl และ Helm 3.0 หรือใหม่กว่า เพื่อให้สามารถติดตั้งและใช้งานได้อย่างเต็มประสิทธิภาพ ตัวสแตกของ TauGrid ถูกออกแบบมาเพื่อควบรวม 5 องค์ประกอบสำคัญที่ปกติแล้วทีมแพลตฟอร์มมักจะต้องนำมาบูรณาการเข้าด้วยกันเอง ได้แก่ เครื่องมือ tau CLI, ระบบคิวและการรับเข้าภาระงานผ่าน Kueue, การจัดการคลัสเตอร์ Ray ผ่าน KubeRay, ระบบมอนิเตอร์สุขภาพ GPU ระดับโหนด และระบบติดตามการทำงานของคลัสเตอร์กับภาระงาน

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
การแบ่งแยกหน้าที่การทำงานถือเป็นจุดเด่นสำคัญในการออกแบบ โดยทีมแพลตฟอร์มจะมีหน้าที่ดูแลในส่วนของพื้นที่ทำงาน (Workspaces) คิว โปรไฟล์การประมวลผล พื้นจัดเก็บข้อมูล ตัวตน และระบบมอนิเตอร์ ในขณะที่นักวิจัยสามารถทำงานผ่านที่เก็บโค้ด (Repository) และคอมมานด์ไลน์ (CLI) ได้โดยตรง โดยไม่ต้องเข้ามาตั้งค่าระบบ Kubernetes ด้วยตนเอง โค้ดเบสหลักของแพลตฟอร์มนี้พัฒนาขึ้นด้วยภาษา Go และอธิบายภาระงานผ่านไฟล์การตั้งค่าประเภท tau.yaml
การเปิดโอเพนซอร์ส TauGrid ของ Microsoft สะท้อนให้เห็นถึงความพยายามในการแก้ปัญหาความซับซ้อนของการจัดการโครงสร้างพื้นฐานสำหรับ AI ที่มักต้องใช้เครื่องมือหลากหลายตัวมาประกอบกัน การผสาน Kubernetes เข้ากับเครื่องมือจัดการภาระงานเฉพาะทางอย่าง Kueue และ KubeRay ช่วยลดภาระของทีมวิศวกรในการสร้างระบบจัดการคิวและการประมวลผลแบบกระจายด้วยตนเอง ซึ่งถือเป็นก้าวสำคัญในการทำให้ระบบประมวลผล AI ขนาดใหญ่เข้าถึงได้ง่ายและเป็นมาตรฐานเดียวกันมากขึ้นสำหรับองค์กรทั่วไป
ตัวอย่างการฝึกอบรมโมเดล GPU ที่ทาง Microsoft เผยแพร่นั้น ใช้สำหรับการรันงาน PyTorch บนชิปประมวลผล A100 เพียงตัวเดียว โดยกำหนดค่าผ่านไฟล์ tau.yaml ซึ่งเมื่อผู้ใช้พิมพ์คำสั่ง tau run ระบบจะทำการประมวลผลนโยบายของแพลตฟอร์ม แปลงเป็น Kubernetes Job หรือ KubeRay RayJob และส่งต่อไปยัง Kueue ทันที กระบวนการทำงานทั้งหมดแบ่งออกเป็น 6 ขั้นตอนหลัก ได้แก่ การส่งงาน (Submission) การเข้าคิว (Queueing) การประมวลผล (Execution) การเฝ้าระวัง (Monitoring) การกู้คืนระบบ (Recovery) และการจัดเก็บหลักฐานการทำงาน (Evidence) เพื่อให้สามารถตรวจสอบย้อนหลังและทำซ้ำได้
สำหรับการติดตั้ง ผู้ใช้สามารถดึง Helm chart จาก MCR ได้โดยตรงผ่านคำสั่งติดตั้ง พร้อมระบุเนมสเปซที่ต้องการ โดยทาง Microsoft แนะนำให้ระบุแท็กเวอร์ชันหรือไดเจสต์ที่เจาะจงแทนการใช้ป้ายกำกับล่าสุด (latest) สำหรับตัว CLI นั้นสามารถติดตั้งได้จาก GitHub Releases ทั้งบนระบบปฏิบัติการ Linux, macOS รวมถึงโปรแกรมติดตั้ง PowerShell สำหรับ Windows amd64 ที่มีการตรวจสอบผลรวมเช็คซัมเพื่อความปลอดภัย
ในส่วนของการประเมินการใช้งานนอกสภาพแวดล้อมของ Azure มีรายละเอียดสำคัญสองประการคือ TauGrid จะไม่ส่งข้อมูลทางไกล (Telemetry) กลับไปยัง Microsoft เป็นค่าเริ่มต้น และระบบส่งออกข้อมูลระยะไกลจะถูกปิดไว้จนกว่าผู้ดูแลระบบจะกำหนดปลายทาง นอกจากนี้ยังมีบางส่วนที่ยังผูกติดกับ Azure โดยเฉพาะ เช่น ระบบมอนิเตอร์ผ่าน Azure Data Explorer แม้ว่าความตั้งใจหลักคือการรองรับ Kubernetes ทั้งบนคลาวด์ทั่วไปและระบบภายในองค์กร (On-premises) โดยไม่พึ่งพา Azure และเปิดกว้างสำหรับการร่วมพัฒนาจากชุมชนนักพัฒนา
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น