ข้ามไปเนื้อหาหลัก

FreeToken เปิดตัวรันโมเดล 753B บน GPU เวิร์กสเตชัน

FreeToken เอนจิ้นรัน MoE เผยแพร่บน PyPI และ GitHub ช่วยให้เวิร์กสเตชันตัวเดียวรันโมเดลยักษ์ใหญ่ได้เร็วขึ้น

เรียบเรียงโดย AI
Inewgen
23 Aug 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
FreeToken เปิดตัวรันโมเดล 753B บน GPU เวิร์กสเตชัน

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • FreeToken เป็นเอนจิ้น MoE แบบ edge-native รันโมเดลใหญ่บน GPU เวิร์กสเตชันเดี่ยว
  • ทำความเร็วบน RTX 5090 ได้ 77-83 tok/s สำหรับ Qwen3.6-35B และ 22-25 tok/s สำหรับ DeepSeek-V4-Flash
  • รองรับการเชื่อมต่อ API แบบเดียวกับ OpenAI และ Anthropic ผ่านพอร์ต 1919
  • เหมาะสำหรับนักพัฒนาเดี่ยวและองค์กรที่ต้องการความเป็นส่วนตัวของข้อมูลสูง

แวดวงปัญญาประดิษฐ์ต้อนรับ FreeToken เอนจิ้นเสิร์ฟโมเดลแบบ edge-native Mixture-of-Experts (MoE) ที่ถูกพัฒนาขึ้นมาเพื่อให้การรันโมเดลภาษาขนาดใหญ่บนฮาร์ดแวร์ระดับเวิร์กสเตชันตัวเดียวกลายเป็นจริงได้ในเชิงปฏิบัติ โดยซอฟต์แวร์นี้เปิดให้ใช้งานภายใต้สัญญาอนุญาต Apache-2.0 บน GitHub และเผยแพร่ผ่าน PyPI ในเวอร์ชัน freetoken v0.1.2 รวมทั้งมีแอปพลิเคชันเดสก์ท็อปแบบคลิกเดียวสำหรับ Windows และ Linux ที่เว็บไซต์ flashml.ai

ในส่วนของการใช้งานผ่านคอมมานด์ไลน์ (CLI) จะมุ่งเป้าไปที่ระบบ Linux x86_64 ที่ใช้การ์ดจอ NVIDIA พร้อมไดรเวอร์ r580+ ขึ้นไป (CUDA 13) โดยคำสั่ง ft serve จะทำหน้าที่เปิดพอร์ต 1919 เพื่อให้บริการ endpoint ที่รองรับมาตรฐานเดียวกับ OpenAI และ Anthropic ขณะที่คำสั่ง ft launch claude ช่วยเชื่อมต่อเครื่องมืออย่าง Claude Code, Codex, OpenCode หรือ OpenClaw เข้ากับระบบส่วนตัวของผู้ใช้งานได้ทันที

เทคโนโลยี MoE ทำให้การประมวลผลโมเดลขนาดใหญ่บนเครื่องท้องถิ่นมีความเป็นไปได้ทางคณิตศาสตร์ ตัวอย่างเช่น DeepSeek-V4-Flash จะเปิดใช้งานผู้เชี่ยวชาญ (experts) เพียง 6 ตัวจากทั้งหมด 256 ตัวในแต่ละเลเยอร์ที่มีอยู่ 43 เลเยอร์ ส่งผลให้มีพารามิเตอร์เพียง 13 พันล้านตัวจากทั้งหมด 284 พันล้านตัวเท่านั้นที่เข้าร่วมประมวลผลในแต่ละโทเค็น แม้จะมีความบางเบา (sparsity) แต่กลุ่มผู้เชี่ยวชาญทั้งหมดที่ฟอร์แมตแบบ FP4 จะมีขนาดราว 140 GB ทำให้ผู้เชี่ยวชาญที่ไม่ได้ใช้งานถูกเก็บไว้ในหน่วยความจำหลักของโฮสต์และถูกเรียกเข้ามาในเส้นทางการประมวลผลตามความต้องการ

server room technology hardware rack

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

สถาปัตยกรรม Mixture-of-Experts (MoE) ช่วยแก้ปัญหาคอขวดของการรันโมเดลขนาดใหญ่โดยการเลือกประมวลผลเฉพาะส่วนที่จำเป็น แทนที่จะเรียกใช้พารามิเตอร์ทั้งหมดพร้อมกัน แนวทางนี้ช่วยประหยัดทรัพยากรการคำนวณอย่างมหาศาล ทำให้การรันโมเดลระดับท็อปบนคอมพิวเตอร์ส่วนบุคคลหรือเวิร์กสเตชันราคาประหยัดเทียบกับคลัสเตอร์เซิร์ฟเวอร์กลายเป็นทางเลือกที่น่าสนใจสำหรับนักพัฒนา

ทางด้านประสิทธิภาพ FreeToken บนการ์ดจอ RTX 5090 สามารถรักษาความเร็วได้ที่ 77-83 โทเค็นต่อวินาทีสำหรับโมเดล Qwen3.6-35B-A3B (BF16) และ 22-25 โทเค็นต่อวินาทีสำหรับ DeepSeek-V4-Flash (MXFP4) ซึ่งคิดเป็น 1.5 ถึง 2.3 เท่าของระบบพื้นฐานที่แข็งแกร่งที่สุด นอกจากนี้ยังมีอัตราการพลาดของแคช (LRU misses) ที่ต่ำกว่าคู่แข่งอย่างเห็นได้ชัดเมื่อเทียบที่ความจุแคชเท่ากัน

753Bขนาดพารามิเตอร์ของ GLM-5.2 บน RTX PRO 6000
14.9โทเค็นต่อวินาทีที่ความเร็วรันโมเดลยักษ์ใหญ่

กลุ่มเป้าหมายที่เหมาะสมที่สุดประกอบด้วยนักพัฒนาอิสระ สตาร์ทอัพ และทีมวิศวกรรมของวิสาหกิจขนาดกลางและขนาดย่อมที่ค่าใช้จ่ายโทเค็นเอเจนต์สูงกว่าราคา GPU ที่เป็นเจ้าของ สำหรับองค์กรขนาดใหญ่สามารถมองเป็นแนวทางสำหรับเวิร์กโหลดที่ถูกตัดขาดจากอินเทอร์เน็ต (air-gapped) หรืออยู่ภายใต้กฎระเบียบข้อบังคับ โดยมีการใช้งานที่โดดเด่นในกลุ่มอุตสาหกรรมการแพทย์ กฎหมาย การเงิน และการวิจัยและพัฒนาที่มีทรัพย์สินทางปัญญาหนาแน่น

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้