เปรียบเทียบโทเค็น 7 รูปแบบข้อมูล JSON เปลืองกว่า CSV สามเท่า
นักพัฒนาทดลองนับจำนวนโทเค็นข้อมูลตารางสินค้าใน 7 ฟอร์แมต เผย Pretty JSON ใช้โทเค็นมากกว่า CSV ถึง 3 เท่า พร้อมแนะวิธีประหยัดต้นทุน AI

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- นักพัฒนาทดลองนับจำนวนโทเค็นสำหรับชุดข้อมูลตารางสินค้า 20 แถว ใน 7 ฟอร์แมตที่แตกต่างกัน
- Pretty JSON (จัดรูปแบบเว้นบรรทัดสวยงาม) ใช้โทเค็นมากกว่า CSV ถึง 3 เท่าตัว
- YAML มีจำนวนตัวอักษรน้อยกว่า JSON แบบย่อ แต่กลับใช้โทเค็นมากกว่าเพราะขึ้นบรรทัดใหม่และใส่คีย์ซ้ำ
- การตัดฟิลด์ที่ไม่ได้ใช้งาน ค่าว่าง และทศนิยมส่วนเกินออก ช่วยลดต้นทุนการเรียกใช้ LLM ได้จริง
การส่งข้อมูลเข้าสู่โมเดลภาษาขนาดใหญ่ (LLM) ด้วยรูปแบบ JSON ผ่านคำสั่ง JSON.stringify(data, null, 2) เป็นวิธีที่นักพัฒนาคุ้นเคย แต่อาจไม่เคยตระหนักถึงต้นทุนที่แท้จริงจากจำนวนโทเค็นที่ถูกเผาผลาญไปโดยเปล่าประโยชน์ Jaehyun Cho นักพัฒนาซอฟต์แวร์ จึงได้ทำการทดลองเปรียบเทียบข้อมูลชุดเดียวกันใน 7 รูปแบบ เพื่อหาว่าฟอร์แมตใดคุ้มค่าที่สุดสำหรับการส่ง prompt

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
การทดลองใช้ตารางผลิตภัณฑ์ขนาด 20 แถว มี 5 ฟิลด์ ประกอบด้วย id, name, price, in_stock และ category โดยนับโทเค็นผ่าน o200k_base ซึ่งเป็น tokenizer ตัวเดียวกับที่ใช้งานใน GPT-4o และโมเดลรุ่นใหม่ล่าสุดจาก OpenAI ผลลัพธ์ที่ได้เผยให้เห็นว่า รูปแบบ Pretty JSON เปลืองโทเค็นมากกว่า CSV ถึงประมาณ 3 เท่า ซึ่งส่งผลโดยตรงต่อค่าใช้จ่ายในการเรียกใช้งาน API
สิ่งที่น่าสนใจคือ YAML กลายเป็นฟอร์แมตที่แปลกประหลาด เนื่องจากมีจำนวนตัวอักษรน้อยกว่า JSON แบบย่อ (minified JSON) แต่กลับใช้จำนวนโทเค็นสูงกว่า นั่นเป็นเพราะโครงสร้างของ YAML กำหนดให้ทุกฟิลด์ต้องอยู่คนละบรรทัดและใส่คีย์ซ้ำกันในทุกรายการ ทำให้ Tokenizer มองเห็นชุดข้อมูลที่ยาวขึ้นในแง่ของหน่วยประมวลผลคำ
การทำความเข้าใจเรื่อง Tokenization ช่วยให้วิศวกรซอฟต์แวร์และ AI สามารถออกแบบระบบที่มีประสิทธิภาพสูงขึ้น โทเค็นไม่ใช่จำนวนคำหรือตัวอักษรตรงๆ แต่เป็นหน่วยย่อยที่โมเดลใช้ประมวลผล การเลือกฟอร์แมตข้อมูลที่กะทัดรัดจึงลดภาระการประมวลผลและลดค่าใช้จ่ายด้าน API ได้อย่างมหาศาลเมื่อระบบเติบโตขึ้นในระดับ Production
สำหรับการใช้งาน Coding agents ที่ต้องส่งโค้ดจำนวนมากเข้าสู่ระบบ การตัดฟิลด์ที่ไม่ได้ใช้งาน ค่า null และทศนิยมส่วนเกินออก จะช่วยประหยัดโทเค็นได้อีกทาง ตัวอย่างเช่น หากแนบตาราง 20 แถวไว้ในทุกคำขอ ส่งวันละ 1,000 ครั้ง รวมเป็น 30,000 ครั้งต่อเดือน ด้วยอัตราค่าบริการ 2 ดอลลาร์ต่อล้านอินพุตโทเค็น ต้นทุนเหล่านี้อาจดูเล็กน้อยต่อหนึ่งคำขอ แต่จะสะสมเป็นก้อนใหญ่สำหรับผลิตภัณฑ์จริงและสําหรับระบบ RAG ที่มีข้อมูลตอบกลับขนาดยาว
ทั้งนี้ ผู้ทดลองได้สร้างเครื่องมือคำนวณโทเค็นแบบใช้งานฟรีบนเบราว์เซอร์ โดยใช้ตัวประมวลผล o200k ตัวเดียวกัน เพื่อให้ผู้ใช้สามารถวางชุดข้อมูลเปรียบเทียบระหว่าง 2 ฟอร์แมตและคำนวณต้นทุนต่อโมเดลได้ทันทีโดยไม่มีการอัปโหลดข้อมูลขึ้นเซิร์ฟเวอร์
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น