Adaption Labs เปิดตัว Invent a Dataset สร้างชุดข้อมูลฝึก AI
Adaption Labs เปิดตัวเครื่องมือ Invent a Dataset บนแอปพลิเคชัน Python SDK และ REST API สร้างชุดข้อมูลฝึก AI จากคำอธิบายงานโดยตรง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Invent a Dataset เปิดใช้งานแล้วผ่านแอปพลิเคชัน Adaption, Python SDK และ REST API
- รองรับการสร้างข้อมูล 2 รูปแบบ ได้แก่ instruction_dataset และ preference_pairs
- ระบบ language_expansion ช่วยแปลหรือปรับภาษาตามภูมิภาคด้วย sample_rate ระหว่าง 0.01 ถึง 1
- ทำงานร่วมกับ AutoScientist ที่เปิดตัวในเดือนพฤษภาคม 2026 เพื่อร่วมปรับแต่งข้อมูลและกระบวนการฝึก
Adaption Labs ได้เปิดตัวเครื่องมือใหม่ที่มีชื่อว่า Invent a Dataset ซึ่งเปลี่ยนวิธีการเตรียมข้อมูลสำหรับฝึกปัญญาประดิษฐ์ โดยระบบนี้จะสร้างชุดข้อมูลฝึกอบรมขึ้นมาจากคำอธิบายงาน (task description) แทนที่จะเริ่มต้นจากคลังข้อมูลที่มีอยู่เดิม (seed corpus) เพื่อแก้ปัญหาข้อจำกัดของข้อมูลที่มีอยู่ในปัจจุบันซึ่งมักจะไม่ครอบคลุมงานเฉพาะทาง
กระบวนการทำงานแบบเดิมมักจะต้องอาศัยข้อมูลที่มีอยู่แล้วตามด้วยขั้นตอนการติดป้ายกำกับ (labeling) คัดกรอง และปรับแต่งเป็นเวลาหลายสัปดาห์ ทาง Adaption ชี้ว่าแนวทางดังกล่าวทำให้คุณภาพของโมเดลถูกจำกัดด้วยความสอดคล้องของข้อมูลที่มีอยู่กับพฤติกรรมที่ต้องการ แต่สำหรับงานเฉพาะทางและข้อมูลที่เป็นกรรมสิทธิ์ ข้อมูลที่มีประโยชน์มักจะอยู่ในระบบภายในหรือบันทึกขั้นตอนการทำงานซึ่งแปลงเป็นชุดข้อมูลฝึกได้ยาก
เครื่องมือ Invent a Dataset เริ่มต้นทำงานก่อนขั้นตอนที่เครื่องมือสังเคราะห์ข้อมูลทั่วไปเคยทำ โดยเริ่มต้นตั้งแต่ระดับพฤติกรรม ใช้งานผ่านฟังก์ชัน datasets.invent ซึ่งจะสร้างชุดข้อมูลและเริ่มกระบวนการทันทีโดยส่งสถานะ running กลับมา จากนั้นผู้ใช้สามารถตรวจสอบสถานะด้วย datasets.get จนกว่าจะขึ้นสถานะ succeeded หรือ failed แล้วจึงดาวน์โหลดข้อมูล

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
การควบคุมหลักจะใช้รหัสโดเมน (domain codes) ซึ่งดึงข้อมูลปัจจุบันผ่านฟังก์ชัน datasets.invent_domains เช่น โดเมน medical และสามารถเจาะจงประเภทย่อยลงไปได้เช่น medical.symptoms_diagnosis โดยจำเป็นต้องระบุอย่างน้อยหนึ่งโดเมน โดเมนที่รองรับแบ่งออกเป็นสองรูปแบบคือนโยบาย instruction_dataset สำหรับการทำ supervised fine-tuning และ preference_pairs สำหรับการฝึกแบบ preference-based เช่น DPO
ในส่วนของการใช้งานจริง มีพารามิเตอร์สำคัญสามตัวประกอบด้วย estimate=True สำหรับตรวจสอบเครดิตที่ต้องใช้โดยไม่มีการเรียกเก็บเงิน, prompt รองรับข้อความสูงสุด 10,000 ตัวอักษรเพื่อกำหนดทิศทางของชุดข้อมูล และ idempotency_key รองรับสูงสุด 255 ตัวอักษรเพื่อความปลอดภัยในการส่งคำขอซ้ำ นอกจากนี้ยังมีฟังก์ชัน language_expansion ที่ทำงานในโหมด translate และ localize พร้อมค่า sample_rate ระหว่าง 0.01 ถึง 1
เครื่องมือ Invent a Dataset ถือเป็นก้าวสำคัญในการแก้ปัญหาคอขวดของการเตรียมข้อมูลฝึก AI ซึ่งปกติมักใช้เวลานานและมีต้นทุนสูง การสร้างข้อมูลจากคำอธิบายงานโดยตรงช่วยให้ทีมนักพัฒนาสามารถทดลองแนวคิดใหม่ๆ ได้รวดเร็วขึ้นโดยไม่ต้องรอรวบรวมและติดป้ายกำกับข้อมูลแบบเดิม
Invent a Dataset เป็นส่วนแรกของวงจรการทำงาน โดยสามารถส่งรหัสชุดข้อมูลต่อไปยัง autoscientist.create เพื่อปรับแต่งข้อมูลและสูตรการฝึกร่วมกันได้ทันที ระบบ AutoScientist นี้เปิดตัวครั้งแรกในเดือนพฤษภาคม 2026 และผลการประเมินภายในพบว่าช่วยเพิ่มประสิทธิภาพการฝึกได้ดีกว่าทีมวิจัยกำหนดเองเฉลี่ย 35% บนสถาปัตยกรรมที่ให้บริการโดย Together AI
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น