Mistral AI เปิดตัว Shieldstral 1.0 3B โมเดลความปลอดภัยมัลติโมดัลขนาดกะทัดรัด
โมเดลความปลอดภัยโอเพนซอร์กขนาด 3 พันล้านพารามิเตอร์จาก Mistral AI ที่ทำงานบนจีพียูเดี่ยวและเทียบชั้นโมเดลที่มีขนาดใหญ่กว่าถึง 7 เท่า

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Shieldstral-1.0-3B เป็นโมเดลความปลอดภัยมัลติโมดัลขนาด 3 พันล้านพารามิเตอร์ ใช้สัญญาอนุญาต Apache 2.0
- ใช้หน่วยความจำ VRAM เพียง 16GB ในรูปแบบ BF16 และรันบนจีพียูเดี่ยวได้ทันที
- ทำคะแนนเฉลี่ย F1 บนความปลอดภัยข้อความสูงถึง 84.9% เทียบเท่า GPT-OSS-Safeguard-20B
- รองรับบริบทสูงสุด 32,000โทเค็นครอบคลุม 12 ภาษาและติดตั้งใช้งานผ่านแพลตฟอร์มยอดนิยมได้หลากหลาย
Mistral AI ได้เปิดตัวโมเดลความปลอดภัยตัวใหม่ล่าสุดในชื่อ Shieldstral-1.0-3B ซึ่งเป็นตัวจำแนกความปลอดภัยมัลติโมดัลแบบปรับนโยบายได้ (Policy-Adaptive Multimodal Safety Classifier) ที่มาพร้อมน้ำหนักแบบเปิดเผย (Open-Weights) โดยจุดเด่นสำคัญคือการทำงานแบบโลคอลบนจีพียูเดี่ยว และใช้พื้นที่หน่วยความจำ VRAM เพียง 16GB ในรูปแบบ BF16 พร้อมทั้งเปิดให้ใช้งานเชิงพาณิชย์และทั่วไปภายใต้สัญญาอนุญาต Apache 2.0
ในด้านการติดตั้งใช้งาน โมเดลนี้รองรับเส้นทางการให้บริการที่หลากหลาย ได้แก่ vLLM เวอร์ชัน 0.26.0 ขึ้นไป (แนะนำ), llama.cpp ผ่านการแปลงไฟล์เป็น GGUF ด้วยการควอนไทซ์ระดับ Q8_0, Q5_K_M และ Q4_K_M รวมถึง SGLang และ Transformers อีกทั้งยังสนับสนุนการปรับแต่งโมเดลเพิ่มเติม (Fine-tuning) ผ่านเครื่องมือ Axolotl เนื่องจากการจำแนกผลลัพธ์จะปล่อยโทเค็นออกมาเพียงตัวเดียว ส่งผลให้ความหน่วง (Latency) และต้นทุนต่ำกว่าระบบป้องกันที่ใช้กระบวนการให้เหตุผล (Reasoning-based guards) อย่าง GPT-OSS-Safeguard-20B อย่างมาก
การที่โมเดลขนาดเล็กอย่าง Shieldstral-1.0-3B สามารถทำหน้าที่ตรวจสอบความปลอดภัยได้รวดเร็วโดยปล่อยโทเค็นเพียงตัวเดียว ถือเป็นก้าวสำคัญในการลดภาระต้นทุนด้านฮาร์ดแวร์สำหรับองค์กรที่ต้องการระบบคัดกรองเนื้อหาแบบเรียลไทม์บนเซิร์ฟเวอร์ท้องถิ่น แทนที่จะต้องพึ่งพา API ขนาดใหญ่ที่มีค่าใช้จ่ายสูงและมีความหน่วงมากกว่า
ความได้เปรียบของโมเดลนี้ไม่ได้มาจากขนาดพารามิเตอร์ แต่มาจากชุดข้อมูลฝึกอบรมที่มีจำนวนราว 54.1 ล้านตัวอย่าง ซึ่งแบ่งเป็นข้อมูลข้อความโอเพนซอร์ก 45.2 ล้านตัวอย่าง ข้อความเปรียบเทียบเชิงสังเคราะห์ 4.4 ล้านตัวอย่าง และข้อมูลมัลติโมดัลอีก 4.5 ล้านตัวอย่าง ทีมงานได้พัฒนาเลเยอร์รวมกลุ่มแบบใช้เทมเพลตเพื่อแปลงชุดข้อมูลทั้งหมดให้อยู่ในรูปแบบ คำสั่ง-คำถาม-เอกสาร เดียวกัน ผ่านตัวประมวลผลเฉพาะของแต่ละชุดข้อมูล พร้อมทั้งปรับระดับความเข้มงวดให้เหมาะสม

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
เทคนิคที่น่าสนใจคือการสร้างข้อมูลเปรียบเทียบ (Contrastive Generation) โดยใช้โมเดลภาษาขนาดใหญ่แปลงข้อความที่ปลอดภัยให้กลายเป็นเวอร์ชันที่ไม่ปลอดภัย ซึ่งละเมิดหมวดหมู่เป้าหมายแต่จงใจไม่ละเมิดหมวดหมู่พี่น้อง (Sibling categories) ทำให้เกิดตัวอย่างเชิงบวกและตัวอย่างเชิงลบที่ยากบนเนื้อหาเดียวกันในการเรียกใช้งานครั้งเดียว ส่วนข้อมูลรูปภาพจะถูกเสริมด้วยชุดข้อมูลภาพทั่วไปเพื่อใช้เป็นตัวอย่างเชิงลบ การกลายพันธุ์ของคำถามผ่านอนุกรมวิธานภาพ 14 ประเภทย่อย และการกรองด้วยตัวจัดอันดับใหม่แบบวิสัยทัศน์-ภาษา (Vision-language reranker)
กระบวนการฝึกอบรมเริ่มต้นด้วยการทำ LoRA fine-tuning ตามด้วยการรวมโมเดลแบบสามทางผ่านวิธี SLERP ในสัดส่วน 0.6 สำหรับข้อมูลสาธารณะและข้อมูลสังเคราะห์, 0.3 สำหรับข้อมูลสาธารณะอย่างเดียว และ 0.1 สำหรับ Ministral-3B-Instruct ผลลัพธ์ด้านความปลอดภัยของข้อความรายงานว่าทำคะแนนเฉลี่ย F1 ได้ 84.9% ซึ่งเท่ากับ GPT-OSS-Safeguard-20B ในฐานะโมเดลที่เล็กที่สุดในการเปรียบเทียบ โดยมีคะแนนนำบนชุดข้อมูล ToxicChat ที่ 84.1, HarmBench ที่ 99.4 และ Aegis v2 response ที่ 87.2 ส่วนความปลอดภัยมัลติโมดัลทำได้ 83.8% เหนือกว่า OmniGuard-7B ที่ทำได้ 77.6% รวมถึงนำหน้า VLGuard ที่ 97.7 และ UnsafeBench ที่ 81.8
อย่างไรก็ตาม โมเดลนี้ยังมีจุดอ่อนในด้านการจำแนกข้อความแจ้งเตือน (Prompt) หลายภาษา โดยเฉพาะภาษาอาหรับและภาษาอินโดนีเซีย รวมถึงชุดข้อมูลแจ้งเตือน RTP-LX ที่ทำคะแนนได้ 70.3 เทียบกับ 86.1 ของ Nemotron-3.5-Safety-4B นอกจากนี้ Mistral ยังระบุถึงความน่าเชื่อถือที่ลดลงเมื่อเจอข้อมูลป้อนเข้าที่เป็นการโจมตีหรือถูกอำพราง รวมถึงเอกสารที่มีความยาวมากๆ โดยโมเดลรองรับบริบทการฝึกอบรมที่ 32k โทเค็นครอบคลุม 12 ภาษา
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น