ค่า Threshold ของตัวตรวจจับ AI ไม่ใช่ค่าที่ได้จากการโจมตี
เจาะลึกเหตุผลทางคณิตศาสตร์และชุดข้อมูลเบนช์มาร์ก 726 รายการ ที่ชี้ว่า Threshold ของการ์ดเรลควรมาจากทราฟฟิกปกติ ไม่ใช่ข้อมูลการโจมตี

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Threshold ของระบบป้องกันไม่ใช่พารามิเตอร์ของโมเดล แต่เป็นคุณลักษณะของทราฟฟิก
- การปรับค่า Threshold ด้วยข้อมูลการโจมตีจริงถือเป็นความเข้าใจที่คลาดเคลื่อน
- การกระจายตัวของทราฟฟิกปกติเป็นตัวกำหนดค่า Threshold และจุดทำงานที่ดีที่สุด
- ทราฟฟิกที่เปลี่ยนไปทำให้การคาลิเบรทเก่าคลาดเคลื่อนได้ถึง 5 เท่า
นักพัฒนาซอฟต์แวร์มักมองว่าค่า Threshold ของการ์ดเรล (Guardrail) เป็นพารามิเตอร์ของโมเดล แต่ในความเป็นจริงแล้ว มันคือคุณลักษณะของทราฟฟิกที่ระบบต้องเผชิญ การพิสูจน์ด้วยสมการบรรทัดเดียวแสดงให้เห็นว่า สิ่งที่คนส่วนใหญ่นำมาใช้คาลิเบรทค่านี้อาจเป็นชุดข้อมูลที่ผิดตั้งแต่ต้น
การวัดผลจากเบนช์มาร์กสาธารณะที่มีชุดข้อมูลการโจมตีแบบ Prompt-injection จำนวน 629 รายการ ซึ่งฝังอยู่ในเอาต์พุตเครื่องมือปกติ เช่น บิล ใบแจ้งหนี้ อีเมล และหน้าเว็บ พร้อมด้วยเอาต์พุตปกติอีก 97 รายการ ผ่านตัวตรวจจับโอเพนซอร์ส 9 ตัว เผยให้เห็นปัญหาความต่างของสเกลคะแนนที่ห่างกันถึง 5 Order of magnitude
ตัวอย่างเช่น โมเดล Prompt Guard 2 ให้คะแนนการโจมตีอยู่ที่ประมาณ 0.009 และข้อมูลปกติที่ 0.0008 ขณะที่ค่า Cutoff ถูกตั้งไว้สูงถึง 0.5 ซึ่งสูงกว่าช่วงคะแนนทั้งหมดของโมเดล ทำให้ตรวจจับการโจมตีได้เพียง 6 จาก 629 รายการ หรือคิดเป็น 1.0% เท่านั้น และไม่เคยแจ้งเตือนข้อมูลปกติเลย ขณะเดียวกัน ตัวตรวจจับอื่นในตารางเดียวกันกลับให้คะแนนข้อมูลปกติสูงถึง ~0.999 ทำให้ค่า 0.5 อยู่ต่ำกว่าช่วงคะแนนทั้งหมดของมันเช่นกัน
ปัญหาความต่างของสเกลคะแนนนี้ชี้ให้เห็นว่า ค่า Threshold เริ่มต้นไม่ใช่ค่ามาตรฐานสากล แต่เป็นเพียงการคาดเดาสเกลที่โมเดลของคุณอาจไม่ได้ใช้ร่วมด้วย การกำหนดค่าด้วยชุดข้อมูลที่ไม่สอดคล้องกันจึงนำไปสู่ความล้มเหลวสองขั้ว ทั้งการตรวจไม่พบอะไรเลยและการแจ้งเตือนผิดพลาดตลอดเวลา
เมื่อกำหนดงบประมาณอัตราการแจ้งเตือนผิดพลาด (False-alarm rate) ไว้ที่ f จุดทำงานที่เป็นไปได้จะถูกกำหนดโดยการกระจายตัวของคะแนนปกติเท่านั้น โดยค่า Threshold ที่ให้ค่า TPR สูงสุดจะสอดคล้องกับคะแนนปกติอันดับที่ k โดยคำนวณจาก k = floor(f · n_benign) ป้ายกำกับของการโจมตีเป็นตัวเลือกงบประมาณ แต่ทราฟฟิกปกติคือสิ่งที่กำหนดตำแหน่ง Threshold

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
การตรวจสอบข้อมูลด้วยการกวาดค่า Threshold ที่ติดป้ายการโจมตี พบว่ามันให้ผลลัพธ์อัตรา TPR ตรงกับข้อมูลปกติอย่างแม่นยำจนถึงจุดทศนิยมสำหรับตัวตรวจจับทั้ง 9 ตัว การใช้ข้อมูลการโจมตีจริงมาคาลิเบรทจึงเป็นความผิดพลาดเชิงประเภท (Category error) เพราะข้อมูลการโจมตีมีไว้เพื่อวัดผลตอบแทน ไม่ใช่ตัวปรับแต่งค่า
ความท้าทายที่แท้จริงคือเมื่อแบ่งเบนช์มาร์กออกเป็น 4 โดเมนย่อย และคาลิเบรท Threshold จาก 3 โดเมนที่งบประมาณข้อผิดพลาด 2% ก่อนนำไปใช้กับโดเมนที่เหลือ ผลปรากฏว่ามันทำลายงบประมาณใน 11 จาก 36 โดเมน โดยอัตราความผิดพลาดพุ่งสูงถึง 4.9% ซึ่งสูงกว่าที่สัญญาไว้ถึง 2.5 เท่า เนื่องจากทราฟฟิกเปลี่ยนไปแต่ตัวตรวจจับคงเดิม ทำให้การคาลิเบรทเมื่อไตรมาสก่อนหน้าคลาดเคลื่อนไปถึง 5 เท่า
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น