เจาะลึกระบบ AI Text Watermarking วิธีฝังลายน้ำในข้อความ
ทำความเข้าใจระบบ AI Text Watermarking ตามแนวทาง SynthID-Text ที่ Anthropic นำมาใช้ในเดือนสิงหาคม 2026 เพื่อปฏิบัติตามกฎหมาย EU AI Act

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- โมเดล AI สามารถฝังลายน้ำผ่านการเลือกคำที่ดูปกติและทนทานต่อการคัดลอกได้
- Anthropic นำ SynthID-Text ของ Google DeepMind มาใช้เพื่อตอบสนองกฎหมาย EU AI Act
- กระบวนการทำงานอาศัยกุญแจลับและบริบทคำก่อนหน้าเพื่อคำนวณคะแนนผ่าน tournament sampling
- เครื่องมือตรวจจับจะคำนวณคะแนนเฉลี่ยย้อนหลังเพื่อหาความน่าจะเป็นของการมีลายน้ำ
โมเดลปัญญาประดิษฐ์สามารถซ่อนลายน้ำไว้ในชุดคำศัพท์ที่เลือกใช้งานได้อย่างแนบเนียน ข้อความที่ถูกสร้างขึ้นจะดูเหมือนข้อความทั่วไปและยังคงรักษาร่องรอยของลายน้ำไว้ได้แม้จะถูกคัดลอกไปยังโปรแกรมอื่น เนื่องจากข้อมูลดังกล่าวถูกแบกรับไว้ผ่านลำดับของโทเค็น โดยอาศัยเครื่องมือตรวจจับที่มีกุญแจตรงกันในการตรวจสอบรูปแบบดังกล่าวในภายหลัง
บริษัท Anthropic ได้อธิบายถึงแนวทางการดำเนินงานดังกล่าวในเดือนสิงหาคม 2026 ในบทความหัวข้อ "How Claude's text watermark works" โดยเลือกใช้งานเทคโนโลยีรูปแบบหนึ่งจาก SynthID-Text ที่ทาง Google DeepMind เคยตีพิมพ์เผยแพร่ลงในวารสาร Nature เมื่อปี 2024 ซึ่งทาง Anthropic ระบุว่าการนำระบบใส่ลายน้ำนี้เข้ามาก็เพื่อรองรับข้อกำหนดด้านความโปร่งใสตามกฎหมาย EU AI Act ของสหภาพยุโรป
ผู้พัฒนาได้ทำการศึกษาและทดลองนำเอาโค้ดขนาดเล็กไปทดลองใช้งานร่วมกับ GPT-2 ผ่านทาง Google Colab เพื่อทำความเข้าใจว่าการเลือกใช้คำธรรมดาจะสามารถพกพาเอกลักษณ์เฉพาะตัวได้อย่างไร และเครื่องมือตรวจจับจะบอกอะไรเราได้บ้างเมื่อพบเอกลักษณ์นั้น โดยกระบวนการทำงานของภาษาจะเริ่มจากการประมวลผลทีละโทเค็น ซึ่งโทเค็นอาจเป็นคำ ส่วนของคำ หรือเครื่องหมายวรรคตอนก็ได้ และตัวโทไนเซอร์ของ GPT-2 เองก็มีชุดโทเค็นอยู่ประมาณ 50,000 โทเค็น
โมเดลจะทำการกำหนดค่าความน่าจะเป็นให้กับโทเค็นถัดไปที่เป็นไปได้ สมมติว่าในกรณีตัวอย่างแบบง่ายจะมีตัวเลือกเพียง 3 ตัวเลือกที่มีความน่าจะเป็นมากกว่าศูนย์ โดยในภาวะปกติที่ไม่มีการใส่ลายน้ำ การสุ่มจากความน่าจะเป็นเหล่านี้จะเลือกคำว่า "sits" ออกมาประมาณครึ่งหนึ่งของการทำงานทั้งหมด จากนั้นโทเค็นที่ถูกเลือกจะเข้าไปรวมอยู่ในประโยคพร้อมกับคำนวณความน่าจะเป็นของโทเค็นถัดไปต่อไป
การทำความเข้าใจระบบ AI Text Watermarking ถือเป็นก้าวสำคัญในการสร้างความโปร่งใสให้กับเนื้อหาที่สร้างโดยปัญญาประดิษฐ์ โดยเฉพาะในยุคที่ข้อความจาก AI มีความเนียนจนมนุษย์แทบไม่สามารถแยกแยะได้ด้วยตาเปล่า การฝังลายน้ำในระดับโทเค็นช่วยให้ผู้ให้บริการสามารถตรวจสอบที่มาของเนื้อหาได้โดยไม่กระทบต่อคุณภาพทางภาษา

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
กระบวนการใส่ลายน้ำจะไม่ไปเปลี่ยนแปลงน้ำหนักของโมเดล AI แต่จะเข้าไปมีอิทธิพลต่อขั้นตอนการเลือกโทเค็นแทน ด้วยอินพุตชุดเดียวกัน โมเดลจึงยังคงให้ค่าความน่าจะเป็นเริ่มต้นชุดเดิม แต่ลายน้ำจะทำหน้าที่ปรับเปลี่ยนผลลัพธ์ที่ถูกเลือกออกมา เช่น จากเดิมที่อาจจะได้ประโยคว่า "The cat sits on the mat." ก็อาจจะเปลี่ยนเป็น "The cat sat on the rug." แทน โดยการเลือกคำเหล่านี้จะเกิดขึ้นในระหว่างที่ข้อความกำลังถูกสร้างขึ้น
ระบบ SynthID-Text จะใช้งานกระบวนการที่เรียกว่า tournament sampling ในการคัดเลือกโทเค็นถัดไป โดยระบบจะอาศัยกุญแจลับร่วมกับโทเค็นก่อนหน้าเพื่อคำนวณคะแนน 0 หรือ 1 ให้กับโทเค็นผู้ท้าชิงแต่ละตัวในแต่ละรอบการแข่งขัน คะแนนที่สูงกว่าจะเป็นผู้ชนะ และหากคะแนนเท่ากันจะใช้วิธีสุ่มตัดสิน ซึ่งความสามารถในการทำซ้ำได้อย่างแม่นยำนี้เองที่ทำให้กระบวนการตรวจจับในภายหลังสามารถทำได้จริง
ในด้านผลกระทบต่อคุณภาพของข้อความ Google ได้ทำการทดสอบการตั้งค่าแบบรักษาคุณภาพกับข้อความตอบกลับจาก Gemini เกือบ 20 ล้านครั้ง ซึ่งรายงานวิจัยระบุว่าไม่มีความแตกต่างอย่างมีนัยสำคัญทางสถิติในคะแนนความพึงพอใจระหว่างข้อความที่มีลายน้ำและไม่มีลายน้ำ อย่างไรก็ตาม หากโมเดลมีทางเลือกในการใช้คำจำกัด การตรวจจับก็จะทำได้ยากขึ้นเนื่องจากมีพื้นที่ให้ฝังลายน้ำน้อยลง
"Anthropic explained its approach in August 2026 in How Claude's text watermark works . It uses a version of SynthID-Text, which Google DeepMind published in Nature in 2024 ."
Dev.to
เครื่องมือตรวจจับจะทำงานโดยอาศัยข้อความ กุญแจลับ และการตั้งค่าลายน้ำแบบเดียวกับที่ใช้ในขั้นตอนการสร้างข้อความ พร้อมกับใช้โทไนเซอร์ที่ตรงกันเพื่อแบ่งข้อความออกเป็นส่วนๆ สำหรับข้อความที่ไม่ได้ใส่ลายน้ำ คะแนนเฉลี่ยที่คำนวณได้จะอยู่ราว 0.5 เนื่องจากฟังก์ชันการให้คะแนนถูกออกแบบมาให้มีสัดส่วนของเลขศูนย์และเลขหนึ่งใกล้เคียงกัน ในขณะที่ข้อความที่มีการฝังลายน้ำจะมีคะแนนเฉลี่ยสูงกว่าปกติ
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น