Sealify: ค้นหารูปถูกก๊อปปี้บนเว็บโดยไม่ต้องทำระบบ Crawler เอง
วิธีใหม่ในการตรวจจับภาพละเมิดลิขสิทธิ์โดยอาศัยดัชนีของ Google, Yandex และ Bing ช่วยประหยัดพลังงานและฮาร์ดแวร์ รันบน Mac mini เครื่องเดียว

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Sealify ไม่ทำระบบเว็บคอว์ลเลอร์เองเพื่อประหยัดพลังงานและลดขยะอิเล็กทรอนิกส์
- ใช้ดัชนีภาพย้อนกลับของ Google, Yandex และ Bing เป็นระบบค้นหาเบื้องต้น
- ตรวจสอบความถูกต้องในเครื่อง Mac mini ส่วนตัวด้วยระบบยืนยันผลสองชั้น
- การผสาน Google Lens และ Yandex ช่วยให้พบสำเนาภาพบน 396 โดเมน
เครื่องมือค้นหาบนอินเทอร์เน็ตได้ทำหน้าที่จัดทำดัชนีหน้าเว็บและรูปภาพไว้หมดแล้ว การทำเว็บคอว์ลเลอร์เพื่อกวาดข้อมูลซ้ำซ้อนจะสิ้นเปลืองทั้งฮาร์ดแวร์ พลังงาน และทรัพยากรน้ำ นี่คือแนวคิดหลักเบื้องหลังโปรแกรม Sealify ที่นักพัฒนาเริ่มต้นสร้างขึ้นในปี 2023 โดยใช้ดัชนีที่มีอยู่แล้วเป็นขั้นตอนแรกในการตรวจจับภาพซ้ำ และทำการตรวจสอบความถูกต้องทั้งหมดด้วยตัวเองบนคอมพิวเตอร์ Mac mini เพียงเครื่องเดียว
เมื่อคุณเผยแพร่ภาพถ่ายหรือวิดีโอ ผลงานเหล่านั้นมักจะไปโผล่บนเว็บไซต์ที่ไม่เคยรู้จักมาก่อน ซึ่งมักไม่ใช่สำเนาต้นฉบับตรงๆ แต่ผ่านการครอปภาพ ปรับขนาด บีบอัดใหม่ เปลี่ยนเกรดสี ยัดลงในภาพตัดปะ แปลชื่อเรื่องเป็นภาษาอื่น หรืออัปโหลดใหม่โดยถอดเสียงออก การตามหาภาพเหล่านี้มักถูกมองว่าเป็นโจทย์เรื่องการทำคอว์ลเลอร์ ซึ่งต้องดึงข้อมูลเว็บให้ได้มากที่สุด สร้างลายนิ้วมือดิจิทัล และค้นหาในดัชนีนั้น ซึ่งเป็นเหตุผลว่าทำไมระบบใหญ่จึงมีราคาแพงและสิ้นเปลือง

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในทางตรงกันข้าม ระบบคลาวด์และเซิร์ฟเวอร์ไม่ได้เป็นเพียงแค่ตัวเลขค่าใช้จ่าย แต่ต้องแลกมาด้วยการขุดแร่ ผลิต และขนส่งฮาร์ดแวร์ที่ใช้ไฟฟ้าทุกชั่วโมง โดยในปี 2024 ศูนย์ข้อมูลทั่วโลกใช้ไฟฟ้าไปประมาณ 1.5% ของโลก และเฉพาะในสหรัฐอเมริกาประเทศเดียวมีการใช้น้ำจืดเพื่อหล่อเย็นถึงประมาณ 66 พันล้านลิตรในปี 2023 นอกจากนี้ โลกยังผลิตขยะอิเล็กทรอนิกส์สูงถึง 62 ล้านตันในปี 2022 โดยมีไม่ถึงหนึ่งในสี่ที่ได้รับการรีไซเคิลอย่างถูกต้อง
ด้วยเหตุนี้ Sealify จึงเลือกที่จะไม่ทำเว็บคอว์ลเลอร์เลย แต่เลือกที่จะดึงภาพตัวอย่างขนาดเล็กเพียงไม่กี่ร้อยภาพจากเสิร์ชเอนจินที่มีอยู่แล้วมาประมวลผลบนเครื่องคอมพิวเตอร์ส่วนตัว เพื่อตัดสินใจว่าภาพใดคือสำเนาที่แท้จริง โดยระบบจะใช้รูปแบบการดึงข้อมูลแล้วนำมาตรวจสอบ (retrieve-then-verify) ซึ่งช่วยลดต้นทุนได้อย่างมหาศาล เพราะการสร้างดัชนีคือส่วนที่แพงที่สุด ขณะที่การตรวจสอบความถูกต้องโดยเทียบภาพหนึ่งภาพกับผู้สมัครไม่กี่ร้อยรายสามารถทำได้ภายในไม่กี่นาที
แนวคิดการไม่สร้างเว็บคอว์ลเลอร์ซ้ำซ้อน (Not Crawling) สะท้อนให้เห็นมุมมองด้านการพัฒนาซอฟต์แวร์ที่คำนึงถึงสิ่งแวดล้อม (Sustainable Software Engineering) ในยุคที่ปัญญาประดิษฐ์และศูนย์ข้อมูลเติบโตอย่างก้าวกระโดด การหยิบเครื่องมือที่มีผู้พัฒนาไว้แล้วมาต่อยอดถือเป็นแนวทางที่ช่วยลดการปล่อยคาร์บอนและขยะอิเล็กทรอนิกส์ได้อย่างเป็นรูปธรรม
ในส่วนกระบวนการทำงาน ตัวสแกนจะส่งคำขอไปยังเครื่องมือค้นหาหลายแห่งพร้อมกันแบบขนาน ได้แก่ Google Lens (ทั้งการค้นหาแบบตรงและภาพที่ใกล้เคียงกัน), Google Reverse Image Search แบบคลาสสิก, Yandex และ Bing ผ่าน API ภายนอก ผลลัพธ์จากการทดสอบพบว่าการใช้งาน Google Lens และ Yandex ร่วมกันสามารถตรวจพบสำเนาภาพที่ได้รับการยืนยันแล้วบนโดเมนถึง 396 โดเมน โดยมีเพียง 8 โดเมนเท่านั้นที่ปรากฏในทั้งสองเครื่องมือ ซึ่งแสดงให้เห็นว่าหากใช้เครื่องมือใดเครื่องมือหนึ่งเพียงอย่างเดียวจะพลาดสำเนาไปราวครึ่งหนึ่ง
เมื่อได้รายชื่อผู้สมัครมาแล้ว ระบบจะทำการลบข้อมูลซ้ำ ดาวน์โหลดภาพตัวอย่างขนาดเล็ก และส่งเข้าสู่ระบบตรวจสอบความถูกต้อง ซึ่งตัวตรวจสอบจะให้คะแนนผู้สมัครแต่ละรายสองครั้ง ได้แก่ คะแนนฉาก (Scene-score) และคะแนนใบหน้า เพื่อคัดกรองภาพที่คล้ายคลึงกันแต่อาจไม่ใช่ภาพเดียวกัน เช่น ภาพนักแสดงคนเดียวกันแต่คนละฉาก หรือโปสเตอร์จากภาพยนตร์เรื่องเดียวกัน
"A server is never just a line on a cloud bill. It is hardware that has to be mined, manufactured and shipped."
Levent Celiksan
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น