Pawscript: แอปแปลงภาพสุนัขเป็นจดหมายจากมุมมองน้องหมา
นักพัฒนาสร้าง Pawscript สำหรับ DEV Weekend Challenge ใช้ความสามารถมัลติมีเดียของ Gemini วิเคราะห์ภาพถ่ายและเสียงเห่าเพื่อเขียนจดหมายเฉพาะตัว

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Pawscript แปลงภาพถ่ายสุนัขเป็นจดหมายส่วนตัวจากมุมมองของน้องหมา
- ใช้ความสามารถ multimodal ของ Gemini วิเคราะห์ทั้งภาพและเสียงเห่า
- บังคับโครงสร้างข้อมูล JSON ให้ผลลัพธ์ตรงกับรูปภาพจริงไม่มีการสุ่ม
- ชูจุดเด่นความเป็นส่วนตัวด้วยการไม่จัดเก็บข้อมูลภาพและเสียงไว้บนเซิร์ฟเวอร์
นักพัฒนาซอฟต์แวร์ได้สร้างสรรค์ผลงานชิ้นใหม่ในชื่อ Pawscript สำหรับกิจกรรม DEV Weekend Challenge: Dog Days Edition โดยแอปพลิเคชันนี้ออกแบบมาเพื่อให้เจ้าของสุนัขสามารถอัปโหลดภาพถ่ายของสัตว์เลี้ยงคู่ใจ พร้อมเสียงเห่า เสียงคราง หรือเสียงถอนหายใจ เพื่อให้ระบบแปลงข้อมูลเหล่านี้ออกมาเป็นจดหมายอบอุ่นหัวใจที่เขียนขึ้นจากมุมมองของน้องหมาเอง
แนวคิดเบื้องหลังโครงการนี้คือการหลีกเลี่ยงรูปแบบเดิมๆ ของแอปพลิเคชันสัตว์เลี้ยงทั่วไป ที่มักจะแสดงผลลัพธ์เป็นป้ายกำกับรูปภาพแบบสุ่มซ้ำๆ กัน แต่ Pawscript มุ่งเน้นไปที่การวิเคราะห์ภาพถ่ายเฉพาะใบที่ผู้ใช้ป้อนเข้าไปจริงๆ ส่งผลให้สุนัขตัวเดียวกันเมื่อสแกนสองครั้งจะได้จดหมายที่มีเนื้อหาแตกต่างกันอย่างแท้จริงตามรายละเอียดที่ปรากฏในภาพ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในส่วนของการพัฒนาหน้าจอ นักพัฒนาได้เริ่มต้นจากดีไซน์ที่ชื่นชอบ นั่นคือ แถบความคืบหน้าการสแกนรูปอุ้งเท้าห้าดวงพร้อมแอนิเมชันการหายใจ ก่อนจะพัฒนาตรรกะเบื้องหลังให้ทำงานจริงแทนที่จะเป็นเพียงภาพเคลื่อนไหวตกแต่ง โดยเชื่อมโยงแอนิเมชันดังกล่าวเข้ากับวงจรการดึงข้อมูลจริง เพื่อให้ช่วงเวลาการสแกนมีความหมายและตอบสนองต่อการทำงานของระบบอย่างแท้จริง
การใช้ความสามารถ Multimodal AI เช่น Gemini ในการผสมผสานข้อมูลภาพและเสียงเข้าด้วยกัน ถือเป็นก้าวสำคัญในการพัฒนาแอปพลิเคชันสายสัตว์เลี้ยง (Pet Tech) การที่ระบบสามารถแยกแยะเสียงเห่าแหลมสูงออกจากเสียงคำรามต่ำได้ ช่วยเพิ่มมิติความสมจริงให้กับข้อความที่สร้างขึ้น และแสดงให้เห็นถึงศักยภาพของการประมวลผลข้อมูลหลายรูปแบบพร้อมกันในงานพัฒนาซอฟต์แวร์สมัยใหม่
หัวใจสำคัญของระบบคือการส่งคำสั่งครั้งเดียวแบบมัลติมีเดียไปยัง Gemini โดยแนบภาพถ่ายและเสียงที่แปลงเป็น base64 เข้าไปด้วย พร้อมคำสั่งควบคุมระบบที่บังคับให้โมเดลอ้างอิงรายละเอียดทางภาพที่มองเห็นได้จริง เช่น ขน ท่าทาง สภาพแวดล้อม และสีหน้า เพื่อไม่ให้จดหมายออกมาในลักษณะกว้างๆ นอกจากนี้ยังมีการบังคับรูปแบบข้อมูลขาออกให้อยู่ในโครงสร้าง JSON ที่ชัดเจน ได้แก่ letter, mood_tag, observations และ used_audio เพื่อให้ส่วนติดต่อผู้ใช้งานสามารถประมวลผลการตอบกลับได้อย่างแม่นยำ
ประเด็นที่ท้าทายที่สุดในการพัฒนาคือการจัดการเส้นทางเสียงทางเลือก ซึ่งระบบจะสั่งให้ Gemini หลอมรวมโทนเสียงเข้ากับจดหมาย ในขณะเดียวกันก็มีคำสั่งที่ชัดเจนว่าห้ามสร้างลักษณะเสียงขึ้นมาเองหากผู้ใช้ไม่ได้อัปโหลดไฟล์เสียงเข้ามา นอกจากนี้ ในแง่ของความเป็นส่วนตัว ระบบจะไม่จัดเก็บข้อมูลใดๆ ที่ถูกอัปโหลดขึ้นไป โดยภาพถ่ายและเสียงจะถูกส่งตรงไปยัง Gemini เพื่อการวิเคราะห์เท่านั้นและจะไม่ถูกเก็บรักษาไว้บนระบบ
ที่มา: Dev.to
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น