ข้ามไปเนื้อหาหลัก

Pawscript: แอปแปลงภาพสุนัขเป็นจดหมายจากมุมมองน้องหมา

นักพัฒนาสร้าง Pawscript สำหรับ DEV Weekend Challenge ใช้ความสามารถมัลติมีเดียของ Gemini วิเคราะห์ภาพถ่ายและเสียงเห่าเพื่อเขียนจดหมายเฉพาะตัว

เรียบเรียงโดย AI
Inewgen
17 Aug 2026ที่มา: Dev.to3 นาทีอ่าน (0 ครั้ง)
แชร์
Pawscript: แอปแปลงภาพสุนัขเป็นจดหมายจากมุมมองน้องหมา

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Pawscript แปลงภาพถ่ายสุนัขเป็นจดหมายส่วนตัวจากมุมมองของน้องหมา
  • ใช้ความสามารถ multimodal ของ Gemini วิเคราะห์ทั้งภาพและเสียงเห่า
  • บังคับโครงสร้างข้อมูล JSON ให้ผลลัพธ์ตรงกับรูปภาพจริงไม่มีการสุ่ม
  • ชูจุดเด่นความเป็นส่วนตัวด้วยการไม่จัดเก็บข้อมูลภาพและเสียงไว้บนเซิร์ฟเวอร์

นักพัฒนาซอฟต์แวร์ได้สร้างสรรค์ผลงานชิ้นใหม่ในชื่อ Pawscript สำหรับกิจกรรม DEV Weekend Challenge: Dog Days Edition โดยแอปพลิเคชันนี้ออกแบบมาเพื่อให้เจ้าของสุนัขสามารถอัปโหลดภาพถ่ายของสัตว์เลี้ยงคู่ใจ พร้อมเสียงเห่า เสียงคราง หรือเสียงถอนหายใจ เพื่อให้ระบบแปลงข้อมูลเหล่านี้ออกมาเป็นจดหมายอบอุ่นหัวใจที่เขียนขึ้นจากมุมมองของน้องหมาเอง

แนวคิดเบื้องหลังโครงการนี้คือการหลีกเลี่ยงรูปแบบเดิมๆ ของแอปพลิเคชันสัตว์เลี้ยงทั่วไป ที่มักจะแสดงผลลัพธ์เป็นป้ายกำกับรูปภาพแบบสุ่มซ้ำๆ กัน แต่ Pawscript มุ่งเน้นไปที่การวิเคราะห์ภาพถ่ายเฉพาะใบที่ผู้ใช้ป้อนเข้าไปจริงๆ ส่งผลให้สุนัขตัวเดียวกันเมื่อสแกนสองครั้งจะได้จดหมายที่มีเนื้อหาแตกต่างกันอย่างแท้จริงตามรายละเอียดที่ปรากฏในภาพ

dog photo scanning application interface

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในส่วนของการพัฒนาหน้าจอ นักพัฒนาได้เริ่มต้นจากดีไซน์ที่ชื่นชอบ นั่นคือ แถบความคืบหน้าการสแกนรูปอุ้งเท้าห้าดวงพร้อมแอนิเมชันการหายใจ ก่อนจะพัฒนาตรรกะเบื้องหลังให้ทำงานจริงแทนที่จะเป็นเพียงภาพเคลื่อนไหวตกแต่ง โดยเชื่อมโยงแอนิเมชันดังกล่าวเข้ากับวงจรการดึงข้อมูลจริง เพื่อให้ช่วงเวลาการสแกนมีความหมายและตอบสนองต่อการทำงานของระบบอย่างแท้จริง

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

การใช้ความสามารถ Multimodal AI เช่น Gemini ในการผสมผสานข้อมูลภาพและเสียงเข้าด้วยกัน ถือเป็นก้าวสำคัญในการพัฒนาแอปพลิเคชันสายสัตว์เลี้ยง (Pet Tech) การที่ระบบสามารถแยกแยะเสียงเห่าแหลมสูงออกจากเสียงคำรามต่ำได้ ช่วยเพิ่มมิติความสมจริงให้กับข้อความที่สร้างขึ้น และแสดงให้เห็นถึงศักยภาพของการประมวลผลข้อมูลหลายรูปแบบพร้อมกันในงานพัฒนาซอฟต์แวร์สมัยใหม่

หัวใจสำคัญของระบบคือการส่งคำสั่งครั้งเดียวแบบมัลติมีเดียไปยัง Gemini โดยแนบภาพถ่ายและเสียงที่แปลงเป็น base64 เข้าไปด้วย พร้อมคำสั่งควบคุมระบบที่บังคับให้โมเดลอ้างอิงรายละเอียดทางภาพที่มองเห็นได้จริง เช่น ขน ท่าทาง สภาพแวดล้อม และสีหน้า เพื่อไม่ให้จดหมายออกมาในลักษณะกว้างๆ นอกจากนี้ยังมีการบังคับรูปแบบข้อมูลขาออกให้อยู่ในโครงสร้าง JSON ที่ชัดเจน ได้แก่ letter, mood_tag, observations และ used_audio เพื่อให้ส่วนติดต่อผู้ใช้งานสามารถประมวลผลการตอบกลับได้อย่างแม่นยำ

ประเด็นที่ท้าทายที่สุดในการพัฒนาคือการจัดการเส้นทางเสียงทางเลือก ซึ่งระบบจะสั่งให้ Gemini หลอมรวมโทนเสียงเข้ากับจดหมาย ในขณะเดียวกันก็มีคำสั่งที่ชัดเจนว่าห้ามสร้างลักษณะเสียงขึ้นมาเองหากผู้ใช้ไม่ได้อัปโหลดไฟล์เสียงเข้ามา นอกจากนี้ ในแง่ของความเป็นส่วนตัว ระบบจะไม่จัดเก็บข้อมูลใดๆ ที่ถูกอัปโหลดขึ้นไป โดยภาพถ่ายและเสียงจะถูกส่งตรงไปยัง Gemini เพื่อการวิเคราะห์เท่านั้นและจะไม่ถูกเก็บรักษาไว้บนระบบ

ที่มา: Dev.to

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้