Alibaba Qwen-Image-2.1: โมเดลโอเพนเวท 7B ตัวใหม่
Alibaba เปิดตัว Qwen-Image-2.1 โมเดล 7B สำหรับสร้างและแก้ไขภาพ พร้อมความสามารถ mixed-granularity attention และคะแนนบน Qwen-Image-Bench ที่ 60.28

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Alibaba เปิดตัว Qwen-Image-2.1 โมเดลขนาด 7B สำหรับสร้างและแก้ไขภาพในตัวเดียว
- ใช้สถาปัตยกรรม mixed-granularity attention ช่วยลดการคำนวณซ้ำผ่านการรีใช้ KV cache
- ทำคะแนนบน Qwen-Image-Bench ได้ 60.28 เหนือกว่ารุ่นเปิดรุ่นอื่นอย่าง FLUX 2 Max
- รองรับการใช้งานผ่าน Diffusers, ComfyUI, vLLM-Omni, SGLang และฮาร์ดแวร์หลากหลายค่าย
ทีมพัฒนาจาก Alibaba ได้ประกาศเปิดตัว Qwen-Image-2.1 โมเดลโอเพนเวทขนาด 7 พันล้านพารามิเตอร์ (7B) ที่ถูกออกแบบมาเพื่อรองรับงานสร้างภาพ (Text-to-Image) และการแก้ไขภาพ (Image Editing) ไว้ภายในโมเดลเดียว โดยรุ่นนี้มีขนาดลดลงเหลือเพียงประมาณหนึ่งในสามของรุ่นดั้งเดิมอย่าง Qwen-Image ที่เปิดตัวไปในเดือนสิงหาคม 2025 ซึ่งใช้ขนาด 20B ภายใต้ไลเซนส์ Apache 2.0 แม้ตัวโมเดลการแพร่กระจาย (diffusion transformer) จะมีขนาด 7B แต่ในระบบท่อส่งข้อมูล (pipeline) จะมีการโหลดตัวเข้ารหัส Qwen3-VL ขนาด 8B เพิ่มเติมสำหรับการวางแผนการใช้หน่วยความจำ
ความโดดเด่นด้านประสิทธิภาพของ Qwen-Image-2.1 มาจากกลไกการทำงานของ attention mask โดยในส่วนของโทเค็นข้อความจะใช้ token-level causal mask ขณะที่โทเค็นรูปภาพใช้ chunk-level bidirectional mask ภายในแต่ละภาพ ซึ่งทางทีมผู้พัฒนาเรียกว่า mixed-granularity attention เนื่องจากการใส่เงื่อนไข (condition prefix) จะอยู่ก่อนส่วนของสัญญาณรบกวน (noisy latent) ทำให้มันไม่เคยสนใจตัวสัญญาณรบกวนโดยตรง ส่งผลให้ค่า keys และ values คงที่ตลอดทุกขั้นตอนการลดสัญญาณรบกวน (denoising steps) โมเดลจึงคำนวณข้อความและภาพอินพุตเพียงครั้งเดียวในขั้นตอนแรก แล้วนำ prefix KV cache กลับมาใช้ใหม่ในทุกขั้นตอนที่เหลือ ซึ่งช่วยประหยัดเวลาได้อย่างมากโดยเฉพาะเมื่อใช้งานกับภาพอ้างอิงหลายภาพ
การพัฒนาสถาปัตยกรรมที่แยกส่วนการประมวลผลข้อความและภาพออกเป็น mixed-granularity attention ถือเป็นก้าวสำคัญในการแก้ปัญหาคอขวดด้านความเร็วของการประมวลผลโมเดลรูปภาพขนาดใหญ่ การรีใช้ KV cache ช่วยลดภาระการประมวลผลซ้ำซ้อนในขั้นตอนการสุ่มภาพซ้ำๆ ทำให้โมเดลขนาดเล็กอย่าง 7B สามารถประมวลผลภาพที่มีความซับซ้อนสูงหรือภาพอ้างอิงหลายรูปพร้อมกันได้อย่างมีประสิทธิภาพโดยไม่สูญเสียคุณภาพ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในด้านการเปรียบเทียบประสิทธิภาพ ทีมวิจัยได้ทดสอบบนเกณฑ์มาตรฐานภายในที่เรียกว่า Qwen-Image-Bench โดยผลปรากฏว่า Qwen-Image-2.1 ทำคะแนนรวมได้ 60.28 ซึ่งส่งผลให้มันอยู่อเหนือกว่า Nano Banana 2.0 ที่ทำได้ 59.82 รวมถึงโมเดลแบบโอเพนเวททุกตัวในรายการ ขณะที่ FLUX 2 Max ซึ่งเป็นโมเดลเปิดขนาด 32B ทำคะแนนไว้ที่ 55.33 นอกจากนี้ยังมีโมเดลแบบปิด (closed models) อีก 6 ตัวที่ทำคะแนนได้สูงกว่า นำโดย GPT Image 2.5 Sunburst ซึ่งทำคะแนนสูงสุดที่ 67.01
สำหรับการใช้งานและการปรับใช้ (Deployment) โมเดลนี้พร้อมรองรับสำหรับการวิจัยและการประเมินผลทันทีในวันแรก (Day 0 support) ผ่านเครื่องมือต่างๆ เช่น Diffusers, ComfyUI, vLLM-Omni, SGLang และ LightX2V อย่างไรก็ตาม การนำไปใช้งานเชิงพาณิชย์ยังคงต้องขอไลเซนส์แยกต่างหากจากทีม Qwen สำหรับนักพัฒนาที่ต้องการติดตั้ง สามารถเริ่มต้นด้วยการติดตั้ง PyTorch 2.4.0 ขึ้นไป, transformers 5.17 ขึ้นไป, Diffusers จากซอร์สโค้ด, accelerate และ pillow
ตัวอย่างการเรียกใช้งานโค้ดพื้นฐานมีดังนี้:
- ติดตั้งไลบรารีและโหลดไปป์ไลน์ผ่าน
QwenImage21Pipeline.from_pretrained("Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16).to("cuda") - กำหนดพรอมต์ เช่น
prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night"พร้อมตั้งค่าnum_inference_steps=40 - สำหรับงานแก้ไขภาพ สามารถใช้ไปป์ไลน์เดียวกันโดยส่งพารามิเตอร์
image=ร่วมกับภาพอ้างอิงตั้งแต่ 1 ภาพขึ้นไป - ในกรณีที่ใช้การ์ดจอ GPU ขนาดเล็ก สามารถใช้ฟังก์ชัน
pipe.enable_model_cpu_offload()เพื่อช่วยลดแรงกดดันด้านหน่วยความจำ
นอกจากนี้ ในส่วนของการให้บริการ (Serving) ทาง vLLM-Omni ได้เพิ่มการรองรับการทำ quantization แบบ FP8, การแคช prefix KV, การถอดรหัสด้วย CUDA Graph และ tensor parallelism ขณะที่ SGLang เพิ่ม Cache-DiT, CUDA graphs, การทำ multi-GPU parallelism และ component offload นอกจากฮาร์ดแวร์ของ NVIDIA แล้ว การปล่อยโมเดลครั้งนี้ยังครอบคลุมไปถึง AMD Radeon GPUs ผ่านทาง ROCm และแพลตฟอร์มชิปอีก 8 ค่ายผ่าน FlagOS พร้อมทั้งมีการเปิดตัวโมเดลแปลงพรอมต์ (prompt-rewriting models) จำนวน 2 รุ่น ซึ่งเป็นจุดตรวจสโคปที่ปรับแต่งเพิ่มเติมจาก Qwen3.5-VL 9B สำหรับช่วยขยายพรอมต์สั้นให้มีรายละเอียดครบถ้วนและเลือกอัตราส่วนภาพที่เหมาะสม
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น