ข้ามไปเนื้อหาหลัก

Alibaba Qwen-Image-2.1: โมเดลโอเพนเวท 7B ตัวใหม่

Alibaba เปิดตัว Qwen-Image-2.1 โมเดล 7B สำหรับสร้างและแก้ไขภาพ พร้อมความสามารถ mixed-granularity attention และคะแนนบน Qwen-Image-Bench ที่ 60.28

เรียบเรียงโดย AI
Inewgen
22 Sep 2026ที่มา: MarkTechPost4 นาทีอ่าน (0 ครั้ง)
แชร์
Alibaba Qwen-Image-2.1: โมเดลโอเพนเวท 7B ตัวใหม่

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • Alibaba เปิดตัว Qwen-Image-2.1 โมเดลขนาด 7B สำหรับสร้างและแก้ไขภาพในตัวเดียว
  • ใช้สถาปัตยกรรม mixed-granularity attention ช่วยลดการคำนวณซ้ำผ่านการรีใช้ KV cache
  • ทำคะแนนบน Qwen-Image-Bench ได้ 60.28 เหนือกว่ารุ่นเปิดรุ่นอื่นอย่าง FLUX 2 Max
  • รองรับการใช้งานผ่าน Diffusers, ComfyUI, vLLM-Omni, SGLang และฮาร์ดแวร์หลากหลายค่าย

ทีมพัฒนาจาก Alibaba ได้ประกาศเปิดตัว Qwen-Image-2.1 โมเดลโอเพนเวทขนาด 7 พันล้านพารามิเตอร์ (7B) ที่ถูกออกแบบมาเพื่อรองรับงานสร้างภาพ (Text-to-Image) และการแก้ไขภาพ (Image Editing) ไว้ภายในโมเดลเดียว โดยรุ่นนี้มีขนาดลดลงเหลือเพียงประมาณหนึ่งในสามของรุ่นดั้งเดิมอย่าง Qwen-Image ที่เปิดตัวไปในเดือนสิงหาคม 2025 ซึ่งใช้ขนาด 20B ภายใต้ไลเซนส์ Apache 2.0 แม้ตัวโมเดลการแพร่กระจาย (diffusion transformer) จะมีขนาด 7B แต่ในระบบท่อส่งข้อมูล (pipeline) จะมีการโหลดตัวเข้ารหัส Qwen3-VL ขนาด 8B เพิ่มเติมสำหรับการวางแผนการใช้หน่วยความจำ

ความโดดเด่นด้านประสิทธิภาพของ Qwen-Image-2.1 มาจากกลไกการทำงานของ attention mask โดยในส่วนของโทเค็นข้อความจะใช้ token-level causal mask ขณะที่โทเค็นรูปภาพใช้ chunk-level bidirectional mask ภายในแต่ละภาพ ซึ่งทางทีมผู้พัฒนาเรียกว่า mixed-granularity attention เนื่องจากการใส่เงื่อนไข (condition prefix) จะอยู่ก่อนส่วนของสัญญาณรบกวน (noisy latent) ทำให้มันไม่เคยสนใจตัวสัญญาณรบกวนโดยตรง ส่งผลให้ค่า keys และ values คงที่ตลอดทุกขั้นตอนการลดสัญญาณรบกวน (denoising steps) โมเดลจึงคำนวณข้อความและภาพอินพุตเพียงครั้งเดียวในขั้นตอนแรก แล้วนำ prefix KV cache กลับมาใช้ใหม่ในทุกขั้นตอนที่เหลือ ซึ่งช่วยประหยัดเวลาได้อย่างมากโดยเฉพาะเมื่อใช้งานกับภาพอ้างอิงหลายภาพ

การพัฒนาสถาปัตยกรรมที่แยกส่วนการประมวลผลข้อความและภาพออกเป็น mixed-granularity attention ถือเป็นก้าวสำคัญในการแก้ปัญหาคอขวดด้านความเร็วของการประมวลผลโมเดลรูปภาพขนาดใหญ่ การรีใช้ KV cache ช่วยลดภาระการประมวลผลซ้ำซ้อนในขั้นตอนการสุ่มภาพซ้ำๆ ทำให้โมเดลขนาดเล็กอย่าง 7B สามารถประมวลผลภาพที่มีความซับซ้อนสูงหรือภาพอ้างอิงหลายรูปพร้อมกันได้อย่างมีประสิทธิภาพโดยไม่สูญเสียคุณภาพ

artificial intelligence code software development screen

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในด้านการเปรียบเทียบประสิทธิภาพ ทีมวิจัยได้ทดสอบบนเกณฑ์มาตรฐานภายในที่เรียกว่า Qwen-Image-Bench โดยผลปรากฏว่า Qwen-Image-2.1 ทำคะแนนรวมได้ 60.28 ซึ่งส่งผลให้มันอยู่อเหนือกว่า Nano Banana 2.0 ที่ทำได้ 59.82 รวมถึงโมเดลแบบโอเพนเวททุกตัวในรายการ ขณะที่ FLUX 2 Max ซึ่งเป็นโมเดลเปิดขนาด 32B ทำคะแนนไว้ที่ 55.33 นอกจากนี้ยังมีโมเดลแบบปิด (closed models) อีก 6 ตัวที่ทำคะแนนได้สูงกว่า นำโดย GPT Image 2.5 Sunburst ซึ่งทำคะแนนสูงสุดที่ 67.01

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

60.28คะแนน Qwen-Image-Bench
7Bขนาดพารามิเตอร์โมเดล
8Bขนาดพารามิเตอร์ Qwen3-VL

สำหรับการใช้งานและการปรับใช้ (Deployment) โมเดลนี้พร้อมรองรับสำหรับการวิจัยและการประเมินผลทันทีในวันแรก (Day 0 support) ผ่านเครื่องมือต่างๆ เช่น Diffusers, ComfyUI, vLLM-Omni, SGLang และ LightX2V อย่างไรก็ตาม การนำไปใช้งานเชิงพาณิชย์ยังคงต้องขอไลเซนส์แยกต่างหากจากทีม Qwen สำหรับนักพัฒนาที่ต้องการติดตั้ง สามารถเริ่มต้นด้วยการติดตั้ง PyTorch 2.4.0 ขึ้นไป, transformers 5.17 ขึ้นไป, Diffusers จากซอร์สโค้ด, accelerate และ pillow

ตัวอย่างการเรียกใช้งานโค้ดพื้นฐานมีดังนี้:

  • ติดตั้งไลบรารีและโหลดไปป์ไลน์ผ่าน QwenImage21Pipeline.from_pretrained("Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16).to("cuda")
  • กำหนดพรอมต์ เช่น prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night" พร้อมตั้งค่า num_inference_steps=40
  • สำหรับงานแก้ไขภาพ สามารถใช้ไปป์ไลน์เดียวกันโดยส่งพารามิเตอร์ image= ร่วมกับภาพอ้างอิงตั้งแต่ 1 ภาพขึ้นไป
  • ในกรณีที่ใช้การ์ดจอ GPU ขนาดเล็ก สามารถใช้ฟังก์ชัน pipe.enable_model_cpu_offload() เพื่อช่วยลดแรงกดดันด้านหน่วยความจำ

นอกจากนี้ ในส่วนของการให้บริการ (Serving) ทาง vLLM-Omni ได้เพิ่มการรองรับการทำ quantization แบบ FP8, การแคช prefix KV, การถอดรหัสด้วย CUDA Graph และ tensor parallelism ขณะที่ SGLang เพิ่ม Cache-DiT, CUDA graphs, การทำ multi-GPU parallelism และ component offload นอกจากฮาร์ดแวร์ของ NVIDIA แล้ว การปล่อยโมเดลครั้งนี้ยังครอบคลุมไปถึง AMD Radeon GPUs ผ่านทาง ROCm และแพลตฟอร์มชิปอีก 8 ค่ายผ่าน FlagOS พร้อมทั้งมีการเปิดตัวโมเดลแปลงพรอมต์ (prompt-rewriting models) จำนวน 2 รุ่น ซึ่งเป็นจุดตรวจสโคปที่ปรับแต่งเพิ่มเติมจาก Qwen3.5-VL 9B สำหรับช่วยขยายพรอมต์สั้นให้มีรายละเอียดครบถ้วนและเลือกอัตราส่วนภาพที่เหมาะสม

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้