H Company เปิดตัว NeoMME โมเดล Multimodal ขนาด 260M และ 800M
H Company ปล่อย NeoMME ตระกูลโมเดลเข้ารหัส Multimodal แบบ Single-Tower ตัด Vision Tower และ Causal Decoder ออก รองรับ Apache 2.0 บน Hugging Face

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- H Company เปิดตัว NeoMME โมเดลขนาด 260M และ 800M
- ใช้ Transformer เดียวประมวลผลทั้งข้อความและภาพ 32x32
- โมเดล NeoMME-Retriever ทำคะแนน nDCG@10 ถึง 0.523 บน ViDoRe v3
- เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 บน Hugging Face
H Company ได้เปิดตัวตระกูลโมเดลใหม่ในชื่อ NeoMME ซึ่งเป็นตัวเข้ารหัสแบบ bidirectional ขนาด 260 ล้าน และ 800 ล้านพารามิเตอร์ โดยสถาปัตยกรรมนี้ได้ตัดองค์ประกอบอย่าง Vision Tower และ Causal Decoder ออกไป ทำให้สถาปัตยกรรมมีความคล่องตัวสูงขึ้นด้วยการใช้ Transformer เพียงตัวเดียวในการประมวลผลทั้งโทเค็นข้อความหลายภาษาและแพตช์ภาพ RGB ขนาด 32x32 พิกเซลผ่านเลเยอร์เดียวกันทั้งหมด ซึ่งเริ่มต้นฝึกฝนจากค่าเริ่มต้นแบบสุ่ม
ในด้านการนำไปใช้งานจริง โมเดลทั้งหมดพร้อมให้ดาวน์โหลดภายใต้สัญญาอนุญาต Apache 2.0 พร้อมรองรับการใช้งานผ่าน Hugging Face Transformers ตั้งแต่วันแรก โดยรุ่น 260M สามารถจัดทำดัชนีได้ 51.3 หน้าต่อวินาทีบนการ์ดจอ NVIDIA L40S เพียงตัวเดียว และสามารถเข้ารหัสข้อความค้นหาได้ภายใน 78.3 มิลลิวินาทีบนโฮสต์ที่ใช้ซีพียูเท่านั้น

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
สถาปัตยกรรมภายในเริ่มต้นด้วยการฝังตัวแบบแยกส่วนสไตล์ ALBERT ใช้การค้นหาขนาด 256 มิติที่ฉายไปยังความกว้างของโมเดล ส่วนภาพจะถูกแบ่งเป็นแพตช์ขนาด 32x32 ที่ไม่ทับซ้อนกันและฉายผ่าน MLP 2 เลเยอร์ที่ฝึกตั้งแต่ต้นโดยไม่ต้องใช้โมดูลผสานแพตช์หรือตระกูล SigLIP2 โมเดลทั้งสองรุ่นรองรับบริบทความยาว 16,384 โทเค็น พร้อมใช้กลไกการใส่ใจแบบเลื่อนหน้าต่างสมมาตร และใช้การใส่ใจแบบทั่วโลกในทุกๆ เลเยอร์ที่หกและเลเยอร์สุดท้าย
สำหรับกระบวนการฝึกอบรมล่วงหน้าใช้การแพร่กระจายแบบถูกปิดกั้นแบบไม่ต่อเนื่อง over ข้อความ โดยส่วนที่เป็นข้อความอย่างเดียวจะมีอัตราการทุจริตตั้งแต่ 0 ถึง 1 ส่วนส่วน Multimodal จะอยู่ที่ 0.30 ถึง 1 เพื่อบังคับให้โมเดลต้องอ่านหน้ากระดาษอย่างละเอียด ผลการทดสอบพิสูจน์แล้วว่าแพตช์หน้ากระดาษที่มองเห็นได้ช่วยเพิ่มความแม่นยำของโทเค็นที่ถูกปิดกั้นขึ้น 38.4 จุดสำหรับรุ่น 260M และ 40.5 จุดสำหรับรุ่น 800M ผ่านการประมวลผลโทเค็นประมาณ 524 พันล้านโทเค็นบนฮาร์ดแวร์ H100
"H Company has released NeoMME, a family of 260M and 800M bidirectional encoders that drops both components."
H Company
การตัด Vision Tower และ Causal Decoder ออกใน NeoMME ถือเป็นแนวทางสำคัญในการลดความซับซ้อนของสถาปัตยกรรม Vision-Language Models (VLMs) แบบดั้งเดิม ซึ่งมักแยกส่วนประมวลผลภาพออกต่างหาก การรวมสถาปัตยกรรมมาไว้ใน Single-Tower ช่วยเพิ่มความเร็วในการประมวลผลเอกสารและลดการใช้ทรัพยากรหน่วยความจำอย่างมีนัยสำคัญ เหมาะสำหรับการนำไปประยุกต์ใช้ในระบบค้นหาเอกสารองค์กรที่ต้องการความเร็วสูง
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น