ข้ามไปเนื้อหาหลัก

H Company เปิดตัว NeoMME โมเดล Multimodal ขนาด 260M และ 800M

H Company ปล่อย NeoMME ตระกูลโมเดลเข้ารหัส Multimodal แบบ Single-Tower ตัด Vision Tower และ Causal Decoder ออก รองรับ Apache 2.0 บน Hugging Face

เรียบเรียงโดย AI
Inewgen
07 Sep 2026ที่มา: MarkTechPost2 นาทีอ่าน (0 ครั้ง)
แชร์
H Company เปิดตัว NeoMME โมเดล Multimodal ขนาด 260M และ 800M

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • H Company เปิดตัว NeoMME โมเดลขนาด 260M และ 800M
  • ใช้ Transformer เดียวประมวลผลทั้งข้อความและภาพ 32x32
  • โมเดล NeoMME-Retriever ทำคะแนน nDCG@10 ถึง 0.523 บน ViDoRe v3
  • เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 บน Hugging Face

H Company ได้เปิดตัวตระกูลโมเดลใหม่ในชื่อ NeoMME ซึ่งเป็นตัวเข้ารหัสแบบ bidirectional ขนาด 260 ล้าน และ 800 ล้านพารามิเตอร์ โดยสถาปัตยกรรมนี้ได้ตัดองค์ประกอบอย่าง Vision Tower และ Causal Decoder ออกไป ทำให้สถาปัตยกรรมมีความคล่องตัวสูงขึ้นด้วยการใช้ Transformer เพียงตัวเดียวในการประมวลผลทั้งโทเค็นข้อความหลายภาษาและแพตช์ภาพ RGB ขนาด 32x32 พิกเซลผ่านเลเยอร์เดียวกันทั้งหมด ซึ่งเริ่มต้นฝึกฝนจากค่าเริ่มต้นแบบสุ่ม

ในด้านการนำไปใช้งานจริง โมเดลทั้งหมดพร้อมให้ดาวน์โหลดภายใต้สัญญาอนุญาต Apache 2.0 พร้อมรองรับการใช้งานผ่าน Hugging Face Transformers ตั้งแต่วันแรก โดยรุ่น 260M สามารถจัดทำดัชนีได้ 51.3 หน้าต่อวินาทีบนการ์ดจอ NVIDIA L40S เพียงตัวเดียว และสามารถเข้ารหัสข้อความค้นหาได้ภายใน 78.3 มิลลิวินาทีบนโฮสต์ที่ใช้ซีพียูเท่านั้น

chromebook notebook computer office desk workspace

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

สถาปัตยกรรมภายในเริ่มต้นด้วยการฝังตัวแบบแยกส่วนสไตล์ ALBERT ใช้การค้นหาขนาด 256 มิติที่ฉายไปยังความกว้างของโมเดล ส่วนภาพจะถูกแบ่งเป็นแพตช์ขนาด 32x32 ที่ไม่ทับซ้อนกันและฉายผ่าน MLP 2 เลเยอร์ที่ฝึกตั้งแต่ต้นโดยไม่ต้องใช้โมดูลผสานแพตช์หรือตระกูล SigLIP2 โมเดลทั้งสองรุ่นรองรับบริบทความยาว 16,384 โทเค็น พร้อมใช้กลไกการใส่ใจแบบเลื่อนหน้าต่างสมมาตร และใช้การใส่ใจแบบทั่วโลกในทุกๆ เลเยอร์ที่หกและเลเยอร์สุดท้าย

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

262Mพารามิเตอร์ (รุ่นเล็ก)
793Mพารามิเตอร์ (รุ่นใหญ่)
51.3หน้า/วินาที บน L40S

สำหรับกระบวนการฝึกอบรมล่วงหน้าใช้การแพร่กระจายแบบถูกปิดกั้นแบบไม่ต่อเนื่อง over ข้อความ โดยส่วนที่เป็นข้อความอย่างเดียวจะมีอัตราการทุจริตตั้งแต่ 0 ถึง 1 ส่วนส่วน Multimodal จะอยู่ที่ 0.30 ถึง 1 เพื่อบังคับให้โมเดลต้องอ่านหน้ากระดาษอย่างละเอียด ผลการทดสอบพิสูจน์แล้วว่าแพตช์หน้ากระดาษที่มองเห็นได้ช่วยเพิ่มความแม่นยำของโทเค็นที่ถูกปิดกั้นขึ้น 38.4 จุดสำหรับรุ่น 260M และ 40.5 จุดสำหรับรุ่น 800M ผ่านการประมวลผลโทเค็นประมาณ 524 พันล้านโทเค็นบนฮาร์ดแวร์ H100

"H Company has released NeoMME, a family of 260M and 800M bidirectional encoders that drops both components."

H Company

การตัด Vision Tower และ Causal Decoder ออกใน NeoMME ถือเป็นแนวทางสำคัญในการลดความซับซ้อนของสถาปัตยกรรม Vision-Language Models (VLMs) แบบดั้งเดิม ซึ่งมักแยกส่วนประมวลผลภาพออกต่างหาก การรวมสถาปัตยกรรมมาไว้ใน Single-Tower ช่วยเพิ่มความเร็วในการประมวลผลเอกสารและลดการใช้ทรัพยากรหน่วยความจำอย่างมีนัยสำคัญ เหมาะสำหรับการนำไปประยุกต์ใช้ในระบบค้นหาเอกสารองค์กรที่ต้องการความเร็วสูง

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้