Sakana AI เปิดตัว PC-ALM ฝึกเครือข่ายลึก 1,000 ชั้น
ทีมนักวิจัย Sakana AI นำเสนอ PC-ALM ทางเลือกใหม่ทดแทน Backpropagation ที่ฝึกเครือข่ายความลึก 1,000 ชั้นได้ พร้อมโค้ดอ้างอิงบน JAX

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- Sakana AI เสนอ PC-ALM ทางเลือกทดแทน Backpropagation แบบ Layer-Local
- แก้ปัญหา Credit Signal จางหายในเครือข่ายที่ลึกและแคบได้สำเร็จ
- ทดสอบฝึกเครือข่ายลึกถึง 1,000 ชั้นบนชุดข้อมูล MNIST สำเร็จ
- มีโค้ดอ้างอิง JAX อนุญาตใช้งานภายใต้สัญญาอนุญาต MIT บน GitHub
ทีมนักวิจัยจาก Sakana AI ได้พัฒนาอัลกอริทึมการฝึกโมเดลปัญญาประดิษฐ์ตัวใหม่ในชื่อ PC-ALM ซึ่งเป็นวิธีการฝึกแบบ Layer-Local เพื่อใช้เป็นทางเลือกแทนกระบวนการ Backpropagation แบบดั้งเดิม โดยโครงสร้างนี้มุ่งแก้ปัญหาข้อจำกัดของวิธี Predictive Coding (PC) แบบเดิม ที่มักประสบปัญหาการส่งผ่านสัญญาณเครดิต (Credit Signal) ไม่ถึงชั้นต้นๆ ในเครือข่ายที่มีความลึกแต่แคบ
หลักการทำงานของ Predictive Coding (PC) จะมองการทำงานของ Hidden Activation ทุกตัวให้เป็นตัวแปรสำหรับการปรับแต่ง (Optimization Variable) พร้อมลงโทษค่าความคลาดเคลื่อนกำลังสอง (Squared Mismatch) ระหว่าง Activation ของแต่ละชั้นกับการคาดการณ์จากชั้นด้านล่าง กระบวนการอนุมาน (Inference) จึงเป็นการทำ Gradient Descent บนพลังงานดังกล่าว ขณะที่การเรียนรู้จะใช้การปรับน้ำหนักแบบ Hebbian แต่ข้อจำกัดสำคัญคือสัญญาณกำกับดูแลจะเข้าทางเอาต์พุตและต้องกระจายผ่านเครือข่าย ซึ่ง Innocenti และคณะเคยระบุช่องว่างระหว่าง PC กับ Backpropagation ว่าแย่ที่สุดเมื่อความกว้างน้อยกว่าความลึก
การที่ PC-ALM เข้ามาแก้ปัญหาความต่างระหว่าง Predictive Coding และ Backpropagation ถือเป็นก้าวสำคัญ เพราะ Backpropagation แม้จะมีประสิทธิภาพสูงแต่ต้องอาศัยการส่งข้อมูลย้อนกลับตลอดทั้งเครือข่าย ซึ่งสิ้นเปลืองหน่วยความจำและยากต่อการประมวลผลแบบขนานในเชิงฮาร์ดแวร์ การใช้แนวทาง Layer-Local จึงเปิดโอกาสให้ระบบฝึกโครงข่ายขนาดใหญ่ได้อย่างอิสระมากขึ้นในแต่ละชั้น
สำหรับการอนุมาน PC-ALM จะสลับการทำงาน 2 ขั้นตอนในระดับท้องถิ่น ประกอบด้วย Primal Gradient Step บน Activation และ Dual Step แบบ ที่สะสมค่าความผิดพลาดการคาดการณ์ของชั้นนั้นๆ ทีมวิจัยมองว่าโครงสร้างนี้เทียบเท่ากับตัวควบคุมแบบ PI (Proportional-Integral Controller) ในแต่ละชั้น โดยค่าความผิดพลาดทำหน้าที่เป็นสัดส่วน (Proportional) และตัวคูณทำหน้าที่เป็นปริพันธ์ (Integral) ซึ่งเมื่อกำหนด จะได้วิธีตัวคูณแบบคลาสสิก

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ทีมวิจัยได้ทำการทดสอบด้วยการกวาดค่าความกว้างและความลึกของ Residual MLP ตั้งแต่ 8 ถึง 128 บนชุดข้อมูล Fashion-MNIST และ MNIST ภายใต้พารามิเตอร์แบบ Mean-field เป็นเวลา 1 Epoch ด้วยงบประมาณการอนุมาน พบว่า PC-ALM สามารถทำผลงานได้ทัดเทียมกับ Backpropagation ในทุกความกว้าง ความลึก และฟังก์ชันการใช้งาน (Identity, tanh, ReLU) ในขณะที่วิธี PC แบบเดิมจะตกลงอย่างมากในเซลล์ที่ลึกและแคบ
"เซลล์อ้างอิงในที่เก็บข้อมูล (ความกว้าง 32, ความลึก 32, ReLU, Fashion-MNIST) รายงานความแม่นยำในการทดสอบที่ 78.66% สำหรับ Backpropagation, 68.13% สำหรับ PC และ 77.75% สำหรับ PC-ALM โดยมีความ cosine ของ Gradient เทียบกับ Backpropagation เพิ่มขึ้นจาก 0.604 เป็น 0.909"
Sakana AI Research Team
งานวิจัยชิ้นนี้ยังขยายขอบเขตการทดสอบไปยัง Residual MLP ความลึก 1,000 ชั้น บนชุดข้อมูล MNIST เป็นเวลา 5 Epoch ซึ่งให้ผลลัพธ์อยู่ในเกณฑ์ที่ต่างจาก Backpropagation เพียงราว 2 เปอร์เซ็นต์เท่านั้น นอกจากนี้ PC-ALM ยังแสดงให้เห็นถึงประสิทธิภาพที่ดีกว่า PC ในทุกชุดข้อมูลทดลอง รวมถึง ResNet-18 บน CIFAR-10 และ Tiny ImageNet อีกด้วย
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น