ข้ามไปเนื้อหาหลัก

Anthropic เปิดตัวระบบประเมินปลั๊กอินสำหรับ Claude Code

Anthropic เพิ่มฟีเจอร์ประเมินปลั๊กอินใน Claude Code v2.1.269 ขึ้นไป รองรับ 6 รูปแบบการตรวจ วัดผลเทียบเคียง และระบบ CI Gate สำหรับทักษะ

เรียบเรียงโดย AI
Inewgen
12 Sep 2026ที่มา: MarkTechPost3 นาทีอ่าน (0 ครั้ง)
แชร์
Anthropic เปิดตัวระบบประเมินปลั๊กอินสำหรับ Claude Code

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ขนาดตัวอักษร
  • รองรับ Claude Code v2.1.269 ขึ้นไปและเรียกเก็บเงินตามการใช้งานจริงผ่าน API
  • ชุดประเมินจัดเก็บในโฟลเดอร์ evals/ ของปลั๊กอินพร้อมระบุเงื่อนไขการทำงาน
  • มีเครื่องมือตรวจวัด 6 แบบ ทั้งแบบคำนวณอัตโนมัติและเรียกใช้โมเดลตัดสิน
  • เปรียบเทียบผลลัพธ์ระหว่างกรณีเปิดและปิดใช้งานปลั๊กอินเพื่อหาค่า Δ ที่แท้จริง

Anthropic ได้เพิ่มความสามารถในการประเมินปลั๊กอินหรือ Plugin Evaluations เข้าสู่ Claude Code ตั้งแต่เวอร์ชัน v2.1.269 เป็นต้นไป เพื่อช่วยให้นักพัฒนาสามารถทดสอบและวัดประสิทธิภาพของปลั๊กอินและทักษะต่างๆ ได้อย่างเป็นระบบ โดยเครื่องมือนี้รองรับการทำงานกับไดเรกทอรีที่มีไฟล์ manifest เช่น plugin.json หรือไดเรกทอรีทักษะ ทั้งนี้การรันประเมินทุกครั้งจะนับเป็นการเรียกใช้โมเดลจริงและมีการคิดค่าใช้จ่ายตามแพ็กเกจหรือบัญชี API ของผู้ใช้งาน

โครงสร้างของชุดประเมินจะถูกจัดเก็บไว้ภายในโฟลเดอร์ evals/ ของตัวปลั๊กอิน โดยแต่ละกรณีทดสอบ (test case) จะเป็นโฟลเดอร์ย่อยที่บรรจุไฟล์ prompt.md และโฟลเดอร์ graders/ สำหรับเนื้อหาใน prompt.md จะถูกส่งตรงไปยัง Claude ตามตัวอักษรโดยไม่มีการขยายเครื่องหมาย @path ส่วนชุดคำสั่ง frontmatter จะทำหน้าที่กำหนดค่าต่างๆ เช่น จำนวนรอบสูงสุด (max_turns) กำหนดเวลา (timeout_seconds) รุ่นของโมเดล แท็ก และเครื่องมือที่อนุญาตให้ใช้งาน

software developer computer workspace notebook computer office desk workspace

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง

ในส่วนของเครื่องมือตรวจวัดหรือ Graders จะอยู่ในรูปของไฟล์ Markdown ที่กำหนดประเภท (type) น้ำหนัก (weight) และอาร์ม (arm) ผ่านทาง frontmatter โดยมีประเภททั้งหมด 6 แบบ ดังนี้:

  • regex: ตรวจสอบจากข้อความถอดบทสนทนาและไฟล์บนดิสก์ (ไม่เสียค่าใช้จ่าย)
  • tool_used: ตรวจสอบการเรียกใช้เครื่องมือ (ไม่เสียค่าใช้จ่าย)
  • tool_order: ตรวจสอบลำดับการเรียกใช้เครื่องมือ (ไม่เสียค่าใช้จ่าย)
  • file_exists: ตรวจสอบการมีอยู่ของไฟล์ (ไม่เสียค่าใช้จ่าย)
  • llm: ใช้โมเดลผู้ตัดสินให้คะแนนตามเกณฑ์ข้อความที่กำหนด (มีค่าใช้จ่าย)
  • baseline: เปรียบเทียบผลลัพธ์กับคำตอบอ้างอิง (มีค่าใช้จ่าย)

การเพิ่มระบบประเมินปลั๊กอินเข้ามาใน Claude Code ถือเป็นการยกระดับกระบวนการพัฒนา AI Agents ไปอีกขั้น เนื่องจากที่ผ่านมาชุมชนนักพัฒนามักพบปัญหาว่าโมเดลไม่เลือกใช้ทักษะที่สร้างขึ้นแม้ตัวโค้ดหรือชุดคำสั่งจะถูกต้องตามหลักไวยากรณ์ การวัดผลเปรียบเทียบระหว่างเปิดและปิดปลั๊กอิน (Δ) จึงช่วยให้เห็นประสิทธิภาพที่แท้จริงและลดช่องว่างระหว่างการทดสอบในห้องแล็บกับการใช้งานจริงในสภาพแวดล้อมการทำงาน

ไม่อยากพลาดข่าวใหม่?

สมัครรับสรุปข่าวสารใหม่ทางอีเมล ไม่บ่อยจนรำคาญ

โฆษณา

ตามค่าเริ่มต้น ระบบจะทำการทดสอบกรณีละสองรอบ ได้แก่ รอบที่เปิดใช้งานปลั๊กอินและรอบที่ไม่มีการโหลดปลั๊กอิน เพื่อนำผลลัพธ์มาหาค่าความต่างหรือค่า Δ ซึ่งสะท้อนถึงประสิทธิภาพที่ปลั๊กอินนั้นสร้างขึ้นจริงๆ หากกรณีทดสอบได้คะแนน 1.0 ทั้งสองรอบ แสดงว่าปลั๊กอินไม่ได้เป็นสาเหตุที่ทำให้ผ่านการทดสอบนั้น นอกจากนี้ยังมีคำสั่ง claude plugin eval init ที่คอยช่วยอ่านปลั๊กอิน สัมภาษณ์ความต้องการ สร้างกรณีทดสอบเบื้องต้น และเขียนไฟล์ให้อัตโนมัติ หรือใช้คำสั่ง --bare สำหรับการรันบนระบบ CI

"Anthropic calls out the most common first finding: a Δ near zero with the tool_used: Skill grader failing, which means Claude is not choosing the skill on natural phrasing."

MarkTechPost

รายงานผลลัพธ์จะถูกบันทึกไว้ในไดเรกทอรี evals/results/ พร้อมรายละเอียดคำตัดสินและคะแนนจากผู้ตรวจ นอกจากนี้ระบบยังรองรับการเผยแพร่รายงานไปยัง claude.ai โดยอัตโนมัติหากบัญชีผู้ใช้รองรับ ยกเว้นว่าจะมีการระบุคำสั่ง --no-publish เพื่อปิดการใช้งานดังกล่าว สำหรับการรันบนระบบ CI ทางเอกสารได้แนะนำรูปแบบคำสั่งที่กำหนดขีดจำกัดต้นทุนสูงสุดด้วยพารามิเตอร์ --max-cost-usd 20 พร้อมระบุความจำเป็นในการติดตั้ง Claude Code และชุดข้อมูลรับรองเช่น ANTHROPIC_API_KEY

ที่มา: MarkTechPost

ความคิดเห็น

แสดงความคิดเห็น
0/2000

พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้