Anthropic เปิดตัวระบบประเมินปลั๊กอินสำหรับ Claude Code
Anthropic เพิ่มฟีเจอร์ประเมินปลั๊กอินใน Claude Code v2.1.269 ขึ้นไป รองรับ 6 รูปแบบการตรวจ วัดผลเทียบเคียง และระบบ CI Gate สำหรับทักษะ

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
- รองรับ Claude Code v2.1.269 ขึ้นไปและเรียกเก็บเงินตามการใช้งานจริงผ่าน API
- ชุดประเมินจัดเก็บในโฟลเดอร์ evals/ ของปลั๊กอินพร้อมระบุเงื่อนไขการทำงาน
- มีเครื่องมือตรวจวัด 6 แบบ ทั้งแบบคำนวณอัตโนมัติและเรียกใช้โมเดลตัดสิน
- เปรียบเทียบผลลัพธ์ระหว่างกรณีเปิดและปิดใช้งานปลั๊กอินเพื่อหาค่า Δ ที่แท้จริง
Anthropic ได้เพิ่มความสามารถในการประเมินปลั๊กอินหรือ Plugin Evaluations เข้าสู่ Claude Code ตั้งแต่เวอร์ชัน v2.1.269 เป็นต้นไป เพื่อช่วยให้นักพัฒนาสามารถทดสอบและวัดประสิทธิภาพของปลั๊กอินและทักษะต่างๆ ได้อย่างเป็นระบบ โดยเครื่องมือนี้รองรับการทำงานกับไดเรกทอรีที่มีไฟล์ manifest เช่น plugin.json หรือไดเรกทอรีทักษะ ทั้งนี้การรันประเมินทุกครั้งจะนับเป็นการเรียกใช้โมเดลจริงและมีการคิดค่าใช้จ่ายตามแพ็กเกจหรือบัญชี API ของผู้ใช้งาน
โครงสร้างของชุดประเมินจะถูกจัดเก็บไว้ภายในโฟลเดอร์ evals/ ของตัวปลั๊กอิน โดยแต่ละกรณีทดสอบ (test case) จะเป็นโฟลเดอร์ย่อยที่บรรจุไฟล์ prompt.md และโฟลเดอร์ graders/ สำหรับเนื้อหาใน prompt.md จะถูกส่งตรงไปยัง Claude ตามตัวอักษรโดยไม่มีการขยายเครื่องหมาย @path ส่วนชุดคำสั่ง frontmatter จะทำหน้าที่กำหนดค่าต่างๆ เช่น จำนวนรอบสูงสุด (max_turns) กำหนดเวลา (timeout_seconds) รุ่นของโมเดล แท็ก และเครื่องมือที่อนุญาตให้ใช้งาน

ภาพประกอบจากคลังภาพสต็อก ไม่ใช่ภาพจากเหตุการณ์จริง
ในส่วนของเครื่องมือตรวจวัดหรือ Graders จะอยู่ในรูปของไฟล์ Markdown ที่กำหนดประเภท (type) น้ำหนัก (weight) และอาร์ม (arm) ผ่านทาง frontmatter โดยมีประเภททั้งหมด 6 แบบ ดังนี้:
- regex: ตรวจสอบจากข้อความถอดบทสนทนาและไฟล์บนดิสก์ (ไม่เสียค่าใช้จ่าย)
- tool_used: ตรวจสอบการเรียกใช้เครื่องมือ (ไม่เสียค่าใช้จ่าย)
- tool_order: ตรวจสอบลำดับการเรียกใช้เครื่องมือ (ไม่เสียค่าใช้จ่าย)
- file_exists: ตรวจสอบการมีอยู่ของไฟล์ (ไม่เสียค่าใช้จ่าย)
- llm: ใช้โมเดลผู้ตัดสินให้คะแนนตามเกณฑ์ข้อความที่กำหนด (มีค่าใช้จ่าย)
- baseline: เปรียบเทียบผลลัพธ์กับคำตอบอ้างอิง (มีค่าใช้จ่าย)
การเพิ่มระบบประเมินปลั๊กอินเข้ามาใน Claude Code ถือเป็นการยกระดับกระบวนการพัฒนา AI Agents ไปอีกขั้น เนื่องจากที่ผ่านมาชุมชนนักพัฒนามักพบปัญหาว่าโมเดลไม่เลือกใช้ทักษะที่สร้างขึ้นแม้ตัวโค้ดหรือชุดคำสั่งจะถูกต้องตามหลักไวยากรณ์ การวัดผลเปรียบเทียบระหว่างเปิดและปิดปลั๊กอิน (Δ) จึงช่วยให้เห็นประสิทธิภาพที่แท้จริงและลดช่องว่างระหว่างการทดสอบในห้องแล็บกับการใช้งานจริงในสภาพแวดล้อมการทำงาน
ตามค่าเริ่มต้น ระบบจะทำการทดสอบกรณีละสองรอบ ได้แก่ รอบที่เปิดใช้งานปลั๊กอินและรอบที่ไม่มีการโหลดปลั๊กอิน เพื่อนำผลลัพธ์มาหาค่าความต่างหรือค่า Δ ซึ่งสะท้อนถึงประสิทธิภาพที่ปลั๊กอินนั้นสร้างขึ้นจริงๆ หากกรณีทดสอบได้คะแนน 1.0 ทั้งสองรอบ แสดงว่าปลั๊กอินไม่ได้เป็นสาเหตุที่ทำให้ผ่านการทดสอบนั้น นอกจากนี้ยังมีคำสั่ง claude plugin eval init ที่คอยช่วยอ่านปลั๊กอิน สัมภาษณ์ความต้องการ สร้างกรณีทดสอบเบื้องต้น และเขียนไฟล์ให้อัตโนมัติ หรือใช้คำสั่ง --bare สำหรับการรันบนระบบ CI
"Anthropic calls out the most common first finding: a Δ near zero with the tool_used: Skill grader failing, which means Claude is not choosing the skill on natural phrasing."
MarkTechPost
รายงานผลลัพธ์จะถูกบันทึกไว้ในไดเรกทอรี evals/results/ พร้อมรายละเอียดคำตัดสินและคะแนนจากผู้ตรวจ นอกจากนี้ระบบยังรองรับการเผยแพร่รายงานไปยัง claude.ai โดยอัตโนมัติหากบัญชีผู้ใช้รองรับ ยกเว้นว่าจะมีการระบุคำสั่ง --no-publish เพื่อปิดการใช้งานดังกล่าว สำหรับการรันบนระบบ CI ทางเอกสารได้แนะนำรูปแบบคำสั่งที่กำหนดขีดจำกัดต้นทุนสูงสุดด้วยพารามิเตอร์ --max-cost-usd 20 พร้อมระบุความจำเป็นในการติดตั้ง Claude Code และชุดข้อมูลรับรองเช่น ANTHROPIC_API_KEY
ที่มา: MarkTechPost
พบข้อมูลผิดพลาดในบทความนี้? แจ้งปัญหาบทความนี้
ความคิดเห็น
แสดงความคิดเห็น