Kiểm thử skill claude ai — Bài 5 · Claude Wiki
Bài 05Phần 2 · Kỹ thuật

Kiểm thử và lặp lại
Testing Framework

Kiểm thử skill Claude AI qua ba cấp và ba loại test. Skill viết xong chưa phải là skill dùng được — cần biết chính xác nó hỏng ở đâu.

🎯 Mục tiêu bài học

  • Chạy kiểm thử skill theo 3 cấp độ, từ thủ công tới tự động hoá.
  • Phân biệt 3 loại test và biết mỗi loại trả lời câu hỏi gì.
  • Chẩn đoán chính xác lỗi undertriggering, overtriggering và execution.
  • Áp dụng vòng lặp Claude A / Claude B mà Anthropic khuyến nghị để tinh chỉnh skill.
BA CẤP KIỂM THỬ

Thang kiểm thử từ thấp lên cao

1

Cấp 1 — Manual: upload trực tiếp lên Claude.ai

Nhanh nhất để bắt lỗi thô. Nén skill thành file zip, upload qua Settings, rồi gõ 5 cách diễn đạt khác nhau xem skill có thức dậy không. Phù hợp vòng lặp đầu tiên.

2

Cấp 2 — Scripted: chạy qua Claude Code trong terminal

Đặt skill vào ~/.claude/skills/ hoặc .claude/skills/ của dự án, chạy các kịch bản thật. Claude Code tự phát hiện thay đổi file trong phiên nên vòng lặp sửa và thử rất nhanh.

3

Cấp 3 — Programmatic: bộ test tự động qua Skills API

Dựng suite chạy toàn bộ kịch bản đánh giá qua endpoint /v1/skills. Phù hợp khi skill đã ổn định và bạn cần bảo đảm không hồi quy sau mỗi lần sửa.

BA LOẠI TEST

Mỗi loại trả lời một câu hỏi khác nhau

1

Triggering — skill có thức dậy đúng lúc không?

Gõ ít nhất 5 cách diễn đạt khác nhau cho cùng một yêu cầu. Mục tiêu tỷ lệ kích hoạt trên 90%. Đồng thời gõ vài yêu cầu không liên quan để chắc chắn skill không bắt nhầm.

2

Functional — output có đúng chuẩn không?

Kết quả tạo ra có bám đúng template quy định không? Có đủ các mục bắt buộc không? Có bịa dữ liệu không có trong nguồn không?

3

Performance — có tiết kiệm thật không?

So với gõ prompt tay: tốn ít token hơn bao nhiêu, giảm được mấy lượt hỏi lại? Nếu skill khiến cuộc hội thoại dài hơn thì nó đang phản tác dụng.

CHẨN ĐOÁN BỆNH

Triệu chứng — nguyên nhân — cách chữa

Triệu chứngNguyên nhân gốcCách chữa
Undertriggering — skill bỏ sót, không thức dậyDescription thiếu từ khoá người dùng thực sự gõBổ sung các cách diễn đạt đa dạng vào description, gồm cả tiếng Anh lẫn tiếng Việt nếu team dùng cả hai
Overtriggering — skill bắt nhầm, quá nhạyDescription quá chung chung, phủ quá rộngThu hẹp phạm vi và thêm điều kiện phủ định: quy định rõ khi nào KHÔNG dùng skill
Execution — skill thức dậy nhưng làm saiThiếu quy tắc hoặc thiếu ngữ cảnh trong phần thânTinh chỉnh hướng dẫn cốt lõi, bổ sung file mẫu hoặc ví dụ đầu vào và đầu ra
Claude đọc file nhưng bỏ qua nội dungTham chiếu lồng quá sâu — file A trỏ B, B trỏ CGiữ mọi tham chiếu chỉ một tầng từ SKILL.md để Claude đọc trọn file
Claude chỉ đọc lướt file dàiFile tham chiếu quá dài, Claude preview bằng lệnh xem đầu fileFile dài hơn 100 dòng phải có mục lục ở đầu
QUY TRÌNH ANTHROPIC KHUYẾN NGHỊ

Vòng lặp Claude A và Claude B

1

Claude A — người viết skill

Làm việc với một phiên Claude để thiết kế và tinh chỉnh skill. Claude hiểu định dạng SKILL.md một cách tự nhiên, bạn chỉ cần yêu cầu: "Tạo skill đóng gói quy trình chúng ta vừa làm."

2

Claude B — người dùng skill

Mở một phiên hoàn toàn mới đã nạp skill, giao tác vụ thật. Quan sát: Claude B có tìm đúng thông tin không, có áp dụng đúng quy tắc không, có bỏ sót bước nào không.

3

Quan sát và mang phản hồi ngược lại

Ghi cụ thể chỗ Claude B trượt. Ví dụ: "Khi tôi xin báo cáo theo vùng, Claude quên lọc tài khoản test dù skill có ghi quy tắc này."

4

Claude A đề xuất sửa

Đưa nguyên văn SKILL.md hiện tại kèm mô tả hiện tượng. Claude A sẽ gợi ý sắp xếp lại để quy tắc nổi bật hơn, hoặc dùng từ ngữ mạnh hơn.

5

Lặp lại theo sử dụng thật

Tiếp tục chu kỳ quan sát — tinh chỉnh — kiểm thử với tác vụ thật, không phải kịch bản giả. Mỗi vòng lặp cải thiện skill dựa trên hành vi quan sát được.

🔬
Pro tip: lặp trên tác vụ KHÓ NHẤT trướcĐừng bắt đầu bằng ví dụ dễ. Hãy lấy tác vụ khó nhất, mơ hồ nhất trong nhóm việc bạn muốn tự động hoá, gõ prompt tay tới khi ra kết quả ưng ý, rút ra prompt chiến thắng đó rồi mới code vào skill. Skill nào giải được ca khó nhất thì đương nhiên giải được mọi ca dễ hơn.

🧪 Test với mọi model bạn định dùng

Skill là phần bổ sung cho model, nên hiệu quả phụ thuộc vào model bên dưới. Cùng một skill: với Haiku 4.5 hãy hỏi "hướng dẫn đã đủ chi tiết chưa"; với Sonnet 5 hỏi "đã rõ ràng và hiệu quả chưa"; với Opus 5 hỏi "có đang giải thích thừa không". Cái hoàn hảo cho Opus có thể quá sơ sài cho Haiku.

CÂU HỎI THƯỜNG GẶP

FAQ — 3 câu hỏi thường gặp về kiểm thử skill claude ai

Ba loại test cần chạy cho một skill là gì?

Triggering — skill có thức dậy đúng lúc không (gõ 5 cách diễn đạt khác nhau, mục tiêu trên 90%). Functional — output có đúng chuẩn template không. Performance — có tiết kiệm token và giảm số lượt hỏi lại thật không.

Skill không tự kích hoạt thì sửa thế nào?

Đó là lỗi undertriggering — nguyên nhân là description thiếu từ khoá người dùng thực sự gõ. Bổ sung các cách diễn đạt đa dạng vào description, gồm cả tiếng Anh lẫn tiếng Việt nếu team dùng cả hai. Ngược lại, skill bắt nhầm là overtriggering — cần thu hẹp phạm vi và thêm điều kiện phủ định.

Vòng lặp Claude A / Claude B hoạt động thế nào?

Claude A là phiên giúp bạn thiết kế và tinh chỉnh skill. Claude B là phiên mới đã nạp skill, dùng làm tác vụ thật. Bạn quan sát Claude B trượt ở đâu rồi mang phản hồi cụ thể ngược lại cho Claude A để sửa. Lặp theo sử dụng thật, không theo kịch bản giả.

Nguồn: Bài viết biên soạn dựa trên tài liệu Xây dựng bộ Skills cho Claude (Anthropic Academy, bản tiếng Việt do Nguyen Ngoc Tuan trình bày), đã viết lại và đối chiếu với tài liệu Agent Skills chính thức của Anthropic (platform.claude.com và code.claude.com), cập nhật 15/08/2026. Mọi số liệu kỹ thuật lấy theo tài liệu chính thức.