Anthropic wprowadził nowy workflow ewaluacji pluginów dla Claude Code, który umożliwia deweloperom precyzyjny pomiar efektywności swoich rozszerzeń. Narzędzie claude plugin eval command uruchamia plugin wobec realistycznych promptów, ocenia wygenerowaną odpowiedź i porównuje ją z wynikami działania modelu bez załadowanego pluginu. To rozwiązuje trzy kluczowe pytania, na które deweloperzy nie potrafili wcześniej odpowiedzieć - czy skill zostaje prawidłowo wyzwolony, czy przetrwa edycję lub przejście na nowy model, oraz czy naprawdę przewyższa bazowy model bez dodatkowych narzędzi.

Systemem ewaluacji są przypadki testowe umieszczane w katalogu evals/ wewnątrz pluginu. Każdy przypadek to poddirectory zawierający plik prompt.md i folder graders/. Deweloperzy mogą definiować maksymalną liczbę turów (domyślnie 10), timeout (domyślnie 300 sekund) oraz wybrane modele. Kluczowa innowacja to sześć typów oceniających - cztery bezkosztowe, które analizują transkrypt i pliki na dysku (regex, tool_used, tool_order, file_exists), oraz dwa płatne opierające się na modelach (llm do oceny odpowiedzi względem kryteriów oraz baseline porównujący z odpowiedzią referencyjną). Komenda claude plugin eval init automatycznie inicjalizuje strukturę ewaluacji dla pluginu.

Rozwiązanie jest wdrażalne już teraz dla Claude Code v2.1.269 i nowszych, obsługując pluginy zarówno w formacie plugin.json, .claude-plugin/plugin.json, jak i skills-directory. Ważne jest, że każde uruchomienie ewaluacji i użycie oceniającego modelu generuje rzeczywiste wywołania modelu, które są rozliczane na planie lub koncie API użytkownika. To podejście pozwala deweloperom na ciągłą integrację (CI gate) sprawdzania umiejętności swoich pluginów.