
Anthropic представила claude plugin eval — инструмент для объективной оценки полезности плагинов в Claude Code через автоматические A/B тесты и детальные HTML-отчеты.
Разработчики из Anthropic представили важное обновление для своего CLI-инструмента Claude Code. Теперь в арсенале программистов появилась команда claude plugin eval, предназначенная для объективного тестирования и оценки эффективности дополнений (плагинов) и «навыков» (Skills). Это нововведение решает одну из главных проблем разработки расширений для больших языковых моделей — отсутствие простых и понятных метрик, подтверждающих реальную пользу конкретного инструмента для качества ответов нейросети.
Основная идея claude plugin eval заключается в проведении автоматизированных A/B тестов. Вместо того чтобы полагаться на субъективные ощущения от нескольких ручных запросов, разработчик получает структурированную аналитику. Процесс оценки разделен на несколько этапов:
Такой подход позволяет разработчикам выявлять регрессии и находить «узкие места» в логике плагинов еще до их масштабного внедрения в рабочие процессы.
Интеграция инструмента в рабочий процесс происходит через стандартный терминал. Для начала работы необходимо перейти в директорию с плагином и инициализировать окружение командой claude plugin eval init. После завершения первичной настройки и калибровки тестов, основной запуск осуществляется через claude plugin eval.
Результатом работы команды становится подробный отчет в формате HTML. В нем наглядно отображаются все кейсы, оценки и разница в ответах. Это упрощает визуальный аудит и позволяет быстро делиться результатами тестов внутри команды разработчиков.
Поскольку процесс оценки подразумевает множественные обращения к модели, выполнение тестов расходует токены. Чтобы избежать чрезмерных трат на этапе отладки самих тестов, разработчики рекомендуют использовать флаг --runs 1. Это ограничит количество повторений каждого кейса и позволит убедиться в правильности настройки без лишних затрат API-ресурсов.
Особое внимание в документации уделено безопасности. Плагины, включая MCP-серверы (Model Context Protocol) и другие компоненты, получают те же права доступа, что и сам пользователь в текущей сессии. Anthropic настоятельно рекомендует использовать plugin eval только для проверки тех инструментов, которым вы доверяете, так как в процессе выполнения тестов плагины могут взаимодействовать с файловой системой или внешними сервисами от вашего имени.
Новый функционал уже доступен в рамках Claude Code. Ознакомиться с техническими подробностями и примерами конфигурации можно в официальной документации проекта. Инструмент станет важным звеном в создании качественных расширений, позволяя разработчикам опираться на данные, а не на догадки.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.