La inteligencia artificial está avanzando a pasos agigantados, y con ella, la necesidad de herramientas que permitan a los desarrolladores no solo crear, sino también validar y mejorar sus creaciones. En este contexto, Anthropic ha dado un paso audaz al introducir un nuevo flujo de trabajo de evaluación de plugins para Claude Code. Esta innovación, denominada ‘claude plugin eval’, no es solo una mejora incremental; es un cambio de paradigma en cómo se mide la efectividad y la fiabilidad de las extensiones para modelos de lenguaje grandes (LLMs).
¿Cómo Funciona la Autoevaluación de Claude?
La premisa es simple pero poderosa: el comando ‘claude plugin eval’ ejecuta un plugin contra prompts realistas, califica la respuesta generada por Claude y, crucialmente, la compara con una ejecución donde el plugin no está activo. Esto permite responder tres preguntas fundamentales que antes eran difíciles de cuantificar: ¿se activa la habilidad deseada? ¿sobrevive a una edición o a un nuevo modelo? ¿y supera a un modelo básico sin el plugin? La capacidad de desplegar esta herramienta en Claude Code v2.1.269 o superior, contra cualquier directorio de plugin, la hace accesible y práctica para la comunidad de desarrolladores. Es importante notar que cada ejecución de evaluación y cada calificador (grader) implican llamadas al modelo, lo que se facturará a tu plan o cuenta API, un detalle a tener en cuenta para la gestión de costos.
Seis Tipos de Calificadores: Gratis y de Pago
El sistema de evaluación se apoya en seis tipos de calificadores, cada uno diseñado para arrojar luz sobre diferentes aspectos del rendimiento del plugin. Cuatro de ellos son computacionales y no generan costos adicionales: ‘regex’ (expresiones regulares), ‘tool_used’ (herramienta utilizada), ‘tool_order’ (orden de las herramientas) y ‘file_exists’ (archivo existente). Estos analizan la salida del modelo y los archivos en disco. Los otros dos, ‘llm’ y ‘baseline’, sí implican una llamada a un modelo juez, lo que añade un costo pero proporciona una evaluación más profunda. ‘llm’ califica la respuesta basándose en criterios de prosa definidos por el desarrollador, mientras que ‘baseline’ compara la salida del plugin con una respuesta de referencia. La herramienta ‘claude plugin eval init’ asiste en la creación de estos casos y calificadores, simplificando el proceso inicial.
El Poder del Delta (Δ) y la Puerta de Enlace CI
El verdadero valor de esta herramienta reside en el concepto de ‘delta’ (Δ). Por defecto, cada caso se ejecuta dos veces: una con el plugin cargado (‘with-arm’) y otra sin él (‘without-arm’). La diferencia entre ambas puntuaciones es lo que el plugin realmente aportó. Si un caso obtiene la misma puntuación en ambas ejecuciones, significa que el plugin no fue el factor determinante para su éxito. Un hallazgo común, y que Anthropic destaca, es un Δ cercano a cero junto con un fallo en el calificador ‘tool_used: Skill’. Esto indica que Claude no está seleccionando la habilidad del plugin ante una formulación natural del prompt, un defecto que herramientas de validación previas no podían detectar. La integración de esta evaluación en flujos de Integración Continua (CI) a través de parámetros como ‘–threshold’ y ‘–max-cost-usd’ convierte a ‘claude plugin eval’ en una puerta de enlace robusta para asegurar la calidad y el rendimiento de los plugins antes de su despliegue.