medición abierta de agent skills

Las opiniones abundan. La evidencia escasea.

Batuta es una capa abierta de medición para Agent Skills: enrutamiento local, grupo de control explícito y resultados públicos vinculados con la evidencia bruta.

Línea base medida

0skills con muestra publicable
91 mspara indexar 506 skills
136 msen 50 rutas, incluido el arranque
15 / 15pruebas de conformidad superadas

Benchmark local registrado en la línea base auditada 9fa7471 el 24 de agosto de 2026. Son mediciones con procedencia, no resultados del ecosistema ni garantías para el dispositivo actual.

Batuta Zero

Un embudo, no una puntuación por estrellas

01

El enrutador es la referencia, no el producto

Un binario de Rust sin dependencias indexa las skills instaladas y ordena las coincidencias localmente con BM25. La capa de medición está diseñada para funcionar también con otros enrutadores. El silencio es un resultado válido cuando la coincidencia es débil.

02

La causalidad necesita un brazo de control

Un holdout declarado mantiene el enrutador en silencio durante una proporción configurable de los turnos. Comparar resultados con y sin sugerencia es más útil que confundir correlación con mejora causal.

03

Ningún resultado sin denominador

Las clasificaciones publicadas exigen varias instalaciones e incluyen conteos, contexto del modelo, versión del protocolo y sesgo declarado de la muestra. Una clasificación vacía es más creíble que una anécdota bien presentada.

código abierto · reproducible

Empieza por la evidencia

El repositorio contiene el protocolo, la batería congelada, los esquemas, la implementación y los comandos usados para reproducir la línea base medida.

LAB · phase 0

Lo que el LAB está midiendo ahora

La fase cero publica agregados limitados de ejecuciones confiables del LAB. Los prompts, secretos, firmas, recibos y contenido de proyectos nunca aparecen aquí.

Cargando agregados verificados del LAB…