EvalCore hace que las pruebas de regresión de LLM se sientan amigables con CI al reproducir el comportamiento del modelo grabado offline sin claves de API ni llamadas de red inestables.

Reseñas sobre EvalCore
Su punto dulce es estrecho: si no temes ya las regresiones de prompts, puede parecer una alarma de humo para una tostadora.
Introducción
EvalCore es un ejecutor de pruebas práctico para equipos que construyen aplicaciones y agentes de LLM. Me gusta que registra el comportamiento del modelo en vivo y luego lo reproduce offline en CI para que las pruebas sean menos inestables y no necesiten claves de API. Los desarrolladores pueden definir evaluaciones en YAML, comparar modelos y bloquear regresiones antes de que los cambios en prompts, modelos o dependencias se publiquen.
¿Cuál es el escenario de aplicación más típico de EvalCore?
Un desarrollador de aplicaciones LLM puede usar EvalCore en el CI de solicitudes de extracción para reproducir el comportamiento del modelo guardado offline y detectar regresiones de prompts o modelos sin llamadas de API inestables.
Funciones de EvalCore
Definir suites de evaluación y reglas de puntuación en YAML
Grabar llamadas de modelos en vivo y reproducirlas offline
Ejecutar verificaciones de CI repetibles con almacenamiento local de casetes
Probar objetivos compatibles con OpenAI, REST, shell o trazas
Comparar líneas base, pruebas y versiones de modelos
Casos de uso de EvalCore
Añadir pruebas de regresión de LLM a cada solicitud de extracción
Ejecutar evaluaciones de CI sin claves de API en vivo ni llamadas de red
Verificar cambios en prompts o modelos antes del lanzamiento
Probar snapshots del comportamiento de agentes contra líneas base guardadas
Información de precios de EvalCore
FreeInformación de precios pública recopilada del sitio web oficial.
Open source
- Apache-2.0 open source
- in CI offline replay
- any language
- One small binary
- No telemetry
- No signup
- No server
Última comprobación: Jul 24, 2026. Visite el sitio web oficial para ver los términos más recientes.