O EvalCore torna os testes de regressão de LLM amigáveis para CI ao reproduzir offline o comportamento registrado do modelo sem chaves de API ou chamadas de rede instáveis.

Avaliações sobre EvalCore
Seu ponto forte é limitado: se você não teme regressões em prompts, pode parecer um alarme de fumaça para uma torradeira.
Introdução
EvalCore é um executor de testes prático para equipes que constroem apps e agentes de LLM. Gosto que ele registra o comportamento do modelo ao vivo e depois o reproduz offline em CI, tornando os testes menos instáveis e sem necessidade de chaves de API. Os desenvolvedores podem definir avaliações em YAML, comparar modelos e bloquear regressões antes que mudanças em prompts, modelos ou dependências sejam enviadas.
Qual é o cenário de aplicação mais típico do EvalCore?
Um desenvolvedor de apps de LLM pode usar o EvalCore no CI de pull requests para reproduzir offline o comportamento salvo do modelo e detectar regressões em prompts ou modelos sem chamadas de API instáveis.
Recursos do EvalCore
Defina suítes de avaliação e regras de pontuação em YAML
Registre chamadas de modelo ao vivo e reproduza-as offline
Execute verificações de CI repetíveis com armazenamento local de cassetes
Teste alvos compatíveis com OpenAI, REST, shell ou trace
Compare baselines, trials e versões de modelos
Casos de uso para EvalCore
Adicione testes de regressão de LLM a cada pull request
Execute avaliações de CI sem chaves de API ou chamadas de rede ao vivo
Verifique mudanças em prompts ou modelos antes do lançamento
Teste de snapshot do comportamento do agente contra baselines salvos
Informações de preços de EvalCore
FreeInformações de preços públicas coletadas do site oficial.
Open source
- Apache-2.0 open source
- in CI offline replay
- any language
- One small binary
- No telemetry
- No signup
- No server
Última verificação em Jul 24, 2026. Visite o site oficial para os termos mais recentes.