EvalCore macht LLM-Regressions-Tests CI-freundlich, indem es aufgezeichnetes Modellverhalten offline wiedergibt, ohne API-Schlüssel oder flakige Netzwerkaufrufe.

Bewertungen zu EvalCore
Sein Sweet Spot ist eng: Wenn man Prompt-Regressionen nicht schon fürchtet, wirkt es wie ein Rauchmelder für einen Toaster.
Einführung
EvalCore ist ein praktischer Test-Runner für Teams, die LLM-Apps und -Agenten entwickeln. Es zeichnet Live-Modellverhalten auf und spielt es offline in der CI wieder ab, sodass Tests weniger flakig sind und keine API-Schlüssel benötigen. Entwickler können YAML-Evals definieren, Modelle vergleichen und Regressionen blockieren, bevor Prompt-, Modell- oder Abhängigkeitsänderungen ausgeliefert werden.
Was ist das typischste Anwendungsszenario für EvalCore?
Ein LLM-App-Entwickler kann EvalCore in der Pull-Request-CI einsetzen, um gespeichertes Modellverhalten offline wiederzugeben und Prompt- oder Modellregressionen ohne flakige API-Aufrufe zu erkennen.
Funktionen von EvalCore
Eval-Suiten und Bewertungsregeln in YAML definieren
Live-Modellaufrufe aufzeichnen und offline wiedergeben
Wiederholbare CI-Checks mit lokaler Kassetten-Speicherung ausführen
OpenAI-kompatible, REST-, Shell- oder Trace-Ziele testen
Baselines, Trials und Modellversionen vergleichen
Anwendungsfälle für EvalCore
LLM-Regressions-Tests zu jedem Pull-Request hinzufügen
CI-Evals ohne Live-API-Schlüssel oder Netzwerkaufrufe ausführen
Prompt- oder Modelländerungen vor der Veröffentlichung prüfen
Agentenverhalten gegen gespeicherte Baselines snapshot-testen
Preisinformationen zu EvalCore
FreeÖffentliche Preisinformationen von der offiziellen Website.
Open source
- Apache-2.0 open source
- in CI offline replay
- any language
- One small binary
- No telemetry
- No signup
- No server
Zuletzt geprüft am Jul 24, 2026. Besuchen Sie die offizielle Website für die aktuellen Bedingungen.