EvalCore membuat pengujian regresi LLM terasa ramah CI dengan memutar ulang perilaku model yang direkam secara offline tanpa kunci API atau panggilan jaringan yang tidak stabil.

Ulasan untuk EvalCore
Titik manisnya sempit: jika Anda belum takut dengan regresi prompt, ini mungkin terasa seperti alarm asap untuk pemanggang roti.
Pengantar
EvalCore adalah runner pengujian praktis untuk tim yang membangun aplikasi dan agen LLM. Saya suka bahwa ia merekam perilaku model langsung, lalu memutar ulangnya secara offline di CI sehingga pengujian tidak mudah gagal dan tidak memerlukan kunci API. Pengembang dapat mendefinisikan evaluasi YAML, membandingkan model, dan mencegah regresi sebelum perubahan prompt, model, atau dependensi dirilis.
Apa skenario penggunaan paling umum untuk EvalCore?
Pengembang aplikasi LLM dapat menggunakan EvalCore dalam CI pull request untuk memutar ulang perilaku model yang disimpan secara offline dan menangkap regresi prompt atau model tanpa panggilan API yang tidak stabil.
Fitur EvalCore
Tentukan suite evaluasi dan aturan penilaian dalam YAML
Rekam panggilan model langsung dan putar ulang secara offline
Jalankan pemeriksaan CI yang dapat diulang dengan penyimpanan kaset lokal
Uji target yang kompatibel dengan OpenAI, REST, shell, atau trace
Bandingkan baseline, percobaan, dan versi model
Kasus penggunaan untuk EvalCore
Tambahkan pengujian regresi LLM ke setiap pull request
Jalankan evaluasi CI tanpa kunci API langsung atau panggilan jaringan
Periksa perubahan prompt atau model sebelum rilis
Uji snapshot perilaku agen terhadap baseline yang disimpan
Informasi harga EvalCore
FreeInformasi harga publik yang dikumpulkan dari situs resmi.
Open source
- Apache-2.0 open source
- in CI offline replay
- any language
- One small binary
- No telemetry
- No signup
- No server
Terakhir diperiksa Jul 24, 2026. Kunjungi situs resmi untuk ketentuan terbaru.