Nav4AI
すべてコード・ITEvalCore
EvalCore

EvalCore

AI動作のオフラインスナップショットテスト

EvalCore のスクリーンショット

EvalCore のレビュー

4.3
良い点

EvalCoreは、APIキーや不安定なネットワークコールなしで記録されたモデル動作をオフライン再生することで、LLMリグレッション テストをCIフレンドリーに感じさせます。

気になる点

その最適な用途は狭く、すでにプロンプトリグレッションを恐れていない場合、トースターの煙警報のように感じるかもしれません。

概要

EvalCoreは、LLMアプリやエージェントを構築するチーム向けの実用的なテストランナーです。ライブモデル動作を記録し、CIでオフライン再生することで、テストの不安定さを軽減し、APIキーが不要になる点が気に入っています。開発者はYAMLでevalを定義し、モデルを比較し、プロンプト、モデル、依存関係の変更が出荷される前にリグレッションをブロックできます。

EvalCore の最も典型的な活用シーンは?

LLMアプリ開発者は、EvalCoreをプルリクエストCIで使用して、保存されたモデル動作をオフラインで再生し、不安定なAPIコールなしでプロンプトやモデルのリグレッションを検出できます。

EvalCore の機能

    YAMLでevalスイートとスコアリングルールを定義

    ライブモデルコールを記録し、オフラインで再生

    ローカルカセットストレージで繰り返し可能なCIチェックを実行

    OpenAI互換、REST、シェル、またはトレースターゲットをテスト

    ベースライン、トライアル、モデルバージョンを比較

EvalCore のユースケース

    すべてのプルリクエストにLLMリグレッション テストを追加

    ライブAPIキーやネットワークコールなしでCI evalを実行

    リリース前にプロンプトやモデルの変更を確認

    保存されたベースラインに対してエージェントの動作をスナップショットテスト

EvalCore の料金情報

Free

公式サイトから収集した公開料金情報です。

evalcore.cc の料金

Open source

$0
  • Apache-2.0 open source
  • in CI offline replay
  • any language
  • One small binary
  • No telemetry
  • No signup
  • No server

最終確認:Jul 24, 2026。最新の条件は公式サイトをご確認ください。