AI eval ツール 10 選 — Promptfoo / Autoevals / Evalite / Langfuse / DeepEval / Ragas / Inspect AI / OpenAI Evals / lm-eval-harness / Phoenix を使い分ける

AI eval ツール 10 選 — Promptfoo / Autoevals / Evalite / Langfuse / DeepEval / Ragas / Inspect AI / OpenAI Evals / lm-eval-harness / Phoenix を使い分ける

AI eval(LLM 評価)ツールは 2025-2026 年に乱立しました。GitHub で llm-eval を検索すると 200 本以上。公式カンファレンスが語る「業界標準」も毎月変わります。

本稿では、実務で使われている代表 10 本 を取り上げ、

を 1 枚の全体像として整理します。それぞれの詳細記事へのリンクも付けました。

ツール一覧

ツール ライセンス 強み 弱み
Promptfoo MIT (OSS) YAML でプロンプト回帰テスト、CI 統合、Red Team 大規模な trace 分析は弱い
Autoevals MIT (OSS) Braintrust 発の pre-built scorer、SaaS 不要 LLM-judge の確率的ブレは残る
Evalite MIT (OSS) Vitest ベースの TypeScript 向け、ローカル完結 TypeScript 専用、Python 側には触手なし
Langfuse MIT (OSS) セルフホスト対応、データ主権 商用 UI には届かない
DeepEval Apache 2.0 (OSS) pytest 感覚で LLM テスト、G-Eval Python のみ、商用版 (Confident AI) 連携必須感
Ragas Apache 2.0 (OSS) RAG 特化、faithfulness / context precision RAG 以外には弱い
Inspect AI MIT (OSS) UK AISI 製、safety / capability eval 標準 プロダクト向けではなく研究寄り
OpenAI Evals MIT (OSS) 歴史的意義、YAML registry 開発ペース鈍化、OpenAI ロックイン
lm-evaluation-harness MIT (OSS) EleutherAI 製、学術ベンチマーク de facto 標準 プロダクト eval / agent eval 向きではない
Arize Phoenix Elastic 2.0 (OSS) OTel 準拠、セルフホスト、Arize AX への移行路 UI の洗練度は商用に劣る

補足で取り上げた商用ツール

ツール ライセンス 位置づけ
LangSmith 商用 (SaaS) LangChain 統合、Online Evals
Braintrust 商用 (SaaS) Developer Experience、Autoevals の商用版
Weave 商用 (SaaS) W&B 統合、ML 実験管理の文脈

3 つの軸で分類する

軸 1: OSS か商用か

OSS (無料・セルフホスト可):

商用 SaaS (無料枠 + 従量):

GDPR / データ主権が重要なら OSS 一択。スタートアップで速さ優先なら商用も検討。

軸 2: CLI / SDK / Web UI のどこに重心があるか

CLI 中心 (CI 統合しやすい):

SDK 中心 (コードで書く):

Web UI 中心 (ダッシュボード重視):

軸 3: 評価だけ / 観測も含む

評価専業:

観測 (observability) + 評価の統合:

後者は trace / logs / scores を 1 つのダッシュボードで見られる。本番運用に入ったら必須。

プロジェクト段階ごとの推奨

段階 1: プロトタイプ (1-2 週目)

手に取るべき: Promptfoo

段階 2: 内部開発 (3-8 週目)

手に取るべき: DeepEval または RAG なら Ragas

段階 3: ベータ公開 (2-3 ヶ月目)

手に取るべき: Langfuse (OSS) または Braintrust (商用)

段階 4: 本番運用 (4 ヶ月目以降)

手に取るべき: LangSmith または Phoenix

段階 X: 研究・capability eval

手に取るべき: Inspect AI

「同じカテゴリで迷ったら」判断ガイド

Promptfoo vs DeepEval

迷ったら見るもの Promptfoo DeepEval
CI で YAML 書きたい ◎ △
pytest 感覚で書きたい △ ◎
Red Team テスト ◎ △
カスタムメトリクス ○ ◎

LangSmith vs Braintrust vs Langfuse

迷ったら見るもの LangSmith Braintrust Langfuse
OSS セルフホスト × × ◎
LangChain 使ってる ◎ ○ ○
価格の明快さ △ (LSU) △ (score 従量) ◎ (単純)
Playground の強さ ○ ◎ ○

Phoenix vs Langfuse

迷ったら見るもの Phoenix Langfuse
OTel 準拠 ◎ ○
セルフホスト ◎ ◎
商用版へのアップグレード路 Arize AX Langfuse Cloud
商用統合エコシステム Arize エコシステム LiteLLM / LangChain / OpenAI 直接

Weave vs 他観測ツール

Weave を選ぶ唯一の理由: 既に W&B で ML 実験管理をしているチーム。ML モデルと LLM アプリの実験管理を 1 つのプラットフォームでやりたい。それ以外のケースでは他ツールの方が軽い。

2026 年の業界動向

1. 「評価の分業」が進行

問題生成・評価実行・判定の 3 つを 1 ツールで統合する方向から、専業ツール × 統合プラットフォーム の組み合わせに戻りつつあります:

2. Agent-as-a-Judge の普及

LLM-as-a-Judge の限界(バイアス、hallucinated correctness)を解決するため、判定者自身がエージェント となる方向。詳細: AI エージェント評価サーベイ論文を読み解く

3. OTel 準拠が標準になりつつある

Phoenix を筆頭に、LLM observability は OpenTelemetry 準拠が標準に。既存の APM スタック (Datadog / Honeycomb / Grafana) との統合がしやすくなる。

4. OSS → 商用 upgrade path の整備

Phoenix → Arize AX、Langfuse OSS → Langfuse Cloud、DeepEval → Confident AI など、OSS でスタートして商用に移る道が整った。段階 3 以降で ROI が出れば自然に移行できる。

最初に 1 本選ぶなら

状況 推奨ツール
何を作っているか分からない / とりあえず試したい Promptfoo
Python で LLM アプリを書いている DeepEval
RAG を作っている Ragas
LangChain で書いている LangSmith
データを外に出せない (EU 企業 / 医療 / 金融) Langfuse または Phoenix
モデルの capability / safety を評価したい (研究) Inspect AI
既に W&B 使っている Weave
スタートアップで速さ優先 Braintrust

まとめ

全部試す必要はありません。1-2 本を深く使い、必要になったら足す。これが 2026 年の正しいアプローチです。

全記事リスト

OSS 中心 (user 推奨 10 本):

  1. Promptfoo — YAML による LLM 回帰テスト
  2. Autoevals — Braintrust 発の OSS LLM スコアラ
  3. Evalite — Vitest ベースの TypeScript 向け eval
  4. Langfuse — セルフホスト可能な OSS オブザーバビリティ
  5. DeepEval — pytest 感覚で LLM を評価
  6. Ragas — RAG 特化の評価フレームワーク
  7. Inspect AI — UK AISI 製の safety / capability eval
  8. OpenAI Evals — OSS フレームワーク + Platform evals
  9. lm-evaluation-harness — EleutherAI 製の学術ベンチマーク標準
  10. Arize Phoenix — OTel 準拠の OSS オブザーバビリティ

補足で取り上げた商用プラットフォーム:

chaff grade 連携

上記のうち 1-8 の 8 本には、chaffjs の決定論的スコアラ chaff grade との連携例が用意されています。対象は promptfoo / autoevals / evalite / Langfuse / DeepEval / Ragas / Inspect AI / OpenAI Evals です:

関連記事


Singularity Society はテクノロジー集団として MulmoClaude / MulmoTerminal / MulmoCast を開発しています。エンジニア・起業家向けの実践プログラム BootCamp も運営しています。

この記事をシェア

関連記事

記事一覧に戻る