AI eval(LLM 評価)ツールは 2025-2026 年に乱立しました。GitHub で llm-eval を検索すると 200 本以上。公式カンファレンスが語る「業界標準」も毎月変わります。
本稿では、実務で使われている代表 10 本 を取り上げ、
- どれが OSS でどれが商用か
- どんなプロジェクトのどの段階に向くか
- 似ているツール同士の決定的な違い
を 1 枚の全体像として整理します。それぞれの詳細記事へのリンクも付けました。
ツール一覧
| ツール | ライセンス | 強み | 弱み |
|---|---|---|---|
| Promptfoo | MIT (OSS) | YAML でプロンプト回帰テスト、CI 統合、Red Team | 大規模な trace 分析は弱い |
| Autoevals | MIT (OSS) | Braintrust 発の pre-built scorer、SaaS 不要 | LLM-judge の確率的ブレは残る |
| Evalite | MIT (OSS) | Vitest ベースの TypeScript 向け、ローカル完結 | TypeScript 専用、Python 側には触手なし |
| Langfuse | MIT (OSS) | セルフホスト対応、データ主権 | 商用 UI には届かない |
| DeepEval | Apache 2.0 (OSS) | pytest 感覚で LLM テスト、G-Eval | Python のみ、商用版 (Confident AI) 連携必須感 |
| Ragas | Apache 2.0 (OSS) | RAG 特化、faithfulness / context precision | RAG 以外には弱い |
| Inspect AI | MIT (OSS) | UK AISI 製、safety / capability eval 標準 | プロダクト向けではなく研究寄り |
| OpenAI Evals | MIT (OSS) | 歴史的意義、YAML registry | 開発ペース鈍化、OpenAI ロックイン |
| lm-evaluation-harness | MIT (OSS) | EleutherAI 製、学術ベンチマーク de facto 標準 | プロダクト eval / agent eval 向きではない |
| Arize Phoenix | Elastic 2.0 (OSS) | OTel 準拠、セルフホスト、Arize AX への移行路 | UI の洗練度は商用に劣る |
補足で取り上げた商用ツール
| ツール | ライセンス | 位置づけ |
|---|---|---|
| LangSmith | 商用 (SaaS) | LangChain 統合、Online Evals |
| Braintrust | 商用 (SaaS) | Developer Experience、Autoevals の商用版 |
| Weave | 商用 (SaaS) | W&B 統合、ML 実験管理の文脈 |
3 つの軸で分類する
軸 1: OSS か商用か
OSS (無料・セルフホスト可):
- Promptfoo / DeepEval / Phoenix / Inspect AI / OpenAI Evals / Ragas / Langfuse
商用 SaaS (無料枠 + 従量):
- LangSmith / Braintrust / Weave
GDPR / データ主権が重要なら OSS 一択。スタートアップで速さ優先なら商用も検討。
軸 2: CLI / SDK / Web UI のどこに重心があるか
CLI 中心 (CI 統合しやすい):
- Promptfoo (YAML +
promptfoo eval) - OpenAI Evals (
oaievalCLI)
SDK 中心 (コードで書く):
- DeepEval (
pytest) - Ragas (
evaluate()) - Inspect AI (
@task/@solver/@scorer)
Web UI 中心 (ダッシュボード重視):
- LangSmith / Braintrust / Phoenix / Weave / Langfuse
軸 3: 評価だけ / 観測も含む
評価専業:
- Promptfoo / DeepEval / Ragas / Inspect AI / OpenAI Evals
観測 (observability) + 評価の統合:
- LangSmith / Phoenix / Braintrust / Weave / Langfuse
後者は trace / logs / scores を 1 つのダッシュボードで見られる。本番運用に入ったら必須。
プロジェクト段階ごとの推奨
段階 1: プロトタイプ (1-2 週目)
手に取るべき: Promptfoo
- YAML 1 枚でプロンプトの A/B 比較
- セットアップ 5 分、学習コスト最小
- 「このプロンプトで正しい答えが出るか」の最初の 10 ケースを回す
段階 2: 内部開発 (3-8 週目)
手に取るべき: DeepEval または RAG なら Ragas
- pytest に組み込んで CI で回す
- 100-500 テストケースの管理
- hallucination / relevancy / toxicity などメトリクスを足していく
段階 3: ベータ公開 (2-3 ヶ月目)
手に取るべき: Langfuse (OSS) または Braintrust (商用)
- 本番ログを trace として集める
- Online evals で本番トラフィックをサンプリング評価
- ダッシュボードで非技術者にも共有
段階 4: 本番運用 (4 ヶ月目以降)
- Human feedback 連携
- Alerting / regression detection
- 複数チーム・複数プロダクトの統合
段階 X: 研究・capability eval
手に取るべき: Inspect AI
- Frontier model の capability / safety 評価
- 学術論文に載せられる構造化された eval
- UK AISI / Anthropic / OpenAI の red team 評価と同じ土俵
「同じカテゴリで迷ったら」判断ガイド
Promptfoo vs DeepEval
| 迷ったら見るもの | Promptfoo | DeepEval |
|---|---|---|
| CI で YAML 書きたい | ◎ | △ |
| pytest 感覚で書きたい | △ | ◎ |
| Red Team テスト | ◎ | △ |
| カスタムメトリクス | ○ | ◎ |
LangSmith vs Braintrust vs Langfuse
| 迷ったら見るもの | LangSmith | Braintrust | Langfuse |
|---|---|---|---|
| OSS セルフホスト | × | × | ◎ |
| LangChain 使ってる | ◎ | ○ | ○ |
| 価格の明快さ | △ (LSU) | △ (score 従量) | ◎ (単純) |
| Playground の強さ | ○ | ◎ | ○ |
Phoenix vs Langfuse
| 迷ったら見るもの | Phoenix | Langfuse |
|---|---|---|
| OTel 準拠 | ◎ | ○ |
| セルフホスト | ◎ | ◎ |
| 商用版へのアップグレード路 | Arize AX | Langfuse Cloud |
| 商用統合エコシステム | Arize エコシステム | LiteLLM / LangChain / OpenAI 直接 |
Weave vs 他観測ツール
Weave を選ぶ唯一の理由: 既に W&B で ML 実験管理をしているチーム。ML モデルと LLM アプリの実験管理を 1 つのプラットフォームでやりたい。それ以外のケースでは他ツールの方が軽い。
2026 年の業界動向
1. 「評価の分業」が進行
問題生成・評価実行・判定の 3 つを 1 ツールで統合する方向から、専業ツール × 統合プラットフォーム の組み合わせに戻りつつあります:
- 問題生成: Ragas (RAG) / Inspect AI (safety) / 自前
- 評価実行: DeepEval (CI) / Promptfoo (regression)
- ダッシュボード: Langfuse / LangSmith / Braintrust
2. Agent-as-a-Judge の普及
LLM-as-a-Judge の限界(バイアス、hallucinated correctness)を解決するため、判定者自身がエージェント となる方向。詳細: AI エージェント評価サーベイ論文を読み解く
3. OTel 準拠が標準になりつつある
Phoenix を筆頭に、LLM observability は OpenTelemetry 準拠が標準に。既存の APM スタック (Datadog / Honeycomb / Grafana) との統合がしやすくなる。
4. OSS → 商用 upgrade path の整備
Phoenix → Arize AX、Langfuse OSS → Langfuse Cloud、DeepEval → Confident AI など、OSS でスタートして商用に移る道が整った。段階 3 以降で ROI が出れば自然に移行できる。
最初に 1 本選ぶなら
| 状況 | 推奨ツール |
|---|---|
| 何を作っているか分からない / とりあえず試したい | Promptfoo |
| Python で LLM アプリを書いている | DeepEval |
| RAG を作っている | Ragas |
| LangChain で書いている | LangSmith |
| データを外に出せない (EU 企業 / 医療 / 金融) | Langfuse または Phoenix |
| モデルの capability / safety を評価したい (研究) | Inspect AI |
| 既に W&B 使っている | Weave |
| スタートアップで速さ優先 | Braintrust |
まとめ
- AI eval ツールは乱立しているが、OSS/商用、CLI/SDK/UI、評価/観測 の 3 軸で分類すれば整理できる
- プロジェクト段階ごとに最適解が違う(プロト→内部開発→ベータ→本番)
- 2026 年は「評価の分業 + 観測統合」が業界動向
- 最初の 1 本は Promptfoo か DeepEval、本番運用に入ったら observability 系へ
全部試す必要はありません。1-2 本を深く使い、必要になったら足す。これが 2026 年の正しいアプローチです。
全記事リスト
OSS 中心 (user 推奨 10 本):
- Promptfoo — YAML による LLM 回帰テスト
- Autoevals — Braintrust 発の OSS LLM スコアラ
- Evalite — Vitest ベースの TypeScript 向け eval
- Langfuse — セルフホスト可能な OSS オブザーバビリティ
- DeepEval — pytest 感覚で LLM を評価
- Ragas — RAG 特化の評価フレームワーク
- Inspect AI — UK AISI 製の safety / capability eval
- OpenAI Evals — OSS フレームワーク + Platform evals
- lm-evaluation-harness — EleutherAI 製の学術ベンチマーク標準
- Arize Phoenix — OTel 準拠の OSS オブザーバビリティ
補足で取り上げた商用プラットフォーム:
- LangSmith — LangChain の統合プラットフォーム
- Braintrust — Developer Experience を優先する商用 SaaS
- Weave — W&B の LLM 評価プラットフォーム
chaff grade 連携
上記のうち 1-8 の 8 本には、chaffjs の決定論的スコアラ chaff grade との連携例が用意されています。対象は promptfoo / autoevals / evalite / Langfuse / DeepEval / Ragas / Inspect AI / OpenAI Evals です:
- 参照: isamu/lab: examples/evals/
- LLM-judge の「意見」と chaff の「事実」を同じ採点ランに並べられる
- lm-evaluation-harness と Phoenix は、chaff 固有の連携は不要(通常のメトリクスとして
grade()を attach すれば済む)
関連記事
Singularity Society はテクノロジー集団として MulmoClaude / MulmoTerminal / MulmoCast を開発しています。エンジニア・起業家向けの実践プログラム BootCamp も運営しています。
