LLM テスト

ホーム/タグ一覧/LLM テスト

3件の記事

AI eval ツール 10 選 — Promptfoo / Autoevals / Evalite / Langfuse / DeepEval / Ragas / Inspect AI / OpenAI Evals / lm-eval-harness / Phoenix を使い分ける

AI eval ツール 10 選 — Promptfoo / Autoevals / Evalite / Langfuse / DeepEval / Ragas / Inspect AI / OpenAI Evals / lm-eval-harness / Phoenix を使い分ける

2026年4月5日

AI eval ツールは 2025-2026 年に乱立したが、どれを選ぶべきか判断軸が整理されていない。本稿は代表 10 本 (Promptfoo / DeepEval / LangSmith / Phoenix / Braintrust / Inspect AI / OpenAI Evals / Weave / Ragas / Langfuse) を OSS/商用、CLI/SDK/UI、観測/評価の軸で分類し、プロジェクトの段階ごとに最初に手に取るべき 1 本を提案する。各ツールの詳細記事へのリンク付き。

tech-blogAI evaluationツール比較
DeepEval: pytest 感覚で LLM を評価する OSS

DeepEval: pytest 感覚で LLM を評価する OSS

2026年3月8日

DeepEval は Confident AI が開発する OSS の LLM 評価フレームワークです。pytest 互換の記法で G-Eval や RAG メトリクス、hallucination、bias、toxicity などを計測でき、CI/CD にそのまま組み込めます。本記事では開発元、最小動作例、ハマりポイント、Promptfoo との棲み分け、商用版 Confident AI との関係まで、Python エンジニア向けに整理します。

tech-blogAI evaluationDeepEval
Promptfoo で LLM を YAML で回帰テストする — AI eval の実装者視点

Promptfoo で LLM を YAML で回帰テストする — AI eval の実装者視点

2026年3月5日

Promptfoo は LLM アプリケーションを YAML 一枚で回帰テストできる OSS の CLI ツールです。本稿では Promptfoo が何を解決するのか、最小動作例、llm-rubric や Red Team 機能、DeepEval や LangSmith との違い、よくあるハマりポイントを実装者向けにまとめます。2026 年に OpenAI 傘下に入ったあとの位置づけも整理しました。

tech-blogAI evaluationPromptfoo