
AI eval ツール: lm-evaluation-harness — ベンチマーク標準
2026年4月14日
lm-evaluation-harness は EleutherAI 製の学術ベンチマーク標準フレームワークです。MMLU、HellaSwag、GSM8K、HumanEval、ARC、TruthfulQA などを統一 API から走らせられ、Hugging Face Open LLM Leaderboard の基盤にもなっています。プロダクトや agent の eval ではなく、素のモデル能力 (capability benchmark) を測る用途に特化しています。本稿では歴史、機能、最小動作例、Inspect AI との棲み分け、ハマりポイントを整理します。

AI eval ツール: OpenAI Evals — 本家の評価基盤はいま
2026年3月23日
OpenAI Evals は GPT 評価の事実上の標準として 2023 年に登場した OSS フレームワークです。本稿では OSS 版(github.com/openai/evals)と OpenAI Platform 側の evals、両方の現状と使い分けを整理します。YAML registry、model-graded eval、GPT-as-judge テンプレートの仕組み、最小動作例、他ツールとの棲み分け、そして OpenAI へのベンダーロックや開発ペース低下といったハマりどころまで、2026 年時点の実装者視点でまとめます。

AI eval ツール: Inspect AI — UK AISI の安全性評価標準
2026年3月20日
Inspect AI は、英国 AI Security Institute (UK AISI、旧 AI Safety Institute) が開発するオープンソース評価フレームワーク。frontier model の危険能力評価や red teaming のために設計され、学術機関や政府系の safety evaluation で事実上の標準になりつつあります。本稿では、設計思想、Solver / Scorer / Dataset / Tool / Sandbox / Log の 6 要素、最小動作例、商用プラットフォームとの違い、代表的な use case、ハマりやすいポイントを整理します。

AI エージェント評価 (eval) の最新サーベイ論文を読み解く — 2025-2026 年の到達点と残された課題
2026年2月25日
AI エージェントの評価 (eval) 分野は 2025 年に arxiv で複数のサーベイ論文が出て、ようやく体系化されつつある。本稿は arXiv:2503.16416 (エージェント評価の総覧)、arXiv:2507.21504 (behavior/capabilities/reliability/safety の 4 分類)、arXiv:2601.05111 (Agent-as-a-Judge への進化) の 3 本を軸に、評価の 5 観点、代表的ベンチマーク 10+、hallucinated correctness などの既知の課題、2026 年の実装者が今日採用すべきベストプラクティスを整理する。