AI eval ツール: lm-evaluation-harness — ベンチマーク標準
2026年4月14日
lm-evaluation-harness は EleutherAI 製の学術ベンチマーク標準フレームワークです。MMLU、HellaSwag、GSM8K、HumanEval、ARC、TruthfulQA などを統一 API から走らせられ、Hugging Face Open LLM Leaderboard の基盤にもなっています。プロダクトや agent の eval ではなく、素のモデル能力 (capability benchmark) を測る用途に特化しています。本稿では歴史、機能、最小動作例、Inspect AI との棲み分け、ハマりポイントを整理します。
tech-blogAI evaluationlm-evaluation-harness