サーベイ論文

ホーム/タグ一覧/サーベイ論文

1件の記事

AI エージェント評価 (eval) の最新サーベイ論文を読み解く — 2025-2026 年の到達点と残された課題

AI エージェント評価 (eval) の最新サーベイ論文を読み解く — 2025-2026 年の到達点と残された課題

2026年2月25日

AI エージェントの評価 (eval) 分野は 2025 年に arxiv で複数のサーベイ論文が出て、ようやく体系化されつつある。本稿は arXiv:2503.16416 (エージェント評価の総覧)、arXiv:2507.21504 (behavior/capabilities/reliability/safety の 4 分類)、arXiv:2601.05111 (Agent-as-a-Judge への進化) の 3 本を軸に、評価の 5 観点、代表的ベンチマーク 10+、hallucinated correctness などの既知の課題、2026 年の実装者が今日採用すべきベストプラクティスを整理する。

tech-blogAI evaluationLLM agent