ホーム/タグ一覧/evaluation
1件の記事
2026年2月10日
AI エージェントの evaluation (evals) は、「それっぽく動く」を数値で担保する唯一の方法。本記事では、unit test では捉えられない AI 特有の非決定性、LLM-as-a-judge の使いどころと落とし穴、統計的妥当性のためのサンプル数、本番モニタリングとの関係を、実装パターンとともに整理する。Anthropic Engineering Blog の evals シリーズも参照。