LLM eval

ホーム/タグ一覧/LLM eval

1件の記事

AI で評価用テストペアを生成する手法サーベイ — 2026 年の論文・ツール総覧

AI で評価用テストペアを生成する手法サーベイ — 2026 年の論文・ツール総覧

2026年5月15日

LLM 評価のためのテストペアを AI 自身に作らせる手法が、2022 年の Self-Instruct 以来、急速に広がりました。本稿は Self-Instruct / Evol-Instruct / PAIR / Rainbow Teaming / AutoBencher / Constitutional AI / Ragas / PyRIT など、2026 年までに整理された主要論文とツールを 8 ファミリーに分類し、各手法の原理と限界 (generator ceiling、ベンチマーク汚染、hallucinated correctness など) を俯瞰します。

tech-blogAI evaluationテストペア生成