Python

ホーム/タグ一覧/Python

2件の記事

AI で評価用テストペアを生成する実装ガイド — 2026 年の具体的な作り方

AI で評価用テストペアを生成する実装ガイド — 2026 年の具体的な作り方

2026年6月1日

LLM プロダクトを評価するためのテストペアを AI で生成する 7 つのレシピを、Python コード付きで紹介します。Self-Instruct 風のシード展開、Ragas で RAG 用の test triple、Evol-Instruct で難易度上げ、Promptfoo や PyRIT で red team、本番ログからの抽出、判定役の分離、人間との hybrid loop までを扱います。

tech-blogAI evaluationテストペア生成
DeepEval: pytest 感覚で LLM を評価する OSS

DeepEval: pytest 感覚で LLM を評価する OSS

2026年3月8日

DeepEval は Confident AI が開発する OSS の LLM 評価フレームワークです。pytest 互換の記法で G-Eval や RAG メトリクス、hallucination、bias、toxicity などを計測でき、CI/CD にそのまま組み込めます。本記事では開発元、最小動作例、ハマりポイント、Promptfoo との棲み分け、商用版 Confident AI との関係まで、Python エンジニア向けに整理します。

tech-blogAI evaluationDeepEval