
Langfuse: データを外に出さず LLM を観測する OSS 基盤
2026年4月1日
Langfuse は MIT ライセンスの LLM オブザーバビリティ・評価プラットフォームです。トレース、スコア、データセット、プロンプト管理、Evaluations、ユーザー / セッション追跡を 1 つにまとめ、クラウド版とセルフホスト版を選べます。本稿では docker compose での最小構成、Python SDK の呼び出し、GDPR やデータ主権の観点からの選定理由、LangSmith や Phoenix との違い、OpenAI / Anthropic / LangChain / LiteLLM との統合、ハマりやすい点、価格体系までを一通り整理します。

AI eval ツール: W&B Weave — 実験管理の文脈を LLM に延長する
2026年3月26日
W&B Weave は、Weights & Biases が LLM / エージェント向けに提供する評価・トレーシング基盤です。`@weave.op` デコレータで関数を 1 行ラップすればトレースと評価の両方が走り、ダッシュボードに実験単位で比較できる形で残ります。本稿では ML 実験管理の文脈から Weave の立ち位置を整理し、Traces / Evaluations / Datasets / Models / Playground の使い方、最小動作例、LangSmith / Phoenix との違い、ハマりポイントまで、エンジニア視点でまとめます。

AI eval ツール: Braintrust — 開発者体験で選ばれる商用プラットフォーム
2026年3月17日
Braintrust は、LLM アプリの実験・本番監視・自動採点を一本化した商用のオブザーバビリティ基盤です。Experiments、Playground、Autoevals、Online Scoring、Logs、Datasets といった機能を、開発者が使いやすい SDK と Web UI でまとめて提供します。本稿では、Braintrust の設計思想、TypeScript / Python での最小動作例、LangSmith との違い、向くケース・向かないケース、ハマりポイント、料金体系までを整理し、商用 LLM eval ツールを選ぶ際の判断材料をまとめます。

AI eval ツール: Phoenix — OTel 準拠の OSS オブザーバビリティ
2026年3月14日
Arize Phoenix は、LLM アプリケーションのトレース・評価・実験を一体化した OSS です。OpenTelemetry と OpenInference semantic conventions に準拠し、ベンダーロックインを避けつつ本番監視・デバッグ・eval を同じ画面で回せます。本稿は Phoenix の位置づけ、Traces/Datasets/Experiments/Evals/Prompt Playground の 5 機能、docker + Python 最小動作例、LangSmith / Langfuse との違い、ハマりやすい点をまとめます。

AI eval ツール: LangSmith — trace と評価を一体化した商用プラットフォーム
2026年3月11日
LangSmith は LangChain が提供する商用の LLM オブザーバビリティ兼評価プラットフォーム。trace / dataset / experiment / online eval / human feedback / playground / dashboard を一つの画面で扱える。LangChain を使っていない Python / TypeScript コードからも @traceable と wrap_openai を介して利用でき、無料枠から始められる。本稿は機能、最小動作例、Braintrust / Langfuse との棲み分け、価格、ハマりポイントを整理する。