AI eval ツール: Braintrust — 開発者体験で選ばれる商用プラットフォーム

AI eval ツール: Braintrust — 開発者体験で選ばれる商用プラットフォーム

Braintrust は、LLM アプリケーションの実験管理、本番トレース収集、自動採点(スコアリング)を一本化した商用の AI オブザーバビリティ基盤です。「Ship quality agents at scale」をうたい、開発中の eval ループと本番のログを同じワークフロー上でつなぐ設計になっています。

本連載の LangSmith と Phoenix に続き、本稿では Braintrust を取り上げます。

誰が作っているのか

開発元は Braintrust Data, Inc. です。2023 年に創業され、同年のうちにシード、翌年にはシリーズ A の資金調達を実施。短期間でユーザー数を伸ばしたプロダクト駆動のスタートアップで、OpenAI、Vercel、Notion、Stripe といった名の知れた企業が顧客として公表されています。

ポジショニングは明確で、「開発者が最短で eval を回せる」ことに全振りしています。LLM 周りのツールにありがちな、設定の多さやセットアップの重さを避け、最初の実験を数分で走らせることをゴールにしています。

なぜ dev experience を重視するのか

LLM アプリでは、評価が開発ループの中に組み込まれていないと、ほぼ機能しません。プロンプトを 1 行書き換えるたびに、CSV を書き出して、ノートブックを立ち上げて、手動でスコアを集計して、という手順を踏んでいては、改善のサイクルが止まります。

Braintrust は、この摩擦を減らすことに大きなリソースを割いています。CLI ひとつでローカルの eval コードを本番ダッシュボードに結びつけ、Web UI 側で結果を比較、Playground 上でそのままプロンプトを書き換えて再実験という流れが基本動線です。これを一度体験すると他のツールに戻りにくくなる、というのが Braintrust の売り文句になっています。

主な機能

Braintrust が提供する機能は、大きく以下に整理できます。

Experiments(実験管理): データセットに対してタスクを走らせ、スコアを計算した結果を履歴として残します。プロンプトを変えた前後、モデルを差し替えた前後の差分を、Web UI 上で側面並列に比較できます。

Playground: ブラウザ上の対話的なプロンプト編集環境です。既存のデータセットを読み込ませた状態で、プロンプトやモデルを切り替え、スコアを即座に再計算できます。エンジニア以外のチームメンバー、たとえば PM やドメイン専門家が、コードを書かずに評価に参加できる動線になっています。

Autoevals: Braintrust が OSS として公開している採点ライブラリです。LLM-as-a-judge 系には Factuality、Battle、Humor、Moderation などが用意されています。RAG 系には Context precision、Faithfulness、Answer relevancy など、ヒューリスティック系には Levenshtein や BLEU が揃っています。Braintrust の有料プランを使わなくても、このライブラリだけ単独で利用可能です。

Online Scoring: 本番で収集したトレースに対して、サンプリングで採点を走らせる機能です。デプロイ後の品質低下を、ユーザー申告ではなく自動採点で検出できます。

Logs(トレース): SDK 経由で LLM 呼び出しをラップすると、プロンプト、応答、トークン数、レイテンシ、ツール呼び出しをそのまま収集します。OpenTelemetry と互換のトレース形式に対応しています。

Datasets(データセット): バージョニングされたデータセットを、Web UI、CSV、SDK から追加・編集できます。本番ログで見つかった失敗ケースをクリックひとつでデータセットに昇格させられる動線が、Braintrust らしい点です。

最小動作例

公式ドキュメントに準拠した、最小の eval コードを示します。

TypeScript

import { Eval, initDataset } from "braintrust";
import { Factuality } from "autoevals";

Eval("My Project", {
  experimentName: "baseline",
  data: initDataset("My Project", { dataset: "qa-eval" }),
  task: async (input: string) => {
    return await callModel(input);
  },
  scores: [Factuality],
  metadata: {
    model: "gpt-5-mini",
  },
});

CLI から npx braintrust eval my_eval.ts と叩けば、ダッシュボードに結果が流れます。

Python

from braintrust import Eval, init_dataset
from autoevals import Factuality

Eval(
    "My Project",
    experiment_name="baseline",
    data=init_dataset(project="My Project", name="qa-eval"),
    task=lambda input: call_model(input),
    scores=[Factuality],
    metadata={"model": "gpt-5-mini"},
)

同じく braintrust eval my_eval.py で走ります。BRAINTRUST_API_KEY を環境変数に入れておくだけで、Web ダッシュボードに実験結果が反映されます。Autoevals 単体で手元採点だけしたい場合は、以下のように関数呼び出しもできます。

from autoevals.llm import Factuality

evaluator = Factuality()
result = evaluator(
    output="People's Republic of China",
    expected="China",
    input="Which country has the highest population?",
)
print(result.score, result.metadata["rationale"])

向くケース・向かないケース

Braintrust が強いのは、以下のような場面です。

一方、以下のケースでは慎重な検討が必要です。

競合比較

LangSmith との違い: LangSmith は LangChain エコシステムとの統合が深い一方、Braintrust は特定のフレームワーク非依存です。生の openai クライアント、Vercel AI SDK、独自のオーケストレーションでも等しく使えます。Playground の対話性と、本番ログから直接データセットを作る導線が Braintrust 側の強みです。トレース収集だけを安く済ませたい場合は LangSmith の方が選びやすい、という使い分けになります。

Phoenix / Langfuse との違い: Phoenix(OSS、Arize 製)は OpenTelemetry ベースで、自前ホストが前提。Braintrust は SaaS 前提で、インフラ運用コストをゼロにしつつ Playground のような UI 機能に投資しているという違いがあります。

価格体系の違い: LangSmith はトレース数、Phoenix は OSS で無料、Braintrust は「月額固定 + 処理データ量 + スコア数」のハイブリッド課金です。eval を頻繁に回すチームでは、スコア数(Autoevals 実行 1 回 = 1 スコア)が意外と効いてくる点に注意が必要です。

ハマりポイント

実運用で気づく、いくつかの注意点を挙げておきます。

  1. スコア数の消費が速い: Autoevals を本番ログに Online Scoring として走らせると、1 トレースあたり複数スコアを計算することが多く、無料枠の 10,000 スコアはすぐ尽きます。サンプリング率を最初から下げておく運用が現実的です。
  2. プロジェクトとデータセットの命名規則: 複数チームで使うと、プロジェクト名のスペルゆらぎで実験が分散します。命名規則を最初に決めるのが安全です。
  3. Playground の変更がコードに戻らない: Playground で改善したプロンプトを、コード側に反映させる動線は手動です。プロンプトをコードに直接書く運用だと、二重管理になりがちです。Braintrust 側のプロンプトレジストリに寄せるか、コードを唯一の真実にするか、方針を決めてから使い始めるべきです。
  4. LLM-as-a-judge のモデル代: Autoevals は内部でモデルを呼ぶため、採点にもトークン課金が発生します。Braintrust 側の model credits を使うか、自前 API キーを刺すか、料金の見通しをつけておく必要があります。

価格と無料枠

執筆時点の公開情報では、以下の 3 プラン構成です。

スタートアップ向けには、Pro の 6〜12 ヶ月無料プログラムが用意されています。クレジットカード不要で Starter を試せるので、まずは無料枠で感触を確かめるのが順当な使い始め方です。

まとめ

Braintrust は、「eval を開発ループに溶かし込む」ことに特化した商用プラットフォームです。SDK から Playground、本番の Online Scoring までを一本化し、エンジニアと非エンジニアの両方が同じダッシュボード上で品質を会話できる環境を提供しています。

OSS 自前運用の自由度と引き換えに、SaaS としての速度と洗練された UI を取るか。商用 LLM eval ツールの中で、プロダクト駆動のチームには第一候補として検討する価値があります。無料枠で小さく始めて、トレース量とスコア数が増えてきたら Pro へ、というのが現実的な採用パスでしょう。

関連記事


Singularity Society はテクノロジー集団として MulmoClaude / MulmoTerminal / MulmoCast を開発しています。エンジニア・起業家向けの実践プログラム BootCamp も運営しています。

この記事をシェア

関連記事

記事一覧に戻る