Anthropic Engineering Blog は、2024 年末から急速に充実して、2026 年現在、AI エージェント開発の 一次情報として最良のソース です。
Claude の中の人たちが「どう考えて、何を作ったか」を具体的に書いた記事が並びます。マーケティング記事ではなく、実装の意思決定・ベンチマーク・失敗事例 まで踏み込んでいる。
本稿では、2024-2026 年に公開された記事から 15 本を分野別に厳選 し、どれから読むべきか・どう実務に落とすかを案内します。
まず読むべき 3 本(これだけは外せない)
1. Building effective agents (2024-12-19)
AI エージェント設計の全体像を学ぶ、起点となる 1 本。
- 「ワークフロー」と「エージェント」の違い(事前に経路が決まっているか、動的に判断するか)
- 5 つの基本パターン: Prompt chaining / Routing / Parallelization / Orchestrator-workers / Evaluator-optimizer
- フレームワークに頼らない「素のモデル + ツール」設計の勧め
- 本当に必要な時だけエージェントを使え、という抑制的な指針
2026 年現在もこの記事がすべての議論の土台になります。LangChain・CrewAI・AutoGen の設計も、結局このパターンを組み合わせています。
2. Effective context engineering for AI agents (2025-09-29)
プロンプトエンジニアリングの次に来るもの。
- プロンプト設計 (Prompt Engineering) は 1 ターンの最適化
- 文脈設計 (Context Engineering) は、長いセッション全体で LLM が何を知っているかの最適化
- Claude Code や MulmoClaude のような長時間動くエージェントで、何をコンテキストに残し、何を捨てるか
- 具体的なテクニック: トランスクリプト要約、スキル読み込み、CLAUDE.md の設計、tool 選択の抑制
2026 年のエージェント開発の中心概念がここで整理されました。
3. Claude Code: Best practices for agentic coding (2025-04-18)
Claude Code を使うすべての人の必読書。
CLAUDE.mdの書き方(プロジェクトの文脈をどう伝えるか)- カスタムスラッシュコマンドの設計
- 権限制御(どのツールを許可するか)
- 複数エージェント並列実行の推奨
- イテレーションのループを早くする具体的な方法
Singularity Society BootCamp の参加者も、まずこれを読んでから Claude Code を使い始めます。
エージェント設計の深掘り 4 本
4. How we built our multi-agent research system (2025-06-13)
Anthropic 自身の Research 機能(Deep Research 的な機能)の内部設計。
- オーケストレーター 1 体 + サブエージェント N 体
- 並列検索の設計、結果のマージ戦略
- 評価と反復のループ
- トークンコストが単純シングルエージェントの 10-15 倍、ただし品質で見合う
マルチエージェント構成の実装パターン として最も具体的な公開情報の 1 つ。
5. Equipping agents for the real world with Agent Skills (2025-10-16)
Agent Skills という概念の導入記事。
- Skills は「エージェントに特定の仕事のやり方を教える packaged プロンプト + ツール + サンプル」
- モデルの重みを変えずに専門性を注入する
- Claude Desktop、Claude Code、Claude.ai で動く
- 社内ノウハウを再利用可能な資産にする
Singularity Society の運用 でも、スキル駆動のワークフローが中心になっています。
6. Writing effective tools for agents — with agents (2025-09-11)
エージェントに使わせるツール (function / MCP) の設計原則。
- ツール名・引数名・description の書き方で LLM の精度が大きく変わる
- 「使うべき時だけ」描写が選ばれる description の書き方
- エラーメッセージを LLM が理解できる形で返す
- 「ツールを書くときにエージェントを使え」というメタ的な主張
MCP サーバーを自作している人は必読。
7. Scaling Managed Agents: Decoupling the brain from the hands (2026-04-08)
Anthropic の Managed Agents (API ベースのエージェント実行基盤) のスケーリング設計。
- 「脳」(LLM 推論) と「手」(ツール実行) を分離する設計
- 100k 並列実行時の課題
- タイムアウト・リトライ・冪等性の扱い
大規模なエージェント運用を考えている企業向けの重要文書。
コンテキスト・プロンプト 2 本
8. Code execution with MCP (2025-11-04)
MCP (Model Context Protocol) 経由でコード実行を扱う話。
- サーバー側で任意コードを実行させる場合のセキュリティ設計
- サンドボックスの選択(Docker、WASM、Firecracker)
- トークン消費を抑える戦略
MCP 入門記事 で基礎を押さえた後に。
9. Introducing advanced tool use (2025-11-24)
Developer Platform の高度なツール使用機能。
- 並列ツール呼び出し
- Tool choice 強制
- ストリーミング中のツール実行
API を直接叩いている開発者向け。
評価・品質 3 本
10. Demystifying evals for AI agents (2026-01-09)
AI エージェントの評価方法 を体系的に説明。
- Unit test 的な評価と、エンドツーエンドの評価の違い
- LLM-as-a-judge のパターンと落とし穴
- 統計的に意味のあるサンプル数、人間との整合性
- 本番運用のモニタリング設計
AI 製品を 1 本でも本番運用している人は必読。
11. Designing AI-resistant technical evaluations (2026-01-21)
AI 時代の技術評価(面接・コーディング試験)の設計。
- Claude や Cursor を使って解ける問題は、評価として機能しない
- 「AI を使っても解けない / AI を使う力そのものを問う」評価の設計
- 現場で使えるテンプレート
採用担当・教育担当向けだが、エンジニア個人としても自分の能力を測り直す視点として有益。
12. Quantifying infrastructure noise in agentic coding evals (2026-02-05)
エージェントコーディング評価における「インフラ由来のノイズ」の計測。
- 同じプロンプトを同じモデルに投げても、結果が変わる原因
- CI 環境の違い、ランダム性、タイムアウト
- 評価数値から真の性能を分離する統計手法
ベンチマーク結果を解釈するための教養として読む価値あり。
インフラ・運用 3 本
13. Harness design for long-running application development (2026-03-24)
長時間走るアプリケーション開発の「ハーネス」設計。
- Claude Code や MulmoTerminal のような CLI ハーネスを作る側の視点
- ターミナル I/O、プロセス管理、セッション永続化
tmuxとの付き合い方
MulmoTerminal の worktree 隔離や tmux 永続化の設計は、まさにこの系譜。
14. How we built Claude Code auto mode (2026-03-25)
Claude Code の auto mode(権限プロンプト抑制モード)の設計。
- 「毎回確認を取る」vs「全自動」の中間点
- 動作のクラス分類(ローカル編集・ネットワーク・破壊的)
- Blast radius を最小化する設計
Claude Code のユーザーは全員読んで、auto mode の挙動を理解しておく価値あり。
15. An update on recent Claude Code quality reports (2026-04-23)
Claude Code の品質低下報告 に関する公式ポストモーテム。
- 2026 年 3-4 月に話題になった「Claude Code が劣化した」の分析
- ユーザー体感と実測の乖離
- 内部での再現検証、修正、再発防止
ポストモーテム記事として、情報開示の姿勢が参考になる。他社も見習うべき。
読む順番の推奨
エンジニア (個人開発者)
- Claude Code: Best practices (必読)
- Building effective agents
- Effective context engineering
- Writing effective tools for agents
これだけで AI コーディングの実践が 2 ランク上がります。
エンジニアリングマネージャー / CTO
- Demystifying evals for AI agents
- How we built our multi-agent research system
- Scaling Managed Agents
- Harness design for long-running application development
組織的に AI エージェントを導入する判断に必要な材料が揃います。
研究者 / 評価設計者
- Demystifying evals
- Designing AI-resistant technical evaluations
- Quantifying infrastructure noise in agentic coding evals
- Eval awareness in Claude Opus 4.6’s BrowseComp performance
評価系の設計 を自分で回すなら、この 4 本から派生する論文を追う。
なぜこのブログが優れているか
同時期の AI 企業(OpenAI、Google、Meta)もエンジニアリング情報を出していますが、以下の点で Anthropic が頭ひとつ抜けています。
1. 実装の意思決定が書いてある
「こう設計した」だけでなく「なぜ A ではなく B にしたか」まで踏み込んでいます。設計判断のロジックを学べる。
2. 失敗と修正が隠されていない
品質低下の postmortem、評価メトリクスの偏り、本番で見つかった問題 — ネガティブ情報を公開しています。これは実際にその会社で働いている人がどう考えているかを推察する材料として極めて価値が高い。
3. 具体的なコード・プロンプト・数値
抽象論に留まらず、実際のプロンプト・コード片・ベンチマーク値 が載っています。真似して試せる。
4. 更新頻度
月 2-4 本のペースで新記事が出ます。業界の最前線を追いかけるのに十分な頻度。
次に読むべき外部ソース
Anthropic Engineering Blog を軸にした読書リストとして:
- Simon Willison’s blog — 外部からの観察・実装例、Anthropic 記事の深掘り解説も多い
- AI Snake Oil (Arvind Narayanan) — 批判的な視点、evaluation の問題意識
- Lilian Weng’s blog (元 OpenAI) — 技術的な深い解説
- Andrej Karpathy on X — Software 3.0 の提唱者、ショートな実践知
Anthropic の記事を軸に、これらの外部視点をレイヤーすると、業界全体を立体的に理解できます。
まとめ
- Anthropic Engineering Blog は AI エージェント開発の一次情報として現時点で最良
- まず読むべき 3 本: Building effective agents / Effective context engineering / Claude Code best practices
- エージェント設計 4 本・コンテキスト 2 本・評価 3 本・インフラ運用 3 本 で合計 15 本をカバー
- 2026 年の AI 製品開発のほとんどの意思決定が、ここに書かれている設計原則の派生
ブックマーク登録推奨: https://www.anthropic.com/engineering
関連リンク
- Anthropic Engineering Blog
- MCP (Model Context Protocol) 入門
- Software 3.0 とは — AI 時代のプログラミング・パラダイム
- Claude Code vs Codex vs Gemini CLI — 2026 年版比較
- AI エージェント並列化で開発速度 10 倍
- MulmoTerminal — Claude Code を並列実行するコックピット
Singularity Society はテクノロジー集団として MulmoClaude / MulmoTerminal / MulmoCast を開発しています。エンジニア・起業家向けの実践プログラム BootCamp も運営しています。
