Skip to content

Agentic Data Stack

dustin
2026年3月3日 · 14分で読む

Agentic Data Stack は、エージェント型アナリティクスのためのオープンソースで構成可能なアーキテクチャです。データの保管場所を問わず、AI エージェントをデータへ直接接続します。

Docker を使って手元のノート PC 上でスタックを実行すれば、1 分足らずでデータのクエリを始められます。

git clone https://github.com/ClickHouse/agentic-data-stack && cd agentic-data-stack && ./scripts/prepare-demo.sh && docker compose up -d

詳細については、後述の「使い始める」セクションをご覧ください。

なぜ Agentic Data Stack なのか?

エンタープライズにおける従来の分析ワークフローには、複数のステップと引き継ぎが伴います。ビジネスユーザーが質問し、チケットが発行され、アナリストがダッシュボードを作成し、1 週間後にようやく回答が得られる、といった流れです。AI を活用すれば、ユーザーはこのプロセスを省いて疑問に即座に答えを出せます。

それこそが Agentic Data Stack の目指すところです。AI エージェントをデータに直接接続する、オープンソースで構成可能なアーキテクチャを提供します。ダッシュボードも、チケットの待機列も、無駄な待ち時間もありません。リアルタイムのファクトに基づき、あらゆる対話の完全なオブザーバビリティを確保しながら、データと会話するだけです。

オープンソースの Agentic Data Stack における主要な設計原則の 1 つがデータ主権です。すべてを自社で管理できます。

  • データはローカルに保持: ClickHouse はサードパーティのサービスではなく、自社のインフラ上で稼働します
  • 会話のプライバシーを確保: LibreChat はすべてのデータを自社の MongoDB インスタンスに保存します
  • トレースデータも自社のもの: Langfuse は外部の SaaS ではなく、自社の ClickHouse インスタンスに書き込みます
  • モデルの自由な選択: 幅広いプロバイダー、ゲートウェイ、カスタムエンドポイントがサポートされており、フロンティアモデルを利用できるほか、Ollama や vLLM などのツールを介してローカルホストのモデルも利用できます
  • 自由な MCP サーバー接続: ClickHouse だけでなく、任意の MCP サーバーに接続できます。LibreChat では librechat.yaml 経由に加え、ユーザーインターフェース上から動的にカスタム MCP サーバーを追加できます

Agentic Data Stack のアーキテクチャ

Agentic Data Stack は、3 つの柱に基づくオープンソースのリファレンスアーキテクチャです。

レイヤーコンポーネント役割
ChatLibreChatプロバイダーに依存しない、最新のエージェント型チャットインターフェース
DataClickHouse + MCP世界最速の分析用データベース。オープンソースの clickhouse-mcp サーバーを介してエージェントに公開
ObservabilityLangfuseLLM の完全なトレーシング、評価、プロンプト管理を提供し、エージェントが役割を効果的に果たし、継続的かつ定量的に改善できるように支援

各レイヤーは業界最高水準で、完全なオープンソースであり、単体でも有用です。これらが組み合わさることで、個々の総和を超える価値を生み出します。ユーザーは SQL を 1 行も書くことなく、AI エージェントが数十億行のデータをわずか数瞬でクエリし、指定に合わせたインタラクティブな可視化を自動生成して調整し、有用で共有可能なインサイトを提供し、出力の品質を継続的に監視できるエンドツーエンドのプラットフォームが実現します。

01-architecture.webp

LibreChat

LibreChat はシステムの玄関口です。ChatGPT スタイルの使い慣れた UI を備え、複数の LLM プロバイダーを同時にサポートします。ユーザーは会話の途中でプロバイダーやモデルを切り替えたり、異なるデータセットやユースケース向けに特化したエージェントを作成したり、ウェブ検索やマルチモーダルアップロードといった最新のエージェント向けツールを活用したり、冗長性や推論の労力といったプロバイダー固有のモデルパラメーターを微調整したり、会話や成果物 (Artifacts) をチーム全体で共有したりできます。

LibreChat は単なるチャット画面にとどまりません。以下の機能をサポートしています。

  • MCP サーバー接続: エージェントが実行時にツールを検出して使用可能
  • Artifacts: チャート、テーブル、可視化をインラインで生成
  • RAG: ドキュメントに基づいた回答のための、pgvector をバックエンドとした検索拡張生成
  • エージェント機能: コード実行、ウェブ検索、ファイル検索、OCR、プロンプトの連鎖

このスタックでは、LibreChat は ClickHouse MCP サーバーにあらかじめ接続設定されているため、会話を開いた瞬間からエージェントがデータへアクセスできます。

ClickHouse MCP

ClickHouse MCP サーバー は、エージェント型アナリティクスを実現するための重要なミドルウェアです。この構成では HTTP 経由で Model Context Protocol を実装し、ClickHouse の機能を任意の LLM から呼び出せるツールとして公開します。
エージェントがデータに関する質問に答える際の流れは以下のとおりです。

  1. ユーザーが LibreChat で質問: 「前四半期の売上トップ 10 の顧客は誰ですか?」
  2. LLM が質問を推論: データベースへのクエリが必要であると判断
  3. LLM が MCP サーバーの run_select_query ツールを呼び出し: リクエストを ClickHouse の SQL クエリに変換
  4. ClickHouse がクエリを実行: 数十億行のデータに対して 1 秒未満で処理
  5. 結果が返送: MCP を経由して LLM に届き、人間が読みやすい回答に整形。会話で Artifacts が有効になっている場合は、美しく描画されたチャートやテーブルも生成

2.png

MCP サーバーはベアラートークンで認証される軽量な HTTP サービスとして動作し、ネイティブの HTTP インターフェース経由で ClickHouse に接続します。Docker Compose の構成では、デフォルトで Langfuse と同じ ClickHouse インスタンスに接続されますが、librechat.yaml 設定ファイルまたは MCP 設定 UI から、ClickHouse Cloud を含む任意の ClickHouse 環境を指定できます。

Langfuse

LibreChat が実行するすべての LLM 呼び出しは Langfuse でトレースされます。これにより、以下の機能が得られます。

  • 完全なトレースの可視化: 任意の会話におけるプロンプト、ツール呼び出し、レスポンスの一連の流れを確認
  • コストとレイテンシの監視: プロバイダーやモデルごとの利用コストを追跡
  • 品質評価: カスタムメトリクスで出力をスコアリングし、ハルシネーションを検出し、自動評価を実行
  • プロンプト管理: 本番環境にデプロイする前にプロンプトのバージョン管理とテストを実施

3.png 4.png

このスタックでは Langfuse にあらかじめプロジェクトキーが自動プロビジョニングされているため、起動した瞬間からトレーシングが機能します。localhost:3000 で Langfuse を開けば、すべての対話がリアルタイムに流れてくるのを確認できます。

なぜ今なのか?

1. LLM が SQL を高精度に記述できるようになった

最新の基盤モデルは、自然言語を複雑な分析クエリへ高精度に変換できます。JOIN、ウィンドウ関数、CTE、時系列の集計なども理解します。スキーマのメタデータ、テーブルのコメント、適切なシステムプロンプトを組み合わせることで、一般的な非エンジニアのビジネスユーザーを大きく上回る品質の出力を実現できます。

2. Model Context Protocol の普及

Model Context Protocol (MCP) は、外部システムと対話するための標準化された方法を LLM に提供します。データベース、API、ツールごとに個別の連携を構築する代わりに、MCP はエージェント型の対話に向けて設計された単一のインターフェースを提供します。ClickHouse MCP サーバーにより、LibreChat、Claude Desktop、Cursor、あるいは自社の独自アプリケーションなど、あらゆる MCP 対応クライアントが自然言語から導かれたツール呼び出しを通じて ClickHouse にクエリを発行できるようになります。

これは根本的な転換です。MCP により、データベースは受動的なデータストアから、AI エージェントが自律的に検出、探索、クエリを実行できるエージェント向けのリソースへと進化します。

3. LLM オブザーバビリティツールの成熟

LLM を活用したアプリケーションは非決定的です。同じプロンプトでも異なるレスポンスが生成されることがあります。本番環境において、エージェントやモデルの有効性に関するユーザーからの感覚的な報告だけでは、適切なビジネス上の意思決定を下すための十分なデータとは言えません。すべてのプロンプト、ツール呼び出し、レスポンスをトレースする必要があります。出力品質をスコアリングし、コストとレイテンシを監視し、ユーザーが気づく前に性能の低下を検出しなければなりません。ClickHouse による Langfuse の買収 (2026年1月) により、主要なオープンソース LLM オブザーバビリティプラットフォームがこのスタックに加わりました。Langfuse 自体も内部で ClickHouse 上で稼働しており、AI のオブザーバビリティが求める大量の書き込みと高速な分析クエリを支えています。

導入実績

すでに多くの組織が Agentic Data Stack を活用してデータ活用のあり方を変革しています。

Shopify は社内で LibreChat を運用しており、ほぼ全社的な普及を達成し、30 以上の社内 MCP サーバーに接続された数千のカスタムエージェントが稼働しています。CEO の Tobi Lutke 氏は公に次のように言及しています: 「Shopify では LibreChat の社内フォークを運用しており、ほとんどの変更を本家にマージしています。社内 LLM システムを検討している他の企業にも、このプロジェクトを調べることを強くお勧めします。」

Canva は、オブザーバビリティ、プロンプト管理、評価のために Langfuse を活用したマルチエージェントによるカスタマーサポート基盤を構築しました。これにより、エンジニアだけでなく非技術部門のメンバーも、多岐にわたる評価メトリクスに基づいて AI の品質改善を進められるようになりました。

がんゲノム研究プラットフォームである cBioPortal は、このスタック上に cBioAgent を構築しました。研究者が自然言語を通じて、がんゲノムや治療経過に関するまったく新しい疑問を掘り下げられる環境を実現しています。

Khan Academy は、1 億 5,000 万人以上の登録学習者向け AI チューターである Khanmigo の構築と運用に Langfuse を採用しています。Langfuse の初期のエンタープライズ顧客の 1 つとして、利用は 11 チーム、100 人以上のユーザーに広がり、経営陣、エンジニア、サポートチームの全員が意思決定、デバッグ、インシデント調査にトレースを活用しています。

Daimler Truck は LibreChat を社内デプロイしており、全社導入以来、従業員が製造サポートから特殊なデータ検索に至る業務のために 3,000 以上のカスタム AI エージェント を作成しています。

Fetch は、エージェント型アナリティクスを中核に据えた FAST 製品を ClickHouse 上に構築し、これを*「データインタラクションの未来」*と呼んでいます。

400 万以上の加盟店にサービスを提供するグローバルフィンテック企業の SumUp は、AI を活用した加盟店向けの一次サポートをデプロイしました。Langfuse を導入し、複数の市場や言語にまたがる複雑な LLM 対話のエンドツーエンドのトレーシングとプロンプト管理を実現しています。

ClickHouse 社内でも本スタックを活用しています。DWAINE (Data Warehouse AI Natural Expert) というエージェントを通じて運用しており、現在では 200 人以上の社内ユーザー向けにデータウェアハウスへのクエリの約 70% を処理し、1 日あたり 3,300 万の LLM トークンを処理しています。

使い始める

Agentic Data Stack を手軽に体験するには、Docker を使ってローカルで実行するのが最も早いです。

git clone https://github.com/ClickHouse/agentic-data-stack && cd agentic-data-stack && ./scripts/prepare-demo.sh && docker compose up -d

手順はこれだけです。ブラウザで http://localhost:3080 を開いて LibreChat に、http://localhost:3000 を開いて Langfuse にアクセスすれば、データへの質問をすぐに始められます。

prepare-demo.sh スクリプトが、LLM プロバイダーの API キーの取り込み、ランダムなパスワード、JWT シークレット、暗号化キー、MCP 認証トークンの生成、各サービス間の連携設定など、煩雑なセットアップを自動で処理します。初回に .env ファイルを生成する際に環境変数を渡すか、生成後に .env ファイルを手動で編集することで、初期ユーザーの認証情報をカスタマイズできます。

USER_EMAIL="analyst@company.com" USER_PASSWORD="secure-password" USER_NAME="Data Team" ./scripts/prepare-demo.sh

または、AgentHouse のホスト型デモを試すことも可能です。ClickHouse Playground 上で稼働している公開データセットと対話しながら、Agentic Data Stack の実力を体験していただけます。


この記事をシェア

  • Y Combinator icon
  • X icon
  • Bluesky icon
  • Facebook icon
  • LinkedIn icon

Subscribe to our newsletter

Stay informed on feature releases, product roadmap, support, and cloud offerings!

Follow us

XBlueskySlackGithubTelegramMeetupRSS