> ## Documentation Index
> Fetch the complete documentation index at: https://clickhouse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# ビジョン

> ClickHouse Agents における画像入力と視覚的理解

export const Image = ({img, alt, size = "lg"}) => {
  const normalizedSize = ["sm", "md", "lg"].includes(size) ? size : "lg";
  return <div className={`ch-image-${normalizedSize}`}>
      <Frame>
        <img src={img} alt={alt} />
      </Frame>
    </div>;
};

export const BetaBadge = ({link, galaxyTrack, galaxyEvent}) => {
  if (link) {
    return <a href={link} target="_blank" rel="noopener noreferrer" className="betaBadge" onClick={galaxyTrack && galaxyEvent ? galaxyOnClick(galaxyEvent) : undefined}>
                <Icon />
                <span>ベータ</span>
            </a>;
  }
  return <div className="betaBadge">
            <Icon />
            <span>
                ベータ機能です。 
                <u>
                    <a href="/docs/docs/beta-and-experimental-features#beta-features">
                        詳しくはこちら。
                    </a>
                </u>
            </span>
        </div>;
};

<BetaBadge />

ビジョンでは、ユーザーがエージェントに解析させる画像をアップロードできます。エージェントはその画像をビジョン対応モデルに渡し、モデルが画像の内容を説明したり、要約したり、画像についての質問に答えたりします。

<div id="enable-it">
  ## ビジョン機能を有効にする
</div>

ビジョンは、画像入力をサポートするモデルでのみ使用できます。選択したモデルが画像入力に対応していない場合、メッセージコンポーザーのアップロードコントロールは無効になります。再度有効にするには、ビジョン対応モデルに切り替えてください。

<div id="use-it">
  ## ビジョン機能を使う
</div>

メッセージコンポーザーの左下にあるクリップアイコンをクリックし、**Upload to Provider** を選んでイメージを添付します。スクリーンショット、写真、チャート、図表などを追加できます。続いて、そのイメージを読み取る必要がある質問をします。たとえば、*"このクエリプランの何が問題ですか？"*、*"このスクリーンショット内のテキストを書き起こしてください"*、*"このダッシュボードを先週のものと比較してください"* といった質問です。

<Image img="https://mintcdn.com/private-7c7dfe99/A68-kVUDkVcT2W3b/images/cloud/agent-builder/vision/vision.webp?fit=max&auto=format&n=A68-kVUDkVcT2W3b&q=85&s=78df6e1a2168ea4fda310d9f497366db" alt="Upload to Provider、Upload as Text、Upload to Code Environment の各オプションが表示された、クリップメニューを開いた状態のメッセージコンポーザー" size="lg" width="3838" height="1936" data-path="images/cloud/agent-builder/vision/vision.webp" />

エージェントはイメージをメッセージコンテキストの一部として扱うため、同じターン内の追加の質問では、再アップロードしなくても見た内容を参照できます。

<div id="combine-with-other-tools">
  ## ビジョンを他のツールと組み合わせる
</div>

ビジョンは、画像に基づく分析では[コードインタープリター](/docs/ja/products/cloud/features/ai-ml/agents/builder/code-interpreter)との相性がよく、たとえばエージェントがスクリーンショットから数値を読み取り、その後 Python を実行して合計を計算できます。また、画像にモデルが調べる必要のある対象が含まれている場合は、[ウェブ検索](/docs/ja/products/cloud/features/ai-ml/agents/builder/web-search)も有効です。
