> ## Documentation Index
> Fetch the complete documentation index at: https://clickhouse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 视觉

> ClickHouse 智能体的图像输入与视觉理解

export const Image = ({img, alt, size = "lg"}) => {
  const normalizedSize = ["sm", "md", "lg"].includes(size) ? size : "lg";
  return <div className={`ch-image-${normalizedSize}`}>
      <Frame>
        <img src={img} alt={alt} />
      </Frame>
    </div>;
};

export const BetaBadge = ({link, galaxyTrack, galaxyEvent}) => {
  if (link) {
    return <a href={link} target="_blank" rel="noopener noreferrer" className="betaBadge" onClick={galaxyTrack && galaxyEvent ? galaxyOnClick(galaxyEvent) : undefined}>
                <Icon />
                <span>Beta</span>
            </a>;
  }
  return <div className="betaBadge">
            <Icon />
            <span>
                Beta 版功能。 
                <u>
                    <a href="/docs/docs/beta-and-experimental-features#beta-features">
                        了解更多。
                    </a>
                </u>
            </span>
        </div>;
};

<BetaBadge />

视觉功能支持用户上传图片供智能体分析。智能体会将图片传给支持视觉的模型，由其对图片内容进行描述、总结，或回答相关问题。

<div id="enable-it">
  ## 启用视觉功能
</div>

视觉功能仅适用于支持图像输入的模型。如果所选模型无法处理图像输入，消息输入框中的上传控件会被禁用。切换为支持视觉的模型，即可重新启用该控件。

<div id="use-it">
  ## 使用视觉功能
</div>

点击消息输入框左下角的回形针图标，然后选择 **上传到提供商** 来添加图片——可以是截图、照片、图表或示意图。接着，提出任何需要读取图像内容的问题，例如：*"这个查询计划有什么问题？"*、*"请转录这张截图中的文字。"* 或 *"把这个仪表板和上周的对比一下。"*

<Image img="https://mintcdn.com/private-7c7dfe99/A68-kVUDkVcT2W3b/images/cloud/agent-builder/vision/vision.webp?fit=max&auto=format&n=A68-kVUDkVcT2W3b&q=85&s=78df6e1a2168ea4fda310d9f497366db" alt="消息输入框中的回形针菜单已打开，显示“上传到提供商”“作为文本上传”和“上传到代码环境”选项" size="lg" width="3838" height="1936" data-path="images/cloud/agent-builder/vision/vision.webp" />

智能体会将图像视为消息上下文的一部分，因此在同一轮对话中的后续问题里，你可以直接引用它看到的内容，而无需重新上传。

<div id="combine-with-other-tools">
  ## 将视觉与其他工具结合使用
</div>

视觉与[代码解释器](/docs/zh/products/cloud/features/ai-ml/agents/builder/code-interpreter)搭配使用，非常适合进行基于图像的分析——例如，智能体先从截图中读取数字，再运行 Python 计算总和；如果图像中提到了模型需要进一步查找的内容，还可以配合[网页搜索](/docs/zh/products/cloud/features/ai-ml/agents/builder/web-search)使用。
