> ## Documentation Index
> Fetch the complete documentation index at: https://clickhouse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Vision

> Entrada de imagens e compreensão visual no ClickHouse Agents

export const Image = ({img, alt, size = "lg"}) => {
  const normalizedSize = ["sm", "md", "lg"].includes(size) ? size : "lg";
  return <div className={`ch-image-${normalizedSize}`}>
      <Frame>
        <img src={img} alt={alt} />
      </Frame>
    </div>;
};

export const BetaBadge = ({link, galaxyTrack, galaxyEvent}) => {
  if (link) {
    return <a href={link} target="_blank" rel="noopener noreferrer" className="betaBadge" onClick={galaxyTrack && galaxyEvent ? galaxyOnClick(galaxyEvent) : undefined}>
                <Icon />
                <span>Beta</span>
            </a>;
  }
  return <div className="betaBadge">
            <Icon />
            <span>
                Funcionalidade Beta. 
                <u>
                    <a href="/docs/docs/beta-and-experimental-features#beta-features">
                        Saiba mais.
                    </a>
                </u>
            </span>
        </div>;
};

<BetaBadge />

O Vision permite que os usuários façam upload de imagens para um agente analisar. O agente passa a imagem para um modelo compatível com Vision, que descreve, resume ou responde a perguntas sobre o que há nela.

<div id="enable-it">
  ## Ative os recursos do Vision
</div>

O Vision só funciona com modelos compatíveis com entrada de imagens. Se o modelo selecionado não conseguir processar entrada de imagens, o controle de upload na área de composição da mensagem ficará desabilitado. Mude para um modelo compatível com Vision para reativá-lo.

<div id="use-it">
  ## Use os recursos de Vision
</div>

Clique no ícone de clipe de papel no canto inferior esquerdo da área de composição da mensagem e escolha **Upload to Provider** para anexar uma imagem — uma captura de tela, uma foto, um gráfico ou um diagrama. Em seguida, faça qualquer pergunta que exija a leitura da imagem: *"O que há de errado com este plano de execução da consulta?"*, *"Transcreva o texto desta captura de tela"* ou *"Compare este dashboard com o da semana passada."*

<Image img="https://mintcdn.com/private-7c7dfe99/A68-kVUDkVcT2W3b/images/cloud/agent-builder/vision/vision.webp?fit=max&auto=format&n=A68-kVUDkVcT2W3b&q=85&s=78df6e1a2168ea4fda310d9f497366db" alt="Área de composição da mensagem com o menu do clipe de papel aberto, mostrando as opções Upload to Provider, Upload as Text e Upload to Code Environment" size="lg" width="3838" height="1936" data-path="images/cloud/agent-builder/vision/vision.webp" />

O agente trata a imagem como parte do contexto da mensagem, então perguntas de acompanhamento na mesma interação podem fazer referência ao que ele viu sem precisar reenviá-la.

<div id="combine-with-other-tools">
  ## Combine o Vision com outras ferramentas
</div>

O Vision combina bem com o [code interpreter](/docs/pt-BR/products/cloud/features/ai-ml/agents/builder/code-interpreter) para análises baseadas em imagens — por exemplo, o agente extrai números de uma captura de tela e depois executa Python para calcular totais — e com o [web search](/docs/pt-BR/products/cloud/features/ai-ml/agents/builder/web-search) quando uma imagem faz referência a algo que o modelo precisa pesquisar.
