Skip to main content
O template do BigQuery para o ClickHouse é um pipeline em lote que faz a ingestão de dados de uma tabela do BigQuery para uma tabela no ClickHouse. O template pode ler a tabela inteira ou filtrar registros específicos usando uma consulta SQL fornecida.

Requisitos do pipeline

  • A tabela de origem no BigQuery deve existir.
  • A tabela de destino no ClickHouse deve existir.
  • O host do ClickHouse deve estar acessível a partir das máquinas worker do Dataflow.

Parâmetros do template



Os valores padrão de todos os parâmetros de ClickHouseIO podem ser encontrados no conector Apache Beam ClickHouseIO

Esquema das tabelas de origem e de destino

Para carregar corretamente o conjunto de dados do BigQuery no ClickHouse, o pipeline executa um processo de inferência de colunas com as seguintes fases:
  1. Os templates criam um objeto de esquema com base na tabela de destino do ClickHouse.
  2. Os templates percorrem o conjunto de dados do BigQuery e tentam fazer a correspondência das colunas com base em seus nomes.

Dito isso, seu conjunto de dados do BigQuery (seja uma tabela ou uma consulta) deve ter exatamente os mesmos nomes de colunas da sua tabela de destino do ClickHouse.

Mapeamento de tipos de dados

Os tipos do BigQuery são convertidos com base na definição da sua tabela no ClickHouse. Portanto, a tabela acima mostra o mapeamento recomendado que você deve ter na sua tabela ClickHouse de destino (para uma determinada tabela/consulta do BigQuery):

Executando o template

O template do BigQuery para o ClickHouse pode ser executado pela Google Cloud CLI.
Revise este documento e, em especial, as seções acima para entender completamente os requisitos de configuração e os pré-requisitos do template.
Faça login no Google Cloud Console e procure por DataFlow.
  1. Clique no botão CREATE JOB FROM TEMPLATE
  2. Quando o formulário do template abrir, informe um nome para o job e selecione a região desejada.
  3. No campo DataFlow Template, digite ClickHouse ou BigQuery e selecione o template BigQuery to ClickHouse
  4. Depois de selecionado, o formulário será expandido para que você possa fornecer detalhes adicionais:
    • A URL JDBC do servidor ClickHouse, no formato jdbc:clickhouse://host:port/schema.
    • O nome de usuário do ClickHouse.
    • O nome da tabela de destino do ClickHouse.

A opção de senha do ClickHouse aparece como opcional, para casos em que nenhuma senha esteja configurada. Para adicioná-la, role a página até a opção Password for ClickHouse Endpoint.
  1. Personalize e adicione quaisquer configurações relacionadas ao BigQuery/ClickHouseIO, conforme detalhado na seção Parâmetros do template

Monitore o job

Acesse a aba Dataflow Jobs no Google Cloud Console para monitorar o status do job. Você verá os detalhes do job, incluindo o progresso e eventuais erros:

Solução de problemas

Erro de limite de memória (total) excedido (código 241)

Esse erro ocorre quando o ClickHouse fica sem memória ao processar grandes lotes de dados. Para resolver esse problema:
  • Aumente os recursos da instância: faça upgrade do seu servidor ClickHouse para uma instância maior, com mais memória, para suportar a carga de processamento de dados.
  • Reduza o tamanho do lote: ajuste o tamanho do lote na configuração do job do Dataflow para enviar fragmentos menores de dados ao ClickHouse, reduzindo o consumo de memória por lote. Essas mudanças podem ajudar a equilibrar o uso de recursos durante a ingestão de dados.

Código-fonte do template

O código-fonte do template está disponível em:
Última modificação em 3 de julho de 2026