Requisitos do pipeline
- A tabela de origem no BigQuery deve existir.
- A tabela de destino no ClickHouse deve existir.
- O host do ClickHouse deve estar acessível a partir das máquinas worker do Dataflow.
Parâmetros do template
Os valores padrão de todos os parâmetros de
ClickHouseIO podem ser encontrados no conector Apache Beam ClickHouseIOEsquema das tabelas de origem e de destino
- Os templates criam um objeto de esquema com base na tabela de destino do ClickHouse.
- Os templates percorrem o conjunto de dados do BigQuery e tentam fazer a correspondência das colunas com base em seus nomes.
Mapeamento de tipos de dados
Executando o template
Revise este documento e, em especial, as seções acima para entender completamente os requisitos de configuração
e os pré-requisitos do template.
- Google Cloud Console
- Google Cloud CLI
Faça login no Google Cloud Console e procure por DataFlow.
- Clique no botão
CREATE JOB FROM TEMPLATE - Quando o formulário do template abrir, informe um nome para o job e selecione a região desejada.
- No campo
DataFlow Template, digiteClickHouseouBigQuerye selecione o templateBigQuery to ClickHouse - Depois de selecionado, o formulário será expandido para que você possa fornecer detalhes adicionais:
- A URL JDBC do servidor ClickHouse, no formato
jdbc:clickhouse://host:port/schema. - O nome de usuário do ClickHouse.
- O nome da tabela de destino do ClickHouse.
- A URL JDBC do servidor ClickHouse, no formato
A opção de senha do ClickHouse aparece como opcional, para casos em que nenhuma senha esteja configurada.
Para adicioná-la, role a página até a opção
Password for ClickHouse Endpoint.- Personalize e adicione quaisquer configurações relacionadas ao BigQuery/ClickHouseIO, conforme detalhado na seção Parâmetros do template
Monitore o job
Solução de problemas
Erro de limite de memória (total) excedido (código 241)
- Aumente os recursos da instância: faça upgrade do seu servidor ClickHouse para uma instância maior, com mais memória, para suportar a carga de processamento de dados.
- Reduza o tamanho do lote: ajuste o tamanho do lote na configuração do job do Dataflow para enviar fragmentos menores de dados ao ClickHouse, reduzindo o consumo de memória por lote. Essas mudanças podem ajudar a equilibrar o uso de recursos durante a ingestão de dados.
Código-fonte do template
GoogleCloudPlatform/DataflowTemplates— o repositório original do Google Cloud Platform.ClickHouse/DataflowTemplates— o fork do ClickHouse.