Exigences du pipeline
- La table source BigQuery doit exister.
- La table ClickHouse cible doit exister.
- L’hôte ClickHouse doit être accessible depuis les machines worker de Dataflow.
Paramètres du template
Les valeurs par défaut de tous les paramètres
ClickHouseIO sont disponibles dans le Connecteur Apache Beam ClickHouseIOSchéma des tables source et cible
- Les templates construisent un objet de schéma à partir de la table ClickHouse cible.
- Les templates parcourent le jeu de données BigQuery et tentent de faire correspondre les colonnes en fonction de leur nom.
Correspondance des types de données
Exécuter le Template
Veillez à consulter ce document, en particulier les sections ci-dessus, afin de bien comprendre les exigences de configuration et les prérequis du template.
- Google Cloud Console
- Google Cloud CLI
Connectez-vous à votre Google Cloud Console et recherchez DataFlow.
- Cliquez sur le bouton
CREATE JOB FROM TEMPLATE - Une fois le formulaire du template ouvert, saisissez un nom de job et sélectionnez la région souhaitée.
- Dans le champ
DataFlow Template, saisissezClickHouseouBigQuery, puis sélectionnez le templateBigQuery to ClickHouse - Une fois sélectionné, le formulaire s’étend pour vous permettre de renseigner des informations supplémentaires :
- L’URL JDBC du serveur ClickHouse, au format suivant
jdbc:clickhouse://host:port/schema. - Le nom d’utilisateur ClickHouse.
- Le nom de la table cible ClickHouse.
- L’URL JDBC du serveur ClickHouse, au format suivant
L’option de mot de passe ClickHouse est indiquée comme facultative, pour les cas d’usage où aucun mot de passe n’est configuré.
Pour l’ajouter, faites défiler la page jusqu’à l’option
Password for ClickHouse Endpoint.- Personnalisez et ajoutez toute configuration liée à BigQuery/ClickHouseIO, comme indiqué dans la section Template Parameters
Surveiller le job
Dépannage
Erreur : limite de mémoire (totale) dépassée (code 241)
- Augmentez les ressources de l’instance : passez à une instance plus grande pour votre serveur ClickHouse, avec davantage de mémoire afin d’absorber la charge liée au traitement des données.
- Réduisez la taille des lots : ajustez la taille des lots dans la configuration de votre job Dataflow pour envoyer à ClickHouse de plus petits volumes de données, ce qui réduit la consommation de mémoire par lot. Ces modifications peuvent aider à mieux répartir l’utilisation des ressources lors de l’ingestion des données.
Code source du template
GoogleCloudPlatform/DataflowTemplates— le dépôt upstream de Google Cloud Platform.ClickHouse/DataflowTemplates— le fork de ClickHouse.