Fonctionnalités clés
- CDC en streaming en temps réel : Streamkap capture les changements directement à partir des journaux de votre base de données, garantissant que les données dans ClickHouse sont une réplique en temps réel de la source. Traitement de flux simplifié : transformez, enrichissez, acheminez, mettez en forme et créez des embeddings à partir des données en temps réel avant leur ingestion dans ClickHouse. Le tout, propulsé par Flink, sans la complexité associée
- Entièrement géré et évolutif : Il fournit un pipeline prêt pour la production, sans maintenance, ce qui élimine la nécessité de gérer votre propre infrastructure Kafka, Flink, Debezium ou de registre de schémas. La plateforme est conçue pour un débit élevé et peut passer à l’échelle de façon linéaire pour traiter des milliards d’événements.
- Évolution du schéma automatisée : Streamkap détecte automatiquement les changements de schéma dans la base de données source et les propage vers ClickHouse. Il peut gérer l’ajout de nouvelles colonnes ou la modification des types de colonnes sans intervention manuelle.
- Optimisé pour ClickHouse : L’intégration est conçue pour exploiter efficacement les fonctionnalités de ClickHouse. Par défaut, elle utilise le moteur ReplacingMergeTree pour gérer de manière transparente les mises à jour et les suppressions provenant du système source.
- Livraison fiable : La plateforme offre une garantie de livraison au moins une fois, assurant la cohérence des données entre votre source et ClickHouse. Pour les opérations d’upsert, elle effectue une déduplication basée sur la clé primaire.
Premiers pas
Prérequis
- Un compte Streamkap.
- Les informations de connexion de votre cluster ClickHouse : nom d’hôte, port, nom d’utilisateur et mot de passe.
- Une base de données source (par exemple, PostgreSQL, SQL Server) configurée pour autoriser la CDC. Vous trouverez des guides de configuration détaillés dans la documentation Streamkap.
1
Configurer la source dans Streamkap
- Connectez-vous à votre compte Streamkap.
- Dans la barre latérale, accédez à Connectors et sélectionnez l’onglet Sources.
- Cliquez sur + Add et sélectionnez le type de votre base de données source (par exemple, SQL Server RDS).
- Renseignez les informations de connexion, notamment l’endpoint, le port, le nom de la base de données et les identifiants utilisateur.
- Enregistrez le connecteur.
2
Configurer la destination ClickHouse
- Dans la section Connectors, sélectionnez l’onglet Destinations.
- Cliquez sur + Add, puis choisissez ClickHouse dans la liste.
- Saisissez les informations de connexion de votre service ClickHouse :
- Nom d’hôte : l’hôte de votre instance ClickHouse (par exemple,
abc123.us-west-2.aws.clickhouse.cloud) - Port : le port HTTPS sécurisé, généralement
8443 - Nom d’utilisateur et mot de passe : les identifiants de votre utilisateur ClickHouse
- Base de données : le nom de la base de données cible dans ClickHouse
- Nom d’hôte : l’hôte de votre instance ClickHouse (par exemple,
- Enregistrez la destination.
3
Créer et exécuter le pipeline
- Accédez à Pipelines dans la barre latérale et cliquez sur + Create.
- Sélectionnez la source et la destination que vous venez de configurer.
- Choisissez les schémas et les tables que vous souhaitez diffuser en continu.
- Donnez un nom à votre pipeline et cliquez sur Save.
4
Vérifier les données dans ClickHouse
Connectez-vous à votre cluster ClickHouse et exécutez une requête pour voir les données arriver dans la table cible.
Fonctionnement avec ClickHouse
Moteur de table et gestion des données
- La clé primaire de la table source est utilisée comme clé ORDER BY dans la définition de la table ReplacingMergeTree.
- Les mises à jour effectuées dans la source sont écrites sous forme de nouvelles lignes dans ClickHouse. Lors de son processus de fusion en arrière-plan, ReplacingMergeTree regroupe ces lignes et ne conserve que la version la plus récente en fonction de la clé ORDER BY.
-
Les suppressions sont gérées par un indicateur de métadonnées qui alimente le paramètre ReplacingMergeTree
is_deleted. Les lignes supprimées dans la source ne sont pas retirées immédiatement, mais marquées comme supprimées.- Les enregistrements supprimés peuvent, si vous le souhaitez, être conservés dans ClickHouse à des fins d’analytique