Fonctionnalités clés
- Compatibilité avec pandas : 209 méthodes de DataFrame pandas, 56 méthodes
.str, plus de 42 méthodes.dt - Optimisation SQL : les opérations sont automatiquement compilées en requêtes SQL optimisées
- Évaluation paresseuse : les opérations sont différées jusqu’à ce que les résultats soient nécessaires
- 630+ méthodes d’API : une API complète pour la manipulation des données
- Extensions ClickHouse : des accesseurs supplémentaires (
.arr,.json,.url,.ip,.geo) indisponibles dans pandas
Architecture
- Chaîne d’opérations différées : les opérations sont enregistrées, et non exécutées immédiatement
- Sélection intelligente du moteur : QueryPlanner oriente chaque segment vers le moteur le plus adapté (chDB pour SQL, Pandas pour les opérations complexes)
- Mise en cache intermédiaire : les résultats sont mis en cache à chaque étape pour accélérer l’exploration itérative
Migration en une ligne depuis Pandas
Comparaison des performances
Benchmark effectué sur 10M lignes. Voir le script de benchmark et le Guide des performances pour plus de détails.
Quand utiliser DataStore
- Vous travaillez avec de grands jeux de données (des millions de lignes)
- Vous effectuez des agrégations et des opérations
groupby - Vous interrogez des données provenant de fichiers, de bases de données ou du stockage cloud
- Vous construisez des pipelines de données complexes
- Vous souhaitez bénéficier de l’API pandas avec de meilleures performances
- Vous préférez écrire directement en SQL
- Vous avez besoin d’un contrôle fin sur l’exécution des requêtes
- Vous travaillez avec des fonctionnalités spécifiques à ClickHouse qui ne sont pas exposées dans l’API pandas
Comparaison des fonctionnalités
Statistiques de l’API
Prise en main
- Démarrage rapide - Installation et utilisation de base
- Migration depuis Pandas - Guide de migration étape par étape
Référence de l’API
- Méthodes de fabrique - Création de DataStore à partir de diverses sources
- Construction de requêtes - Opérations de requête de style SQL
- compatibilité avec pandas - Les 209 méthodes compatibles avec pandas
- Accesseurs - Accesseurs String, DateTime, Array, JSON, URL, IP et Geo
- Agrégation - Fonctions d’agrégation et fonctions de fenêtre
- Opérations d’E/S - Lecture et écriture de données
Sujets avancés
- Modèle d’exécution - Évaluation paresseuse et mise en cache
- Référence de classe - Référence complète de l’API
Configuration et débogage
- Configuration - Toutes les options de configuration
- Performance Mode - Mode axé SQL pour un débit maximal
- Débogage - Explain, profilage et journalisation
Guides d’utilisation de Pandas
- Recettes Pandas - Cas d’usage courants
- Principales différences - Différences importantes avec Pandas
- guide des performances - Conseils d’optimisation
- SQL pour les utilisateurs de Pandas - Comprendre le SQL sous-jacent aux opérations de Pandas
Exemple rapide
Étapes suivantes
- Vous découvrez DataStore ? Commencez par le guide de démarrage rapide
- Vous venez de pandas ? Consultez le guide de migration
- Vous voulez en savoir plus ? Consultez la référence de l’API