Moteurs disponibles
Configuration du moteur
Configuration globale
Vérifier le moteur actuel
Mode automatique
auto (par défaut), DataStore choisit le moteur optimal pour chaque opération :
Opérations exécutées dans chDB
- Filtrage compatible avec SQL (
filter(),where()) - Sélection de colonnes (
select()) - Tri (
sort(),orderby()) - Regroupement et agrégation (
groupby().agg()) - Jointures (
join(),merge()) - Distinct (
distinct(),drop_duplicates()) - Limitation (
limit(),head(),tail())
Opérations exécutées dans pandas
- Fonctions personnalisées avec
apply(custom_func) - Tableaux croisés dynamiques complexes avec des agrégations personnalisées
- Opérations impossibles à exprimer en SQL
- Lorsque l’entrée est déjà un pandas DataFrame
Exemple
Mode chDB
Quand utiliser
- Traitement de grands volumes de données (millions de lignes)
- Charges de travail d’agrégation intensives
- Lorsque vous recherchez une optimisation SQL maximale
- Comportement cohérent pour toutes les opérations
Caractéristiques de performance
Limites
- Les fonctions Python personnalisées peuvent ne pas être prises en charge
- Certaines fonctionnalités propres à pandas nécessitent une conversion
Mode pandas
Quand utiliser
- Tests de compatibilité avec pandas
- Utilisation de fonctionnalités propres à pandas
- Débogage de problèmes liés à pandas
- Lorsque les données sont déjà au format pandas
Caractéristiques des performances
Moteur Cross-DataStore
Exemple
Logique de sélection du moteur
Arbre de décision du mode Auto
Surcharge au niveau des fonctions
Comparaison des performances
Points clés :
- chDB excelle pour les agrégations et les pipelines complexes
- pandas est légèrement plus rapide pour les opérations simples
- Utilisez le mode
autopour tirer le meilleur parti des deux