Pourquoi DataStore est plus rapide
1. SQL Pushdown
2. Sélection des colonnes nécessaires
3. Évaluation différée
Benchmark : DataStore vs pandas
Environnement de test
- Données : 10 millions de lignes
- Matériel : ordinateur portable standard
- Format de fichier : CSV
Résultats
Points clés
- Opérations GroupBy : DataStore jusqu’à 19,93x plus rapide
- Pipelines complexes : DataStore 5 à 6x plus rapide (avantage du SQL pushdown)
- Opérations de découpage simples : performances comparables - différence négligeable
- Meilleur cas d’utilisation : opérations en plusieurs étapes avec groupby/agrégation
- Zero-copy :
to_df()n’entraîne aucun surcoût de conversion des données
Quand DataStore est préférable
Agrégations intensives
Pipelines complexes
Traitement des fichiers volumineux
Opérations sur plusieurs colonnes
Quand pandas tient la comparaison
Petits jeux de données (<1 000 lignes)
Opérations de découpage simples
Fonctions lambda Python personnalisées
ImportantMême dans les scénarios où DataStore est “plus lent”, les performances sont généralement du même ordre que celles de pandas — la différence est négligeable en pratique. Les avantages de DataStore pour les opérations complexes l’emportent largement sur ces cas particuliers.Pour un contrôle plus fin de l’exécution, consultez la page Configuration du moteur d’exécution.
Intégration zero-copy des DataFrames
to_df()est pratiquement gratuit - sans sérialisation ni copie en mémoire- La création d’un DataStore à partir d’un pandas DataFrame est instantanée
- La mémoire est partagée entre DataStore et les vues pandas
Conseils d’optimisation
1. Activer le mode Performance pour les charges de travail intensives
filter+groupby, avec une consommation mémoire réduite pour les fichiers Parquet volumineux.
Voir Mode Performance pour plus de détails.