Por que o DataStore é mais rápido
1. SQL Pushdown
2. Poda de colunas
3. Avaliação preguiçosa
Benchmark: DataStore vs pandas
Ambiente de teste
- Dados: 10 milhões de linhas
- Hardware: Laptop comum
- Formato de arquivo: CSV
Resultados
Principais conclusões
- Operações de GroupBy: DataStore até 19,93x mais rápido
- Pipelines complexos: DataStore 5–6x mais rápido (benefício do SQL pushdown)
- Operações simples de fatiamento: Desempenho comparável — diferença insignificante
- Melhor caso de uso: Operações em várias etapas com GroupBy/agregação
- Zero-copy:
to_df()não tem sobrecarga de conversão de dados
Quando o DataStore leva vantagem
Agregações pesadas
Pipelines complexos
Processamento de arquivos grandes
Operações em várias colunas
Quando o pandas se equipara
Pequenos volumes de dados (<1.000 linhas)
Operações simples de fatiamento
Funções lambda personalizadas em Python
ImportanteMesmo em cenários em que o DataStore é “mais lento”, o desempenho geralmente fica no mesmo nível do pandas — a diferença é desprezível na prática. As vantagens do DataStore em operações complexas superam de longe esses casos pontuais.Para um controle mais detalhado da execução, consulte Configuração do mecanismo de execução.
Integração de DataFrame com zero-copy
to_df()praticamente não tem custo — sem serialização nem cópia de memória- Criar um DataStore a partir de um DataFrame do pandas é instantâneo
- A memória é compartilhada entre o DataStore e as views do pandas
Dicas de otimização
1. Ative o modo de desempenho para cargas de trabalho com muita agregação
filter+groupby, com uso de memória reduzido para arquivos Parquet grandes.
Consulte Modo de desempenho para ver todos os detalhes.