Skip to main content
Grande parte dos dados do mundo está armazenada em buckets do Amazon S3. Neste guia, vamos aprender a consultar esses dados usando o chDB.

Configuração

Primeiro, vamos criar um ambiente virtual:
E agora vamos instalar o chDB. Verifique se você tem a versão 2.0.2 ou superior:
Agora, vamos instalar o IPython:
Vamos usar o ipython para executar os comandos do restante do guia, que você pode iniciar executando:
Você também pode usar o código em um script em Python ou no notebook da sua preferência.

Explorando os metadados do Parquet

Vamos explorar um arquivo Parquet do conjunto de dados Amazon reviews. Mas antes, vamos instalar o chDB:
Ao consultar arquivos Parquet, podemos usar o formato de entrada ParquetMetadata para retornar metadados do Parquet em vez do conteúdo do arquivo. Vamos usar a cláusula DESCRIBE para ver os campos retornados ao usar esse formato:
Agora, vamos dar uma olhada nos metadados deste arquivo. columns e row_groups contêm arrays de tuplas com muitas propriedades, então vamos deixá-los de fora por enquanto.
A partir dessa saída, vemos que este arquivo Parquet tem mais de 40 milhões de linhas, distribuídas em 42 grupos de linhas, com 15 colunas de dados por linha. Um grupo de linhas é uma partição horizontal lógica dos dados em linhas. Cada grupo de linhas tem metadados associados, e as ferramentas de consulta podem usar esses metadados para consultar o arquivo com eficiência. Vamos examinar um dos grupos de linhas:

Consultando arquivos Parquet

Em seguida, vamos consultar o conteúdo do arquivo. Podemos fazer isso ajustando a consulta acima para remover ParquetMetadata e, por exemplo, calcular a star_rating mais frequente em todas as avaliações:
Curiosamente, há mais avaliações de 5 estrelas do que todas as outras notas somadas! Parece que as pessoas gostam dos produtos da Amazon ou, se não gostam, simplesmente não deixam uma avaliação.
Última modificação em 23 de julho de 2026