Skip to main content
世界中の多くのデータは、Amazon S3バケットに保存されています。 このガイドでは、chDBを使ってそれらのデータをクエリする方法を学びます。

準備

まず、仮想環境を作成します。
それでは、chDB をインストールします。 バージョン 2.0.2 以上であることを確認してください。
次に、IPython をインストールします:
このガイドの以降では、コマンドの実行に ipython を使用します。次を実行して起動できます。
このコードは、Python スクリプトや普段お使いのノートブックでも使用できます。

Parquetメタデータの確認

Amazon reviews データセットのParquetファイルを確認していきます。 その前に、まず chDB をインストールしましょう。
Parquetファイルをクエリする際は、ParquetMetadata入力フォーマットを使うことで、ファイルの内容ではなくParquetメタデータを返せます。 このフォーマットを使用した際に返されるフィールドを確認するため、DESCRIBE句を使ってみましょう。
では、このファイルのメタデータを見てみましょう。 columnsrow_groups はどちらも、多数のプロパティを持つタプルの配列を含んでいるため、ここではひとまず除外します。
この出力から、このParquetファイルには4,000万を超える行があり、42の行グループに分割され、各行には15個のカラムのデータがあることがわかります。 行グループは、データを行単位で論理的に水平分割したものです。 各行グループには関連するメタデータがあり、クエリツールはそのメタデータを利用してファイルを効率的にクエリできます。 それでは、行グループの1つを見てみましょう。

Parquetファイルのクエリ

次に、ファイルの内容をクエリしてみましょう。 これを行うには、上記のクエリから ParquetMetadata を除き、たとえば全レビューで最も多い star_rating を算出します。
興味深いことに、5つ星レビューの数は、他のすべての評価を合計した数よりも多くなっています! Amazon の商品は好評なようで、そうでない場合は、そもそも評価自体を投稿しないのでしょう。
最終更新日 2026年7月23日