cluster_table_function_buckets_batch_size
bucket 分割粒度を使用する cluster table function でのタスクの分散処理において使われる、バッチのおおよそのサイズ (バイト単位) を定義します。システムは、少なくともこのサイズに達するまでデータを蓄積します。実際のサイズは、データ境界に合わせるため、これよりわずかに大きくなる場合があります。
cluster_table_function_split_granularity
file— 各タスクがファイル全体を処理します。bucket— ファイル内の内部データブロックごとにタスクが作成されます (たとえば、Parquet の行グループ) 。
bucket など) を選ぶと、少数の大きなファイルを扱う場合の並列度を向上できます。
たとえば、Parquet ファイルに複数の行グループが含まれている場合、bucket 粒度を有効にすると、各グループを別々のワーカーが独立して処理できるようになります。