cluster_table_function_buckets_batch_size
bucket 拆分粒度的 cluster 表函数中,对任务进行分布式处理时所使用的批次近似大小 (以字节为单位) 。系统会持续累积数据,直到至少达到该大小。为与数据边界对齐,实际大小可能会略大一些。
cluster_table_function_split_granularity
file— 每个任务处理整个文件。bucket— 按文件内部的数据块创建任务 (例如 Parquet 行组) 。
bucket) 可以提高并行度。
例如,如果一个 Parquet 文件包含多个行组,启用 bucket 粒度后,每个行组都可以由不同的工作线程独立处理。