Skip to main content
这些设置可在 system.settings 中查看,并由 源文件 自动生成。

cluster_table_function_buckets_batch_size

定义在采用 bucket 拆分粒度的 cluster 表函数中,对任务进行分布式处理时所使用的批次近似大小 (以字节为单位) 。系统会持续累积数据,直到至少达到该大小。为与数据边界对齐,实际大小可能会略大一些。

cluster_table_function_split_granularity

控制在执行 cluster 表函数 时,如何将数据拆分为任务。 此设置定义了在集群中分发工作的粒度:
  • file — 每个任务处理整个文件。
  • bucket — 按文件内部的数据块创建任务 (例如 Parquet 行组) 。
处理少量大文件时,选择更细的粒度 (如 bucket) 可以提高并行度。 例如,如果一个 Parquet 文件包含多个行组,启用 bucket 粒度后,每个行组都可以由不同的工作线程独立处理。
最后修改于 2026年7月23日