cluster_table_function_buckets_batch_size
bucket. Система накапливает данные, пока не достигнет как минимум этого объёма. Фактический размер может быть немного больше для выравнивания по границам данных.
cluster_table_function_split_granularity
file— каждая задача обрабатывает файл целиком.bucket— задачи создаются для каждого внутреннего блока данных в файле (например, для групп строк в Parquet).
bucket) может повысить параллелизм при работе с небольшим числом крупных файлов.
Например, если файл Parquet содержит несколько групп строк, включение гранулярности bucket позволяет обрабатывать каждую группу независимо разными воркерами.