cluster_table_function_buckets_batch_size
버킷 분할 세분화 수준을 사용하는 cluster 테이블 함수에서 작업을 분산 처리할 때 사용하는 배치의 대략적인 크기(바이트 단위)를 정의합니다. 시스템은 최소 이 크기에 도달할 때까지 데이터를 누적합니다. 실제 크기는 데이터 경계에 맞추기 위해 이보다 약간 더 클 수 있습니다.
cluster_table_function_split_granularity
file— 각 작업이 파일 전체를 처리합니다.버킷— 파일 내부의 각 데이터 블록 단위로 작업이 생성됩니다(예: Parquet row groups).
버킷처럼 더 세밀한 세분화 수준을 선택하면, 적은 수의 대용량 파일을 처리할 때 병렬성을 높일 수 있습니다.
예를 들어 Parquet 파일에 여러 row group이 포함된 경우, 버킷 세분화 수준을 사용하면 각 그룹을 서로 다른 워커가 독립적으로 처리할 수 있습니다.