cluster_table_function_buckets_batch_size
bucket. Le système accumule les données jusqu’à atteindre au moins cette taille. La taille réelle peut être légèrement supérieure afin de respecter les limites des données.
cluster_table_function_split_granularity
file— chaque tâche traite un fichier entier.bucket— des tâches sont créées pour chaque bloc de données interne d’un fichier (par exemple, les groupes de lignes Parquet).
bucket) peut améliorer le parallélisme lorsque vous travaillez avec un petit nombre de fichiers volumineux.
Par exemple, si un fichier Parquet contient plusieurs groupes de lignes, activer la granularité bucket permet de traiter chaque groupe indépendamment par différents workers.