SELECT e INSERT de datos desde Google Cloud Storage. Requiere el IAM role Storage Object User.
Este es un alias de la función de tabla s3.
Si tiene varias réplicas en el cluster, puede usar en su lugar la función s3Cluster (que funciona con GCS) para paralelizar los inserts.
Sintaxis
Argumentos
GCSLa ruta de GCS tiene este formato, ya que el endpoint de la API XML de Google es distinto del de la API JSON:y no https://storage.cloud.google.com.
url, format, structure, compression_method y partition_strategy funcionan de la misma manera, y se admiten algunos parámetros adicionales:
Valor devuelto
Ejemplos
https://storage.googleapis.com/clickhouse_public_datasets/my-test-bucket-768/data.csv.gz. El método de compresión se detecta automáticamente a partir de la extensión de archivo .gz:
gzip especificado de forma explícita en lugar de depender de la autodetección:
Uso
- ‘https://storage.googleapis.com/my-test-bucket-768/some_prefix/some_file_1.csv'
- ‘https://storage.googleapis.com/my-test-bucket-768/some_prefix/some_file_2.csv'
- ‘https://storage.googleapis.com/my-test-bucket-768/some_prefix/some_file_3.csv'
- ‘https://storage.googleapis.com/my-test-bucket-768/some_prefix/some_file_4.csv'
- ‘https://storage.googleapis.com/my-test-bucket-768/another_prefix/some_file_1.csv'
- ‘https://storage.googleapis.com/my-test-bucket-768/another_prefix/some_file_2.csv'
- ‘https://storage.googleapis.com/my-test-bucket-768/another_prefix/some_file_3.csv'
- ‘https://storage.googleapis.com/my-test-bucket-768/another_prefix/some_file_4.csv'
file-000.csv, file-001.csv, … , file-999.csv:
test-data.csv.gz:
test-data.csv.gz desde una tabla existente:
my-test-bucket-768 de forma recursiva:
test-data.csv.gz ubicados en cualquier carpeta dentro del directorio my-test-bucket, de forma recursiva:
Escritura particionada
PARTITION BY al insertar datos en la tabla GCS, se crea un archivo independiente para cada valor de partición. Dividir los datos en archivos independientes ayuda a mejorar la eficiencia de las operaciones de lectura.
Cuando compatibility se establece en 26.6 o una versión posterior, o cuando se aplican los valores predeterminados actuales, hive es la estrategia de partición predeterminada. Como las rutas que contienen {_partition_id} requieren wildcard, los siguientes ejemplos establecen partition_strategy='wildcard' explícitamente.
Ejemplos
- Usar el ID de la partición en la clave crea archivos independientes:
file_x.csv, file_y.csv y file_z.csv.
- El uso del ID de la partición en el nombre de un bucket crea archivos en buckets diferentes:
my_bucket_1/file.csv, my_bucket_10/file.csv y my_bucket_20/file.csv.