概述
S3BackedMergeTree 将 S3 用作 MergeTree 引擎的存储层。这种表引擎使您能够利用 S3 在可扩展性和成本方面的优势,同时保持 MergeTree 引擎的插入和查询性能。
请注意,与标准 ClickHouse 部署相比,实现和管理存储与计算分离架构更加复杂。虽然自管理 ClickHouse 支持本指南中介绍的存储与计算分离方案,但我们建议使用 ClickHouse Cloud。借助 SharedMergeTree 表引擎,您无需额外配置即可在这种架构下使用 ClickHouse。
本指南假设您使用的是 22.8 或更高版本的 ClickHouse。
1
将 S3 用作 ClickHouse 的磁盘
创建磁盘
在 ClickHouse 的config.d 目录中新建一个文件,用于存放存储配置:BUCKET、ACCESS_KEY_ID 和 SECRET_ACCESS_KEY 替换为你希望用于存储数据的 AWS 存储桶详细信息:region 或发送自定义 HTTP header,可以在此处查看相关设置列表。你也可以将 access_key_id 和 secret_access_key 替换为以下内容,这会尝试从环境变量和 Amazon EC2 元数据中获取凭证:2
创建基于 S3 的表
为了测试 S3 磁盘是否已正确配置,我们可以尝试创建一个表并进行查询。创建一个表,并指定新的 S3 存储策略:请注意,我们不必将引擎指定为 你应该会看到以下结果:现在,向新表中插入一些行:让我们验证这些行是否已插入:在 AWS 控制台中,如果你的数据已成功写入 S3,你应该会看到 ClickHouse 已在你指定的存储桶中创建了新文件。如果一切都正常,你现在已经在使用采用存储与计算分离架构的 ClickHouse!
S3BackedMergeTree。如果 ClickHouse 检测到该表使用 S3 作为存储,它会在内部自动转换引擎类型。确认该表已使用正确的策略创建:3
配置复制以实现容错(可选)
为实现容错,您可以使用分布在多个 AWS 区域的多个 ClickHouse 服务器节点,并为每个节点配置一个 S3 存储桶。可以使用
ReplicatedMergeTree 表引擎来实现 S3 磁盘的复制。有关详细信息,请参阅以下指南: