Это руководство предоставляет корпоративным командам, оценивающим ClickHouse Cloud, исчерпывающую информацию о возможностях мониторинга и обсервабилити для развертываний в продакшне. Корпоративные заказчики часто спрашивают о встроенных возможностях мониторинга, интеграции с существующими стеками обсервабилити, включая такие инструменты, как Datadog и AWS CloudWatch, а также о том, как мониторинг ClickHouse соотносится с самоуправляемыми развертываниями.
Расширенная панель обсервабилити
ClickHouse Cloud предоставляет комплексные возможности мониторинга через встроенные интерфейсы панелей мониторинга, доступные в разделе Monitoring. Эти панели мониторинга визуализируют системные метрики и метрики производительности в реальном времени без дополнительной настройки и служат основными инструментами для мониторинга продакшн-среды в реальном времени в ClickHouse Cloud.
- Advanced Dashboard: основной интерфейс панели мониторинга, доступный через Monitoring → Advanced dashboard, обеспечивает видимость в реальном времени частоты запросов, использования ресурсов, состояния системы и производительности хранилища. Эта панель мониторинга не требует отдельной аутентификации, не мешает инстансам переходить в состояние простоя и не создает дополнительную нагрузку запросами на вашу продакшн-систему. Каждая визуализация строится на основе настраиваемых SQL-запросов, а готовые диаграммы сгруппированы по метрикам, специфичным для ClickHouse, показателям состояния системы и метрикам, специфичным для Cloud. Вы можете расширить возможности мониторинга, создавая пользовательские запросы прямо в SQL Console.
Доступ к этим метрикам не отправляет запрос к базовому сервису и не выводит бездействующие сервисы из состояния простоя.
Пользователи, которые хотят расширить эти визуализации, могут использовать функцию dashboards в ClickHouse Cloud, выполняя запросы напрямую к системным таблицам.
- Native advanced dashboard: альтернативный интерфейс панели мониторинга, доступный по ссылке “You can still access the native advanced dashboard” в разделе Monitoring. Он открывается в отдельной вкладке, требует аутентификации и предоставляет альтернативный интерфейс для мониторинга состояния системы и сервиса. Эта панель мониторинга поддерживает расширенную аналитику: вы можете изменять лежащие в ее основе SQL-запросы.
Обе панели мониторинга обеспечивают мгновенную видимость состояния сервиса и производительности без внешних зависимостей, что отличает их от внешних инструментов, ориентированных на отладку, таких как ClickStack.
Подробное описание возможностей панели мониторинга и доступных метрик см. в документации по advanced dashboard.
Query Insights и мониторинг ресурсов
ClickHouse Cloud предоставляет дополнительные возможности мониторинга:
- Query Insights: встроенный интерфейс для анализа производительности запросов и устранения неполадок
- Панель использования ресурсов: отслеживает использование памяти, выделение CPU и динамику передачи данных. Графики использования CPU и памяти показывают максимальное значение метрики использования за определенный период времени. График использования CPU показывает метрику загрузки CPU на уровне системы (а НЕ метрику загрузки CPU ClickHouse).
Подробную информацию см. в документации по Query Insights и использованию ресурсов.
Совместимая с Prometheus конечная точка метрик
ClickHouse Cloud предоставляет конечную точку Prometheus. Это позволяет сохранить текущие рабочие процессы, использовать имеющуюся экспертизу команды и интегрировать метрики ClickHouse в корпоративные платформы мониторинга, включая Grafana, Datadog и другие инструменты, совместимые с Prometheus.
Конечная точка на уровне организации объединяет метрики всех сервисов, а конечные точки отдельных сервисов обеспечивают более детальный мониторинг. Основные возможности:
- Опция фильтрации метрик: необязательный параметр filtered_metrics=true уменьшает объем передаваемых данных с более чем 1000 доступных метрик до 125 «критически важных» метрик, что помогает оптимизировать затраты и упростить мониторинг
- Кэшированная выдача метрик: используются materialized views, обновляемые каждую минуту, чтобы минимизировать нагрузку от запросов на системы в продакшн
Этот подход учитывает поведение сервиса при простое, что позволяет оптимизировать затраты, когда сервисы не обрабатывают запросы активно. Для этой конечной точки API требуются учетные данные ClickHouse Cloud API. Полные сведения о конфигурации конечной точки см. в документации по Prometheus в Cloud.
Внешняя интеграция позволяет организациям сохранять устоявшиеся процессы мониторинга, использовать накопленную в командах экспертизу работы со знакомыми инструментами и встраивать мониторинг ClickHouse в более широкий контур обсервабилити инфраструктуры без нарушения текущих процессов и без необходимости значительных вложений в переобучение.
Команды могут применять существующие правила оповещений и процедуры эскалации к метрикам ClickHouse, одновременно сопоставляя производительность базы данных с состоянием приложений и инфраструктуры в рамках единой платформы обсервабилити. Такой подход помогает максимально повысить отдачу от текущих систем мониторинга и ускоряет устранение неполадок за счет консолидированных панелей мониторинга и привычных интерфейсов инструментов.
Мониторинг в Grafana Cloud
Grafana поддерживает мониторинг ClickHouse как через прямую интеграцию с плагином, так и с помощью подходов на основе Prometheus. Интеграция через конечную точку Prometheus позволяет сохранять операционное разделение между мониторингом и производственными рабочими нагрузками, а также визуализировать данные в существующей инфраструктуре Grafana Cloud. Рекомендации по настройке см. в документации Grafana по ClickHouse.
Datadog разрабатывает специальную API-интеграцию, которая обеспечит корректный мониторинг облачного сервиса с учетом перехода сервиса в режим простоя. Пока она не готова, команды могут использовать подход с интеграцией OpenMetrics через конечные точки Prometheus ClickHouse, чтобы разграничить эксплуатационные задачи и снизить затраты на мониторинг. Рекомендации по настройке см. в документации Datadog по интеграции Prometheus и OpenMetrics.
ClickStack — рекомендуемое решение ClickHouse для обсервабилити, предназначенное для глубокого анализа системы и отладки. Оно предоставляет единую платформу для журналов, метрик и трассировок, где ClickHouse выступает в качестве движка хранения. Этот подход основан на HyperDX — интерфейсе ClickStack, который напрямую подключается к системным таблицам внутри вашего экземпляра ClickHouse.
В HyperDX есть панель мониторинга, ориентированная на ClickHouse, со вкладками Selects, Inserts и Infrastructure. Команды также могут использовать синтаксис Lucene или SQL для поиска по системным таблицам и журналам, а также создавать собственные визуализации через Chart Explorer для детального анализа системы.
Этот подход лучше всего подходит для отладки сложных проблем, анализа производительности и глубокого изучения внутреннего состояния системы, а не для оповещений в production в реальном времени.
Обратите внимание: при таком подходе будут активироваться бездействующие сервисы, поскольку HyperDX напрямую выполняет запросы к системным таблицам.
Варианты развертывания ClickStack
- HyperDX в ClickHouse Cloud (закрытая предварительная версия): HyperDX можно запустить на любом сервисе ClickHouse Cloud.
- Helm: Рекомендуется для отладочных сред на базе Kubernetes. Поддерживает интеграцию с ClickHouse Cloud и позволяет настраивать конфигурацию под конкретную среду, лимиты ресурсов и масштабирование через
values.yaml.
- Docker Compose: Развертывает каждый компонент (ClickHouse, HyperDX, OTel collector, MongoDB) отдельно. При интеграции с ClickHouse Cloud вы можете изменить compose-файл и удалить неиспользуемые компоненты, в частности ClickHouse и OpenTelemetry Collector.
- Только HyperDX: Автономный контейнер HyperDX.
Полный перечень вариантов развертывания и сведения об архитектуре см. в документации ClickStack и руководстве по ингестии данных.
Вы также можете собирать метрики из конечной точки Prometheus ClickHouse Cloud через OpenTelemetry Collector и передавать их в отдельное развертывание ClickStack для визуализации.
Прямая интеграция с плагином Grafana
Плагин источника данных ClickHouse для Grafana позволяет визуализировать и исследовать данные напрямую из ClickHouse с использованием системных таблиц. Этот подход хорошо подходит для мониторинга производительности и создания пользовательских дашбордов для детального анализа системы.
Подробные сведения об установке и настройке плагина см. в плагине источника данных ClickHouse. Полное решение для мониторинга с использованием набора Prometheus-Grafana mix-in с преднастроенными дашбордами и правилами оповещений описано в статье Monitor ClickHouse with the new Prometheus-Grafana mix-in.
Прямая интеграция с Datadog
Datadog предлагает для своего агента плагин ClickHouse Monitoring, который напрямую запрашивает системные таблицы. Эта интеграция обеспечивает комплексный мониторинг базы данных с учетом особенностей кластера благодаря функции clusterAllReplicas.
Эта интеграция не рекомендуется для развертываний ClickHouse Cloud из-за несовместимости с механизмом бездействия, используемым для оптимизации затрат, а также из-за эксплуатационных ограничений облачного прокси-слоя.
Непосредственное использование системных таблиц
Вы можете выполнять углубленный анализ производительности запросов, обращаясь напрямую к системным таблицам ClickHouse, в частности к system.query_log. Используя SQL-консоль или клиент ClickHouse, команды могут выявлять медленные запросы, анализировать использование ресурсов и отслеживать закономерности использования в масштабах всей организации.
Анализ производительности запросов
Для анализа производительности запросов можно использовать журнал запросов из системной таблицы.
Пример запроса: найдите 5 самых долгих запросов среди всех реплик кластера:
Сообщество ClickHouse разработало комплексные решения для мониторинга, интегрируемые с популярными стеками обсервабилити. ClickHouse Monitoring предоставляет полноценное решение для мониторинга с преднастроенными дашбордами. Этот проект с открытым исходным кодом предлагает быстрый старт для команд, которые хотят внедрить мониторинг ClickHouse, опираясь на устоявшиеся лучшие практики и проверенные конфигурации дашбордов.
Как и другие подходы к прямому мониторингу базы данных, это решение выполняет запросы напрямую к системным таблицам ClickHouse, из-за чего инстансы не могут переходить в состояние простоя, что негативно сказывается на оптимизации затрат.
Все описанные выше подходы либо используют конечные точки Prometheus, либо управляются через ClickHouse Cloud, либо напрямую выполняют запросы к системным таблицам.
Последний из этих вариантов предполагает выполнение запросов к продакшн-сервису ClickHouse. Это создает дополнительную нагрузку на наблюдаемую систему и не позволяет экземплярам ClickHouse Cloud переходить в неактивное состояние, что ухудшает оптимизацию затрат. Кроме того, если продакшн-система выйдет из строя, мониторинг тоже может пострадать, поскольку они связаны между собой. Этот подход хорошо подходит для глубокого анализа внутреннего состояния системы и отладки, но менее уместен для мониторинга продакшн-среды в реальном времени. При оценке прямой интеграции с Grafana по сравнению с подходами интеграции через внешние инструменты, рассмотренными в следующем разделе, учитывайте этот компромисс между возможностями детального анализа системы и операционными накладными расходами. Последнее изменение 23 июля 2026 г.