system.query_log para identificar patrones recurrentes de consultas lentas, elegir una ejecución representativa y revisar su uso de recursos. A continuación, usará EXPLAIN para inspeccionar el plan de consulta y formular una hipótesis sobre el cuello de botella antes de modificar la consulta o el esquema.
Antes de empezar
nyc_taxi.trips_small_inferred. Para ejecutarlos tal como se muestran, cree y cargue la tabla si aún no lo ha hecho:
Configure el conjunto de datos de ejemplo
Configure el conjunto de datos de ejemplo
El archivo Parquet de origen ocupa aproximadamente 5,8 GB. La carga puede tardar varios minutos, según la red y los recursos disponibles.
SYSTEM FLUSH LOGS, espere a que el registro de consultas se vacíe automáticamente y vuelva a intentar la primera búsqueda. Al diagnosticar su propia carga de trabajo, asegúrese de que system.query_log contenga ejecuciones completadas dentro del intervalo de tiempo que desea inspeccionar.
Cómo funciona
system.query_log. Cada registro puede incluir la duración de la consulta, el número de filas leídas, el uso de CPU y memoria, y la actividad de la caché del sistema de archivos.
Estas mediciones ayudan a identificar patrones de consultas lentas y a comprender cómo usan los recursos. Tras seleccionar una ejecución representativa, puede inspeccionar su plan de consulta para investigar en qué puntos podría estar invirtiendo tiempo la consulta.
En un clúster, los datos del registro de consultas se mantienen localmente en cada nodo. Los ejemplos de esta guía usan clusterAllReplicas para consultar todas las réplicas y merge para incluir la tabla system.query_log actual y cualquier tabla query_log_N versionada que se conserve tras cambios en el esquema de las tablas del sistema.
Cada ejemplo del registro de consultas incluye pestañas para implementaciones en clúster y de un solo nodo. ClickHouse Cloud proporciona el clúster default utilizado en los ejemplos de clúster. En una implementación autogestionada, sustituya default por un clúster que figure en system.clusters.
Los ejemplos establecen
skip_unavailable_shards para que una réplica temporalmente no disponible no provoque un error en la consulta de diagnóstico. Esto resulta especialmente útil durante el escalado automático. Los registros de una réplica omitida no se incluyen, por lo que los resultados pueden estar incompletos.Diagnostique una consulta lenta
Identifique las consultas problemáticas
Comience agrupando las consultas iniciales completadas por Utilice El campo
normalized_query_hash. Esto permite distinguir los patrones de consulta recurrentes de las ejecuciones lentas puntuales. La siguiente consulta ordena los patrones según su duración mediana e incluye una consulta de ejemplo para cada patrón:- Clúster
- Nodo único
executions para distinguir un workload recurrente de queries aisladas. Un pattern con una duración mediana elevada, ejecuciones frecuentes o un uso elevado de recursos es un candidate más claro para la investigation que una única ejecución lenta.A modo de inventario rápido, la siguiente consulta muestra la ejecución completada más lenta de hasta cinco query patterns distintos sobre el NYC Taxi dataset. Excluye las sentencias de carga del dataset y las ejecuciones repetidas del mismo patrón. En el paso siguiente, acotará el query history a las ejecuciones con el normalized_query_hash que seleccionó más arriba.- Clúster
- Nodo único
query_duration_ms contiene la duración de la consulta en milisegundos. En estos resultados, la consulta de mayor duración tardó 2967 ms.También puede identificar consultas candidatas según el uso de recursos en lugar de la duración de la consulta:Identifique las consultas que consumen muchos recursos
Identifique las consultas que consumen muchos recursos
Esta consulta ordena las consultas recientes por uso de memoria e incluye su uso de CPU. Los resultados varían según la carga de trabajo y la implementación:
- Clúster
- Nodo único
Elija una ejecución representativa de una consulta
Una sola ejecución lenta podría ser un valor atípico causado por una consulta ad hoc o una carga temporal del sistema. Antes de inspeccionar el plan de consulta, revise varias ejecuciones completadas con el mismo Los resultados de ejemplo del registro de consultas muestran que cada candidato leyó aproximadamente 329,04 millones de filas. Como referencia, confirme el número de filas de la tabla de ejemplo:La tabla contiene 329,04 millones de filas, aproximadamente la misma cantidad que se muestra en
normalized_query_hash, que es idéntico para las consultas que solo difieren en valores literales. Elija una ejecución que represente la duración y el uso de recursos habituales del patrón.Sustituya el valor asignado a selected_hash por el normalized_query_hash del patrón que desea investigar:- Clúster
- Nodo único
- Busque ejecuciones con valores similares de
read_rowsyread_bytes. - Compare
query_duration_msymemory_usagede esas ejecuciones. - Seleccione el
query_idcuyoquery_duration_mssea más cercano a la mediana.
Los resultados históricos del registro de consultas pueden variar según el estado de la caché y la carga del sistema; utilícelos para elegir una consulta que investigar, no para comparar cambios de optimización. Si el registro de consultas no contiene suficientes ejecuciones completadas, ejecute la consulta varias veces en condiciones similares. La siguiente guía, Aislar cuellos de botella de las consultas, explica cómo recopilar mediciones controladas para comparar cambios.
read_rows para cada candidato. Esto sugiere que las consultas examinaron la mayor parte o la totalidad de la tabla, pero no indica por qué se leyeron esas filas ni si esa cantidad es adecuada para la consulta. A continuación, inspeccione el plan de consulta para ver cómo ClickHouse seleccionó y procesó los datos.Inspeccione el plan de ejecución
Después de seleccionar una ejecución representativa, usa La salida incluye las siguientes operaciones. Detalles como el número de partes y gránulos dependen de cómo se almacenan los datos:De abajo hacia arriba, el plan se corresponde con la consulta de la siguiente manera:
EXPLAIN para examinar cómo ClickHouse planifica la consulta sin ejecutarla. La salida muestra las operaciones que ClickHouse prevé realizar y cómo se mueven los datos entre ellas, lo que aporta más contexto a las mediciones del registro de consultas.Para consultar una introducción detallada a los formatos de salida disponibles, consulta Comprender la ejecución de consultas con el analyzer. En este ejemplo, EXPLAIN muestra cómo ClickHouse planea leer y filtrar los datos, y si puede omitir alguno de ellos.La salida es un árbol de operaciones que muestra cómo ClickHouse prevé leer, filtrar y procesar los datos. Las operaciones secundarias aparecen debajo de sus operaciones principales. Comienza con la operación de lectura más profunda y luego sigue el plan hacia arriba para ver cómo ClickHouse transforma los datos en el resultado final.Para este ejemplo, examina la consulta de velocidad calculada de los resultados del registro de consultas:ReadFromMergeTreelee denyc_taxi.trips_small_inferred. La ausencia de la secciónIndexes, junto con el hecho de queread_rowscoincide con el número de filas de la tabla, muestra que ClickHouse lee toda la tabla.Filtermuestra la expresión expandida paraspeed_mph > 30. Para cada fila leída, ClickHouse calcula la duración y la velocidad del viaje, y conserva solo las filas con una velocidad superior a 30 millas por hora.Aggregatingcalcula los cuantiles a partir de los valores filtrados detrip_distance.
speed_mph durante el filtrado y calcular los cuantiles.