Skip to main content
El diagnóstico de una consulta lenta comienza con los datos de su historial de consultas. Esta guía muestra cómo usar system.query_log para identificar patrones recurrentes de consultas lentas, elegir una ejecución representativa y revisar su uso de recursos. A continuación, usará EXPLAIN para inspeccionar el plan de consulta y formular una hipótesis sobre el cuello de botella antes de modificar la consulta o el esquema.

Antes de empezar

Los ejemplos de esta guía utilizan la tabla nyc_taxi.trips_small_inferred. Para ejecutarlos tal como se muestran, cree y cargue la tabla si aún no lo ha hecho:
El archivo Parquet de origen ocupa aproximadamente 5,8 GB. La carga puede tardar varios minutos, según la red y los recursos disponibles.
Para reproducir los resultados del registro de consultas de esta guía, ejecute las tres consultas de carga de trabajo de ejemplo al menos dos veces después de cargar el conjunto de datos. A continuación, vacíe el registro de consultas para que las ejecuciones completadas estén disponibles para los ejemplos siguientes:
Si no puede ejecutar SYSTEM FLUSH LOGS, espere a que el registro de consultas se vacíe automáticamente y vuelva a intentar la primera búsqueda. Al diagnosticar su propia carga de trabajo, asegúrese de que system.query_log contenga ejecuciones completadas dentro del intervalo de tiempo que desea inspeccionar.

Cómo funciona

De forma predeterminada, ClickHouse registra información sobre las consultas completadas en la tabla system.query_log. Cada registro puede incluir la duración de la consulta, el número de filas leídas, el uso de CPU y memoria, y la actividad de la caché del sistema de archivos. Estas mediciones ayudan a identificar patrones de consultas lentas y a comprender cómo usan los recursos. Tras seleccionar una ejecución representativa, puede inspeccionar su plan de consulta para investigar en qué puntos podría estar invirtiendo tiempo la consulta. En un clúster, los datos del registro de consultas se mantienen localmente en cada nodo. Los ejemplos de esta guía usan clusterAllReplicas para consultar todas las réplicas y merge para incluir la tabla system.query_log actual y cualquier tabla query_log_N versionada que se conserve tras cambios en el esquema de las tablas del sistema. Cada ejemplo del registro de consultas incluye pestañas para implementaciones en clúster y de un solo nodo. ClickHouse Cloud proporciona el clúster default utilizado en los ejemplos de clúster. En una implementación autogestionada, sustituya default por un clúster que figure en system.clusters.
Los ejemplos establecen skip_unavailable_shards para que una réplica temporalmente no disponible no provoque un error en la consulta de diagnóstico. Esto resulta especialmente útil durante el escalado automático. Los registros de una réplica omitida no se incluyen, por lo que los resultados pueden estar incompletos.

Diagnostique una consulta lenta

Con ejecuciones completadas en el registro de consultas, siga estos tres pasos en orden. Identificará un patrón recurrente de consultas lentas, elegirá una ejecución representativa e inspeccionará el plan de ejecución de la consulta.
1

Identifique las consultas problemáticas

Comience agrupando las consultas iniciales completadas por normalized_query_hash. Esto permite distinguir los patrones de consulta recurrentes de las ejecuciones lentas puntuales. La siguiente consulta ordena los patrones según su duración mediana e incluye una consulta de ejemplo para cada patrón:
Utilice executions para distinguir un workload recurrente de queries aisladas. Un pattern con una duración mediana elevada, ejecuciones frecuentes o un uso elevado de recursos es un candidate más claro para la investigation que una única ejecución lenta.A modo de inventario rápido, la siguiente consulta muestra la ejecución completada más lenta de hasta cinco query patterns distintos sobre el NYC Taxi dataset. Excluye las sentencias de carga del dataset y las ejecuciones repetidas del mismo patrón. En el paso siguiente, acotará el query history a las ejecuciones con el normalized_query_hash que seleccionó más arriba.
El campo query_duration_ms contiene la duración de la consulta en milisegundos. En estos resultados, la consulta de mayor duración tardó 2967 ms.También puede identificar consultas candidatas según el uso de recursos en lugar de la duración de la consulta:
Esta consulta ordena las consultas recientes por uso de memoria e incluye su uso de CPU. Los resultados varían según la carga de trabajo y la implementación:
2

Elija una ejecución representativa de una consulta

Una sola ejecución lenta podría ser un valor atípico causado por una consulta ad hoc o una carga temporal del sistema. Antes de inspeccionar el plan de consulta, revise varias ejecuciones completadas con el mismo normalized_query_hash, que es idéntico para las consultas que solo difieren en valores literales. Elija una ejecución que represente la duración y el uso de recursos habituales del patrón.Sustituya el valor asignado a selected_hash por el normalized_query_hash del patrón que desea investigar:
  1. Busque ejecuciones con valores similares de read_rows y read_bytes.
  2. Compare query_duration_ms y memory_usage de esas ejecuciones.
  3. Seleccione el query_id cuyo query_duration_ms sea más cercano a la mediana.
Los resultados históricos del registro de consultas pueden variar según el estado de la caché y la carga del sistema; utilícelos para elegir una consulta que investigar, no para comparar cambios de optimización. Si el registro de consultas no contiene suficientes ejecuciones completadas, ejecute la consulta varias veces en condiciones similares. La siguiente guía, Aislar cuellos de botella de las consultas, explica cómo recopilar mediciones controladas para comparar cambios.
Los resultados de ejemplo del registro de consultas muestran que cada candidato leyó aproximadamente 329,04 millones de filas. Como referencia, confirme el número de filas de la tabla de ejemplo:
La tabla contiene 329,04 millones de filas, aproximadamente la misma cantidad que se muestra en read_rows para cada candidato. Esto sugiere que las consultas examinaron la mayor parte o la totalidad de la tabla, pero no indica por qué se leyeron esas filas ni si esa cantidad es adecuada para la consulta. A continuación, inspeccione el plan de consulta para ver cómo ClickHouse seleccionó y procesó los datos.
3

Inspeccione el plan de ejecución

Después de seleccionar una ejecución representativa, usa EXPLAIN para examinar cómo ClickHouse planifica la consulta sin ejecutarla. La salida muestra las operaciones que ClickHouse prevé realizar y cómo se mueven los datos entre ellas, lo que aporta más contexto a las mediciones del registro de consultas.Para consultar una introducción detallada a los formatos de salida disponibles, consulta Comprender la ejecución de consultas con el analyzer. En este ejemplo, EXPLAIN muestra cómo ClickHouse planea leer y filtrar los datos, y si puede omitir alguno de ellos.La salida es un árbol de operaciones que muestra cómo ClickHouse prevé leer, filtrar y procesar los datos. Las operaciones secundarias aparecen debajo de sus operaciones principales. Comienza con la operación de lectura más profunda y luego sigue el plan hacia arriba para ver cómo ClickHouse transforma los datos en el resultado final.Para este ejemplo, examina la consulta de velocidad calculada de los resultados del registro de consultas:
La salida incluye las siguientes operaciones. Detalles como el número de partes y gránulos dependen de cómo se almacenan los datos:
De abajo hacia arriba, el plan se corresponde con la consulta de la siguiente manera:
  1. ReadFromMergeTree lee de nyc_taxi.trips_small_inferred. La ausencia de la sección Indexes, junto con el hecho de que read_rows coincide con el número de filas de la tabla, muestra que ClickHouse lee toda la tabla.
  2. Filter muestra la expresión expandida para speed_mph > 30. Para cada fila leída, ClickHouse calcula la duración y la velocidad del viaje, y conserva solo las filas con una velocidad superior a 30 millas por hora.
  3. Aggregating calcula los cuantiles a partir de los valores filtrados de trip_distance.
Este plan identifica tres fuentes de trabajo que se deben evaluar: leer todas las filas, calcular speed_mph durante el filtrado y calcular los cuantiles.

Próximos pasos

A continuación, consulte Aislar cuellos de botella en las consultas para aprender a probar posibles fuentes de carga en condiciones controladas. Compara formas de consulta cada vez más sencillas para identificar qué operaciones requieren una investigación más profunda.
Última modificación el 28 de agosto de 2026