Mejoras en la experiencia de métricas
Este lote de mejoras facilita la creación de métricas y dashboards, a partir de los comentarios de un cliente que está migrando desde Datadog. Tiene un flujo de trabajo de métricas bien diseñado. Aún no hemos abordado todos sus comentarios, pero la mayoría se centraba en la creación de gráficos y la investigación de dashboards con cientos de series temporales en pantalla.
Un cambio no está relacionado con las métricas, aunque surgió de la misma conversación: los tiles del dashboard ahora se ajustan a una cuadrícula visible mientras los creas. Al arrastrar o cambiar el tamaño de un tile, la cuadrícula aparece detrás y resalta las celdas alrededor de su posición actual. Antes, no quedaba claro dónde terminaría un tile ni si moverlo desplazaría otro. La cuadrícula muestra ambas cosas. Utiliza la misma geometría que el motor de diseño, por lo que las guías coinciden con la posición final del tile, incluso en los bordes derecho e inferior.
Los cambios en las métricas se centran en gráficos con un gran número de series, algo habitual al agrupar por varias dimensiones. Antes, al pasar el cursor sobre un gráfico se mostraban todas las series en esa marca de tiempo. En un gráfico con 300 series, la información sobre herramientas podía ser más alta que el propio gráfico, y la serie bajo el cursor rara vez era la que necesitabas.
Los gráficos con más de 10 series ahora muestran solo la serie más cercana al cursor. Esta se dibuja por encima de las demás, que se atenúan. Los gráficos con 10 series o menos conservan la información sobre herramientas completa y ordenada, por lo que su comportamiento no ha cambiado. La leyenda es más compacta y puede ocultarse por completo. Cuando está visible, también funciona como control de selección y búsqueda rápida, lo que facilita acceder a una serie concreta.
El mayor cambio se produce en pantalla completa, a la que se suele acceder tras detectar una desviación que se quiere investigar. Ahora se puede acceder a la pantalla completa con un clic desde un icono de la barra de herramientas, en lugar de tener que abrir el menú de tres puntos. Una vez abierta, la leyenda adopta un diseño más útil con información resumida y un cuadro de búsqueda. Filtrar por una subcadena en el nombre de la serie permite reducir 300 series a las pocas que interesan, listas para compararlas al pasar el cursor sobre ellas.
Un aspecto cambió después de la llamada. La elección entre la información sobre herramientas para una sola serie o para varias series será configurable, en lugar de depender de un umbral fijo. Comparar los valores absolutos de varias series en el mismo momento dado resulta útil cuando no hay muchas, por lo que los usuarios deberían poder elegir el comportamiento que mejor se adapte al gráfico.
PR relacionadas: #2715 feat(dashboard): mostrar una cuadrícula de ajuste al arrastrar o cambiar el tamaño de un tile, #2722 Mejorar el comportamiento al pasar el cursor en gráficos temporales densos, #2720 feat(dashboard): mover la pantalla completa del tile a un icono de la barra de herramientas de nivel superior, #2719 fix(dashboard): dibujar una serie aislada de gráfico temporal más allá del límite de renderizado de líneas, #2776 Configuración de visualización configurable para gráficos temporales (leyenda, información sobre herramientas, estilo de línea)
Mejoras en el visor de trazas
Dos pequeñas correcciones en el visor de trazas rediseñado, ambas basadas directamente en los comentarios sobre el nuevo diseño.
El panel de detalles del span se trasladó recientemente a la derecha de la cascada, pero no todo el mundo prefería tenerlo allí. Un nuevo control junto al botón de cierre del panel permite moverlo entre el lado derecho, que sigue siendo la ubicación predeterminada, y la parte inferior. Cuando el panel está en la parte inferior, puedes arrastrarlo hasta la altura que mejor te convenga.
El mismo hilo de comentarios también reveló un error de ajuste de línea. Con el ajuste de línea habilitado, los valores de atributo largos sin puntos de corte naturales seguían recortándose. Un
url.path sin espacios, guiones cortos ni guiones largos era un ejemplo. Ahora los valores de atributo pueden dividirse en cualquier carácter, lo que permite leer el valor completo.
PR relacionados: #2693 feat(traces): ajuste de línea break-word de atributos + alternador de diseño
Mejoras del servidor MCP y de las evaluaciones
El cambio más pequeño de esta sección puede tener el mayor impacto en la adopción. Activar el servidor MCP en ClickHouse Cloud era difícil de encontrar: los usuarios debían seguir las instrucciones de la aplicación y luego localizar la configuración adecuada en el plano de control. Ahora el botón abre directamente el modal correspondiente, desde el que se puede activar el servidor.
Brandon sigue mejorando nuestro marco de evaluación para MCP, basándose en su trabajo reciente. El marco de evaluación ahora puede usar un proveedor y un modelo distintos de los que se evalúan. Anteriormente, toda la evaluación debía usar modelos de Anthropic, por lo que un modelo podía terminar calificando su propia salida. Ahora puede proporcionar una clave de OpenAI y una especificación de modelo de juez con prefijo de proveedor para dirigir la calificación a través de OpenAI.
La comparación de jueces reveló algunas diferencias útiles. Algunos aplican la rúbrica con mucho más rigor y consideran fallida una ejecución si no usa una clave específica, mientras que otros aceptan una respuesta suficientemente aproximada. También corregimos un error de calificación desactualizada detectado durante este trabajo. Al volver a calificar un Batch con un juez diferente, ahora se ejecuta el nuevo juez en lugar de devolver el resultado anterior.
Brandon también añadió una nueva herramienta MCP,
clickstack_emerging_signals, tras preguntarle al servidor MCP qué necesitaba para mejorar su puntuación en el escenario de comprobación de estado del servicio. Es un detector de novedades en patrones con dos ventanas. La herramienta extrae patrones de logs y eventos de una ventana de referencia y una ventana actual, y luego compara ambos conjuntos. Informa de patrones nuevos, que se han vuelto significativamente más frecuentes o que han desaparecido.
Esto contrasta con las herramientas existentes: los patrones de eventos describen lo que es común dentro de una ventana, mientras que las diferencias de eventos muestran qué atributos han cambiado. La nueva herramienta añade unos 10 puntos a la puntuación de la comprobación de estado del servicio.
También se han añadido al MCP herramientas CRUD para sources y webhooks, tras una solicitud para configurar la ingestión desde una skill. Ahora los agentes pueden crear, actualizar y eliminar sources y webhooks, en lugar de limitase a consultarlos.
Se está trabajando para ejecutar las evaluaciones en CI para cada pull request, sustituyendo el proceso actual de pegar manualmente las puntuaciones en las descripciones de los PR. La inicialización de S3 ya funciona. El único obstáculo pendiente es conceder a GitHub Action acceso al bucket. Una vez resuelto, los resultados de las evaluaciones deberían llegar mucho más rápido.
PR relacionados: #2710 feat(evals): proveedor/modelo de juez independiente + corrección de omisión de calificación desactualizada al cambiar de juez, #2701 feat(mcp): añadir la herramienta clickstack_emerging_signals, #2702 feat(mcp): herramientas CRUD para source y webhook, #2628 feat(evals): estructura inicial de CI M1, ejecutar evaluaciones MCP de extremo a extremo en GitHub Actions, #2674 feat(evals): inicialización rápida de snapshot de Parquet M2