← Volver al blog
La primera fila de un panel de KubeBolt 2.3: cuatro tarjetas con su cifra y su gráfica, y solo una encendida

Los paneles nuevos de KubeBolt 2.3, tarjeta a tarjeta

En la 2.3 rehicimos casi todos los paneles de KubeBolt. Cada uno empieza con una fila de tarjetas con su cifra y su gráfica. Te explico qué dice cada tarjeta de Overview, Fleet y Home, cuándo cambia de color y qué conviene mirar después.

Lo primero que haces al abrir un panel es buscar si algo te necesita. Hasta la 2.2, la primera fila de Overview eran cuatro anillos muy parecidos entre sí, y para saberlo tenías que leerlos todos.

En la 2.3 hemos rehecho casi todos los paneles para que esa primera fila te lo diga nada más entrar. Cada tarjeta tiene una cifra grande con una frase debajo, y una gráfica pequeña que cambia según lo que mide. Solo cambian de color las tarjetas que muestran algo que alguien tiene que revisar.

En este artículo repaso las tarjetas de Overview, Fleet y Home, que son las que más vas a usar, y al final resumo el resto de la versión. Si solo quieres saber qué trae la 2.3:

  • Paneles nuevos en Overview, Home, Fleet, Capacity, Reliability, Cost, Security, Nodes y el uso de Kobi.
  • Autopilot reparte el crédito a lo largo del mes y deja de repetir diagnósticos que ya tiene.
  • Kobi lee el disco de los nodos, algo que desde la 2.2.0 rechazaba por error.
  • Un usuario con rol de lector ya no puede aprobar acciones de Autopilot.
  • KubeBolt se instala en OpenShift sin pasos adicionales.

Overview, tarjeta a tarjeta

Overview es el panel de un clúster, y el que más ha cambiado.

La fila de tarjetas de Overview en la 2.2, con anillos sobre fondo azulado, y en la 2.3, con cada cifra acompañada de su gráfica
Overview en la 2.2 (arriba) y en la 2.3 (abajo). La interfaz de la aplicación está hoy solo en inglés.

Su primera fila tiene cuatro tarjetas:

  1. Cluster health. Una nota de 0 a 100 dibujada como un semicírculo. Parte de 100 y resta puntos por los insights abiertos según su gravedad; al lado ves cuántos puntos resta cada grupo, así que sabes de dónde sale la nota sin abrir nada. Debajo, cuántos insights críticos hay.
  2. Nodes ready. Los nodos listos sobre el total y los más cargados en anillos: el anillo interior es la CPU y el exterior, la memoria. Si un nodo está al límite, se nota antes de leer el número.
  3. Pods. Los pods que funcionan sobre el total, con una línea de cuántos ha habido en las últimas 24 horas. Un pico o un hueco en esa línea suele ser un rollout o un nodo que se fue. Debajo tienes el desglose por estado.
  4. Insights. Cuántos hay abiertos ahora y una lista con las reglas que más se repiten, como service-no-endpoints ×3. Debajo, el reparto por gravedad.

Cada tarjeta lleva a su página. «View all» en Nodes y en Pods abre la lista correspondiente, y la tarjeta de insights abre Insights.

Cuándo se enciende una tarjeta

Una tarjeta cambia de color cuando su cifra necesita que alguien la mire, por ejemplo cuando hay un insight crítico abierto o un nodo que no está listo. Las demás se quedan en gris aunque tengan datos. Rojo para lo crítico y ámbar para lo que está degradado, los mismos colores que en el resto del producto.

TarjetaSe enciende cuando…Qué mirar después
Cluster healthhay al menos un insight crítico abiertola lista de Insights, empezando por los críticos
Nodes readyalgún nodo no está listoese nodo y sus eventos recientes
Podshay pods degradados o que no arrancanesos pods y su última terminación (un OOMKilled, un CrashLoopBackOff)
Insightshay insights críticosel insight y su historial: si ya pasó antes, cuándo y cómo se cerró
Reliability · 5xxla tasa de errores 5xx pasa del umbralel servicio afectado y lo que se desplegó justo antes

Lo que la tabla no te dice es cuánto tiempo lleva así. Para eso están la línea de 24 horas de Pods y el historial de cada insight.

Si ninguna tarjeta tiene color, en ese panel no hay nada que te necesite ahora.

Fleet: todos tus clústeres en una fila

Si tienes más de un clúster, Fleet es la página que más vas a abrir.

Fleet con dos clústeres: la fila de la flota con clústeres, gasto, pods y agentes, y debajo una tarjeta por clúster
Fleet con dos clústeres. Uno tiene un insight crítico y el otro está sano.

La primera fila resume la flota entera. La tarjeta de clústeres te dice cuántos tienes y cuántos tienen algo crítico, con una barra por clúster ordenada de peor a mejor. La de gasto muestra lo que cuesta la flota al mes según OpenCost, la línea de los últimos 7 días y en qué clúster se concentra. La de pods cuenta cuántos corren y en cuántos nodos, repartidos por clúster. Y la de agentes te dice cuántos están enviando datos: si uno deja de hacerlo, aquí lo ves antes de echar de menos sus métricas.

Debajo hay una tarjeta por clúster con su estado, sus pods, nodos, gasto y hallazgos de seguridad, y la línea de pods de las últimas 24 horas. Cuando a un clúster le falta un dato, la tarjeta explica por qué. En la captura, el segundo clúster no muestra gasto porque no tiene OpenCost, y la tarjeta lo dice («needs OpenCost») en lugar de dejar un hueco que parece un cero.

Home: lo que pasó mientras no estabas

Home es lo que ves al entrar. Arriba te dice cuántas cosas te necesitan ahora, y justo debajo está «While you were away», lo que pasó desde tu última visita.

Home con el saludo y el bloque While you were away: una línea de tiempo y tres episodios, uno resuelto solo, uno nuevo y otro abierto
«While you were away»: una línea de tiempo desde tu última visita y los episodios más importantes.

Es una línea de tiempo con hasta tres episodios, los más importantes primero. En la captura, uno se resolvió solo, otro es nuevo y el tercero sigue abierto, con un botón para revisarlo. Si hubo más, una línea te dice cuántos quedan sin mostrar y te lleva al historial completo.

Antes este bloque era un texto con una frase por cada ráfaga de incidentes. Si volvías después de un mes, podías encontrarte cincuenta frases seguidas. Ahora lo lees en unos segundos.

Debajo, Home repite en pequeño la fila de la flota: clústeres, pods, gasto y hallazgos de seguridad. La tarjeta de gasto te dice además qué parte de ese dinero paga capacidad que no se usa. En nuestro entorno de pruebas era el 87 %.

El resto de paneles

Capacity, Reliability, Cost, Security y Nodes empiezan con el mismo tipo de fila. En Cost y en Nodes la fila pasa de cinco tarjetas a cuatro. La página de uso de Kobi, dentro del hub de IA, abre ahora con las sesiones, su salud, los tokens y el gasto.

Hay dos detalles que no se ven en una captura. Las cifras cuentan hacia arriba y las gráficas se rellenan la primera vez que abres una página en la sesión; si vuelves, o si los datos se refrescan, ves el valor final directamente, igual que si tienes activado el movimiento reducido. Y los colores son ahora los de kubebolt.io: los textos pequeños pasan el contraste AA, que antes no pasaban. El tema claro no cambia.

Lo demás que trae la 2.3

Autopilot. A un cliente del programa piloto, Autopilot le hizo 35 investigaciones la madrugada del día 1, casi todas sobre los mismos dos Deployments y con el mismo resultado. El crédito del mes se terminó esa noche y durante 29 días no pudo analizar nada más. Ahora, si un problema vuelve sin cambios, Autopilot reabre el incidente que ya tenía en lugar de pagar otra investigación, y el crédito se reparte a lo largo del mes.

Crédito de Autopilot usado a lo largo del mes: en la 2.2 se gastó entero el día 1; en la 2.3 hay un tope que sube cada día
Con la 2.3, el primer día puede usar como mucho el 13 % del crédito del mes. Los incidentes críticos se atienden siempre.

Ese cliente tenía apagados los correos de notificación, así que las recomendaciones de Autopilot no le llegaban a nadie. Ahora, si no hay ningún canal configurado, se envían por correo a los administradores de la organización, con un resumen semanal de lo que sigue pendiente.

Kobi y los discos. Desde la 2.2.0, si le preguntabas a Kobi por un nodo con DiskPressure, respondía que no tenía acceso al disco. La herramienta existía, pero una validación interna rechazaba la consulta. Ya está corregido, y de paso Kobi revisa todos los discos del nodo en lugar de solo el primero, y usa el valor más alto de cada intervalo para que un disco que se llenó unos minutos no pase desapercibido.

Permisos. Hasta esta versión, un usuario con rol de lector podía cambiar la configuración de Autopilot y aprobar o rechazar sus acciones. Ahora aprobar y relanzar requiere rol de editor, cambiar la configuración requiere administrador, y cada decisión queda registrada con el nombre de quien la tomó.

OpenShift. KubeBolt se instala sin pasos adicionales, también con la política restricted-v2. Gracias a un ingeniero de plataforma que lo probó a fondo y nos contó todo lo que fallaba.

Insights. readiness-probe-failing y hpa-maxed-out saltaban en situaciones sanas. Después de actualizar puede que veas menos, y los que quedan son reales.

Lo que viene

A veces el clúster está bien y el problema está en otro sitio, como una base de datos que se quedó sin conexiones. Estamos trabajando en conectores MCP para que Kobi pueda revisar esos recursos en AWS, Azure y GCP cuando investiga un incidente. Solo podrá leer: no le daremos ninguna herramienta que modifique recursos en tu nube, y lo que vea dependerá del rol que crees en tu cuenta.

Adelanto: Kobi comprueba que los pods de payments-api están bien y encuentra la causa en AWS, una base de datos RDS sin conexiones libres
Así se verá: los pods están bien y la causa es la base de datos.

Empieza por aquí

Si usas la versión Open Source, actualiza a la 2.3.0 y el agente a la 1.4.2. En Cloud ya está todo actualizado.

Abre Overview en tu clúster y mira la primera fila. Si alguna tarjeta tiene color, la tabla de arriba te dice por dónde seguir.

Si todavía no usas KubeBolt, empieza gratis: dos clústeres, sin límite de tiempo.