ZeusK8s
Observabilidad

Ingenieros en modo pánico, googling por qué se expulsan pods. Eso no es una estrategia de observabilidad.

La mayoría de equipos tiene visibilidad de un clúster, en una herramienta, con lag. Cuando algo se rompe a las 3am en tres clústeres, no basta. Zeus streamea el estado real de todos tus clústeres en un solo sitio — y te deja actuar sobre lo que ves sin cambiar de herramienta.

En vivo, no a posteriori

Qué corre de verdad ahora mismo, en cada clúster.

Estado de pods, contadores de restarts, CPU y memoria, salud de deployments — en cada clúster y cloud, en streaming en vivo. No un dashboard que refrescas y esperas que esté actual. El estado que ves es el estado en el que está el clúster.

Cuando un pod se expulsa, lo ves conforme ocurre. Cuando un deployment hace rolling, miras cada réplica ponerse en verde. Cuando un nodo está bajo presión, las métricas lo muestran antes de que salte el alert. Estás mirando el clúster, no esperando un resumen de lo que pasó.

Y cuando ves algo mal, puedes actuar desde la misma pantalla — tail de logs, exec un shell, reiniciar un pod, escalar réplicas — sin cambiar de contexto a kubectl u otra herramienta.

Zeus · Logs — api-gateway
Pods
Logs
Metrics
Events
filter logs…
api-gateway-7d4f… ▾
production-us ▾
streaming
14:23:01 api-gateway INFO POST /api/auth/token 200 OK 34ms user=user_8821
14:23:01 api-gateway INFO DB query 4ms pool=primary rows=1
14:23:02 worker-5b2e INFO Job dequeued id=job_92841 queue=notifications
14:23:02 api-gateway WARN Rate limit: 87/100 for ip=203.0.113.4
14:23:03 worker-5b2e INFO Email dispatched recipients=3 latency=210ms
14:23:04 api-gateway ERROR connect ETIMEDOUT 10.96.14.2:5432 — DB primary unreachable
14:23:04 api-gateway ERROR Retrying connection (attempt 1/3)
14:23:05 api-gateway WARN Retry 1 failed, waiting 500ms
14:23:06 api-gateway INFO DB reconnected pool=primary latency=12ms
14:23:07 api-gateway INFO POST /api/auth/token 200 OK 12ms user=user_3310
·
tail 100 · all levels
Qué puedes hacer

Vélo. Entiéndelo. Arréglalo. Desde una pantalla.

Logs en streaming con filtros

Haz tail de logs de cualquier pod en cualquier clúster, filtrados por keyword, severidad o ventana de tiempo. Merge multi-pod de logs para servicios con varias réplicas. Sin port-forwarding de kubectl, sin SSH.

Shell interactivo en el browser

Entra a un shell de contenedor directamente desde la vista del pod. Debuggea, inspecciona archivos, corre comandos — sin salir de la consola ni montar acceso local al clúster.

Métricas Prometheus por workload

Gráficas de CPU, memoria y red por pod, deployment y nodo. Cualquier servicio que exponga métricas se scrapea automáticamente — dashboards custom sin un setup Grafana aparte para visibilidad operativa básica.

Eventos de Kubernetes sobre los que puedes actuar

Un stream de eventos en vivo — OOMKills, expulsions, fallos de scheduling, fallos de probes — que puedes marcar para investigación y marcar como resueltos. Un audit trail de lo que pasó y lo que se hizo al respecto.

Multi-clúster

Un incidente. Tres clústeres. Un solo sitio donde mirar.

Cuando algo va mal en un setup multi-clúster, el problema suele ser que no puedes ver todas las señales relevantes en un solo sitio a la vez. Estás saltando entre consolas cloud, contextos de kubectl y un hilo de Slack intentando correlacionar lo que ves.

Todos los clústeres, una lista de pods

Filtra pods en todos los clústeres a la vez. Una expulsión en production-eu aparece en la misma lista que production-us.

Estado de deployments entre nubes

Un deploy en rolling muestra el progreso por clúster en una timeline — no tres llamadas separadas a kubectl rollout status.

Presión de nodos en toda la flota

Ve qué nodos están bajo presión de CPU o memoria en todos los clústeres. Detecta patrones que una vista por clúster esconde.

Correlación de logs entre servicios

Haz tail de logs del api-gateway en us-east y del servicio downstream en eu-west lado a lado.

Eventos de cada clúster

Un solo stream de eventos de todos los clústeres te deja ver si un issue está aislado o ocurre en todas partes a la vez.

Actúa sin cambiar de contexto

Reinicia, escala, exec — desde la vista multi-clúster. Sin cambiar de contexto kubectl a mitad de un incidente.