ZeusK8s
Observabilité

Des ingénieurs en mode panique, en train de googler pourquoi des pods sont évincés. Ce n'est pas une stratégie d'observabilité.

La plupart des équipes ont de la visibilité sur un cluster, dans un outil, après un lag. Quand quelque chose casse à 3 h du matin sur trois clusters, ce n'est pas assez. Zeus streame l'état réel de tous vos clusters en un seul endroit — et vous laisse agir sur ce que vous voyez sans changer d'outil.

En live, pas après coup

Ce qui tourne vraiment en ce moment, sur chaque cluster.

Statut des pods, comptes de restarts, CPU et mémoire, santé des déploiements — sur chaque cluster et cloud, en streaming live. Pas un dashboard que vous rafraîchissez en espérant qu'il soit à jour. L'état que vous voyez est l'état dans lequel est le cluster.

Quand un pod est en train d'être évincé, vous le voyez au moment où ça se passe. Quand un déploiement roule, vous regardez chaque réplica passer au vert. Quand un nœud est sous pression, les métriques le montrent avant que l'alerte ne tire. Vous regardez le cluster, vous n'attendez pas un résumé de ce qui s'est passé.

Et quand vous voyez quelque chose de mal, vous pouvez agir depuis le même écran — tailer les logs, exécuter un shell, redémarrer un pod, scaler des réplicas — sans context-switch vers kubectl ou un autre outil.

Zeus · Logs — api-gateway
Pods
Logs
Metrics
Events
filter logs…
api-gateway-7d4f… ▾
production-us ▾
streaming
14:23:01 api-gateway INFO POST /api/auth/token 200 OK 34ms user=user_8821
14:23:01 api-gateway INFO DB query 4ms pool=primary rows=1
14:23:02 worker-5b2e INFO Job dequeued id=job_92841 queue=notifications
14:23:02 api-gateway WARN Rate limit: 87/100 for ip=203.0.113.4
14:23:03 worker-5b2e INFO Email dispatched recipients=3 latency=210ms
14:23:04 api-gateway ERROR connect ETIMEDOUT 10.96.14.2:5432 — DB primary unreachable
14:23:04 api-gateway ERROR Retrying connection (attempt 1/3)
14:23:05 api-gateway WARN Retry 1 failed, waiting 500ms
14:23:06 api-gateway INFO DB reconnected pool=primary latency=12ms
14:23:07 api-gateway INFO POST /api/auth/token 200 OK 12ms user=user_3310
·
tail 100 · all levels
Ce que vous pouvez faire

Voyez. Comprenez. Corrigez. Depuis un seul écran.

Logs en streaming avec filtres

Tailez les logs de n'importe quel pod dans n'importe quel cluster, filtrés par mot-clé, sévérité ou fenêtre temporelle. Merge multi-pod pour les services multi-réplicas. Pas de port-forward kubectl, pas de SSH.

Shell interactif dans le navigateur

Basculez dans un shell de container directement depuis la vue pod. Debuggez, inspectez des fichiers, lancez des commandes — sans quitter la console ni configurer un accès local au cluster.

Métriques Prometheus par workload

Graphiques CPU, mémoire et réseau par pod, deployment et nœud. Tout service qui expose des métriques est scrapé automatiquement — des dashboards custom sans setup Grafana séparé pour la visibilité opérationnelle de base.

Événements Kubernetes sur lesquels agir

Un flux d'événements live — OOMKills, évictions, échecs de scheduling, échecs de probes — que vous pouvez flager pour investigation et marquer résolus. Une piste d'audit de ce qui s'est passé et de ce qui a été fait.

Multi-cluster

Un incident. Trois clusters. Un seul endroit où regarder.

Quand quelque chose tourne mal dans un setup multi-cluster, le problème est en général que vous ne pouvez pas voir tous les signaux pertinents en un seul endroit en même temps. Vous basculez entre consoles cloud, contextes kubectl et un thread Slack en essayant de corréler ce que vous voyez.

Tous les clusters, une liste de pods

Filtrez les pods sur chaque cluster d'un coup. Une éviction sur production-eu apparaît dans la même liste que production-us.

Statut de déploiement multi-cloud

Un rolling deploy montre le progrès par cluster sur une seule timeline — pas trois appels kubectl rollout status séparés.

Pression des nœuds sur la flotte

Voyez quels nœuds sont sous pression CPU ou mémoire sur tous les clusters. Repérez des patterns qu'une vue par cluster cache.

Corrélation de logs entre services

Tailez les logs de l'api-gateway dans us-east et du service downstream dans eu-west côte à côte.

Événements de chaque cluster

Un seul flux d'événements de tous les clusters vous laisse voir si un problème est isolé ou se produit partout d'un coup.

Agissez sans changer de contexte

Redémarrez, scalez, exec — depuis la vue multi-cluster. Pas de bascule de contexte kubectl en plein incident.