ZeusK8s
Observability

Engineers im Panic Mode, die googeln, warum Pods evicted werden. Das ist keine Observability-Strategie.

Die meisten Teams haben Visibility in einen Cluster, in einem Tool, mit Lag. Wenn um 3 Uhr morgens etwas über drei Cluster bricht, reicht das nicht. Zeus streamt den echten Zustand aller Ihrer Cluster an einem Ort — und lässt Sie auf das handeln, was Sie sehen, ohne Tools zu wechseln.

Live, nicht hinterher

Was gerade tatsächlich läuft — über jeden Cluster.

Pod-Status, Restart Counts, CPU und Memory, Deployment Health — über jeden Cluster und jede Cloud, live gestreamt. Kein Dashboard, das Sie refreshen und hoffen, dass es aktuell ist. Der State, den Sie sehen, ist der State, in dem der Cluster ist.

Wenn ein Pod evicted wird, sehen Sie es, während es passiert. Wenn ein Deployment rollt, sehen Sie jede Replica grün werden. Wenn ein Node under Pressure ist, zeigen die Metrics es, bevor der Alert feuert. Sie watchen den Cluster — Sie warten nicht auf eine Summary dessen, was passiert ist.

Und wenn Sie etwas Falsches sehen, können Sie vom selben Screen handeln — Logs tailen, Shell execen, Pod restarten, Replicas skalieren — ohne Context-Switch zu kubectl oder einem anderen Tool.

Zeus · Logs — api-gateway
Pods
Logs
Metrics
Events
filter logs…
api-gateway-7d4f… ▾
production-us ▾
streaming
14:23:01 api-gateway INFO POST /api/auth/token 200 OK 34ms user=user_8821
14:23:01 api-gateway INFO DB query 4ms pool=primary rows=1
14:23:02 worker-5b2e INFO Job dequeued id=job_92841 queue=notifications
14:23:02 api-gateway WARN Rate limit: 87/100 for ip=203.0.113.4
14:23:03 worker-5b2e INFO Email dispatched recipients=3 latency=210ms
14:23:04 api-gateway ERROR connect ETIMEDOUT 10.96.14.2:5432 — DB primary unreachable
14:23:04 api-gateway ERROR Retrying connection (attempt 1/3)
14:23:05 api-gateway WARN Retry 1 failed, waiting 500ms
14:23:06 api-gateway INFO DB reconnected pool=primary latency=12ms
14:23:07 api-gateway INFO POST /api/auth/token 200 OK 12ms user=user_3310
·
tail 100 · all levels
Was Sie tun können

Sehen. Verstehen. Fixen. Von einem Screen.

Streaming Logs mit Filtern

Logs von jedem Pod in jedem Cluster tailen, gefiltert nach Keyword, Severity oder Time Window. Multi-Pod Log Merge für Services mit mehreren Replicas. Kein kubectl Port-Forwarding, kein SSH.

Interaktive Shell im Browser

Direkt aus der Pod-View in eine Container Shell springen. Debuggen, Files inspecten, Commands laufen lassen — ohne die Console zu verlassen oder lokalen Access zum Cluster aufzusetzen.

Prometheus Metrics pro Workload

CPU-, Memory- und Network-Graphs pro Pod, Deployment und Node. Jeder Service, der Metrics exposet, wird automatisch gescraped — custom Dashboards ohne separates Grafana-Setup für basic operative Visibility.

Kubernetes Events, auf die Sie handeln können

Ein Live-Event-Stream — OOMKills, Evictions, Scheduling Failures, Probe Failures — den Sie zur Investigation flaggen und als resolved markieren können. Ein Audit Trail davon, was passiert ist und was dagegen getan wurde.

Multi-Cluster

Ein Incident. Drei Cluster. Ein Ort zum Hinschauen.

Wenn in einem Multi-Cluster-Setup etwas schiefläuft, ist das Problem meist, dass Sie nicht alle relevanten Signals an einem Ort gleichzeitig sehen. Sie tabben zwischen Cloud Consoles, kubectl Contexts und einem Slack-Thread und versuchen zu korrelieren, was Sie sehen.

Alle Cluster, eine Pod-Liste

Pods über jeden Cluster auf einmal filtern. Eine Eviction auf production-eu erscheint in derselben Liste wie production-us.

Deployment Status über Clouds

Ein rolling Deploy zeigt per-Cluster Progress in einer Timeline — nicht drei separate kubectl rollout status Calls.

Node Pressure über die Fleet

Sehen, welche Nodes unter CPU- oder Memory-Pressure sind — über alle Cluster. Patterns spotten, die eine per-Cluster View versteckt.

Log Correlation über Services

Logs vom api-gateway in us-east und dem Downstream Service in eu-west Side-by-Side tailen.

Events von jedem Cluster

Ein einzelner Event Stream von allen Clustern lässt Sie sehen, ob ein Issue isoliert ist oder überall gleichzeitig passiert.

Handeln ohne Context Switch

Restart, Scale, Exec — aus der Multi-Cluster View. Kein kubectl Context Switching mitten im Incident.

Sehen Sie Ihre Cluster live — nicht hinterher.

Ein Live-Demo über echte Cluster — Pods, Logs, Metrics und die Actions, die Sie während eines Incidents nehmen würden.