Monitoring & Hochverfügbarkeit

Ein System ist erst dann betrieben, wenn jemand den Ausfall kommen sieht, bevor er eintritt. Wir bauen Monitoring, das die richtigen Dinge misst und Probleme erkennt. Dazu bauen wir Architekturen, die einen Ausfall wegstecken: Failover-Cluster seit Solaris- und Veritas-Zeiten, heute Patroni auf Kubernetes, MariaDB Galera, HAProxy/nginx/Apache/Squid mit Keepalived und GlusterFS. Dazu Backup und Recovery, die wir regelmäßig wirklich testen.

Für Kunden mit hohen Verfügbarkeitsanforderungen bauen wir Systeme, die den Verlust eines ganzen Rechenzentrums überstehen (Disaster Recovery). Den Ernstfall testen wir mit unseren Kunden regelmäßig.

Typische Aufgaben

  • System- und Service-Monitoring mit checkmk oder Nagios aufbauen, Alarmierung mit Sinn und Maß
  • Metriken und Logs: Grafana, InfluxDB und Telegraf, ELK-Stack mit Logstash und Filebeat
  • Datenbank-Monitoring mit Oracle Enterprise Manager und Grid Control, von 10g bis 12c eingeführt
  • Backup und Recovery mit RMAN und Veritas NetBackup, Recovery-Tests statt Hoffnung
  • Failover-Cluster und Hochverfügbarkeit: Veritas Cluster Server, Patroni, MariaDB Galera, HAProxy und Keepalived, GlusterFS, Samba mit CTDB
  • Patch-Management und Security-Patching, Secrets mit HashiCorp Vault

Aus der Praxis

Für die RCI Banque haben wir ein hochverfügbares Nextcloud-System mit MariaDB Galera und GlusterFS und ein HA-Samba-System mit CTDB aufgebaut; die OpenShift-Cluster werden mit checkmk überwacht. Ein älteres Beispiel: Für rund 120 Test-Datenbanken bei Vodafone haben wir zwischen 2002 und 2007 ein Failover-Cluster-Konzept mit Veritas Cluster Server und EMC-SAN entworfen und umgesetzt und Oracle Enterprise Manager Grid Control als zentrales Datenbank-Monitoring eingeführt.

Häufige Fragen

Welche Monitoring-Werkzeuge setzen Sie ein?
checkmk und Nagios für System- und Service-Monitoring, Grafana mit InfluxDB und Telegraf für Metriken, ELK für Logs, Oracle Enterprise Manager für Datenbanken.
Testen Sie Backups wirklich?
Ja. Ein Backup ohne Recovery-Test ist eine Hoffnung. Wir planen Recovery-Tests mit RMAN und Veritas NetBackup als festen Bestandteil des Betriebs.
Wie erreichen Sie Hochverfügbarkeit für Datenbanken?
Je nach System: Oracle mit RAC und Data Guard, PostgreSQL mit Patroni auf Kubernetes, MariaDB mit Galera, davor HAProxy und Keepalived. Failover-Cluster bauen wir seit Veritas-Cluster-Zeiten.

Nicht sicher, welches Feld passt?

Beschreiben Sie uns das Problem, nicht die Technologie.

Kontakt