Seminar / Training
Das Einzelseminar vermittelt Statusdaten, Trace Logs, Metrikpipeline, SLIs und SLOs, Engpassanalyse, Incident-Klassifikation, Runbooks und Post-Incident-Arbeit. Die Themen werden von der fachlichen Einordnung über die Konfiguration beziehungsweise Implementierung bis zur kontrollierten Prüfung in einer zusammenhängenden Laborumgebung bearbeitet.
Jeder Themenblock enthält eine eigene Inhaltsübersicht, konkrete Arbeitsschritte und Prüfpunkte. Konfigurationen, Datenmodelle und Betriebsentscheidungen werden so dokumentiert, dass sie in Projekt- und Betriebsstandards übernommen werden können.
Inhaltsübersicht
- 1. Maschinenlesbarer Clusterstatus
- 2. Trace Logs und Ereigniskorrelation
- 3. Metrikpipeline und Dashboards
- 4. SLIs, SLOs und Alarmierung
- 5. Engpassanalyse und Lastklassifikation
- 6. Incident-Klassifikation und Erstmaßnahmen
- 7. Störungsrunbooks und sichere Eingriffe
- 8. Post-Incident-Analyse und Prävention
1. Maschinenlesbarer Clusterstatus
Kapitelinhaltsverzeichnis
- 1.1 Einordnung und Zielsetzung
- 1.2 Fachthemen
- 1.3 Schritt-für-Schritt-Übung
- 1.4 Prüfpunkte
Einordnung und Zielsetzung
Der maschinenlesbare Status bildet die Grundlage für automatisierte Zustandsbewertung. Einzelwerte werden im Kontext von Rollen, Fault Domains und Last interpretiert.
Fachthemen
- Availability, Data und Workload
- Processes und Roles
- Konfiguration und Warnungen
Schritt-für-Schritt-Übung: einen Statusparser und Gesundheitsbefund erstellen
- Schritt 1: Status json in regelmäßigen Intervallen erfassen und versioniert speichern.
- Schritt 2: Verfügbarkeit, Datenzustand, Prozesse und Konfiguration extrahieren.
- Schritt 3: Warnungen nach Datenrisiko, Kapazität und Leistung klassifizieren.
- Schritt 4: Rollen- und Fault-Domain-Ausfälle zusammenführen.
- Schritt 5: Einen kompakten Gesundheitsbefund mit begründeter Aktion erzeugen.
Prüfpunkte
- Die Umsetzung berücksichtigt Availability, Data und Workload und ist reproduzierbar dokumentiert.
- Das Verhalten von Processes und Roles ist mit einem positiven und einem negativen Testfall geprüft.
- Abbruch-, Rückfall- und Eskalationskriterien sind eindeutig benannt.
2. Trace Logs und Ereigniskorrelation
Kapitelinhaltsverzeichnis
- 2.1 Einordnung und Zielsetzung
- 2.2 Fachthemen
- 2.3 Schritt-für-Schritt-Übung
- 2.4 Prüfpunkte
Einordnung und Zielsetzung
Trace Logs liefern tiefe technische Ereignisse, müssen aber gefiltert und über Prozessrollen korreliert werden. Aufbewahrung und Zugriff werden wegen möglicher sensibler Metadaten kontrolliert.
Fachthemen
- Severity und Eventtypen
- Log Groups und Rollen
- Zeitkorrelation und sensible Daten
Schritt-für-Schritt-Übung: eine Trace-basierte Diagnose durchführen
- Schritt 1: Trace-Pfade, Rotation, Format und Log Groups erfassen.
- Schritt 2: Zeitraum und betroffene Prozesse aus dem Incident eingrenzen.
- Schritt 3: Events nach Severity, Typ und Kennungen filtern.
- Schritt 4: Korrelierte Ereigniskette über mehrere Rollen erstellen.
- Schritt 5: Befund, verbleibende Unsicherheit und nächste Messung dokumentieren.
Prüfpunkte
- Die Umsetzung berücksichtigt Severity und Eventtypen und ist reproduzierbar dokumentiert.
- Das Verhalten von Log Groups und Rollen ist mit einem positiven und einem negativen Testfall geprüft.
- Abbruch-, Rückfall- und Eskalationskriterien sind eindeutig benannt.
3. Metrikpipeline und Dashboards
Kapitelinhaltsverzeichnis
- 3.1 Einordnung und Zielsetzung
- 3.2 Fachthemen
- 3.3 Schritt-für-Schritt-Übung
- 3.4 Prüfpunkte
Einordnung und Zielsetzung
Messdaten aus Clusterstatus, Trace-Auswertung und Clients werden in einem gemeinsamen Modell zusammengeführt. Kardinalität und Datenmenge bleiben kontrolliert.
Fachthemen
- Cluster-, Prozess- und Clientmetriken
- Kardinalität und Labels
- Dashboards und Retention
Schritt-für-Schritt-Übung: eine belastbare Metrikpipeline aufbauen
- Schritt 1: Betriebsfragen und daraus abgeleitete Kennzahlen definieren.
- Schritt 2: Collector für Status, Prozessressourcen und Clienttelemetrie bereitstellen.
- Schritt 3: Labels auf Cluster, Region, Rolle und begrenzte Transaktions-Tags beschränken.
- Schritt 4: Dashboards für Verfügbarkeit, Latenz, Konflikte, Datenbewegung und Kapazität erstellen.
- Schritt 5: Ausfall des Collectors und Datenlücken sichtbar machen.
Prüfpunkte
- Die Umsetzung berücksichtigt Cluster-, Prozess- und Clientmetriken und ist reproduzierbar dokumentiert.
- Das Verhalten von Kardinalität und Labels ist mit einem positiven und einem negativen Testfall geprüft.
- Abbruch-, Rückfall- und Eskalationskriterien sind eindeutig benannt.
4. SLIs, SLOs und Alarmierung
Kapitelinhaltsverzeichnis
- 4.1 Einordnung und Zielsetzung
- 4.2 Fachthemen
- 4.3 Schritt-für-Schritt-Übung
- 4.4 Prüfpunkte
Einordnung und Zielsetzung
SLIs beschreiben die wahrgenommene Dienstqualität. Alarme werden auf Auswirkungen und erschöpfte Reserven ausgerichtet, nicht auf jedes einzelne interne Ereignis.
Fachthemen
- Verfügbarkeit und Commit-Erfolg
- Latenz und Fehlerbudget
- Symptom- statt ursachenbasierte Alarme
Schritt-für-Schritt-Übung: SLO-basierte Alarme definieren
- Schritt 1: Kritische Nutzeroperationen und deren Erfolgsdefinition festlegen.
- Schritt 2: Commit-Erfolg, End-to-End-Latenz und Verfügbarkeit messen.
- Schritt 3: SLO, Messfenster und Fehlerbudget vereinbaren.
- Schritt 4: Mehrstufige Alarme für akute Wirkung und schleichenden Verbrauch erstellen.
- Schritt 5: Alarme mit kontrollierten Fehlern und Lastspitzen testen.
Prüfpunkte
- Die Umsetzung berücksichtigt Verfügbarkeit und Commit-Erfolg und ist reproduzierbar dokumentiert.
- Das Verhalten von Latenz und Fehlerbudget ist mit einem positiven und einem negativen Testfall geprüft.
- Abbruch-, Rückfall- und Eskalationskriterien sind eindeutig benannt.
5. Engpassanalyse und Lastklassifikation
Kapitelinhaltsverzeichnis
- 5.1 Einordnung und Zielsetzung
- 5.2 Fachthemen
- 5.3 Schritt-für-Schritt-Übung
- 5.4 Prüfpunkte
Einordnung und Zielsetzung
Engpässe werden entlang von Symptom, begrenzender Ressource und verursachendem Workload untersucht. Eine einzelne hohe Ressourcenauslastung ist noch keine ausreichende Ursache.
Fachthemen
- CPU, Disk, Netzwerk und Queueing
- Storage- und Logdruck
- Clientkonflikte und Hotspots
Schritt-für-Schritt-Übung: einen Performancevorfall eingrenzen
- Schritt 1: Zeitfenster, betroffene Operationen und Ausgangslatenz bestimmen.
- Schritt 2: Clientfehler, Retry-Raten und Transaktions-Tags analysieren.
- Schritt 3: Rollenlast, Disk, Netzwerk und Datenbewegung korrelieren.
- Schritt 4: Hotspots oder übergroße Transaktionen im Workload suchen.
- Schritt 5: Eine Hypothese mit gezielter Änderung und Gegenmessung prüfen.
Prüfpunkte
- Die Umsetzung berücksichtigt CPU, Disk, Netzwerk und Queueing und ist reproduzierbar dokumentiert.
- Das Verhalten von Storage- und Logdruck ist mit einem positiven und einem negativen Testfall geprüft.
- Abbruch-, Rückfall- und Eskalationskriterien sind eindeutig benannt.
6. Incident-Klassifikation und Erstmaßnahmen
Kapitelinhaltsverzeichnis
- 6.1 Einordnung und Zielsetzung
- 6.2 Fachthemen
- 6.3 Schritt-für-Schritt-Übung
- 6.4 Prüfpunkte
Einordnung und Zielsetzung
Die Erstklassifikation entscheidet über Geschwindigkeit und Eingriffsrechte. Datenrisiko und verlorene Redundanz haben Vorrang vor reiner Performanceoptimierung.
Fachthemen
- Datenrisiko
- Verfügbarkeitswirkung
- Kapazitäts- und Performancewirkung
Schritt-für-Schritt-Übung: einen Incident in den ersten Minuten bearbeiten
- Schritt 1: Verfügbarkeit und mögliche Datengefährdung feststellen.
- Schritt 2: Letzte Änderungen und gleichzeitig laufende Wartung stoppen oder einfrieren.
- Schritt 3: Status, Logs und Zeitreferenz unverändert sichern.
- Schritt 4: Incidentstufe, Verantwortliche und Kommunikationsrhythmus festlegen.
- Schritt 5: Nur reversible Stabilisierung mit klarer Erfolgsmessung durchführen.
Prüfpunkte
- Die Umsetzung berücksichtigt Datenrisiko und ist reproduzierbar dokumentiert.
- Das Verhalten von Verfügbarkeitswirkung ist mit einem positiven und einem negativen Testfall geprüft.
- Abbruch-, Rückfall- und Eskalationskriterien sind eindeutig benannt.
7. Störungsrunbooks und sichere Eingriffe
Kapitelinhaltsverzeichnis
- 7.1 Einordnung und Zielsetzung
- 7.2 Fachthemen
- 7.3 Schritt-für-Schritt-Übung
- 7.4 Prüfpunkte
Einordnung und Zielsetzung
Runbooks ordnen häufige Störungen klaren Diagnose- und Eingriffsfolgen zu. Jeder Schritt nennt Vorbedingungen und Stop-Kriterien.
Fachthemen
- Prozess-, Host- und Zonenverlust
- Koordinator- und Clusterdateiprobleme
- Überlast und Datenbewegung
Schritt-für-Schritt-Übung: ein Störungsrunbook testen
- Schritt 1: Konkretes Störungsbild und erwartete Statusanzeichen beschreiben.
- Schritt 2: Datenrisiko, Redundanz und laufende Datenbewegung als Vorprüfung ergänzen.
- Schritt 3: Diagnosebefehle und erwartete Ergebnisse festlegen.
- Schritt 4: Reversible Eingriffe mit Abbruchgrenzen definieren.
- Schritt 5: Runbook im Labor ausführen und Zeit, Wirkung sowie Abweichungen erfassen.
Prüfpunkte
- Die Umsetzung berücksichtigt Prozess-, Host- und Zonenverlust und ist reproduzierbar dokumentiert.
- Das Verhalten von Koordinator- und Clusterdateiprobleme ist mit einem positiven und einem negativen Testfall geprüft.
- Abbruch-, Rückfall- und Eskalationskriterien sind eindeutig benannt.
8. Post-Incident-Analyse und Prävention
Kapitelinhaltsverzeichnis
- 8.1 Einordnung und Zielsetzung
- 8.2 Fachthemen
- 8.3 Schritt-für-Schritt-Übung
- 8.4 Prüfpunkte
Einordnung und Zielsetzung
Die Nachanalyse rekonstruiert Auslöser, Verstärker und verspätete Erkennung. Maßnahmen werden messbar und mit Eigentümer versehen.
Fachthemen
- Zeitleiste und Ursachen
- Technische und organisatorische Faktoren
- Maßnahmen und Nachtest
Schritt-für-Schritt-Übung: eine belastbare Nachanalyse erstellen
- Schritt 1: Faktenbasierte Zeitleiste aus Status, Logs, Changes und Kommunikation aufbauen.
- Schritt 2: Direkte Ursache, beitragende Faktoren und fehlende Schutzbarrieren trennen.
- Schritt 3: Erkennungs-, Reaktions- und Recovery-Zeiten auswerten.
- Schritt 4: Maßnahmen mit Priorität, Eigentümer und Abnahmekriterium festlegen.
- Schritt 5: Fehlerfall nach Umsetzung erneut injizieren und Wirksamkeit nachweisen.
Prüfpunkte
- Die Umsetzung berücksichtigt Zeitleiste und Ursachen und ist reproduzierbar dokumentiert.
- Das Verhalten von technische und organisatorische Faktoren ist mit einem positiven und einem negativen Testfall geprüft.
- Abbruch-, Rückfall- und Eskalationskriterien sind eindeutig benannt.
Fachbereichsleitung / Trainerleitung / Ansprechpersonen
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | SRE, Datenbankbetrieb, Monitoring-Teams, Incident Management und Plattformbetrieb |
| Voraussetzungen: | Grundkenntnisse der FoundationDB-Architektur, Linux-Betrieb sowie Erfahrung mit Metriken, Logs und Alarmierung |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Fachvortrag, Demonstrationen, geführte Übungen und Praxisaufgaben am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmenden |
| Sprache: | Deutsch - bei Firmenseminaren auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
