Der Workshop schafft einen vollständigen technischen Kontrollkreislauf für Störung, Beobachtung, Sicherung und Änderung der Open Data Discovery Platform. Fehler werden reproduzierbar eingegrenzt, Betriebsindikatoren mit klaren Schwellen versehen und Upgrades nur mit getesteter Wiederherstellungs- und Rückfallfähigkeit durchgeführt.
Inhaltsverzeichnis
- Lernziele
- Zielgruppe
- Kapitel 1: Systematische Fehleranalyse
- Kapitel 2: Logs, Metriken und Beobachtbarkeit
- Kapitel 3: Typische Störungsdomänen
- Kapitel 4: Backup und Restore
- Kapitel 5: Upgradeplanung und Kompatibilität
- Kapitel 6: Produktivrollout, Rollback und Notfallübung
- Praxisübungen
- Voraussetzungen und Anschluss
Lernziele
- Störungen hypothesenbasiert und risikoarm analysieren
- Logs, Metriken und Traces für Monitoring nutzen
- Backup- und Restore-Verfahren praktisch validieren
- Upgrades mit Kompatibilitäts- und Regressionstests planen
- Rollback und Notfallkommunikation sicher durchführen
Zielgruppe
Plattformbetrieb, DevOps, SRE, Systemadministration, Datenbankadministration und technischer Support.
Kapitel 1: Systematische Fehleranalyse
Inhaltsverzeichnis dieses Kapitels
- Fehlerbild, Zeitachse und Betroffenheit
- Änderungen und Abhängigkeiten
- reproduzierbare Prüfungen
- Eindämmung und Ursachenbeleg
- Schritt-für-Schritt-Umsetzung
Störungen werden von Symptom und Wirkung über Hypothesen bis zur verifizierten Ursache bearbeitet.
1. Fehlerbild, Zeitachse und Betroffenheit
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
2. Änderungen und Abhängigkeiten
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
3. reproduzierbare Prüfungen
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
4. Eindämmung und Ursachenbeleg
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
Schritt für Schritt
- Symptom, Beginn und betroffene Funktionen erfassen
- letzte Änderungen und externe Abhängigkeiten prüfen
- Hypothesen nach Wahrscheinlichkeit und Risiko ordnen
- je Hypothese einen kleinen, reversiblen Test durchführen
- Ursache und Gegenbeweis nachvollziehbar dokumentieren
Kontrollpunkte
- Ergebnis ist fachlich und technisch nachvollziehbar.
- Verantwortung, Voraussetzungen und Abhängigkeiten sind benannt.
- Fehlerfälle, Rückfalloptionen und Nachkontrolle sind dokumentiert.
Kapitel 2: Logs, Metriken und Beobachtbarkeit
Inhaltsverzeichnis dieses Kapitels
- strukturierte Anwendungs- und Infrastruktur-Logs
- Metriken und OTLP-Ausgabe
- Dashboards und Baselines
- Alarmgrenzen und Eskalation
- Schritt-für-Schritt-Umsetzung
Technische Signale werden mit Plattformfunktionen und Servicezielen verbunden.
1. strukturierte Anwendungs- und Infrastruktur-Logs
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
2. Metriken und OTLP-Ausgabe
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
3. Dashboards und Baselines
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
4. Alarmgrenzen und Eskalation
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
Schritt für Schritt
- kritische Nutzer- und Ingestion-Flüsse bestimmen
- passende Logs und Metriken je Fluss zuordnen
- Normalbereich unter typischer Last messen
- Warn- und Kritisch-Schwellen definieren
- Alarm mit Runbook und zuständiger Rolle testen
Kontrollpunkte
- Ergebnis ist fachlich und technisch nachvollziehbar.
- Verantwortung, Voraussetzungen und Abhängigkeiten sind benannt.
- Fehlerfälle, Rückfalloptionen und Nachkontrolle sind dokumentiert.
Kapitel 3: Typische Störungsdomänen
Inhaltsverzeichnis dieses Kapitels
- Authentifizierung und Berechtigung
- Datenbank, Sessions und Persistenz
- Collectors und Ingestion API
- Netzwerk, Mail und optionale Dienste
- Schritt-für-Schritt-Umsetzung
Fehler in Zugriff, Datenbank, Ingestion und Zusatzdiensten werden voneinander abgegrenzt.
1. Authentifizierung und Berechtigung
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
2. Datenbank, Sessions und Persistenz
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
3. Collectors und Ingestion API
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
4. Netzwerk, Mail und optionale Dienste
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
Schritt für Schritt
- Störung der richtigen Domäne zuordnen
- Gesundheitszustand und Erreichbarkeit der Abhängigkeit prüfen
- Konfiguration und Berechtigung gegen Sollzustand vergleichen
- kleinen Wiederanlauf oder isolierten Test durchführen
- Ergebnis und verbleibendes Risiko bewerten
Kontrollpunkte
- Ergebnis ist fachlich und technisch nachvollziehbar.
- Verantwortung, Voraussetzungen und Abhängigkeiten sind benannt.
- Fehlerfälle, Rückfalloptionen und Nachkontrolle sind dokumentiert.
Kapitel 4: Backup und Restore
Inhaltsverzeichnis dieses Kapitels
- Datenbank und persistente Zustände
- Konfiguration und Secrets-Referenzen
- Aufbewahrung und Schutz
- Restore-Test und Wiederanlauf
- Schritt-für-Schritt-Umsetzung
Sicherungen werden nach Wiederherstellbarkeit statt nur nach erfolgreicher Dateierzeugung bewertet.
1. Datenbank und persistente Zustände
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
2. Konfiguration und Secrets-Referenzen
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
3. Aufbewahrung und Schutz
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
4. Restore-Test und Wiederanlauf
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
Schritt für Schritt
- zu sichernde Daten und Abhängigkeiten inventarisieren
- Sicherungsrhythmus und Aufbewahrung festlegen
- Backup verschlüsselt und zugriffsgeschützt erzeugen
- Wiederherstellung in isolierter Umgebung durchführen
- Datenkonsistenz und Kernfunktionen nach Restore prüfen
Kontrollpunkte
- Ergebnis ist fachlich und technisch nachvollziehbar.
- Verantwortung, Voraussetzungen und Abhängigkeiten sind benannt.
- Fehlerfälle, Rückfalloptionen und Nachkontrolle sind dokumentiert.
Kapitel 5: Upgradeplanung und Kompatibilität
Inhaltsverzeichnis dieses Kapitels
- Releaseumfang und Abhängigkeiten
- Datenbankschema und Migration
- Collectors, APIs und Konfiguration
- Regression und Abnahme
- Schritt-für-Schritt-Umsetzung
Änderungen werden gegen Daten, Integrationen, Konfiguration und Betriebsverfahren geprüft.
1. Releaseumfang und Abhängigkeiten
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
2. Datenbankschema und Migration
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
3. Collectors, APIs und Konfiguration
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
4. Regression und Abnahme
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
Schritt für Schritt
- Ausgangsversion und Zielzustand dokumentieren
- Änderungen auf relevante Komponenten und Konfiguration prüfen
- vollständige Sicherung und Restore-Test abschließen
- Upgrade in Testumgebung mit repräsentativen Daten ausführen
- Kernfunktionen, Ingestion, Suche und Berechtigungen regressiv prüfen
Kontrollpunkte
- Ergebnis ist fachlich und technisch nachvollziehbar.
- Verantwortung, Voraussetzungen und Abhängigkeiten sind benannt.
- Fehlerfälle, Rückfalloptionen und Nachkontrolle sind dokumentiert.
Kapitel 6: Produktivrollout, Rollback und Notfallübung
Inhaltsverzeichnis dieses Kapitels
- Wartungsfenster und Kommunikation
- Go-/No-Go-Kriterien
- technischer Rollback
- Nachkontrolle und Lessons Learned
- Schritt-für-Schritt-Umsetzung
Freigabe und Rückfall erfolgen anhand vorher definierter Kriterien statt unter Zeitdruck.
1. Wartungsfenster und Kommunikation
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
2. Go-/No-Go-Kriterien
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
3. technischer Rollback
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
4. Nachkontrolle und Lessons Learned
Der Themenbereich wird fachlich eingeordnet, anhand eines repräsentativen Plattformszenarios demonstriert und mit Qualitäts-, Sicherheits- sowie Betriebskriterien verknüpft. Abhängigkeiten, verantwortliche Rollen und typische Fehlannahmen werden dabei ausdrücklich dokumentiert.
Schritt für Schritt
- Verantwortungen und Kommunikationskanäle bestätigen
- Startbedingungen und Abbruchschwellen prüfen
- Upgrade schrittweise ausführen und Metriken beobachten
- bei Schwellenverletzung Rollback samt Datenzustand durchführen
- Nachkontrolle, Ursachen und Verbesserungen dokumentieren
Kontrollpunkte
- Ergebnis ist fachlich und technisch nachvollziehbar.
- Verantwortung, Voraussetzungen und Abhängigkeiten sind benannt.
- Fehlerfälle, Rückfalloptionen und Nachkontrolle sind dokumentiert.
Praxisübungen
- Störung anhand einer Hypothesenmatrix untersuchen
- Monitoring-Dashboard und Alarmregel entwerfen
- Backup und Restore in einer Testumgebung planen
- Upgradecheckliste mit Regressionstests erstellen
- Rollback- und Notfallübung durchführen
Voraussetzungen und Anschluss
Voraussetzungen: Praxiskenntnisse der eingesetzten Deployment-Plattform, Datenbankgrundlagen und ODD-Betriebsarchitektur.
Anschluss: Als Vorbereitung eignen sich Deployment mit Docker und Kubernetes sowie Administration und täglicher Betrieb.
Fachbereichsleitung / Leitung der Trainer / Ansprechpersonen
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Plattformbetrieb, DevOps, SRE, Systemadministration, Datenbankadministration und technischer Support. |
| Voraussetzungen: | Praxiskenntnisse der eingesetzten Deployment-Plattform, Datenbankgrundlagen und ODD-Betriebsarchitektur. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
