Betriebsüberwachung mit Talos Health, Systemdiensten, Kernel- und Servicelogs, Kubernetes-Events, Metriken, zentraler Sammlung, SLOs, Dashboards, Alarmierung und Runbooks.
Inhaltsverzeichnis
- Zielsetzung und Einsatzbereich
- Zielgruppe und Vorkenntnisse
- Seminarinhalte
- Observability-Ziele und Signalkatalog
- Talos Health und Systemdienste
- Kernel-, Service- und Kubernetes-Ereignisse
- Metriken, Kapazität und Trends
- Zentrale Sammlung und Aufbewahrung
- Dashboards, SLOs und Alarmierung
- Praxisübungen
- Methodik und Zeitbedarf
Zielsetzung und Einsatzbereich
Das Seminar vermittelt einen reproduzierbaren Arbeitsablauf von der technischen Einordnung über Planung und Umsetzung bis zur belastbaren Prüfung. Entscheidungen werden anhand von Abhängigkeiten, Risiken, Freigabepunkten und Rückfallmöglichkeiten dokumentiert.
Zielgruppe und Vorkenntnisse
Teilnehmerkreis: Talos- und Kubernetes-Administration, SRE, Plattformbetrieb und technische Betriebsverantwortung.
Voraussetzungen: Talos- und Kubernetes-Grundkenntnisse sowie Erfahrung mit Logging, Metriken und Alarmierung.
Seminarinhalte
- Observability-Ziele und Signalkatalog
- Talos Health und Systemdienste
- Kernel-, Service- und Kubernetes-Ereignisse
- Metriken, Kapazität und Trends
- Zentrale Sammlung und Aufbewahrung
- Dashboards, SLOs und Alarmierung
1. Observability-Ziele und Signalkatalog
- Benutzerwirkung, Plattform-SLOs und technische Komponenten miteinander verknüpfen.
- Verfügbarkeit, Latenz, Fehler, Sättigung und Kapazität als Kernsignale definieren.
- Control Plane, Worker, Netzwerk, Storage und Imageversorgung getrennt abdecken.
- Owner, Reaktionszeit und Eskalationsweg für jedes Signal festlegen.
2. Talos Health und Systemdienste
- Maschinen- und Cluster-Health in einzelne technische Prüfungen zerlegen.
- Servicezustände, Neustarts, Abhängigkeiten und Versionsstände überwachen.
- Zertifikatslaufzeiten und Konfigurationsstand in regelmäßige Kontrollen aufnehmen.
- Wartungszustände von echten Störungen und schleichender Degradation unterscheiden.
3. Kernel-, Service- und Kubernetes-Ereignisse
- Kernel-, Talos-Service-, Kubernetes-System- und Workloadlogs korrekt zuordnen.
- Kubernetes-Events als kurzfristige Diagnosequelle berücksichtigen.
- Zeitstempel, Knotenidentität, Cluster und Komponente konsistent anreichern.
- Vertrauliche Inhalte bei Sammlung, Aufbewahrung und Weitergabe begrenzen.
4. Metriken, Kapazität und Trends
- CPU, Arbeitsspeicher, Dateisystem, Netzwerk und Storage als Ressourcengruppen messen.
- Node Conditions, Podzustände und Control-Plane-Indikatoren integrieren.
- Kapazitätsreserven und Sättigungsschwellen aus realen Lastprofilen ableiten.
- Trend- und Forecastdaten für Skalierung, Wartung und Budgetplanung nutzen.
5. Zentrale Sammlung und Aufbewahrung
- Log- und Metrikpfade redundant und ausfallsicher gestalten.
- Pufferung, Backpressure, Verlustverhalten und Abhängigkeiten dokumentieren.
- Aufbewahrungsdauer, Zugriffsschutz und Löschung nach Datenklasse festlegen.
- Monitoringabhängigkeiten von der überwachten Plattform minimieren.
6. Dashboards, SLOs und Alarmierung
- Übersicht, Diagnose und Kapazität in getrennten Dashboardebenen darstellen.
- Alarme auf Wirkung, Dauer und Kombination mehrerer Signale stützen.
- Flapping, Duplikate und wartungsbedingte Fehlalarme reduzieren.
- Jeden Alarm mit Erstdiagnose, Owner, Eskalation und Runbook verknüpfen.
Praxisübungen
- Signal- und SLO-Katalog erstellen
- Talos-Dienste und Kubernetes-Events korrelieren
- Zentrale Logsammlung im Labor anbinden
- Plattformdashboard entwerfen
- Mehrstufige Alarmregeln testen
- Alarmbezogenes Erstdiagnose-Runbook erstellen
Methodik und Zeitbedarf
Die Inhalte werden als fachlich strukturierter Vortrag, geführte Demonstration und schrittweise praktische Übung vermittelt. Jede Arbeitsphase endet mit technischen Prüfpunkten, dokumentierten Sollwerten und einer kontrollierten Fehler- oder Rückfallsituation.
Zwei Tage sind erforderlich, um Signalmodell, technische Sammlung, Dashboards, Alarmierung und Betriebsintegration als geschlossenes Konzept umzusetzen.
Fachbereichsleitung / Trainerteam / Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weiterer Tag: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Talos- und Kubernetes-Administration, SRE, Plattformbetrieb und technische Betriebsverantwortung. |
| Voraussetzungen: | Talos- und Kubernetes-Grundkenntnisse sowie Erfahrung mit Logging, Metriken und Alarmierung. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
