Eine AI-Plattform besteht aus Komponenten mit sehr unterschiedlichem Schutzbedarf. Containerimages und öffentliche Modellgewichte lassen sich häufig reproduzierbar wiederherstellen, während feinabgestimmte Modelle, Vektordaten, Zugriffspolicies, Schlüssel und betriebliche Konfigurationen einmalig sein können. Ein pauschales Vollbackup ist deshalb weder ausreichend noch wirtschaftlich.
Das Seminar entwickelt eine belastbare Schutz- und Wiederanlaufstrategie aus Geschäftsanforderungen, Fehlerdomänen und technischen Abhängigkeiten. Neben Redundanz stehen überprüfbare Sicherungen, geordnete Startreihenfolgen, Kapazitätsreserven und regelmäßige Wiederherstellungstests im Mittelpunkt.
Zielgruppe
System- und Plattformadministratoren, Backup-Verantwortliche, Kubernetes-Administratoren, IT-Service-Manager und technische Notfallverantwortliche.
Voraussetzungen
Erfahrung im Betrieb von Server-, Speicher- oder Kubernetes-Umgebungen. Grundkenntnisse zu AI-Infrastruktur oder der vorherige Besuch des Grundlagenseminars werden empfohlen.
Seminarinhalte
Schutzbedarf und Wiederanlaufziele
- Dienste, Daten, Modelle, Adapter, ModelCaches, Konfigurationen, Geheimnisse und Protokolle inventarisieren
- Kritikalität, Wiederbeschaffbarkeit, RPO, RTO und maximal tolerierbare Leistungseinbuße festlegen
- Abhängigkeiten zwischen Identitätsdienst, Registry, Modellablage, Cluster, Inferenz und Monitoring erfassen
- Notbetrieb mit reduziertem Modellangebot oder geringerer Kapazität als eigene Betriebsart definieren
Fehlerdomänen und Hochverfügbarkeit
- Ausfall von Prozess, Pod, Knoten, Rack, Storage-System, Netzwerkzone und Standort unterscheiden
- Redundanz für Control Plane, Registries, Modellobjektspeicher, Datenbanken und Inferenz-Gateways planen
- Beschleunigerknappheit, lange Modellladezeiten und große Artefakte bei Failover berücksichtigen
- Health Checks, Pod Disruption Budgets, Antiaffinität und geordnete Wartung sinnvoll kombinieren
Sicherung von AI-Plattformen
- Deklarative Rekonstruktion und Sicherung für Linux, Kubernetes, Operatoren, Policies und Gateways trennen
- Versionierte Sicherung von Modellartefakten, Adaptern, Promptvorlagen, Vektorindizes und Metadaten
- Volume Group Snapshots, applikationskonsistente Sicherung, Replikation und unveränderbare Kopien abgrenzen
- Schlüssel, Zertifikate und Geheimnisse mit getrennten Schutz- und Wiederherstellungsverfahren behandeln
Disaster Recovery und Wiederinbetriebnahme
- Wiederanlaufreihenfolge von Basisdiensten über Modellablage und Cache-Aufbau bis zu Endpunkten festlegen
- Cold-, Warm- und Hot-Standby anhand von Kosten, RTO und Hardwareverfügbarkeit vergleichen
- Abweichende Hardware, Treiberstände und Netzparameter am Ersatzstandort einplanen
- DNS, Zertifikate, API-Endpunkte, Warteschlangen und Clientverhalten beim Umschalten berücksichtigen
Tests und Nachweise
- Restore-Tests von bloßer Job-Erfolgsmeldung trennen und fachliche Funktionsprüfungen definieren
- Tabletop-Übung, Komponententest, Teilausfall und vollständigen Standorttest staffeln
- Zeitmessung, Abweichungen, manuelle Schritte und fehlende Berechtigungen protokollieren
- Runbooks nach Tests aktualisieren und offene Risiken mit Verantwortlichen und Fristen versehen
Störungsbetrieb und Kommunikation
- Ausfallbilder priorisieren, Zuständigkeiten aktivieren und Veränderungen während der Störung kontrollieren
- Technische Diagnose von Kapazitätsentscheidungen und Servicekommunikation trennen
- Rückkehr vom Notbetrieb in den Normalbetrieb mit Datenabgleich und kontrollierter Lastzuschaltung planen
- Nachbereitung mit Ursachenanalyse, Maßnahmenverfolgung und erneutem Wirksamkeitstest durchführen
Praktische Übungen
- Schutzklassen und Wiederanlaufziele für eine beispielhafte On-Premises-AI-Plattform festlegen
- Eine Abhängigkeitsmatrix und geordnete Wiederanlaufsequenz erstellen
- Sicherungsumfang für Kubernetes-Konfigurationen, Modelle, Vektordaten und Geheimnisse definieren
- Den Ausfall eines GPU-Knotens und eines Modellobjektspeichers anhand eines Runbooks bearbeiten
- Einen Restore-Test mit technischen und funktionalen Abnahmekriterien planen
Methodik
Bewährte Verfahren aus Hochverfügbarkeit und Backup werden auf die besonderen Eigenschaften großer Modelle und beschleunigter Plattformen übertragen. Szenarien, Checklisten und Wiederanlaufpläne werden in Gruppen erstellt und anhand messbarer Ziele geprüft.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Administratoren, Backup- und Notfallverantwortliche |
| Voraussetzungen: | Betriebserfahrung; AI-Infrastruktur-Grundlagen empfohlen |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
