Leistungsfähige AI- und KI-Systeme entstehen nicht allein durch geeignete Modelle. Für einen verlässlichen Betrieb werden abgestimmte Server, Beschleuniger, Betriebssysteme, Containerplattformen, Speicher, Netzwerke, Observability und Sicherheitsmechanismen benötigt. Das Seminarprogramm vermittelt diese Aufgaben konsequent aus Sicht der Administration und des Plattformbetriebs.
Die Seminare sind herstellerübergreifend und auf den Betriebsstand 2026 ausgerichtet. Sie berücksichtigen Linux und virtualisierte Umgebungen ebenso wie GPU-Operatoren, Kubernetes DRA und Kueue, verteiltes LLM-Serving, Inference Gateway, moderne Datenpfade und vertrauliche Ausführung. Stabile Funktionen werden klar von optionalen oder experimentellen Verfahren getrennt. Praktische Übungen bilden Aufgaben von der Bestandsaufnahme bis zur Störungsanalyse ab.
Seminarprogramm
- AI-Infrastruktur für Administratoren: Beschleuniger- und GPU-Server unter Linux: GPU-Operatoren, DRA, Treiberbetrieb, Partitionierung und Fehleranalyse von Beschleunigerknoten.
- AI-Infrastruktur für Administratoren: Grundlagen, Architektur und Betriebsmodelle: Technische Grundlagen, Betriebsmodelle, Dimensionierung und Verantwortlichkeiten.
- AI-Infrastruktur für Administratoren: Hochverfügbarkeit, Backup und Wiederanlauf: Hochverfügbarkeit, Sicherung, Wiederanlauf und belastbare Notfallverfahren.
- AI-Infrastruktur für Administratoren: Inferenzplattformen und LLM-Serving: Produktiver Betrieb verteilter LLM-Dienste mit LLMInferenceService und Inference Gateway.
- AI-Infrastruktur für Administratoren: Intensivseminar Plattform- und GPU-Betrieb: Gebündelter Aufbaupfad von den Grundlagen bis zur Kubernetes- und GPU-Plattform.
- AI-Infrastruktur für Administratoren: Intensivseminar Produktiver Betrieb und Resilienz: Gebündelter Betriebspfad für Inferenz, Überwachung, Sicherheit und Resilienz.
- AI-Infrastruktur für Administratoren: Kompaktseminar: Verdichteter Überblick mit durchgehendem Administrationslabor in drei Tagen.
- AI-Infrastruktur für Administratoren: Kubernetes für AI-Workloads: Aufbau und Administration von Kubernetes-Clustern für AI-Workloads.
- AI-Infrastruktur für Administratoren: Monitoring, Performance und Kapazitätsplanung: GenAI-Observability, GPU-Telemetrie, Dashboards, Kapazitätsplanung und Fehlerdiagnose.
- AI-Infrastruktur für Administratoren: Sicherheit, IAM und Mandantenfähigkeit: Identitäten, Mandantentrennung, Lieferkettenschutz, vertrauliche Ausführung und Attestierung.
- AI-Infrastruktur für Administratoren: Storage, Datenpfade und Hochleistungsnetzwerke: ModelCache, KV-Cache-Transfer, direkte Datenpfade und Hochleistungsnetze für AI-Systeme.
Empfohlene Reihenfolge
- AI-Infrastruktur für Administratoren: Grundlagen, Architektur und Betriebsmodelle
- AI-Infrastruktur für Administratoren: Beschleuniger- und GPU-Server unter Linux
- AI-Infrastruktur für Administratoren: Kubernetes für AI-Workloads
- AI-Infrastruktur für Administratoren: Storage, Datenpfade und Hochleistungsnetzwerke
- AI-Infrastruktur für Administratoren: Inferenzplattformen und LLM-Serving
- AI-Infrastruktur für Administratoren: Monitoring, Performance und Kapazitätsplanung
- AI-Infrastruktur für Administratoren: Sicherheit, IAM und Mandantenfähigkeit
- AI-Infrastruktur für Administratoren: Hochverfügbarkeit, Backup und Wiederanlauf
Der Fachpfad beginnt mit der gemeinsamen technischen Basis. Danach folgen Beschleuniger und Kubernetes-Orchestrierung, weil DRA-, Scheduling-, Speicher-, Netzwerk- und Inferenzentscheidungen von diesen Grundlagen abhängen. Observability und Sicherheit werden anschließend auf die produktive Plattform angewendet. Hochverfügbarkeit, Sicherung und Wiederanlauf schließen den Fachpfad ab.
Alternative Lernpfade
Kompaktpfad
Das Kompaktseminar vermittelt in drei Tagen einen zusammenhängenden Überblick. Es eignet sich für erfahrene Administratoren, die eine erste AI-Plattform bewerten oder den späteren Spezialisierungspfad vorbereiten. Bei anschließendem Vertiefungsbedarf wird mit dem jeweiligen Fachseminar fortgesetzt.
Intensivpfad
Die beiden fünftägigen Intensivseminare werden in der Reihenfolge Plattform- und GPU-Betrieb sowie Produktiver Betrieb und Resilienz besucht. Zusammen verdichten sie die Inhalte der Fachseminare und des Kompaktseminars auf zehn Trainingstage. Der erste Teil schafft die Infrastruktur- und Orchestrierungsbasis; der zweite Teil behandelt Inferenzbetrieb, Überwachung, Sicherheit, Sicherung und Wiederanlauf.
Auswahl nach Aufgabenbereich
- Linux- und Hardwareadministration: Grundlagen, Beschleuniger- und GPU-Server sowie Monitoring.
- Kubernetes- und Plattformbetrieb: Kubernetes, Storage und Netzwerke, Inferenzplattformen sowie Sicherheit.
- Betriebsverantwortung: Monitoring, Sicherheit, Hochverfügbarkeit und Wiederanlauf.
- Architektur und technische Leitung: Kompaktseminar oder beide Intensivseminare.
Seminarauswahl
Seminare zu diesem Hersteller
- AI-Infrastruktur für Administratoren: Beschleuniger- und GPU-Server unter Linux
- AI-Infrastruktur für Administratoren: Grundlagen, Architektur und Betriebsmodelle
- AI-Infrastruktur für Administratoren: Hochverfügbarkeit, Backup und Wiederanlauf
- AI-Infrastruktur für Administratoren: Inferenzplattformen und LLM-Serving
- AI-Infrastruktur für Administratoren: Intensivseminar Plattform- und GPU-Betrieb
- AI-Infrastruktur für Administratoren: Intensivseminar Produktiver Betrieb und Resilienz
- AI-Infrastruktur für Administratoren: Kompaktseminar
- AI-Infrastruktur für Administratoren: Kubernetes für AI-Workloads
- AI-Infrastruktur für Administratoren: Monitoring, Performance und Kapazitätsplanung
- AI-Infrastruktur für Administratoren: Sicherheit, IAM und Mandantenfähigkeit
- AI-Infrastruktur für Administratoren: Storage, Datenpfade und Hochleistungsnetzwerke
Seminarorte:
Durchführungsgarantie für jedes Training:
ja, ab 2 Teilnehmern
Öffentlich, Webinar, Inhaus, Workshop:
ja, sehr gerne
Unterlage im Seminar:
ja, auf Datenträger oder Download
Zertifikat für Ihre Teilnahme am Training:
ja, selbstverständlich
