Seminar AI-Infrastruktur für Administratoren: Beschleuniger- und GPU-Server unter Linux

GPU- und andere Beschleunigerknoten unterscheiden sich im Betrieb deutlich von gewöhnlichen Servern. Treiber, Firmware, Kernel, PCIe-Topologie, NUMA-Zuordnung, Gerätespeicher und Containerlaufzeit müssen als zusammenhängender Stack betrachtet werden. Fehler in nur einer Schicht führen häufig zu unklaren Symptomen wie nicht sichtbaren Geräten, Leistungseinbrüchen oder instabilen Workloads.

Das Seminar behandelt den vollständigen administrativen Lebenszyklus eines Linux-basierten Beschleunigerknotens. Im Mittelpunkt stehen reproduzierbare Installationen, kontrollierte Updates, sichere Gerätefreigabe, sinnvolle Aufteilung teurer Ressourcen und belastbare Diagnoseverfahren für Einzelserver und Clusterknoten.

Zielgruppe

Linux-Administratoren, Rechenzentrumsadministratoren, Kubernetes-Administratoren, Plattformingenieure sowie technische Verantwortliche für GPU-Server und lokale AI-Systeme.

Voraussetzungen

Sichere Linux-Grundkenntnisse, Erfahrung mit Paketverwaltung, Diensten, Protokollen und der Kommandozeile. Grundkenntnisse zu Containern sind hilfreich, werden aber nicht vorausgesetzt.

Seminarinhalte

Architektur und Dimensionierung

  • Unterschiede zwischen CPU, GPU, NPU und weiteren Beschleunigern sowie geeignete Einsatzfelder für Training, Fine-Tuning und Inferenz
  • VRAM-Bedarf, Speicherbandbreite, Rechenformate, Leistungsaufnahme, Kühlung und Rackplanung
  • PCIe-Lanes, Switches, NUMA-Domänen, IOMMU und die Auswirkungen der Hardwaretopologie auf Datentransfers
  • Auswahl zwischen Bare Metal, virtuellen Maschinen, Passthrough und containerisiertem Betrieb

Linux, Firmware und Treiber

  • Bestandsaufnahme mit Systemwerkzeugen, Gerätekennungen, Kernelmodulen, Firmwareständen und Fehlerzählern
  • Treiberpakete, Kernelabhängigkeiten, DKMS, Secure Boot, Signierung und kontrollierte Neustarts
  • Kompatibilitätsprüfung zwischen Treiber, Laufzeitbibliotheken, Containerimages und AI-Frameworks
  • Versionswechsel, Rollback, Wartungsfenster und Aufbau eines freigegebenen Softwarestandes

Containerzugriff auf Beschleuniger

  • OCI-Laufzeiten, Container Device Interface, Node Resource Interface, Gerätedateien und Berechtigungen
  • Bereitstellung für containerd, Podman und Kubernetes ohne unnötig privilegierte Container
  • Validierung mit reproduzierbaren Testcontainern und Trennung von Host- und Containerbibliotheken
  • Image-Varianten, Treiberkompatibilität, Registry-Strategien und Betrieb in Netzen ohne Internetzugang

GPU-Operatoren und Gerätelebenszyklus

  • Operatoren für unterschiedliche Beschleunigerhersteller und deren Custom Resources vergleichen
  • Node Feature Discovery, Geräteerkennung, Device Plugin und DRA-Treiber aufeinander abstimmen
  • Treiber-CRDs, heterogene Betriebssystemstände und gestaffelte Knotenupdates verwalten
  • Node Problem Detector, Zustandsbedingungen und automatisierte Node Remediation kontrolliert einsetzen

Partitionierung und gemeinsame Nutzung

  • Exklusive Zuweisung, Hardwarepartitionierung, Time-Slicing und Prozessdienste im Vergleich
  • Mehrinstanzprofile, DRA-Claims, Quoten, Isolation und Auswahl eines passenden Freigabemodells
  • Auswirkungen geteilter Geräte auf Vorhersagbarkeit, Fehlersuche, Abrechnung und Servicegüten
  • Stabile Funktionen von optionalen Alpha- oder Vorschaufunktionen beim GPU-Sharing trennen

Mehrknotenbetrieb und Datenwege

  • Interconnects innerhalb eines Servers und zwischen Servern, RDMA, RoCE und InfiniBand im Überblick
  • NUMA-nahe Platzierung von CPU, Arbeitsspeicher, Netzwerkkarte und Beschleuniger
  • GPUDirect-ähnliche RDMA- und Storage-Datenpfade, Pinned Memory und I/O-Engpässe einordnen
  • Grundlagen kollektiver Kommunikation und Anforderungen verteilter AI-Workloads

Überwachung und Fehleranalyse

  • Temperatur, Energie, Takt, Speicherauslastung, Fehlerkorrektur, Linkzustände und Prozessbelegung
  • Herstellerspezifische Telemetrie, Gesundheitsprüfungen, Burn-in und Baseline-Messungen verbinden
  • Vorgehen bei Treiberfehlern, Geräteverlust, Speicherfehlern, Reset-Ereignissen und Leistungsabfall
  • Wartungschecklisten, Ersatzteilstrategie und Nachweis eines stabilen Betriebszustands

Praktische Übungen

  • Hardware- und Topologieinventar eines Beschleunigerknotens erstellen und bewerten
  • Treiber- und Laufzeitstack installieren, prüfen und mit einem Testcontainer validieren
  • Einen GPU-Operatorzustand, DRA-Treiber und automatisierte Knotenbedingungen analysieren
  • Eine sichere Gerätefreigabe konfigurieren und unterschiedliche Zuweisungsmodelle vergleichen
  • Messwerte erfassen, eine Leistungsbaseline anlegen und einen künstlichen Engpass lokalisieren
  • Einen fehlerhaften Softwarestand analysieren und einen kontrollierten Rollback vorbereiten

Methodik

Kurze Theorieblöcke werden unmittelbar mit administrativen Laboraufgaben verbunden. Konfigurationen, Prüfkommandos und Diagnoseausgaben werden gemeinsam ausgewertet. Der Schwerpunkt liegt auf nachvollziehbaren Betriebsverfahren und nicht auf der Entwicklung von AI-Modellen.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Linux-, Rechenzentrums- und Plattformadministratoren
Voraussetzungen:  
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Stream live 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream gespeichert 3 Tage
Innsbruck 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.at All rights reserved.  | Kontakt | Impressum | Nach oben