GPU- und andere Beschleunigerknoten unterscheiden sich im Betrieb deutlich von gewöhnlichen Servern. Treiber, Firmware, Kernel, PCIe-Topologie, NUMA-Zuordnung, Gerätespeicher und Containerlaufzeit müssen als zusammenhängender Stack betrachtet werden. Fehler in nur einer Schicht führen häufig zu unklaren Symptomen wie nicht sichtbaren Geräten, Leistungseinbrüchen oder instabilen Workloads.
Das Seminar behandelt den vollständigen administrativen Lebenszyklus eines Linux-basierten Beschleunigerknotens. Im Mittelpunkt stehen reproduzierbare Installationen, kontrollierte Updates, sichere Gerätefreigabe, sinnvolle Aufteilung teurer Ressourcen und belastbare Diagnoseverfahren für Einzelserver und Clusterknoten.
Zielgruppe
Linux-Administratoren, Rechenzentrumsadministratoren, Kubernetes-Administratoren, Plattformingenieure sowie technische Verantwortliche für GPU-Server und lokale AI-Systeme.
Voraussetzungen
Sichere Linux-Grundkenntnisse, Erfahrung mit Paketverwaltung, Diensten, Protokollen und der Kommandozeile. Grundkenntnisse zu Containern sind hilfreich, werden aber nicht vorausgesetzt.
Seminarinhalte
Architektur und Dimensionierung
- Unterschiede zwischen CPU, GPU, NPU und weiteren Beschleunigern sowie geeignete Einsatzfelder für Training, Fine-Tuning und Inferenz
- VRAM-Bedarf, Speicherbandbreite, Rechenformate, Leistungsaufnahme, Kühlung und Rackplanung
- PCIe-Lanes, Switches, NUMA-Domänen, IOMMU und die Auswirkungen der Hardwaretopologie auf Datentransfers
- Auswahl zwischen Bare Metal, virtuellen Maschinen, Passthrough und containerisiertem Betrieb
Linux, Firmware und Treiber
- Bestandsaufnahme mit Systemwerkzeugen, Gerätekennungen, Kernelmodulen, Firmwareständen und Fehlerzählern
- Treiberpakete, Kernelabhängigkeiten, DKMS, Secure Boot, Signierung und kontrollierte Neustarts
- Kompatibilitätsprüfung zwischen Treiber, Laufzeitbibliotheken, Containerimages und AI-Frameworks
- Versionswechsel, Rollback, Wartungsfenster und Aufbau eines freigegebenen Softwarestandes
Containerzugriff auf Beschleuniger
- OCI-Laufzeiten, Container Device Interface, Node Resource Interface, Gerätedateien und Berechtigungen
- Bereitstellung für containerd, Podman und Kubernetes ohne unnötig privilegierte Container
- Validierung mit reproduzierbaren Testcontainern und Trennung von Host- und Containerbibliotheken
- Image-Varianten, Treiberkompatibilität, Registry-Strategien und Betrieb in Netzen ohne Internetzugang
GPU-Operatoren und Gerätelebenszyklus
- Operatoren für unterschiedliche Beschleunigerhersteller und deren Custom Resources vergleichen
- Node Feature Discovery, Geräteerkennung, Device Plugin und DRA-Treiber aufeinander abstimmen
- Treiber-CRDs, heterogene Betriebssystemstände und gestaffelte Knotenupdates verwalten
- Node Problem Detector, Zustandsbedingungen und automatisierte Node Remediation kontrolliert einsetzen
Partitionierung und gemeinsame Nutzung
- Exklusive Zuweisung, Hardwarepartitionierung, Time-Slicing und Prozessdienste im Vergleich
- Mehrinstanzprofile, DRA-Claims, Quoten, Isolation und Auswahl eines passenden Freigabemodells
- Auswirkungen geteilter Geräte auf Vorhersagbarkeit, Fehlersuche, Abrechnung und Servicegüten
- Stabile Funktionen von optionalen Alpha- oder Vorschaufunktionen beim GPU-Sharing trennen
Mehrknotenbetrieb und Datenwege
- Interconnects innerhalb eines Servers und zwischen Servern, RDMA, RoCE und InfiniBand im Überblick
- NUMA-nahe Platzierung von CPU, Arbeitsspeicher, Netzwerkkarte und Beschleuniger
- GPUDirect-ähnliche RDMA- und Storage-Datenpfade, Pinned Memory und I/O-Engpässe einordnen
- Grundlagen kollektiver Kommunikation und Anforderungen verteilter AI-Workloads
Überwachung und Fehleranalyse
- Temperatur, Energie, Takt, Speicherauslastung, Fehlerkorrektur, Linkzustände und Prozessbelegung
- Herstellerspezifische Telemetrie, Gesundheitsprüfungen, Burn-in und Baseline-Messungen verbinden
- Vorgehen bei Treiberfehlern, Geräteverlust, Speicherfehlern, Reset-Ereignissen und Leistungsabfall
- Wartungschecklisten, Ersatzteilstrategie und Nachweis eines stabilen Betriebszustands
Praktische Übungen
- Hardware- und Topologieinventar eines Beschleunigerknotens erstellen und bewerten
- Treiber- und Laufzeitstack installieren, prüfen und mit einem Testcontainer validieren
- Einen GPU-Operatorzustand, DRA-Treiber und automatisierte Knotenbedingungen analysieren
- Eine sichere Gerätefreigabe konfigurieren und unterschiedliche Zuweisungsmodelle vergleichen
- Messwerte erfassen, eine Leistungsbaseline anlegen und einen künstlichen Engpass lokalisieren
- Einen fehlerhaften Softwarestand analysieren und einen kontrollierten Rollback vorbereiten
Methodik
Kurze Theorieblöcke werden unmittelbar mit administrativen Laboraufgaben verbunden. Konfigurationen, Prüfkommandos und Diagnoseausgaben werden gemeinsam ausgewertet. Der Schwerpunkt liegt auf nachvollziehbaren Betriebsverfahren und nicht auf der Entwicklung von AI-Modellen.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Linux-, Rechenzentrums- und Plattformadministratoren |
| Voraussetzungen: | |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
