Eine hohe GPU-Auslastung ist nicht automatisch ein guter Betriebszustand, und eine niedrige Auslastung ist nicht automatisch Verschwendung. Aussagekräftige Diagnose entsteht erst, wenn Host, Container, Cluster, Datenpfad und Inferenzdienst entlang desselben Lastprofils betrachtet werden. AI-Systeme benötigen daher zusätzliche Kennzahlen und eine sorgfältige Korrelation über mehrere Schichten.
Das Seminar baut eine Observability-Struktur auf, die technische Fehler, Sättigung, Kapazitätsmangel und ungeeignete Workloadparameter voneinander unterscheidbar macht. Messwerte werden in Baselines und Serviceziele überführt und für Alarmierung, Störungsanalyse und Beschaffungsplanung genutzt.
Zielgruppe
System- und Kubernetes-Administratoren, Plattform- und Observability-Teams, DevOps- und MLOps-Fachkräfte sowie Kapazitätsverantwortliche.
Voraussetzungen
Grundkenntnisse in Linux, Netzwerken und Monitoring. Erfahrung mit Containern oder Kubernetes sowie GPU- oder Inferenzsystemen ist hilfreich.
Seminarinhalte
Messmodell und Serviceziele
- Golden Signals und Sättigungskennzahlen auf AI-Plattformen übertragen
- Latenz, Durchsatz, Fehler, Warteschlange, Zeit bis zum ersten Token und Tokenrate definieren
- Technische SLIs mit Verfügbarkeit, Kapazität und Nutzererfahrung verbinden
- Labels und Kardinalität für Modell, Version, Mandant, Knoten und Endpunkt beherrschen
Host- und Beschleunigermetriken
- CPU, RAM, NUMA, I/O, Netzwerk, Energie und thermische Drosselung überwachen
- NVIDIA-, AMD- und weitere Telemetriepfade für VRAM, Auslastung, Temperatur und Fehler einordnen
- Prozess-, Container- und Gerätebelegung einander zuordnen
- Partitionierte oder geteilte Geräte ohne irreführende Aggregation auswerten
Kubernetes- und Plattformtelemetrie
- Podstatus, Scheduling, Restarts, Ressourcenanforderungen und Knotendruck korrelieren
- Operatoren, DRA-Claims, Gerätegesundheit, Kueue-Warteschlangen und Autoscaler überwachen
- Prometheus-Erfassung, ServiceMonitors, Recording Rules und Dashboardvariablen strukturieren
- Logs und Events für Pending Pods, OOM, Eviction und Gerätefehler zusammenführen
Storage- und Netzwerkdiagnose
- Latenz, IOPS, Durchsatz, Queue Depth, Cache Hit Rate und Modellladezeit messen
- Paketverlust, Retransmits, Puffer, RDMA-Zähler und Linkauslastung interpretieren
- Datenengpass von Rechenengpass und Kommunikationsengpass unterscheiden
- Topologie und Datenlokalität in Dashboards und Diagnoseabläufe einbeziehen
Inferenz-Observability
- Anfragephase, Queueing, Prefill, Decode, KV-Cache-Transfer und Streaming getrennt beobachten
- TTFT, Inter-Token-Latenz, Tokenrate, Batchgröße, Cache und Parallelität miteinander verbinden
- OpenTelemetry-GenAI-Semantik für Gateway-, Modellserver- und Backend-Traces anwenden
- Fehlerbudgets, Alarmgrenzen und Eskalation für Inferenzdienste festlegen
Lasttest und Kapazitätsplanung
- Repräsentative Anfrageverteilungen, Warm-up, Messfenster und Wiederholungen definieren
- Baseline, Sättigungspunkt, nutzbare Reserve und Degradationsverhalten bestimmen
- Kapazität für Spitzenlast, Wachstum, Wartung und Ausfall eines Knotens planen
- Trendbericht und Beschaffungsbedarf mit nachvollziehbaren Annahmen dokumentieren
Praktische Übungen
- Ein Metrikmodell für Host, herstellerneutrale GPU-Telemetrie, DRA, Kubernetes und Inferenz erstellen
- Eine Baseline unter definierter Last aufnehmen und Alarmgrenzen begründen
- Einen künstlichen VRAM-, Storage- oder Netzwerkengpass erzeugen und eindeutig lokalisieren
- Hohe Queue-Zeit, langsame Prefill-Phase und langsame Tokenausgabe anhand von Traces unterscheiden
- Aus Messreihen eine Kapazitätsreserve und einen Erweiterungszeitpunkt ableiten
Methodik
Metriken, Logs und Traces werden an einer vorbereiteten AI-Workload erhoben. Lastparameter und Engpässe werden kontrolliert verändert. Diagnoseentscheidungen müssen durch konkrete Messwerte und reproduzierbare Vergleiche begründet werden.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Administratoren, Plattform- und Observability-Teams |
| Voraussetzungen: | Linux- und Monitoring-Grundkenntnisse |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
