Seminar Training und Fine-Tuning auf Kubernetes mit Kubeflow Trainer und Kueue

Eigene Inferenz löst nur einen Teil der Souveränitätsaufgabe. Sobald Modelle an interne Sprache, Prozesse oder Fachdomänen angepasst werden, benötigt die Plattform kontrollierte Trainingsruntimes, planbare GPU-Zuteilung, reproduzierbare Datensätze und belastbare Checkpoints.

Das Seminar setzt auf die einheitliche TrainJob-API von Kubeflow Trainer v2 und Kueue für Quoten, Prioritäten und Topologie. Ein Fine-Tuning wird vom kleinen Testlauf bis zur verteilten Ausführung, Wiederaufnahme und Übergabe in Registry und Serving durchgespielt.

Einordnung und Nutzen

Vier Tage sind notwendig, weil Runtime-Definitionen, verteilte Ausführung, Kueue-Scheduling, Daten- und Checkpointpfade sowie ein reales Fine-Tuning mit Wiederaufnahme und LLMOps-Übergabe praktisch aufgebaut werden. Drei Tage würden Betrieb und Fehleranalyse unangemessen verkürzen.

Zielgruppe

  • AI- und Machine-Learning-Engineering
  • Kubernetes-, GPU- und Plattformadministration
  • MLOps-, LLMOps- und Data-Engineering-Teams

Voraussetzungen

  • Sichere Kubernetes-Grundkenntnisse
  • Python- und PyTorch-Grundlagen
  • Grundverständnis von Sprachmodellen, Tokenisierung und GPU-Ressourcen

Lernziele

  • Kubeflow Trainer v2 als Plattformdienst administrieren
  • TrainJobs und wiederverwendbare Runtimes sicher definieren
  • GPU-Quoten und verteilte Jobs mit Kueue steuern
  • Fine-Tuning reproduzierbar ausführen, fortsetzen und in den Modelllebenszyklus übergeben

Seminarinhalte

Trainingsarchitektur auf Kubernetes

  • Einzelknoten, Mehrknoten, mehrere Prozesse und verteilte Synchronisation
  • GPU-, CPU-, Netzwerk-, Speicher- und Datenpfade
  • JobSet, MPI-Grundlagen und Abgrenzung zu dauerhaften Inferenzdiensten

Kubeflow Trainer v2

  • TrainJob als einheitliche API statt framework-spezifischer Legacy-Jobs
  • ClusterTrainingRuntime für zentrale Plattformstandards
  • TrainingRuntime für mandantenspezifische Konfigurationen und sichere Images

Kueue und Ressourcenzuteilung

  • LocalQueue, ClusterQueue, ResourceFlavor und Cohorts
  • Faire Quoten, WorkloadPriority, Preemption und all-or-nothing admission
  • Topology-Aware Scheduling und MultiKueue als Architekturvariante

Verteilte Ausführung und Leistung

  • PyTorch-Verteilung, TorchTune und DeepSpeed
  • Prozesse je Knoten, Parallelisierung und Kommunikation
  • GPU-Auslastung, Skalierungseffizienz und systematische Engpassanalyse

Daten, Cache und Checkpoints

  • Versionierte Trainings- und Evaluationsdatensätze
  • Objektstorage, verteiltes Datencaching und I/O-Entlastung der GPUs
  • Periodische Checkpoints, konsistente Wiederaufnahme und Aufbewahrung

Effizientes LLM-Fine-Tuning

  • LoRA und weitere PEFT-Verfahren
  • Präzision, Speicherbedarf, Gradientenakkumulation und Batchgrößen
  • Kleine Validierungsläufe vor der verteilten Skalierung

Sicherheit und Reproduzierbarkeit

  • Zugelassene Images, Runtimes, Modelle und Datensätze
  • Secrets, Identitäten, Egress- und Netzwerkregeln
  • Parameter, Code, Daten, Umgebung und Herkunft vollständig erfassen

LLMOps-Übergabe und Betrieb

  • Metriken, Logs, Ereignisse und Pending-Workloads
  • Registrierung von Checkpoints und finalen Modellen in MLflow
  • Evaluation, Freigabe, Übergabe an KServe und kontrollierte Aufräumverfahren

Praktische Übungen

  • Installation und Prüfung von Kubeflow Trainer v2 und der Kueue-Integration
  • Erstellung von ClusterTrainingRuntime, TrainingRuntime und TrainJob
  • Konfiguration fairer GPU-Quoten, Prioritäten und Topology-Aware Scheduling
  • Ausführung eines LoRA-Fine-Tunings mit versioniertem Datensatz
  • Unterbrechung und Wiederaufnahme aus einem Checkpoint
  • Registrierung und Freigabe des Modellartefakts mit anschließender Testbereitstellung

Methodik

Ein durchgängiges Labor verbindet Plattformkonfiguration, Trainingsjob, Scheduling, Messung, Checkpoint und LLMOps-Übergabe. Skalierung erfolgt erst nach erfolgreichem Kleinlauf, damit Fehlerursachen nachvollziehbar bleiben.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 4 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 2.396 zzgl. MwSt.
Inhaus: € 6.800 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: AI- und Machine-Learning-Engineering, Kubernetes-, GPU- und Plattformadministration, MLOps-, LLMOps- und Data-Engineering-Teams
Voraussetzungen: Sichere Kubernetes-Grundkenntnisse; Python- und PyTorch-Grundlagen; Grundverständnis von Sprachmodellen, Tokenisierung und GPU-Ressourcen
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Klagenfurt 4 Tage
Bregenz 4 Tage
Linz 4 Tage
Salzburg 4 Tage
Graz 4 Tage
Wien 4 Tage
Inhaus / Firmenseminar 4 Tage
Stream live 4 Tage
Innsbruck 4 Tage
Stream gespeichert 4 Tage
Inhaus / Firmenseminar 4 Tage
Stream live 4 Tage
Innsbruck 4 Tage
Stream gespeichert 4 Tage
Klagenfurt 4 Tage
Bregenz 4 Tage
Linz 4 Tage
Salzburg 4 Tage
Graz 4 Tage
Wien 4 Tage
Graz 4 Tage
Wien 4 Tage
Stream live 4 Tage
Inhaus / Firmenseminar 4 Tage
Stream gespeichert 4 Tage
Innsbruck 4 Tage
Klagenfurt 4 Tage
Bregenz 4 Tage
Linz 4 Tage
Salzburg 4 Tage
Linz 4 Tage
Salzburg 4 Tage
Graz 4 Tage
Wien 4 Tage
Inhaus / Firmenseminar 4 Tage
Stream live 4 Tage
Innsbruck 4 Tage
Stream gespeichert 4 Tage
Klagenfurt 4 Tage
Bregenz 4 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.at All rights reserved.  | Kontakt | Impressum | Nach oben