Seminar Serving und Inferenz mit KServe und vLLM

Ein lokal gestarteter Modellserver ist noch kein produktiver AI-Dienst. Für interne Anwendungen werden stabile APIs, reproduzierbare Modellstände, kontrollierter Ressourcenverbrauch, horizontale und verteilte Skalierung, sichere Zugriffe und beobachtbare Rollouts benötigt.

Das Seminar kombiniert vLLM als leistungsfähige Inferenzruntime mit KServe als Kubernetes-nativer Steuerungsebene. Der vollständige Pfad vom Modellartefakt bis zum lastgetesteten, versionierten Endpunkt wird praktisch aufgebaut.

Einordnung und Nutzen

Drei Tage sind erforderlich, da Modellruntime, Kubernetes-Steuerung, Gateway, Skalierung und Performance gemeinsam eingerichtet und unter Last geprüft werden. Ein reiner Quickstart würde die betriebskritischen Teile auslassen.

Zielgruppe

  • AI-, ML- und Platform Engineering
  • Kubernetes- und GPU-Administration
  • MLOps, LLMOps und SRE

Voraussetzungen

  • Kubernetes-Grundkenntnisse
  • Grundverständnis von Sprachmodellen und HTTP-APIs
  • Linux- und YAML-Kenntnisse

Lernziele

  • Modelle reproduzierbar mit vLLM bereitstellen
  • KServe-Ressourcen für generative Inferenz konfigurieren
  • Gateway, Skalierung und Rollouts produktionsgerecht umsetzen
  • Leistung und Fehler anhand geeigneter Messwerte analysieren

Seminarinhalte

Modell- und Runtime-Grundlagen

  • Modellartefakte, Tokenizer, Präzision und Speicherbedarf
  • vLLM-Prozess, OpenAI-kompatible Endpunkte und Streaming
  • CPU-, Einzel-GPU- und Multi-GPU-Betriebsformen

KServe-Architektur

  • Control Plane, Data Plane und Serving-Runtimes
  • InferenceService für klassische und einfache generative Workloads
  • LLMInferenceService und LLMInferenceServiceConfig auf Basis von llm-d für skalierbare LLM-Orchestrierung

Speicher, Cache und Startverhalten

  • Modellspeicher, Persistent Volumes und lokaler Cache
  • KV-Cache, Prefix-Cache, Offloading und cache-bewusstes Routing
  • Warmstart, Modellladezeit, disaggregated prefill/decode als Architekturvariante und Kapazitätsreserve

Netzwerk und AI-Gateway

  • Interne Services, Gateway API und TLS
  • Authentisierung, Token- und Anfrageratenbegrenzung
  • Routing, Zeitüberschreitungen und kontrollierte Fehlerantworten

Skalierung und Rollout

  • Metrikbasiertes Autoscaling und Grenzen von Scale-to-zero
  • Multi-Node- und Multi-GPU-Inferenz
  • Canary, Versionierung, Health Checks und Rollback

Leistung und Betrieb

  • Durchsatz, Time-to-first-token, Inter-token latency und Fehlerquote
  • Continuous Batching, Parallelisierung und Speicherengpässe
  • Lasttests, Metriken, Logs, Traces und Kapazitätsentscheidungen

Praktische Übungen

  • Bereitstellung eines vLLM-Endpunkts mit Streaming
  • Überführung in InferenceService und LLMInferenceService mit persistentem Modellcache
  • Konfiguration von LLMInferenceServiceConfig, Gateway, Rate Limit und Autoscaling
  • Vergleich von Standardrouting und cache-bewusstem Routing
  • Lasttest mit Canary-Wechsel und systematischer Fehleranalyse

Methodik

Ein durchgängiges Labor verbindet Modellruntime, KServe, Gateway und Observability. Konfigurationsänderungen werden unter reproduzierbarer Last bewertet.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: AI-, ML- und Platform Engineering, Kubernetes- und GPU-Administration, MLOps, LLMOps und SRE
Voraussetzungen: Kubernetes-Grundkenntnisse; Grundverständnis von Sprachmodellen und HTTP-APIs; Linux- und YAML-Kenntnisse
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Stream live 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream gespeichert 3 Tage
Innsbruck 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.at All rights reserved.  | Kontakt | Impressum | Nach oben