Ein lokal gestarteter Modellserver ist noch kein produktiver AI-Dienst. Für interne Anwendungen werden stabile APIs, reproduzierbare Modellstände, kontrollierter Ressourcenverbrauch, horizontale und verteilte Skalierung, sichere Zugriffe und beobachtbare Rollouts benötigt.
Das Seminar kombiniert vLLM als leistungsfähige Inferenzruntime mit KServe als Kubernetes-nativer Steuerungsebene. Der vollständige Pfad vom Modellartefakt bis zum lastgetesteten, versionierten Endpunkt wird praktisch aufgebaut.
Einordnung und Nutzen
Drei Tage sind erforderlich, da Modellruntime, Kubernetes-Steuerung, Gateway, Skalierung und Performance gemeinsam eingerichtet und unter Last geprüft werden. Ein reiner Quickstart würde die betriebskritischen Teile auslassen.
Zielgruppe
- AI-, ML- und Platform Engineering
- Kubernetes- und GPU-Administration
- MLOps, LLMOps und SRE
Voraussetzungen
- Kubernetes-Grundkenntnisse
- Grundverständnis von Sprachmodellen und HTTP-APIs
- Linux- und YAML-Kenntnisse
Lernziele
- Modelle reproduzierbar mit vLLM bereitstellen
- KServe-Ressourcen für generative Inferenz konfigurieren
- Gateway, Skalierung und Rollouts produktionsgerecht umsetzen
- Leistung und Fehler anhand geeigneter Messwerte analysieren
Seminarinhalte
Modell- und Runtime-Grundlagen
- Modellartefakte, Tokenizer, Präzision und Speicherbedarf
- vLLM-Prozess, OpenAI-kompatible Endpunkte und Streaming
- CPU-, Einzel-GPU- und Multi-GPU-Betriebsformen
KServe-Architektur
- Control Plane, Data Plane und Serving-Runtimes
- InferenceService für klassische und einfache generative Workloads
- LLMInferenceService und LLMInferenceServiceConfig auf Basis von llm-d für skalierbare LLM-Orchestrierung
Speicher, Cache und Startverhalten
- Modellspeicher, Persistent Volumes und lokaler Cache
- KV-Cache, Prefix-Cache, Offloading und cache-bewusstes Routing
- Warmstart, Modellladezeit, disaggregated prefill/decode als Architekturvariante und Kapazitätsreserve
Netzwerk und AI-Gateway
- Interne Services, Gateway API und TLS
- Authentisierung, Token- und Anfrageratenbegrenzung
- Routing, Zeitüberschreitungen und kontrollierte Fehlerantworten
Skalierung und Rollout
- Metrikbasiertes Autoscaling und Grenzen von Scale-to-zero
- Multi-Node- und Multi-GPU-Inferenz
- Canary, Versionierung, Health Checks und Rollback
Leistung und Betrieb
- Durchsatz, Time-to-first-token, Inter-token latency und Fehlerquote
- Continuous Batching, Parallelisierung und Speicherengpässe
- Lasttests, Metriken, Logs, Traces und Kapazitätsentscheidungen
Praktische Übungen
- Bereitstellung eines vLLM-Endpunkts mit Streaming
- Überführung in InferenceService und LLMInferenceService mit persistentem Modellcache
- Konfiguration von LLMInferenceServiceConfig, Gateway, Rate Limit und Autoscaling
- Vergleich von Standardrouting und cache-bewusstem Routing
- Lasttest mit Canary-Wechsel und systematischer Fehleranalyse
Methodik
Ein durchgängiges Labor verbindet Modellruntime, KServe, Gateway und Observability. Konfigurationsänderungen werden unter reproduzierbarer Last bewertet.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | AI-, ML- und Platform Engineering, Kubernetes- und GPU-Administration, MLOps, LLMOps und SRE |
| Voraussetzungen: | Kubernetes-Grundkenntnisse; Grundverständnis von Sprachmodellen und HTTP-APIs; Linux- und YAML-Kenntnisse |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
