Zielsetzung
Dieses Seminar fokussiert die produktionsfähige Bereitstellung generativer Modelle mit KServe. Behandelt werden Architekturentscheidungen für LLM-Serving, das Zusammenspiel von Modellruntimes und GPU-Infrastruktur sowie die Optimierung von Antwortzeiten, Durchsatz und Betriebskosten.
Zielgruppe
Das Format richtet sich an Teams, die GenAI-Workloads in Kubernetes betreiben oder planen und dafür eine offene, standardisierte und erweiterbare Serving-Plattform aufbauen möchten.
Voraussetzungen
Vorausgesetzt werden sichere Kubernetes-Kenntnisse, Erfahrung mit KServe oder vergleichbaren Serving-Plattformen sowie Grundwissen zu GPU-Ressourcen, Sizing und Modellartefakten.
Inhalte
- Unterschiede zwischen Predictive- und Generative-Serving aus Betriebs- und Architekturperspektive
- Geeignete KServe-Betriebsmodelle für LLM-Workloads und deren Grenzen
- Hugging-Face- und vLLM-basierte Serving-Runtimes in KServe
- OpenAI-kompatible Endpunkte, Streaming-Antworten und Integrationsmuster für Anwendungen
- GPU-Planung, Node-Zuweisung, Scheduling, Ressourcenprofile und Kapazitätsreserven
- Local Model Cache, Modellbereitstellung über Registry- oder Storage-Pfade und Startzeitoptimierung
- KV-Cache-Offloading, Multi-GPU- und Multi-Node-Szenarien sowie Engpassanalyse
- Durchsatz-, Latenz- und Kostenoptimierung für produktionsnahe GenAI-Lastprofile
- Stabiler Betrieb bei langen Requests, Burst-Lasten und ressourcenintensiven Modellen
Praxisanteil
Im Laborteil wird ein LLM mit KServe bereitgestellt, über standardisierte Endpunkte angesprochen und hinsichtlich Ressourcenprofil, Skalierungsverhalten und Startzeiten systematisch optimiert.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 4 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 2.396 zzgl. MwSt. Inhaus: € 6.800 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | GenAI-Plattformteams, MLOps-Engineers, GPU-Betriebsteams, AI-Architekten |
| Voraussetzungen: | Kubernetes- und KServe-Grundlagen, Erfahrung mit Container-Ressourcen; GPU- oder CUDA-Praxis ist hilfreich |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
