Kubernetes kann AI-Workloads vereinheitlichen, löst die besonderen Probleme knapper Beschleuniger aber nicht automatisch. Geräte müssen erkannt und sicher angeboten, Workloads topologienah platziert, Warteschlangen fair gesteuert und große Modellartefakte effizient bereitgestellt werden. Fehlende Regeln führen schnell zu blockierten Ressourcen, schlechter Auslastung oder unzureichender Mandantentrennung.
Das Seminar richtet eine Kubernetes-Plattform gezielt für AI- und GPU-Workloads ein. Der stabile DRA-Kern und klassische Device Plugins werden ebenso behandelt wie herstellerspezifische DRA-Treiber und optionale Sharing-Funktionen mit abweichendem Reifegrad. Alle Konfigurationen werden aus Sicht des Clusterbetriebs geprüft, überwacht und in Wartungs- und Störungsszenarien angewendet.
Zielgruppe
Kubernetes- und Linux-Administratoren, Plattformingenieure, DevOps- und MLOps-Teams sowie Betreiber von privaten AI- oder Data-Science-Plattformen.
Voraussetzungen
Praktische Linux- und Containerkenntnisse sowie Kubernetes-Grundlagen zu Pods, Deployments, Services, Namespaces und kubectl. Grundkenntnisse zu GPU-Servern werden empfohlen.
Seminarinhalte
Plattformarchitektur und Knotenrollen
- Control Plane, CPU-Worker, GPU-Pools, Managementdienste, Registries und Modellablagen strukturieren
- Bare-Metal- und virtualisierte Worker sowie Passthrough-Modelle betrieblich vergleichen
- Containerlaufzeit, CNI, CSI, Gateway API und DNS auf AI-Anforderungen abstimmen
- Knotenpools nach Hardware, Fehlerdomäne, Sicherheitszone und Wartungsmodell trennen
Beschleuniger integrieren
- Treiber, Containerlaufzeit, Node Feature Discovery und Geräteoperatoren zusammenführen
- Device Plugins, Extended Resources, Container Device Interface und DRA-Treiber einordnen
- Dynamic Resource Allocation mit DeviceClass, ResourceClaim und ResourceClaimTemplate anwenden
- DRA-Adminzugriff, priorisierte Geräteauswahl und schedulerverwaltete Sharing-Kapazität bewerten
Scheduling und Topologie
- Requests, Limits, Labels, Node Selector, Affinität, Taints und Tolerations korrekt einsetzen
- NUMA, Topology Manager, CPU Manager und Geräte-Nähe für leistungsfähige Platzierung berücksichtigen
- JobSet, LeaderWorkerSet, mehrere GPUs und gemeinsam startende Mehrknoten-Workloads koordinieren
- Fehlplatzierung, Pending Pods und nicht erfüllbare Ressourcenansprüche systematisch analysieren
Warteschlangen und faire Nutzung
- Namespaces, ResourceQuotas, LimitRanges und Prioritätsklassen für Teams definieren
- Lokale und clusterweite Warteschlangen, Kohorten, Kontingente und Borrowing modellieren
- Kueue Admission, Preemption, Fair Sharing und Reservierung für knappe Beschleuniger steuern
- Topology-Aware Scheduling und MultiKueue nach Reifegrad und Infrastrukturbedarf bewerten
Partitionierung und Sharing
- Vollständige Geräte, Hardwarepartitionen, DRA-Sharing, Time-Slicing und Prozessdienste anbieten
- Ressourcennamen, Labels und Node Pools für unterschiedliche Freigabemodelle gestalten
- Leistungsisolation, Speicherisolation, Fehlerdomäne und Abrechnung transparent dokumentieren
- Änderung eines Partitionierungsprofils mit Drain, Wartung und Validierung durchführen
Storage und Modellverteilung
- Persistent Volumes, StorageClasses, Zugriffsmodi, Snapshots und lokale Volumes für AI auswählen
- Objektspeicher, Modell-Repository, Init-Container und lokale Caches kombinieren
- Große Modelle parallel laden, Cache-Stürme vermeiden und Datenlokalität nutzen
- Kapazitätsgrenzen, I/O-Metriken und Fehler bei Mount, Berechtigung und Datenkonsistenz analysieren
Netzwerk, Sicherheit und Mandanten
- Management-, Service-, Storage- und Hochleistungsverkehr trennen
- NetworkPolicies, Egress-Regeln, interne Registries und private Modellablagen absichern
- ServiceAccounts, RBAC, Workload-Identitäten und Geheimnisse für Plattformdienste einsetzen
- Privilegierte Operatoren, Hostzugriffe und Gerätedateien auf notwendige Rechte begrenzen
Betrieb und Wartung
- Cluster-, Knoten-, Operator-, GPU- und Workloadzustände gemeinsam überwachen
- Treiber-, Kubernetes- und Operatorversionen mit einer Kompatibilitätsmatrix pflegen
- Drain, Pod Disruption Budgets, Knotenrotation und gestaffelte Updates für GPU-Pools durchführen
- Runbooks für Pending Pods, Geräteverlust, Node NotReady und fehlerhafte Operatoren erstellen
Praktische Übungen
- Einen GPU-Worker inventarisieren, kennzeichnen und kontrolliert in den Cluster aufnehmen
- Eine Beschleuniger-Workload mit Device Plugin und DRA-Claim bereitstellen und vergleichen
- DRA-Adminzugriff, Topologie, Affinität und Taints für eine gezielte Platzierung konfigurieren
- Kueue-Quoten, Fair Sharing und topologiebewusste Platzierung für zwei Teams testen
- Ein Modell über zentrale Ablage und Knotencache bereitstellen und Ladezeiten vergleichen
- Eine mandantenfähige Namespace-Konfiguration mit RBAC und Netzwerkpolicy erstellen
- Einen GPU-Knoten warten, Workloads verlagern und den Zustand nach der Rückkehr validieren
Methodik
Die Übungen erfolgen an einem vorbereiteten Kubernetes-Cluster mit CPU- und Beschleunigerknoten. Deklarative Konfigurationen werden angewendet, beobachtet, gezielt gestört und korrigiert. Besonderes Gewicht liegt auf Scheduling, Mehrmandantenbetrieb und wiederholbaren Wartungsverfahren.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 4 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 2.396 zzgl. MwSt. Inhaus: € 6.800 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Kubernetes-, Linux- und Plattformadministratoren |
| Voraussetzungen: | Linux, Container und Kubernetes-Grundlagen |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
