Seminar Beschleuniger und GPU-Orchestrierung mit Kubernetes

Beschleuniger sind die teuerste und betrieblich anspruchsvollste Ressource vieler AI-Plattformen. Leistung, Verfügbarkeit und Auslastung hängen nicht nur vom Modell, sondern auch von Treibern, NUMA-Topologie, Speicherpfaden, Scheduling und sauberer Mandantentrennung ab.

Das Seminar baut eine herstellerneutrale Betriebslogik auf und berücksichtigt klassische Device Plugins, die stabile Dynamic Resource Allocation sowie Kueue für Warteschlangen und faire Ressourcenzuteilung. Übungen reichen von der Knotenerkennung bis zu Multi-GPU-Workloads und belastbaren Kapazitätsregeln.

Einordnung und Nutzen

Drei Tage sind notwendig, weil Hardwareintegration, Scheduling, Performance und Störungsanalyse jeweils praktische Laborzeit erfordern. Eine kürzere Dauer würde zentrale Betriebsrisiken lediglich theoretisch behandeln.

Zielgruppe

  • Kubernetes- und Linux-Administration
  • AI-Plattformbetrieb und Rechenzentrumsplanung
  • MLOps, SRE und Performance Engineering

Voraussetzungen

  • Sichere Kubernetes-Grundkenntnisse
  • Linux-Kenntnisse zu Prozessen, Treibern und Geräten
  • Grundverständnis von AI-Inferenz oder Training

Lernziele

  • Beschleunigerknoten reproduzierbar in Kubernetes integrieren
  • Geräte sicher an Workloads zuweisen und teilen
  • Topologie- und leistungsbewusstes Scheduling umsetzen
  • Auslastung, Fehler und Engpässe systematisch analysieren

Seminarinhalte

Hardware- und Systemarchitektur

  • GPU, NPU und weitere Beschleuniger im Plattformkontext
  • PCIe, NUMA, CPU-Pinning, Arbeitsspeicher und Hochgeschwindigkeitsnetze
  • Treiber, Firmware, Kernelmodule und Container-Runtime

Geräteerkennung und Integration

  • Node Feature Discovery und Knoteninventar
  • Device Plugins, RuntimeClass und Ressourcennamen
  • Gesundheitsstatus, Wartungszustand und standardisierte Labels

Dynamic Resource Allocation

  • DeviceClass, ResourceClaim und ResourceClaimTemplate
  • Geräteattribute, Auswahlregeln und administrative Zuweisung
  • Koexistenz und Migration zwischen Plugin- und DRA-Modellen

Scheduling und Mandantenfähigkeit

  • Kueue mit LocalQueue, ClusterQueue, ResourceFlavor und Cohorts
  • Faire Quoten, Prioritäten, Preemption und all-or-nothing admission
  • Topology-Aware Scheduling, Partitionierung, zeitliches Teilen und sichere Exklusivität

Performance und Kapazität

  • Modellspeicher, KV-Cache, Batchgrößen und Parallelisierung
  • Datenlokalität und Engpässe zwischen Speicher, Netzwerk und Gerät
  • Messung von Durchsatz, Latenz, Speicherverbrauch und Auslastung

Betrieb und Fehleranalyse

  • Gerätemetriken, Temperatur, Fehlerzähler und Drosselung
  • Draining, Wartung und kontrollierte Wiederaufnahme
  • Fehlerbilder bei Treibern, Runtime, Scheduling und Workload

Praktische Übungen

  • Inventarisierung und Labeling eines Beschleunigerknotens
  • Bereitstellung von Workloads mit Device Plugin und ResourceClaim
  • Einrichtung von Kueue mit fairen Quoten, Prioritäten und Topologieregeln
  • Lasttest mit Messung von Auslastung, Latenz und Speicherengpässen

Methodik

Geführte Konfigurationen werden durch Mess- und Fehlerszenarien ergänzt. Der Schwerpunkt liegt auf reproduzierbaren Betriebsverfahren statt auf einzelnen Hardwareprodukten.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Kubernetes- und Linux-Administration, AI-Plattformbetrieb und Rechenzentrumsplanung, MLOps, SRE und Performance Engineering
Voraussetzungen: Sichere Kubernetes-Grundkenntnisse; Linux-Kenntnisse zu Prozessen, Treibern und Geräten; Grundverständnis von AI-Inferenz oder Training
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Sankt Gallen 3 Tage
Basel 3 Tage
Winterthur 3 Tage
Zürich 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Luzern 3 Tage
Bern 3 Tage
Inhaus / Firmenseminar 3 Tage
Inhaus / Firmenseminar 3 Tage
Sankt Gallen 3 Tage
Basel 3 Tage
Winterthur 3 Tage
Zürich 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Luzern 3 Tage
Bern 3 Tage
Luzern 3 Tage
Bern 3 Tage
Inhaus / Firmenseminar 3 Tage
Sankt Gallen 3 Tage
Basel 3 Tage
Winterthur 3 Tage
Zürich 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Stream gespeichert 3 Tage
Bern 3 Tage
Luzern 3 Tage
Inhaus / Firmenseminar 3 Tage
Sankt Gallen 3 Tage
Basel 3 Tage
Winterthur 3 Tage
Zürich 3 Tage
Stream live 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Luzern 3 Tage
Bern 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.ch All rights reserved.  | Kontakt | Impressum | Nach oben