Beschleuniger sind die teuerste und betrieblich anspruchsvollste Ressource vieler AI-Plattformen. Leistung, Verfügbarkeit und Auslastung hängen nicht nur vom Modell, sondern auch von Treibern, NUMA-Topologie, Speicherpfaden, Scheduling und sauberer Mandantentrennung ab.
Das Seminar baut eine herstellerneutrale Betriebslogik auf und berücksichtigt klassische Device Plugins, die stabile Dynamic Resource Allocation sowie Kueue für Warteschlangen und faire Ressourcenzuteilung. Übungen reichen von der Knotenerkennung bis zu Multi-GPU-Workloads und belastbaren Kapazitätsregeln.
Einordnung und Nutzen
Drei Tage sind notwendig, weil Hardwareintegration, Scheduling, Performance und Störungsanalyse jeweils praktische Laborzeit erfordern. Eine kürzere Dauer würde zentrale Betriebsrisiken lediglich theoretisch behandeln.
Zielgruppe
- Kubernetes- und Linux-Administration
- AI-Plattformbetrieb und Rechenzentrumsplanung
- MLOps, SRE und Performance Engineering
Voraussetzungen
- Sichere Kubernetes-Grundkenntnisse
- Linux-Kenntnisse zu Prozessen, Treibern und Geräten
- Grundverständnis von AI-Inferenz oder Training
Lernziele
- Beschleunigerknoten reproduzierbar in Kubernetes integrieren
- Geräte sicher an Workloads zuweisen und teilen
- Topologie- und leistungsbewusstes Scheduling umsetzen
- Auslastung, Fehler und Engpässe systematisch analysieren
Seminarinhalte
Hardware- und Systemarchitektur
- GPU, NPU und weitere Beschleuniger im Plattformkontext
- PCIe, NUMA, CPU-Pinning, Arbeitsspeicher und Hochgeschwindigkeitsnetze
- Treiber, Firmware, Kernelmodule und Container-Runtime
Geräteerkennung und Integration
- Node Feature Discovery und Knoteninventar
- Device Plugins, RuntimeClass und Ressourcennamen
- Gesundheitsstatus, Wartungszustand und standardisierte Labels
Dynamic Resource Allocation
- DeviceClass, ResourceClaim und ResourceClaimTemplate
- Geräteattribute, Auswahlregeln und administrative Zuweisung
- Koexistenz und Migration zwischen Plugin- und DRA-Modellen
Scheduling und Mandantenfähigkeit
- Kueue mit LocalQueue, ClusterQueue, ResourceFlavor und Cohorts
- Faire Quoten, Prioritäten, Preemption und all-or-nothing admission
- Topology-Aware Scheduling, Partitionierung, zeitliches Teilen und sichere Exklusivität
Performance und Kapazität
- Modellspeicher, KV-Cache, Batchgrößen und Parallelisierung
- Datenlokalität und Engpässe zwischen Speicher, Netzwerk und Gerät
- Messung von Durchsatz, Latenz, Speicherverbrauch und Auslastung
Betrieb und Fehleranalyse
- Gerätemetriken, Temperatur, Fehlerzähler und Drosselung
- Draining, Wartung und kontrollierte Wiederaufnahme
- Fehlerbilder bei Treibern, Runtime, Scheduling und Workload
Praktische Übungen
- Inventarisierung und Labeling eines Beschleunigerknotens
- Bereitstellung von Workloads mit Device Plugin und ResourceClaim
- Einrichtung von Kueue mit fairen Quoten, Prioritäten und Topologieregeln
- Lasttest mit Messung von Auslastung, Latenz und Speicherengpässen
Methodik
Geführte Konfigurationen werden durch Mess- und Fehlerszenarien ergänzt. Der Schwerpunkt liegt auf reproduzierbaren Betriebsverfahren statt auf einzelnen Hardwareprodukten.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Kubernetes- und Linux-Administration, AI-Plattformbetrieb und Rechenzentrumsplanung, MLOps, SRE und Performance Engineering |
| Voraussetzungen: | Sichere Kubernetes-Grundkenntnisse; Linux-Kenntnisse zu Prozessen, Treibern und Geräten; Grundverständnis von AI-Inferenz oder Training |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
