Das Seminar vermittelt den Aufbau eines eigenen Inferenzdienstes für ein ausgewähltes offenes Mistral-Modell. Die Übungen berücksichtigen die vollständige Bereitstellungskette: abgestimmte Hardware, Modellartefakte, passende Inferenzsoftware, Netzwerkzugang, Überwachung und Wiederherstellung. Die tatsächlich verfügbare GPU-Ausstattung bestimmt das verwendete Modell und dessen Konfiguration.
Der eigene Modelldienst wird klar von den vollständigen gehosteten Mistral-Produkten unterschieden. Ein kompatibler Chat-Endpunkt stellt nicht automatisch sämtliche Funktionen von Studio, Vibe, OCR oder verwalteten Agentendiensten bereit. Deshalb werden die vom Labor unterstützten Funktionen explizit geprüft und in einer betrieblichen Leistungsbeschreibung festgehalten.
Inhaltsübersicht
- Kapazität und Modellartefakte
- GPU- und Containerumgebung
- Inferenz mit vLLM
- Zugang und Integration
- Last und Skalierung
- Updates und Wiederherstellung
Seminarinhalte
Kapazität und Modellartefakte
- Gesamte Modellgewichte, Datentyp, Kontextlänge, KV-Cache und Parallelität bei der Speicherplanung berücksichtigen.
- Lizenzbedingungen und Kompatibilität des konkreten Modells mit der ausgewählten vLLM-Version prüfen.
- Gewichte, Tokenizer, Konfiguration und Prüfsummen in einer lokalen Ablage versionieren.
GPU- und Containerumgebung
- GPU-Zugriff, Treiber, Containerlaufzeit und benötigte Berechtigungen kontrollieren.
- Ein vorbereitetes Container-Image mit festgelegter Version verwenden und Modellvolumes einbinden.
- Dateirechte, Speicherpfade und Laufzeitkonfiguration nachvollziehbar trennen.
Inferenz mit vLLM
- Den Dienst mit einem zur Hardware passenden Modell und kontrollierter Kontextlänge starten.
- Tokenizer, Chat-Template und modellabhängige Optionen mit einem Funktionstest überprüfen.
- Textgenerierung und vorhandene Zusatzfähigkeiten über einen geeigneten API-Client testen.
Zugang und Integration
- Inferenzdienst durch Netzwerkgrenzen, TLS-Terminierung und Authentifizierung schützen.
- Quoten, Anfragegrößen und Zeitlimits am vorgesehenen Zugangspunkt begrenzen.
- Ein Frontend oder eine Testanwendung anbinden und Fehlercodes nachvollziehbar behandeln.
Last und Skalierung
- Antwortzeit, Durchsatz, GPU-Auslastung und Speichernutzung unter kontrollierter Last messen.
- Parallelität, Kontextlänge und verfügbare Optimierungen anhand der Messdaten abstimmen.
- Skalierung, Redundanz und Mehr-GPU-Verteilung anhand der vorhandenen Infrastruktur einordnen.
Updates und Wiederherstellung
- Konfigurationen und benötigte Modellartefakte für eine Neuinstallation sichern.
- Einen Modell- oder Containerwechsel mit Funktionstest und Rücknahme durchführen.
- Den Dienst nach einem simulierten Ausfall auf der vorbereiteten Umgebung wiederherstellen.
Praktische Übungen
- Die bereitgestellte Hardware prüfen und ein Modell mit begründeter Speicher- und Kontextplanung auswählen.
- Modellartefakte und ein abgestimmtes Container-Image bereitstellen und vLLM starten.
- Einen geschützten Zugriff konfigurieren und aus einer Testanwendung heraus verifizieren.
- Last schrittweise erhöhen, Speicherengpässe erkennen und die Konfiguration begründet anpassen.
- Eine neue Dienstversion einführen, einen Fehlerfall auslösen und zur funktionierenden Konfiguration zurückkehren.
Schulungsumgebung
Der Kunde stellt die Schulungsumgebung einschließlich der benötigten Zugänge, Nutzungsrechte und vereinbarten Ressourcen bereit. Erforderlich sind vorbereitete Linux-GPU-Systeme mit administrativem Zugriff, ein Container-Registry-Zugang oder lokale Images sowie vorab verfügbare Modellgewichte. Die GPU-Dimensionierung wird anhand des vereinbarten Modells festgelegt. Ein mehrknotiges Hochverfügbarkeitscluster wird nur praktisch verwendet, wenn es bereits bereitsteht; sonst erfolgt die Skalierungsplanung als Architekturübung.
Passende Vertiefungen
Die Auswahl richtet sich nach den jeweiligen Voraussetzungen der Folgeseminare.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 4 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
|---|---|
| Preis: |
Öffentlich oder Live Stream: € 2.396 zzgl. MwSt. Inhaus: € 6.800 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Linux-Administratoren, Platform-Engineers, DevOps-Engineers und Infrastrukturarchitekten |
| Voraussetzungen: | Sichere Linux-, Netzwerk- und Containerkenntnisse sowie Grundverständnis von HTTP, TLS und GPU-Ressourcen; Mistral-Grundlagen oder vergleichbares Wissen. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
