Dieses Intensivseminar bündelt die Entwicklungslinie in einem überschaubaren Anpassungsvorhaben. Ausgehend von einer konkreten Fachaufgabe werden ein geeigneter Modellstand und ein kleiner mehrsprachiger Datensatz ausgewählt. Darauf folgen kontrollierte Datenverarbeitung, eine Baseline, ein begrenzter Anpassungsversuch und eine unabhängige Bewertung.
Zusammengeführt werden die Inhalte der Einzelseminare Datenaufbereitung, Fine-Tuning und Evaluation. Projektgrundlagen sowie die relevanten Sicherheits- und Governance-Fragen werden integriert. Ein gemeinsamer Übungsbestand ersetzt voneinander getrennte Übungsreihen und ermöglicht die Bearbeitung der gesamten Kette innerhalb von fünf Tagen.
OpenEuroLLM-Datenkatalog, Post-Training-Ansätze und Evaluationswerkzeuge dienen der fachlichen Einordnung. Der praktische Anpassungslauf erfolgt auf einer vorab getesteten, für das Labor geeigneten Modellvariante. Umfangreiche Vortrainingsläufe und vollständige HPC-Evaluationen werden methodisch eingeordnet. Im Seminar werden kleine, zeitlich begrenzte Experimente tatsächlich ausgeführt.
Die Intensivfassung deckt die Fachgebiete mit gezielter Auswahl ab. Ausführliche Variantenvergleiche und die vollständige Breite der Einzelübungen verbleiben in den Fachseminaren. Zusammen mit dem Intensivseminar zu Anwendungen, Inferenz und Betrieb entsteht eine vollständige thematische Abdeckung des Einzelprogramms.
Lernziele
- Ein begrenztes Anpassungsexperiment von der Datenauswahl bis zum Vergleichstest durchführen.
- Datenherkunft, Sprachverteilung und unabhängige Prüfbestände nachvollziehbar behandeln.
- Ein parameterarmes Training auf einer geeigneten Modellvariante ausführen und untersuchen.
- Eine begründete Entscheidung über den veränderten Modellstand und weitere Prüfungen dokumentieren.
Inhaltsverzeichnis
- Projektartefakte und Versuchsfrage
- Datenqualität und Sprachmischung
- Baseline und Bewertungsmaßstab
- Kontrollierte Anpassung
- Evaluation und Fehlerschwerpunkte
- Export und dokumentierte Entscheidung
Seminarinhalte
Projektartefakte und Versuchsfrage
- Modell- und Datenveröffentlichungen nach ihrem Zweck einordnen und den Laborstand festlegen.
- Eine konkrete Fachaufgabe mit begrenztem Sprachumfang und messbaren Anforderungen formulieren.
- Ressourcenbudget, Abbruchbedingungen und unveränderliche Vergleichsbedingungen bestimmen.
Datenqualität und Sprachmischung
- Herkunft und Bedingungen erfassen sowie ungeeignete Bestände ausschließen.
- Texte bereinigen, Dubletten untersuchen und Daten anhand von Dokumentgruppen aufteilen.
- Tokenlängen und Sprachanteile messen und eine dokumentierte Mischung für den Versuch erzeugen.
Baseline und Bewertungsmaßstab
- Einen unabhängigen Prüfkatalog mit gleichen Aufgaben vor und nach der Anpassung anlegen.
- Korrektheit, Ausgabeformat und unerwünschte Veränderungen außerhalb der Zieldomäne berücksichtigen.
- Die Ausgangsleistung erfassen und kritische Fehlertypen vor dem Training festhalten.
Kontrollierte Anpassung
- Chatformat oder Texteingabe passend zum gewählten Modell prüfen und trainierte Tokenbereiche kontrollieren.
- Einen geeigneten LoRA-Versuch mit festgelegten Zielmodulen und begrenztem Rechenbudget konfigurieren.
- Einen Probelauf und einen kurzen Trainingslauf durchführen; Überanpassung und Speichergrenzen untersuchen.
Evaluation und Fehlerschwerpunkte
- Den angepassten Stand unter gleichen Bedingungen mit der Baseline vergleichen.
- Abweichungen pro Sprache und Aufgabenart aufschlüsseln und Bewertungskonflikte klären.
- Lokale Evaluationsläufe von der HPC-Orchestrierung mit oellm-eval unterscheiden.
Export und dokumentierte Entscheidung
- Adapter, Basismodellrevision, Tokenizer und Konfiguration gemeinsam dokumentieren.
- Den veränderten Stand in einer frischen Sitzung laden und die Prüffälle wiederholen.
- Datenfreigaben, bekannte Grenzen und weitere Maßnahmen in einem technischen Entscheidungsprotokoll bündeln.
Praktische Übungen
- Die Fachaufgabe festlegen, Artefakte prüfen und einen unveränderten Baseline-Lauf speichern.
- Den Übungsbestand bereinigen, gruppenweise aufteilen und Sprachanteile auf Tokenbasis dokumentieren.
- Trainingseingaben prüfen und einen kurzen parameterarmen Anpassungsversuch ausführen.
- Unabhängige Aufgaben erneut bewerten und den Erfolg je Sprache und Fehlerklasse betrachten.
- Adapter und Konfiguration exportieren, neu laden und einen reproduzierbaren Kontrolllauf durchführen.
- Den Modellstand anhand der vorab festgelegten Kriterien bewerten und weitere Schritte begründen.
Schulungsumgebung
Der Kunde stellt vorbereitete GPU-Arbeitsumgebungen, einen geeigneten kleinen Modellstand und freigegebene Übungsdaten bereit. Referenzartefakte für länger laufende Versuche liegen zusätzlich vor. Ein EuroHPC-Zugang wird nicht vorausgesetzt; die praktischen Arbeiten werden auf das bereitgestellte Labor begrenzt.
Fachliche Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 5 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
|---|---|
| Preis: |
Öffentlich oder Live Stream: € 2.995 zzgl. MwSt. Inhaus: € 8.500 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Scientists, Machine-Learning-Engineers, Data Engineers mit Modellpraxis und fortgeschrittene NLP-Entwickler. |
| Voraussetzungen: | Sichere Python-Kenntnisse, praktische Erfahrung mit Datenaufbereitung und Modellinferenz sowie Grundkenntnisse in PyTorch. Die benötigte Trainingsumgebung muss vorbereitet sein. Der Besuch sämtlicher Einzelkurse ist nicht erforderlich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Schulungsumgebung: | Wird vom Kunden gestellt und vorab technisch abgestimmt |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
