Ein domänenspezifisches Modell muss nicht nur Fachbegriffe kennen, sondern Anweisungen zuverlässig befolgen, erlaubte Werkzeuge korrekt auswählen, Ausgabeformate einhalten und bei ungeeigneten Anfragen kontrolliert reagieren. Instruction Tuning und Präferenzoptimierung richten dieses Verhalten gezielt aus.
Kleine Modelle reagieren empfindlich auf einseitige oder widersprüchliche Beispiele. Das Seminar legt deshalb besonderen Wert auf Datendesign, Aufgabenabdeckung, Negativbeispiele, Kalibrierung und den Erhalt vorhandener Fähigkeiten.
Lernziele
Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.
- Eine Taxonomie domänenspezifischer Instruktionen und gewünschter Verhaltensweisen erstellen
- SFT-Daten für Dialog, strukturierte Ausgabe und Tool Calling konsistent formatieren
- Präferenzpaare erfassen, synthetisch erweitern, filtern und fachlich prüfen
- DPO und verwandte direkte Präferenzverfahren passend konfigurieren und auswerten
- Instruction Following, Präferenztreue, Sicherheit und unerwünschtes Vergessen gemeinsam evaluieren
Seminarinhalte
Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.
Instruction-Design
- Aufgabenfamilien, Systemregeln, Rollen, Dialogzustand und gewünschte Antwortstile
- Positive, negative, mehrdeutige und nicht lösbare Beispiele
- Strukturierte Ausgaben, JSON-Schemata, Funktionssignaturen und Werkzeugentscheidungen
- Abdeckungsmatrix für Fachdomäne, Sprache, Schwierigkeitsgrad und Sicherheitsregeln
Supervised Fine-Tuning
- Chat-Templates, Completion-Maskierung, Sequenzgrenzen und Packing
- Curriculum, Datenmischung, Beispielgewichtung und Balancing
- LoRA- oder QLoRA-basiertes SFT und Kontrolle der trainierbaren Module
- SFT-Baseline als Voraussetzung für belastbare Präferenzoptimierung
Präferenzdaten
- Gewählte und verworfene Antworten, Paarqualität und Stärke der Präferenz
- Menschliche Bewertung, Reviewleitfäden und Übereinstimmung zwischen Bewertern
- Rejection Sampling und synthetische Kandidaten mit fachlicher Kontrolle
- Vermeidung von Längen-, Stil-, Positions- und Judge-Bias in den Daten
Direkte Präferenzoptimierung
- Grundidee von DPO, Referenzmodell, Beta und Verhältnis zum SFT-Modell
- Datenformat, Tokenisierung, Speicherplanung und PEFT-Integration
- Referenzfreie und kontrastive Präferenzverfahren als Alternativen mit abweichenden Stabilitätsanforderungen
- Trainingsdiagnose, übermäßige Präferenzanpassung und Verlust allgemeiner Fähigkeiten
- Wann Reward Modeling oder on-policy Verfahren bei objektiv verifizierbaren Aufgaben zusätzlichen Aufwand rechtfertigen
- Warum Wissens- und Verhaltensdistillation bei kleinen Modellen häufig wirtschaftlicher als Reinforcement Learning ist
Evaluation und Freigabe
- Instruction-Following-Tests, Formatvalidierung und Tool-Calling-Korrektheit
- Paarweiser Modellvergleich mit verblindeter Reihenfolge
- Sicherheits-, Ablehnungs- und Overrefusal-Tests
- Regression gegen Basisfähigkeiten und domänenspezifische Goldensets
Praktische Übungen
Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.
- Instruction-Taxonomie und Abdeckungsmatrix für einen Fachfall erstellen
- SFT-Datensatz einschließlich strukturierten Ausgaben und Tool Calls validieren
- Präferenzpaare erzeugen, prüfen und auf typische Verzerrungen untersuchen
- Einen DPO-Lauf mit Adaptertraining konfigurieren
- SFT- und präferenzoptimierte Variante verblindet vergleichen und regressionsprüfen
Zielgruppe
Gedacht für technische Teams, die das Verhalten eines bereits ausgewählten Basismodells systematisch anpassen. Das Seminar baut auf Fine-Tuning-Grundlagen auf und ersetzt kein Einführungsseminar zur Modellarchitektur.
Methodik
Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | ML Engineers, Data Scientists, KI-Entwickler und Teams für fachliche Modellanpassung |
| Voraussetzungen: | Gute Python- und Transformer-Grundkenntnisse; praktische Erfahrung mit Supervised Fine-Tuning oder LoRA wird empfohlen |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
