Seminar Instruction Tuning und Preference Optimization für Small Language Models

Ein domänenspezifisches Modell muss nicht nur Fachbegriffe kennen, sondern Anweisungen zuverlässig befolgen, erlaubte Werkzeuge korrekt auswählen, Ausgabeformate einhalten und bei ungeeigneten Anfragen kontrolliert reagieren. Instruction Tuning und Präferenzoptimierung richten dieses Verhalten gezielt aus.

Kleine Modelle reagieren empfindlich auf einseitige oder widersprüchliche Beispiele. Das Seminar legt deshalb besonderen Wert auf Datendesign, Aufgabenabdeckung, Negativbeispiele, Kalibrierung und den Erhalt vorhandener Fähigkeiten.

Lernziele

Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.

  • Eine Taxonomie domänenspezifischer Instruktionen und gewünschter Verhaltensweisen erstellen
  • SFT-Daten für Dialog, strukturierte Ausgabe und Tool Calling konsistent formatieren
  • Präferenzpaare erfassen, synthetisch erweitern, filtern und fachlich prüfen
  • DPO und verwandte direkte Präferenzverfahren passend konfigurieren und auswerten
  • Instruction Following, Präferenztreue, Sicherheit und unerwünschtes Vergessen gemeinsam evaluieren

Seminarinhalte

Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.

Instruction-Design

  • Aufgabenfamilien, Systemregeln, Rollen, Dialogzustand und gewünschte Antwortstile
  • Positive, negative, mehrdeutige und nicht lösbare Beispiele
  • Strukturierte Ausgaben, JSON-Schemata, Funktionssignaturen und Werkzeugentscheidungen
  • Abdeckungsmatrix für Fachdomäne, Sprache, Schwierigkeitsgrad und Sicherheitsregeln

Supervised Fine-Tuning

  • Chat-Templates, Completion-Maskierung, Sequenzgrenzen und Packing
  • Curriculum, Datenmischung, Beispielgewichtung und Balancing
  • LoRA- oder QLoRA-basiertes SFT und Kontrolle der trainierbaren Module
  • SFT-Baseline als Voraussetzung für belastbare Präferenzoptimierung

Präferenzdaten

  • Gewählte und verworfene Antworten, Paarqualität und Stärke der Präferenz
  • Menschliche Bewertung, Reviewleitfäden und Übereinstimmung zwischen Bewertern
  • Rejection Sampling und synthetische Kandidaten mit fachlicher Kontrolle
  • Vermeidung von Längen-, Stil-, Positions- und Judge-Bias in den Daten

Direkte Präferenzoptimierung

  • Grundidee von DPO, Referenzmodell, Beta und Verhältnis zum SFT-Modell
  • Datenformat, Tokenisierung, Speicherplanung und PEFT-Integration
  • Referenzfreie und kontrastive Präferenzverfahren als Alternativen mit abweichenden Stabilitätsanforderungen
  • Trainingsdiagnose, übermäßige Präferenzanpassung und Verlust allgemeiner Fähigkeiten
  • Wann Reward Modeling oder on-policy Verfahren bei objektiv verifizierbaren Aufgaben zusätzlichen Aufwand rechtfertigen
  • Warum Wissens- und Verhaltensdistillation bei kleinen Modellen häufig wirtschaftlicher als Reinforcement Learning ist

Evaluation und Freigabe

  • Instruction-Following-Tests, Formatvalidierung und Tool-Calling-Korrektheit
  • Paarweiser Modellvergleich mit verblindeter Reihenfolge
  • Sicherheits-, Ablehnungs- und Overrefusal-Tests
  • Regression gegen Basisfähigkeiten und domänenspezifische Goldensets

Praktische Übungen

Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.

  • Instruction-Taxonomie und Abdeckungsmatrix für einen Fachfall erstellen
  • SFT-Datensatz einschließlich strukturierten Ausgaben und Tool Calls validieren
  • Präferenzpaare erzeugen, prüfen und auf typische Verzerrungen untersuchen
  • Einen DPO-Lauf mit Adaptertraining konfigurieren
  • SFT- und präferenzoptimierte Variante verblindet vergleichen und regressionsprüfen

Zielgruppe

Gedacht für technische Teams, die das Verhalten eines bereits ausgewählten Basismodells systematisch anpassen. Das Seminar baut auf Fine-Tuning-Grundlagen auf und ersetzt kein Einführungsseminar zur Modellarchitektur.

Methodik

Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage: 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: ML Engineers, Data Scientists, KI-Entwickler und Teams für fachliche Modellanpassung
Voraussetzungen: Gute Python- und Transformer-Grundkenntnisse; praktische Erfahrung mit Supervised Fine-Tuning oder LoRA wird empfohlen
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Sankt Gallen 3 Tage
Basel 3 Tage
Winterthur 3 Tage
Zürich 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Luzern 3 Tage
Bern 3 Tage
Inhaus / Firmenseminar 3 Tage
Inhaus / Firmenseminar 3 Tage
Sankt Gallen 3 Tage
Basel 3 Tage
Winterthur 3 Tage
Zürich 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Luzern 3 Tage
Bern 3 Tage
Luzern 3 Tage
Bern 3 Tage
Inhaus / Firmenseminar 3 Tage
Sankt Gallen 3 Tage
Basel 3 Tage
Winterthur 3 Tage
Zürich 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Stream gespeichert 3 Tage
Luzern 3 Tage
Bern 3 Tage
Inhaus / Firmenseminar 3 Tage
Sankt Gallen 3 Tage
Basel 3 Tage
Winterthur 3 Tage
Zürich 3 Tage
Stream live 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Luzern 3 Tage
Bern 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.ch All rights reserved.  | Kontakt | Impressum | Nach oben