Seminar Datenaufbereitung und Corpus Engineering für Small Language Models

Bei kleinen Sprachmodellen wirkt sich die Qualität der Domänendaten besonders unmittelbar aus. Unklare Rechte, Dubletten, widersprüchliche Dokumentstände, personenbezogene Informationen oder ungeeignete Trainingsbeispiele werden vom Modell nicht geheilt, sondern häufig verstärkt. Deshalb beginnt verlässliches SLM Engineering mit einem kontrollierten Corpus und nicht mit einem Trainingslauf.

Das Seminar verbindet fachliche Datenanalyse mit einer reproduzierbaren technischen Pipeline. Unstrukturierte Dokumente, Tabellen, Wissensbestände, Dialoge und Prozessdaten werden in geeignete Formate für Continued Pretraining, Supervised Fine-Tuning, Präferenzlernen, RAG und Evaluation überführt.

Lernziele

Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.

  • Datenquellen inventarisieren und nach Zweck, Schutzbedarf, Rechten, Aktualität und Qualität klassifizieren
  • Dokumente extrahieren, normalisieren, deduplizieren, filtern und fachlich segmentieren
  • Trainings-, Validierungs- und Testsätze ohne Datenleckage aufbauen
  • Instruction-, Conversational-, Tool-Calling- und Präferenzdatensätze korrekt strukturieren
  • Datenprovenienz, Versionierung, Qualitätsprüfungen und Freigaben automatisierbar dokumentieren

Seminarinhalte

Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.

Dateninventar und Governance

  • Quellsysteme, Dateiformate, Eigentümerschaft, Nutzungsrechte und Aufbewahrung
  • Schutzbedarfsanalyse, personenbezogene Daten, Geschäftsgeheimnisse und Mandantentrennung
  • Datenspezifikation mit Domänen, Aufgaben, Sprachen, Zeitständen und Ausschlusskriterien
  • Provenienz, Lineage, Versionen und reproduzierbare Datenfreigaben

Bereinigung und Qualitätssteuerung

  • Textextraktion, Zeichensatzbereinigung, Normalisierung, Sprach- und Dokumentklassifikation
  • Exakte und semantische Deduplizierung, Boilerplate-Erkennung und Umgang mit widersprüchlichen Quellen
  • Qualitätsheuristiken, Stichproben, fachliche Reviewverfahren und automatische Prüfregeln
  • Maskierung oder Entfernung sensibler Inhalte sowie kontrollierte Pseudonymisierung

Datensätze für verschiedene Anpassungsverfahren

  • Rohtext und Sequenzbildung für domänenspezifisches Continued Pretraining
  • Prompt-Antwort-Paare, Chat-Templates und strukturierte Zielausgaben für SFT
  • Gewählte und verworfene Antworten für Präferenzoptimierung
  • Dokumente, Metadaten, Chunks und Referenzfragen für RAG und Retrieval-Evaluation
  • Synthetische Daten mit Qualitätsfiltern, Diversitätskontrolle und menschlicher Prüfung

Splits und Reproduzierbarkeit

  • Aufteilung nach Dokument, Kunde, Zeitraum oder Vorgang statt zufälliger Zeilenaufteilung
  • Erkennung von Kontamination und Überschneidungen zwischen Training und Test
  • Dataset-Schemata, Fingerprints, Manifeste und automatisierte Validierung
  • Speichereffiziente Verarbeitung großer Datenbestände und Streaming-Ansätze

Praktische Übungen

Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.

  • Ein heterogenes Beispieldateninventar erstellen und Freigabekriterien definieren
  • Eine Bereinigungs- und Deduplizierungspipeline für Dokumenttexte aufbauen
  • Aus Fachinhalten einen versionierten Instruction-Datensatz mit Qualitätsprüfungen erzeugen
  • Trainings-, Validierungs- und Testsplits auf Leakage und Domänenabdeckung prüfen

Zielgruppe

Geeignet für technische und fachliche Rollen, die Daten für Modellanpassung, Wissenszugriff oder Qualitätstests bereitstellen. Der Schwerpunkt liegt auf reproduzierbaren Verfahren statt auf einem einzelnen Modellprodukt.

Methodik

Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, 2. Tag: 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.198 zzgl. MwSt.
Inhaus: € 3.400 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Data Engineers, Data Scientists, ML Engineers, Fachbereichsexperten, Datenverantwortliche und KI-Governance-Teams
Voraussetzungen: Grundkenntnisse in Python und Datenverarbeitung; grundlegendes Verständnis von Sprachmodellen ist hilfreich
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Winterthur 2 Tage
Zürich 2 Tage
Stream live 2 Tage
Stream gespeichert 2 Tage
Bern 2 Tage
Luzern 2 Tage
Inhaus / Firmenseminar 2 Tage
Sankt Gallen 2 Tage
Basel 2 Tage
Basel 2 Tage
Winterthur 2 Tage
Zürich 2 Tage
Stream live 2 Tage
Stream gespeichert 2 Tage
Luzern 2 Tage
Bern 2 Tage
Inhaus / Firmenseminar 2 Tage
Sankt Gallen 2 Tage
Sankt Gallen 2 Tage
Basel 2 Tage
Winterthur 2 Tage
Zürich 2 Tage
Stream live 2 Tage
Stream gespeichert 2 Tage
Luzern 2 Tage
Bern 2 Tage
Inhaus / Firmenseminar 2 Tage
Inhaus / Firmenseminar 2 Tage
Sankt Gallen 2 Tage
Basel 2 Tage
Winterthur 2 Tage
Zürich 2 Tage
Stream live 2 Tage
Stream gespeichert 2 Tage
Luzern 2 Tage
Bern 2 Tage
Luzern 2 Tage
Bern 2 Tage
Inhaus / Firmenseminar 2 Tage
Sankt Gallen 2 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.ch All rights reserved.  | Kontakt | Impressum | Nach oben