Seminar Evaluation und Qualitätssicherung für domänenspezifische Sprachmodelle

Allgemeine Bestenlisten sagen wenig darüber aus, ob ein Modell interne Fachbegriffe korrekt verwendet, verbindliche Antwortformate einhält oder bei unzureichender Evidenz zuverlässig ablehnt. Qualitätssicherung muss deshalb von den konkreten Aufgaben, Fehlerfolgen und Betriebsbedingungen der Domäne ausgehen.

Das Seminar zeigt, wie aus fachlichen Erwartungen eine wiederholbare Testsuite entsteht. Deterministische Metriken, semantische Bewertungen, menschliche Prüfung und modellgestützte Judges werden so kombiniert, dass ihre jeweiligen Schwächen sichtbar und kontrollierbar bleiben.

Lernziele

Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.

  • Aufgaben, Fehlerklassen, Akzeptanzgrenzen und Risikogewichte für eine Domäne definieren
  • Repräsentative Goldensets und kontrollierte Challenge-Sets ohne Trainingskontamination erstellen
  • Passende Metriken für Klassifikation, Extraktion, Generierung, RAG und strukturierte Ausgaben auswählen
  • LLM-Judges mit menschlichen Bewertungen kalibrieren und auf Verzerrungen prüfen
  • Qualitäts-, Sicherheits- und Leistungsregressionen in Freigabeprozesse integrieren

Seminarinhalte

Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.

Evaluationsdesign

  • Task Taxonomy, Nutzergruppen, Fehlerkosten und risikobasierte Gewichtung
  • Goldenset, Holdout, Challenge-Set, adversariale Fälle und zeitbasierte Tests
  • Stichprobengröße, Konfidenz, Varianz durch Sampling und reproduzierbare Generationsparameter
  • Kontamination, Doppelungen und unbeabsichtigte Hinweise in Testdaten

Metriken und Bewertungsverfahren

  • Exact Match, Precision, Recall, F1, Edit-Distanz und schema-basierte Validierung
  • Semantische Ähnlichkeit, Faktentreue, Vollständigkeit, Relevanz und Ablehnungsverhalten
  • Retrieval-Metriken, Kontexttreue und Antwortqualität bei RAG-Systemen
  • Rubrics, paarweiser Vergleich, Blind Review und Inter-Rater-Übereinstimmung
  • LLM-as-Judge, Positions- und Längenbias, Kalibrierung und menschliche Kontrollstichproben

Robustheit, Sicherheit und Leistung

  • Promptvarianten, Tippfehler, Mehrsprachigkeit, lange Eingaben und fachliche Grenzfälle
  • Prompt Injection, sensible Daten, unerlaubte Inhalte, unsichere Code- oder Tool-Ausgaben
  • Latenz, Time to First Token, Tokens pro Sekunde, Durchsatz und Ressourcenverbrauch
  • Qualitätsvergleich vor und nach Fine-Tuning, Quantisierung oder Modellwechsel

Kontinuierliche Qualitätssicherung

  • Versionierte Testfälle, Schwellenwerte, Freigabegates und Fehlerbudgets
  • CI-Ausführung, Ergebnisprotokoll, Vergleichsberichte und Ursachenanalyse
  • Produktionsstichproben, Nutzerfeedback, Driftindikatoren und Datenschutz bei Logs
  • Canary, A/B-Vergleich, Rollback und erneute fachliche Freigabe

Praktische Übungen

Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.

  • Aus einem Fachprozess Fehlerklassen und eine gewichtete Scorecard ableiten
  • Eine kleine domänenspezifische Testsuite mit automatischen Prüfern implementieren
  • Einen Judge gegen menschliche Bewertungen kalibrieren und Abweichungen analysieren
  • Zwei Modell- oder Quantisierungsvarianten einschließlich Leistungswerten vergleichen
  • Freigabeschwellen und Regressionstest für eine Modellpipeline definieren

Zielgruppe

Geeignet für Teams, die Modellqualität nicht durch Einzelprompts, sondern anhand nachvollziehbarer Prüfverfahren bewerten müssen. Fachprüfer und technische Rollen arbeiten dabei mit derselben Scorecard.

Methodik

Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, 2. Tag: 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.198 zzgl. MwSt.
Inhaus: € 3.400 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Data Scientists, ML Engineers, QA Engineers, Fachprüfer, Product Owner, MLOps- und KI-Governance-Teams
Voraussetzungen: Grundkenntnisse zu Sprachmodellen; Python-Grundkenntnisse sind für die Übungen hilfreich
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Stream gespeichert 2 Tage
Luzern 2 Tage
Bern 2 Tage
Inhaus / Firmenseminar 2 Tage
Sankt Gallen 2 Tage
Basel 2 Tage
Winterthur 2 Tage
Zürich 2 Tage
Stream live 2 Tage
Stream live 2 Tage
Stream gespeichert 2 Tage
Luzern 2 Tage
Bern 2 Tage
Inhaus / Firmenseminar 2 Tage
Sankt Gallen 2 Tage
Basel 2 Tage
Winterthur 2 Tage
Zürich 2 Tage
Zürich 2 Tage
Stream live 2 Tage
Stream gespeichert 2 Tage
Luzern 2 Tage
Bern 2 Tage
Inhaus / Firmenseminar 2 Tage
Sankt Gallen 2 Tage
Basel 2 Tage
Winterthur 2 Tage
Winterthur 2 Tage
Zürich 2 Tage
Stream live 2 Tage
Stream gespeichert 2 Tage
Luzern 2 Tage
Bern 2 Tage
Inhaus / Firmenseminar 2 Tage
Sankt Gallen 2 Tage
Basel 2 Tage
Basel 2 Tage
Winterthur 2 Tage
Zürich 2 Tage
Stream live 2 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.ch All rights reserved.  | Kontakt | Impressum | Nach oben