Allgemeine Bestenlisten sagen wenig darüber aus, ob ein Modell interne Fachbegriffe korrekt verwendet, verbindliche Antwortformate einhält oder bei unzureichender Evidenz zuverlässig ablehnt. Qualitätssicherung muss deshalb von den konkreten Aufgaben, Fehlerfolgen und Betriebsbedingungen der Domäne ausgehen.
Das Seminar zeigt, wie aus fachlichen Erwartungen eine wiederholbare Testsuite entsteht. Deterministische Metriken, semantische Bewertungen, menschliche Prüfung und modellgestützte Judges werden so kombiniert, dass ihre jeweiligen Schwächen sichtbar und kontrollierbar bleiben.
Lernziele
Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.
- Aufgaben, Fehlerklassen, Akzeptanzgrenzen und Risikogewichte für eine Domäne definieren
- Repräsentative Goldensets und kontrollierte Challenge-Sets ohne Trainingskontamination erstellen
- Passende Metriken für Klassifikation, Extraktion, Generierung, RAG und strukturierte Ausgaben auswählen
- LLM-Judges mit menschlichen Bewertungen kalibrieren und auf Verzerrungen prüfen
- Qualitäts-, Sicherheits- und Leistungsregressionen in Freigabeprozesse integrieren
Seminarinhalte
Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.
Evaluationsdesign
- Task Taxonomy, Nutzergruppen, Fehlerkosten und risikobasierte Gewichtung
- Goldenset, Holdout, Challenge-Set, adversariale Fälle und zeitbasierte Tests
- Stichprobengröße, Konfidenz, Varianz durch Sampling und reproduzierbare Generationsparameter
- Kontamination, Doppelungen und unbeabsichtigte Hinweise in Testdaten
Metriken und Bewertungsverfahren
- Exact Match, Precision, Recall, F1, Edit-Distanz und schema-basierte Validierung
- Semantische Ähnlichkeit, Faktentreue, Vollständigkeit, Relevanz und Ablehnungsverhalten
- Retrieval-Metriken, Kontexttreue und Antwortqualität bei RAG-Systemen
- Rubrics, paarweiser Vergleich, Blind Review und Inter-Rater-Übereinstimmung
- LLM-as-Judge, Positions- und Längenbias, Kalibrierung und menschliche Kontrollstichproben
Robustheit, Sicherheit und Leistung
- Promptvarianten, Tippfehler, Mehrsprachigkeit, lange Eingaben und fachliche Grenzfälle
- Prompt Injection, sensible Daten, unerlaubte Inhalte, unsichere Code- oder Tool-Ausgaben
- Latenz, Time to First Token, Tokens pro Sekunde, Durchsatz und Ressourcenverbrauch
- Qualitätsvergleich vor und nach Fine-Tuning, Quantisierung oder Modellwechsel
Kontinuierliche Qualitätssicherung
- Versionierte Testfälle, Schwellenwerte, Freigabegates und Fehlerbudgets
- CI-Ausführung, Ergebnisprotokoll, Vergleichsberichte und Ursachenanalyse
- Produktionsstichproben, Nutzerfeedback, Driftindikatoren und Datenschutz bei Logs
- Canary, A/B-Vergleich, Rollback und erneute fachliche Freigabe
Praktische Übungen
Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.
- Aus einem Fachprozess Fehlerklassen und eine gewichtete Scorecard ableiten
- Eine kleine domänenspezifische Testsuite mit automatischen Prüfern implementieren
- Einen Judge gegen menschliche Bewertungen kalibrieren und Abweichungen analysieren
- Zwei Modell- oder Quantisierungsvarianten einschließlich Leistungswerten vergleichen
- Freigabeschwellen und Regressionstest für eine Modellpipeline definieren
Zielgruppe
Geeignet für Teams, die Modellqualität nicht durch Einzelprompts, sondern anhand nachvollziehbarer Prüfverfahren bewerten müssen. Fachprüfer und technische Rollen arbeiten dabei mit derselben Scorecard.
Methodik
Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, 2. Tag: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Scientists, ML Engineers, QA Engineers, Fachprüfer, Product Owner, MLOps- und KI-Governance-Teams |
| Voraussetzungen: | Grundkenntnisse zu Sprachmodellen; Python-Grundkenntnisse sind für die Übungen hilfreich |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
