Seminar / Training
Standard-Expectations decken viele Prüfaufgaben ab, aber nicht jede fachliche Regel. Das Seminar führt von der präzisen Anforderungsformulierung über Metriken und Ausführungslogik bis zu einer getesteten, dokumentierten und paketierbaren Custom Expectation für pandas-, SQL- oder Spark-basierte Daten.
Inhaltsübersicht
- Zielsetzung und fachliche Einordnung
- Schrittweise Seminarinhalte
- Praxisübungen und Laborszenarien
- Zielgruppe und Voraussetzungen
- Didaktik und Arbeitsweise
Zielsetzung
- Entscheiden, wann Konfiguration, Kombination vorhandener Regeln oder eine Custom Expectation angemessen ist.
- Expectation-Klassen, Parameter, Metriken und Ausführungs-Engines strukturiert entwerfen.
- Eigene Regeln für pandas, SQL und Spark nachvollziehbar implementieren.
- Diagnostische Ergebnisse, Row Conditions, Severity und Parameter korrekt berücksichtigen.
- Custom Expectations testen, dokumentieren, paketieren und versionsfähig bereitstellen.
Zielgruppe
Python-Entwickler, Data Engineers, Analytics Engineers und technische Data-Quality-Verantwortliche, die fachliche Prüfregeln über den Standardkatalog hinaus implementieren.
Voraussetzungen
Sichere Python-Kenntnisse, Erfahrung mit automatisierten Tests und Datenverarbeitung. Grundkenntnisse der GX-Core-Objekte sowie mindestens einer Ausführungsumgebung wie pandas, SQL oder Spark sind erforderlich.
Seminarinhalte
- Schritt 1: Anforderung und Akzeptanzkriterien präzisieren
Geschäftsregel, Gültigkeitsbereich, Toleranz, Nullbehandlung, Severity und erwartete Diagnoseinformationen werden vor der Implementierung eindeutig beschrieben.
- Schritt 2: Lösungsweg auswählen
Vorhandene Expectations, Row Conditions, Parameter, Suite-Kombinationen, SQL-basierte Unexpected-Rows-Prüfung und vollständige Custom Class werden nach Wartungsaufwand verglichen.
- Schritt 3: Expectation-Klassenmodell verstehen
Konfiguration, Domain, Success Keys, Runtime Keys, Metadaten und Abhängigkeiten zu Metriken werden im Lebenszyklus einer Expectation eingeordnet.
- Schritt 4: Parameter und Validierung definieren
Pflicht- und optionale Parameter erhalten Typen, Standardwerte und Plausibilitätsprüfungen. Fehlermeldungen werden früh und verständlich erzeugt.
- Schritt 5: Metriken und Berechnungsdomäne planen
Tabellen-, Spalten- und Spaltenpaarmetriken werden unterschieden. Es wird festgelegt, welche Datenmenge verarbeitet und welche Zwischenergebnisse wiederverwendet werden.
- Schritt 6: Pandas-Implementierung erstellen
Eine Vektor- oder aggregationsbasierte Berechnung wird für pandas umgesetzt. Nullwerte, Datentypen, leere Batches und unerwartete Werte werden explizit behandelt.
- Schritt 7: SQL-Ausführung implementieren
Aggregationen und Bedingungen werden auf die SQL Execution Engine übertragen. Dialektunterschiede, Quoting, Nullsemantik und Pushdown werden berücksichtigt.
- Schritt 8: Spark-Ausführung implementieren
Die Regel wird für Spark DataFrames formuliert. Unnötige Collect-Operationen und großvolumige Ergebnisübertragungen werden vermieden.
- Schritt 9: Erfolgskriterium und mostly-Logik bestimmen
Metrikergebnis, Schwelle und Toleranz werden in ein eindeutiges Success-Ergebnis überführt. Grenzfälle und Rundung werden durch Tests abgesichert.
- Schritt 10: Resultat und Diagnoseinformationen gestalten
Observed Value, unerwartete Anzahl, Stichproben und weitere Details werden nach Result Format begrenzt ausgegeben. Datenschutz und Nutzbarkeit bleiben ausbalanciert.
- Schritt 11: Row Conditions, Parameter und Severity integrieren
Die Custom Expectation wird mit gefilterten Zeilen, Laufzeitparametern und abgestuften Fehlerklassen getestet.
- Schritt 12: Automatisierte Tests aufbauen
Positive, negative, leere, fehlerhafte und plattformübergreifende Testfälle werden erstellt. Regressionen und erwartete Fehlermeldungen werden abgesichert.
- Schritt 13: Dokumentation und Beispiele erstellen
Zweck, Parameter, Beispiele, Grenzen und Engine-Unterstützung werden so beschrieben, dass die Regel ohne Wissen des Autors eingesetzt werden kann.
- Schritt 14: Paketierung und Bereitstellung organisieren
Modulstruktur, Versionsnummer, Abhängigkeiten, Importpfad und interne Veröffentlichung werden festgelegt. Kompatibilität mit GX-Core-Upgrades wird geprüft.
- Schritt 15: Review und Wartungsprozess etablieren
Code-Review, fachliche Freigabe, Testmatrix, Deprecation und Änderungsnachweis werden als dauerhafter Lebenszyklus definiert.
Praxisübungen
- Fachliche Regel in Akzeptanzkriterien und testbare Parameter zerlegen.
- Custom Expectation zunächst für pandas implementieren und mit Grenzfällen testen.
- Dieselbe Regel oder eine geeignete Teilmenge für SQL oder Spark ergänzen.
- Result Format und Diagnoseausgabe für Datenschutz und Fehleranalyse optimieren.
- Paket erstellen, in einem separaten Projekt installieren und in einer Suite verwenden.
- Review anhand einer Qualitätscheckliste mit Fachlichkeit, Performance und Wartbarkeit durchführen.
Methodik
Das dreitägige Entwicklungsseminar folgt einem vollständigen Implementierungszyklus. Theorie wird unmittelbar in Code, Tests, Dokumentation und Paketierung umgesetzt; am Ende steht eine eigenständig nutzbare Custom Expectation mit Abnahmeprotokoll.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Python-Entwickler, Data Engineers, Analytics Engineers und technische Data-Quality-Verantwortliche, die fachliche Prüfregeln über den Standardkatalog hinaus implementieren. |
| Voraussetzungen: | Sichere Python-Kenntnisse, Erfahrung mit automatisierten Tests und Datenverarbeitung. Grundkenntnisse der GX-Core-Objekte sowie mindestens einer Ausführungsumgebung wie pandas, SQL oder Spark sind erforderlich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, strukturierte Schritt-für-Schritt-Übungen und praktische Laboraufgaben am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
