Seminar / Training
Das Gesamtprogramm fasst das vollständige GX-Core-Seminarportfolio in einem komprimierten, praxisorientierten Lernpfad zusammen. Es vermittelt alle wesentlichen Themen von Grundlagen, Datenkontexten und Datenquellen über Expectations, Custom Rules und Multi-Source-Abgleich bis zu Checkpoints, Data Docs, Pipelines, produktivem Betrieb, Performance und Migration.
Inhaltsübersicht
- Zielsetzung und fachliche Einordnung
- Schrittweise Seminarinhalte
- Praxisübungen und Laborszenarien
- Zielgruppe und Voraussetzungen
- Didaktik und Arbeitsweise
Zielsetzung
- Das vollständige GX-Core-Objektmodell in einem End-to-End-Projekt anwenden.
- Pandas-, Datei-, Cloud-, SQL- und Spark-Datenzugriffe fachlich und technisch einordnen.
- Batches, Suites, Parameter, bedingte Regeln und eigene Validierungslogik gestalten.
- Validation Definitions, Checkpoints, Actions, Data Docs und Pipelines automatisieren.
- Betrieb, Sicherheit, Performance, Fehlersuche, Governance und Migration überblicken und praktisch verbinden.
Zielgruppe
Erfahrene Projektteams, künftige GX-Core-Key-User, Data Engineers, Analytics Engineers, Entwickler, Data Stewards und technische Verantwortliche, die in kurzer Zeit einen umfassenden Gesamtüberblick mit praktischem Referenzprojekt benötigen.
Voraussetzungen
Sichere Python-Grundlagen und allgemeines Verständnis von Datenpipelines, SQL oder DataFrames. Wegen der hohen Stoffdichte sind erste praktische Erfahrungen in Datenengineering oder Datenqualität erforderlich.
Seminarinhalte
- Schritt 1: Datenqualitätsziele und Governance festlegen
Datenprodukt, Qualitätsdimensionen, Risiken, Verantwortliche, Severity und Entscheidungsfolgen werden für das Referenzprojekt definiert.
- Schritt 2: GX-Core-Objektmodell vollständig einordnen
Data Context, Data Source, Data Asset, Batch Definition, Expectation, Suite, Validation Definition, Checkpoint, Action, Store und Data Docs werden verbunden.
- Schritt 3: Projektstruktur und Data Context aufbauen
Persistentes Projekt, Konfiguration, Umgebungen, Secrets und Namenskonventionen werden reproduzierbar eingerichtet.
- Schritt 4: Pandas- und DataFrame-Daten validieren
In-Memory-Daten werden als Data Source, Asset und Batch eingebunden und mit ersten Struktur- und Inhaltsregeln geprüft.
- Schritt 5: Dateisysteme und Cloud Storage anbinden
Lokale Dateien und Object Storage werden über präzise Assets, Formate, Präfixe und datumsbasierte Partitionen organisiert.
- Schritt 6: SQL Data Sources und Assets konfigurieren
Sichere Verbindungen, Table und Query Assets, Servicekonten, Batch-Filter und Pushdown werden praktisch umgesetzt.
- Schritt 7: Spark und verteilte Validierung einordnen
Spark DataFrames, Dateiquellen, Partitionen, Kosten und Engine-spezifische Optimierungen werden anhand eines kompakten Falls bearbeitet.
- Schritt 8: Batch Definitions und Partitionierung beherrschen
Gesamtbestand, Zeitpartition, Laufzeitparameter, Nachlieferung und fachliche Prüfeinheit werden reproduzierbar modelliert.
- Schritt 9: Expectation Suites entwerfen
Standardregeln für Struktur, Vollständigkeit, Gültigkeit, Eindeutigkeit und Beziehungen werden zu einer wartbaren Suite gebündelt.
- Schritt 10: Parameter, Row Conditions und Severity einsetzen
Dynamische Schwellen, bedingte Teilmengen und abgestufte Reaktionen werden in ausgewählten Regeln umgesetzt.
- Schritt 11: Validation Definitions und Results analysieren
Batch und Suite werden verbunden; Result Formats, Run Identifier, Statistiken und Fehlerdetails werden zielgerichtet ausgewertet.
- Schritt 12: Custom Expectations mit Python einordnen
Klassenmodell, Metriken, Engine-Unterstützung, Tests und Paketierung werden an einer kleinen Eigenentwicklung durchlaufen.
- Schritt 13: SQL-basierte Fehlerzeilenprüfung erstellen
Eine komplexe Fachregel wird als Unexpected-Rows-Abfrage implementiert und datenschutzgerecht begrenzt.
- Schritt 14: Multi-Source-Abgleich durchführen
Zwei SQL-Datenquellen werden mit deterministischen Abfragen und mostly-Schwelle für einen Migrations- oder ETL-Vergleich verbunden.
- Schritt 15: Checkpoints, Actions und Benachrichtigungen konfigurieren
Mehrere Validierungen, Severity, Statuspfade und eine standardisierte Action werden zu einem steuerbaren Lauf gebündelt.
- Schritt 16: Data Docs und Qualitätsberichte erzeugen
Berichtssite, Detailtiefe, Run-Metadaten, Datenschutz und automatischer Build werden eingerichtet.
- Schritt 17: CI/CD und Orchestrierung integrieren
Checkpoint, Batch Parameter, Exit Codes, Retry, Quarantäne und Pipeline-Gate werden in eine Laborpipeline eingebaut.
- Schritt 18: Stores, Security und Betriebsmodell planen
Ablageorte, minimale Rechte, Secrets, Logging, Monitoring, Aufbewahrung, Backup und Wiederherstellung werden festgelegt.
- Schritt 19: Performance und Fehlersuche anwenden
Datenzugriff, Batch-Größe, Regelkosten und Result-Umfang werden optimiert; ein gemischter Fehlerfall wird mit Diagnosematrix gelöst.
- Schritt 20: Migration und Weiterentwicklung planen
Bestandsinventur, Referenzbatches, Regressionstest, Cutover, Rollback und regelmäßige Wartung werden als Roadmap dokumentiert.
Praxisübungen
- End-to-End-Projekt mit File Data Context und mehreren Datenquellentypen aufbauen.
- Batch- und Partitionskonzept für Tagesläufe und Nachlieferungen erstellen.
- Suite mit Standardregeln, Parameter, Row Condition und Severity umsetzen.
- Custom-Python-Regel und SQL-Fehlerzeilenprüfung in reduzierter Form entwickeln.
- Multi-Source-Abgleich für Quell- und Zielsystem durchführen.
- Validation Definition, Checkpoint, Action und Data Docs vollständig ausführen.
- Pipeline-Gate mit Exit Codes, Retry-Abgrenzung und Quarantäne betreiben.
- Store-, Secret-, Monitoring- und Backup-Konzept abnehmen.
- Performanceproblem und technischen Fehler systematisch diagnostizieren.
- Migrations- und Wartungsroadmap für das Referenzprojekt erstellen.
Methodik
Das fünftägige Gesamtprogramm verdichtet alle Einzelseminare in einem einzigen Referenzprojekt. Spezialisierte Themen werden auf Überblicks- und Entscheidungsniveau behandelt, zentrale Kernschritte jedoch praktisch umgesetzt und in einer umfassenden Projekt- und Betriebsdokumentation zusammengeführt.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 5 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 2.995 zzgl. MwSt. Inhaus: € 8.500 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Erfahrene Projektteams, künftige GX-Core-Key-User, Data Engineers, Analytics Engineers, Entwickler, Data Stewards und technische Verantwortliche, die in kurzer Zeit einen umfassenden Gesamtüberblick mit praktischem Referenzprojekt benötigen. |
| Voraussetzungen: | Sichere Python-Grundlagen und allgemeines Verständnis von Datenpipelines, SQL oder DataFrames. Wegen der hohen Stoffdichte sind erste praktische Erfahrungen in Datenengineering oder Datenqualität erforderlich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, strukturierte Schritt-für-Schritt-Übungen und praktische Laboraufgaben am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
