Seminar / Training
Tabellen wirken einfach, enthalten aber häufig implizite Schlüssel, uneinheitliche Datentypen, Mehrfachwerte und fachliche Abhängigkeiten. Für einen verlässlichen Wissensgraphen müssen diese Eigenschaften explizit modelliert und geprüft werden.
Das Seminar führt von CSV-, Excel- und Datenbankquellen bis zum Knowledge-Graph-Ziel. Schemaerkennung, JDBC-Konfiguration, Schlüsselbildung, inkrementelles Laden und Qualitätskontrollen werden an einem durchgängigen Beispiel umgesetzt.
Inhaltsübersicht
- Seminarziel
- Zielgruppe
- Voraussetzungen
- Seminarinhalte
- Schritt 1: Quellprofil und Datenqualität erfassen
- Schritt 2: CSV- und Excel-Datasets einrichten
- Schritt 3: Datenbankzugriff über JDBC
- Schritt 4: Klassen, Eigenschaften und Schlüssel mappen
- Schritt 5: Transformation und Normalisierung
- Schritt 6: Inkrementelles Laden
- Schritt 7: Prüfung und Workflowbetrieb
- Praxisübungen
- Arbeitsweise
Seminarziel
- CSV-, Excel- und relationale Quellen korrekt als Datasets konfigurieren
- Spalten, Schlüssel und Beziehungen auf semantische Modelle abbilden
- Datentypen, Mehrfachwerte und fehlerhafte Zeilen kontrolliert verarbeiten
- vollständige und inkrementelle Ladevorgänge reproduzierbar gestalten
Zielgruppe
Data Engineers, ETL-Entwickler, Datenbankexperten und Knowledge-Graph-Entwickler mit Verantwortung für strukturierte Quellsysteme.
Voraussetzungen
Grundkenntnisse in Datenbanken und Tabellenformaten. Ein grundlegender Build-Einstieg ist hilfreich; RDF-Vorkenntnisse werden im benötigten Umfang aufgefrischt.
Seminarinhalte
Schritt 1: Quellprofil und Datenqualität erfassen
Vor der technischen Konfiguration werden Schlüssel, Nullwerte, Dubletten, Datentypen und Mehrfachwerte profiliert. Die Erkenntnisse bestimmen Dataset- und Mappingregeln.
- Spaltenprofil und Werteverteilung
- Primär- und Fachschlüssel
- Nullwerte und Dubletten
Schritt 2: CSV- und Excel-Datasets einrichten
Trennzeichen, Kodierung, Tabellenblatt, Kopfzeilen und Spaltentypen werden korrekt konfiguriert. Vorschau und explizite Schemas verhindern Überraschungen im späteren Workflow.
- CSV-Parameter und Zeichensätze
- Excel-Arbeitsblätter
- explizite Schemata
Schritt 3: Datenbankzugriff über JDBC
Treiber, Verbindung, Abfrage und Zugangsdaten werden getrennt verwaltet. Datenbanklast, Abfragebegrenzung und sichere Geheimnisablage werden in die Konfiguration aufgenommen.
- JDBC-Treiber und Verbindungen
- SQL-Abfragen und Sichten
- Credentials und Netzwerkzugriff
Schritt 4: Klassen, Eigenschaften und Schlüssel mappen
Zeilen werden auf Ressourcen abgebildet und Schlüssel in stabile IRIs überführt. Fremdschlüssel und Beziehungstabellen werden als Objektbeziehungen modelliert.
- URI-Muster
- Datentyp- und Objektzuordnungen
- Fremdschlüssel und n:m-Beziehungen
Schritt 5: Transformation und Normalisierung
Datums-, Zahlen- und Textwerte werden vereinheitlicht. Mehrfachwerte und zusammengesetzte Felder werden vor der Graphausgabe in definierte Einzelwerte zerlegt.
- Parsing und Formatierung
- Lookup- und Ersetzungsregeln
- Listen und Mehrfachwerte
Schritt 6: Inkrementelles Laden
Änderungszeitpunkte, Sequenzen oder technische Marker begrenzen den Datenabruf. Die Strategie berücksichtigt neue, geänderte und gelöschte Datensätze sowie einen sicheren Erstlauf.
- Watermark und Deltaabfrage
- Upsert und Löschung
- vollständiger Neuaufbau
Schritt 7: Prüfung und Workflowbetrieb
Mengen, Schlüssel und Pflichtfelder werden vor und nach der Transformation geprüft. Workflowberichte und Stichproben dienen der Abnahme und späteren Betriebsüberwachung.
- Mengenabgleich
- Schlüssel- und Pflichtfeldprüfung
- Berichte und Reconciliation
Praxisübungen
- Import einer CSV- und Excel-Quelle mit explizitem Schema
- Anbindung einer relationalen Datenbank und Abbildung von Fremdschlüsseln
- Umstellung einer Vollbeladung auf einen kontrollierten Delta-Lauf
Arbeitsweise
Die Themen werden in aufeinander aufbauenden Arbeitsschritten vermittelt. Fachliche Einordnung, Demonstration, angeleitete Konfiguration und selbstständige Übungen wechseln sich ab. Jeder größere Arbeitsschritt wird mit einer Prüfung des erzeugten Ergebnisses und einer kurzen technischen Dokumentation abgeschlossen.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, 2. Tag: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineers, ETL-Entwickler, Datenbankexperten und Knowledge-Graph-Entwickler mit Verantwortung für strukturierte Quellsysteme. |
| Voraussetzungen: | Grundkenntnisse in Datenbanken und Tabellenformaten. Ein grundlegender Build-Einstieg ist hilfreich; RDF-Vorkenntnisse werden im benötigten Umfang aufgefrischt. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
