Das Seminar vergleicht Delta Lake und Apache Hudi und zeigt den kontrollierten Einsatz des Lakehouse Connectors für mehrere Tabellenformate. Metastore, Object Storage, Transaktions- und Metadatenmodelle, DML, Migration, Statistiken, Sicherheit und operative Grenzen werden praktisch untersucht.
Inhaltsübersicht
- Lernziele und fachliche Einordnung
- Schrittweise Seminarinhalte
- Praxisübungen und Laborszenarien
- Zielgruppe und Voraussetzungen
- Didaktik und Arbeitsweise
Lernziele
- Delta-Lake-, Hudi- und Lakehouse-Architekturen voneinander abgrenzen.
- Metastore, Object Storage und Catalogs sicher konfigurieren.
- Lese-, Schreib- und Änderungsfunktionen connectorbezogen testen.
- Mehrere Tabellenformate in einem konsistenten Zugriffskonzept betreiben.
- Migration, Wartung, Statistiken und Performance kontrolliert planen.
Schrittweise Seminarinhalte
1. Tabellenformate und Einsatzkriterien
Schwerpunkt: Transaktionslog, Timeline, Metadaten, Copy-on-Write, Merge-on-Read, Snapshots, DML, Interoperabilität und Betriebsaufwand.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Tabellenformate und Einsatzkriterien“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Transaktionslog, Timeline, Metadaten, Copy-on-Write, Merge-on-Read, Snapshots, DML, Interoperabilität und Betriebsaufwand. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis eine begründete Format- und Use-Case-Matrix dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
2. Metastore und Object Storage
Schwerpunkt: Hive Metastore, Glue-kompatible Dienste, Pfade, Berechtigungen, S3-kompatibler Speicher, Azure, Google Cloud und Verbindungstests.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Metastore und Object Storage“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Hive Metastore, Glue-kompatible Dienste, Pfade, Berechtigungen, S3-kompatibler Speicher, Azure, Google Cloud und Verbindungstests. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis eine gemeinsame Metadaten- und Speicherbasis dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
3. Delta-Lake-Connector
Schwerpunkt: Catalog-Konfiguration, Tabellenentdeckung, Transaktionslog, DML, Statistiken, Caching, Verfahren und Fehlerfälle.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Delta-Lake-Connector“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Catalog-Konfiguration, Tabellenentdeckung, Transaktionslog, DML, Statistiken, Caching, Verfahren und Fehlerfälle. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis einen getesteten Delta-Lake-Zugriffs- und Änderungsprozess dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
4. Hudi-Connector
Schwerpunkt: Tabellentypen, Timeline, Partitionen, Read-Optimized- und inkrementelle Muster, Schemaentwicklung und operative Grenzen.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Hudi-Connector“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Tabellentypen, Timeline, Partitionen, Read-Optimized- und inkrementelle Muster, Schemaentwicklung und operative Grenzen. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis ein dokumentiertes Hudi-Abfragemodell dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
5. Lakehouse Connector
Schwerpunkt: Gemeinsamer Catalog, Formaterkennung, Hive-, Iceberg-, Delta- und Hudi-Verhalten, Konfigurationsvererbung und Abgrenzung.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Lakehouse Connector“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Gemeinsamer Catalog, Formaterkennung, Hive-, Iceberg-, Delta- und Hudi-Verhalten, Konfigurationsvererbung und Abgrenzung. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis eine konsolidierte Multi-Format-Catalog-Konfiguration dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
6. Migration und Koexistenz
Schwerpunkt: Bestehende Hive-Tabellen, Redirection, schrittweise Formatmigration, Parallelbetrieb, Datenvalidierung und Rückfalloptionen.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Migration und Koexistenz“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Bestehende Hive-Tabellen, Redirection, schrittweise Formatmigration, Parallelbetrieb, Datenvalidierung und Rückfalloptionen. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis einen risikoarmen Migrations- und Koexistenzplan dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
7. Sicherheit, Wartung und Performance
Schwerpunkt: Catalog-Rechte, Statistiken, Dateigrößen, Metadaten, Cache, Wartungsfenster, Monitoring, Abnahme und Betriebsdokumentation.
- Ausgangslage, fachliche Ziele, technische Abhängigkeiten und Abnahmekriterien für den Themenblock „Sicherheit, Wartung und Performance“ erfassen.
- Relevante Komponenten, Datenobjekte, Rollen und Konfigurationsparameter anhand von Catalog-Rechte, Statistiken, Dateigrößen, Metadaten, Cache, Wartungsfenster, Monitoring, Abnahme und Betriebsdokumentation. modellieren.
- Die erforderliche Konfiguration, SQL-Abfrage oder Prozessfolge im Laborsystem schrittweise umsetzen und jeden Zwischenstand dokumentieren.
- Funktion, Ausführungsplan, Datenzugriff, Berechtigungen, Ressourcenverbrauch und Fehlerverhalten mit definierten Positiv- und Negativfällen prüfen.
- Als Arbeitsergebnis ein belastbares Lakehouse-Betriebsrunbook dokumentieren, fachlich abnehmen und in einen wiederholbaren Standard überführen.
Praxisübungen und Laborszenarien
- Konfiguration getrennter Delta- und Hudi-Catalogs.
- Aufbau eines gemeinsamen Lakehouse-Catalogs mit mehreren Tabellenformaten.
- Planung und Test einer schrittweisen Hive-zu-Lakehouse-Migration.
Zielgruppe und Voraussetzungen
Zielgruppe: Lakehouse- und Data-Platform-Architektur, Data Engineering, Cloud Engineering, Datenbankadministration und technischer Betrieb.
Voraussetzungen: Gute SQL-Kenntnisse, Grundlagen in Object Storage, Metastore und spaltenorientierten Dateiformaten sowie Trino-Grundlagen.
Didaktik und Arbeitsweise
Kurze Fachimpulse werden unmittelbar durch Demonstrationen, strukturierte Konfigurations- oder SQL-Schritte, praktische Übungen und kontrollierte Fehlerfälle vertieft. Jede Übung verwendet definierte Ausgangswerte, Prüfpunkte und Dokumentationsanforderungen, damit die erarbeiteten Abläufe als technischer Standard wiederholbar bleiben.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Lakehouse- und Data-Platform-Architektur, Data Engineering, Cloud Engineering, Datenbankadministration und technischer Betrieb |
| Voraussetzungen: | Gute SQL-Kenntnisse, Grundlagen in Object Storage, Metastore und spaltenorientierten Dateiformaten sowie Trino-Grundlagen |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
