Dieses Seminar behandelt datei- und objektbasierte Datenverarbeitung in SAP Datasphere. File Spaces, Object-Store-Strukturen, offene Dateiformate und Spark-basierte Transformationen werden für großvolumige, schemaflexible und analytisch nutzbare Datenbestände eingesetzt.
Inhaltsverzeichnis
- Zielsetzung
- Lernziele
- Zielgruppe
- Voraussetzungen
- Seminarinhalte
- Praxisübungen
Zielsetzung
Inhaltsverzeichnis: fachliches Ziel · technisches Ziel · Qualität und Betriebsfähigkeit
Ziel ist ein kontrollierter Datenweg von der Dateiablage über skalierbare Transformationen bis zur katalogisierten und für relationale oder analytische Nutzung bereitgestellten Datenbasis.
Lernziele
Inhaltsverzeichnis: Einordnung · Umsetzung · Prüfung · Dokumentation
- die fachlichen und technischen Grundlagen zu Architektur objektbasierter Daten, File Spaces administrieren, Dateiformate und Schema sicher einordnen
- Anforderungen in nachvollziehbare Konfigurations-, Integrations- oder Modellierungsschritte überführen
- einen durchgängigen Praxisfall mit kontrollierten Zwischenschritten umsetzen
- Datenqualität, Berechtigungen, Abhängigkeiten und Laufverhalten mit festgelegten Prüfkriterien bewerten
- die Lösung dokumentieren, deployen und für einen geregelten Betrieb beziehungsweise die weitere Nutzung vorbereiten
Zielgruppe
Inhaltsverzeichnis: Rollen · Aufgabenbereiche · Projektbezug
Data Engineers, Datenplattform-Architekten, Datasphere-Entwickler, Cloud-Spezialisten und technische Administratoren
Voraussetzungen
Inhaltsverzeichnis: Fachkenntnisse · technische Grundlagen · empfohlene Praxiserfahrung
Grundkenntnisse zu Datenintegration, Dateiformaten und Datenmodellierung; erste Erfahrungen mit verteilten Datenverarbeitungsprinzipien sind hilfreich
Seminarinhalte
Inhaltsverzeichnis: Architektur objektbasierter Daten · File Spaces administrieren · Dateiformate und Schema · Datenaufnahme in den Object Store · Spark-Transformationskonzept · Bereinigung und Standardisierung · Anreicherung und Aggregation · Bereitstellung für Datasphere-Modelle · Performance und Betrieb
- Architektur objektbasierter Daten
- File Spaces administrieren
- Dateiformate und Schema
- Datenaufnahme in den Object Store
- Spark-Transformationskonzept
- Bereinigung und Standardisierung
- Anreicherung und Aggregation
- Bereitstellung für Datasphere-Modelle
- Performance und Betrieb
Modul 1: Architektur objektbasierter Daten
Inhaltsverzeichnis: relationale Tabellen und dateibasierte Datenbestände voneinander abgrenzen · Object Store, File Space, Rechenebene und Konsumschicht einordnen · geeignete Szenarien nach Volumen, Struktur und Verarbeitungsart bestimmen · Datenzonen für Roh-, bereinigte und kuratierte Dateien definieren
- Schritt 1: relationale Tabellen und dateibasierte Datenbestände voneinander abgrenzen
- Schritt 2: Object Store, File Space, Rechenebene und Konsumschicht einordnen
- Schritt 3: geeignete Szenarien nach Volumen, Struktur und Verarbeitungsart bestimmen
- Schritt 4: Datenzonen für Roh-, bereinigte und kuratierte Dateien definieren
Praxis: Eine Lakehouse-nahe Zielarchitektur für Sensordaten entwerfen
Modul 2: File Spaces administrieren
Inhaltsverzeichnis: Zweck, Eigentümer und Namenskonvention eines File Space festlegen · Ressourcen und Zugriffsrollen passend zu Teams und Datenklassen zuweisen · Ordner- und Objektstruktur für Datenlebenszyklen planen · administrative Kontrollen und Verantwortlichkeiten dokumentieren
- Schritt 1: Zweck, Eigentümer und Namenskonvention eines File Space festlegen
- Schritt 2: Ressourcen und Zugriffsrollen passend zu Teams und Datenklassen zuweisen
- Schritt 3: Ordner- und Objektstruktur für Datenlebenszyklen planen
- Schritt 4: administrative Kontrollen und Verantwortlichkeiten dokumentieren
Praxis: Einen File Space mit Zonen, Rollen und Ablageregeln konzipieren
Modul 3: Dateiformate und Schema
Inhaltsverzeichnis: strukturierte und semistrukturierte Formate nach Verarbeitungseigenschaften vergleichen · Datentypen, Nullwerte und Zeichencodierung prüfen · Schemaentwicklung und zusätzliche Spalten kontrolliert behandeln · Partitionierung und Dateigröße an Zugriffs- und Ladeverhalten ausrichten
- Schritt 1: strukturierte und semistrukturierte Formate nach Verarbeitungseigenschaften vergleichen
- Schritt 2: Datentypen, Nullwerte und Zeichencodierung prüfen
- Schritt 3: Schemaentwicklung und zusätzliche Spalten kontrolliert behandeln
- Schritt 4: Partitionierung und Dateigröße an Zugriffs- und Ladeverhalten ausrichten
Praxis: Mehrere Beispieldateien auf Format-, Schema- und Partitionierungsqualität untersuchen
Modul 4: Datenaufnahme in den Object Store
Inhaltsverzeichnis: Quell- und Zielpfade eindeutig festlegen · Dateien kontrolliert übertragen oder aus einer Pipeline bereitstellen · Vollständigkeit mit Dateianzahl, Größe und Prüfinformationen validieren · fehlerhafte oder unvollständige Lieferungen isolieren
- Schritt 1: Quell- und Zielpfade eindeutig festlegen
- Schritt 2: Dateien kontrolliert übertragen oder aus einer Pipeline bereitstellen
- Schritt 3: Vollständigkeit mit Dateianzahl, Größe und Prüfinformationen validieren
- Schritt 4: fehlerhafte oder unvollständige Lieferungen isolieren
Praxis: Eine mehrteilige Datenlieferung mit Manifest und Fehlerbereich übernehmen
Modul 5: Spark-Transformationskonzept
Inhaltsverzeichnis: verteilte Verarbeitung und Partitionen fachlich einordnen · Quell- und Zielbestände für eine Transformation auswählen · Transformationsschritte in lesbare und testbare Einheiten zerlegen · Ressourcenbedarf und Wiederholbarkeit vor der Ausführung bewerten
- Schritt 1: verteilte Verarbeitung und Partitionen fachlich einordnen
- Schritt 2: Quell- und Zielbestände für eine Transformation auswählen
- Schritt 3: Transformationsschritte in lesbare und testbare Einheiten zerlegen
- Schritt 4: Ressourcenbedarf und Wiederholbarkeit vor der Ausführung bewerten
Praxis: Einen Transformationsentwurf für großvolumige Ereignisdaten erstellen
Modul 6: Bereinigung und Standardisierung
Inhaltsverzeichnis: Datentypen, Zeitstempel und Codes vereinheitlichen · ungültige, fehlende und doppelte Datensätze behandeln · fachliche Qualitätsregeln auf große Datenmengen anwenden · gültige und fehlerhafte Ergebnisse getrennt persistieren
- Schritt 1: Datentypen, Zeitstempel und Codes vereinheitlichen
- Schritt 2: ungültige, fehlende und doppelte Datensätze behandeln
- Schritt 3: fachliche Qualitätsregeln auf große Datenmengen anwenden
- Schritt 4: gültige und fehlerhafte Ergebnisse getrennt persistieren
Praxis: Rohdaten bereinigen und Qualitätsfehler in einem separaten Bestand ausgeben
Modul 7: Anreicherung und Aggregation
Inhaltsverzeichnis: Dateidaten mit Referenz- oder Stammdaten verbinden · Partitionierung und Join-Strategie auf Datenverteilung abstimmen · Kennzahlen auf geeigneter Granularität aggregieren · Zwischen- und Endergebnisse mit Kontrollsummen vergleichen
- Schritt 1: Dateidaten mit Referenz- oder Stammdaten verbinden
- Schritt 2: Partitionierung und Join-Strategie auf Datenverteilung abstimmen
- Schritt 3: Kennzahlen auf geeigneter Granularität aggregieren
- Schritt 4: Zwischen- und Endergebnisse mit Kontrollsummen vergleichen
Praxis: Ereignisdaten mit Geräteinformationen anreichern und tagesweise verdichten
Modul 8: Bereitstellung für Datasphere-Modelle
Inhaltsverzeichnis: kuratierte Dateien als konsumierbare Datenbasis registrieren · Schema, Schlüssel und Semantik für nachgelagerte Modelle ergänzen · relationale und analytische Zugriffspfade nach Nutzung auswählen · Lineage und Datenproduktbeschreibung vervollständigen
- Schritt 1: kuratierte Dateien als konsumierbare Datenbasis registrieren
- Schritt 2: Schema, Schlüssel und Semantik für nachgelagerte Modelle ergänzen
- Schritt 3: relationale und analytische Zugriffspfade nach Nutzung auswählen
- Schritt 4: Lineage und Datenproduktbeschreibung vervollständigen
Praxis: Einen kuratierten Dateibestand für ein analytisches Modell bereitstellen
Modul 9: Performance und Betrieb
Inhaltsverzeichnis: kleine Dateien, Datenverteilung und unnötige Scans als Kostentreiber erkennen · Partitionierung und Dateigröße anhand von Messwerten optimieren · Läufe, Datenmengen und Fehler automatisiert überwachen · Aufbewahrung, Bereinigung und Wiederanlauf im Runbook dokumentieren
- Schritt 1: kleine Dateien, Datenverteilung und unnötige Scans als Kostentreiber erkennen
- Schritt 2: Partitionierung und Dateigröße anhand von Messwerten optimieren
- Schritt 3: Läufe, Datenmengen und Fehler automatisiert überwachen
- Schritt 4: Aufbewahrung, Bereinigung und Wiederanlauf im Runbook dokumentieren
Praxis: Eine langsame Verarbeitung analysieren und mit geänderter Ablagestruktur verbessern
Praxisübungen
Inhaltsverzeichnis: File-Space- und Datenzonenmodell mit Zugriffsregeln erstellen · Dateilieferung validieren und Spark-basiert bereinigen sowie anreichern · Kuratierten Bestand für Modellierung, Katalog und Betrieb bereitstellen
- File-Space- und Datenzonenmodell mit Zugriffsregeln erstellen
- Dateilieferung validieren und Spark-basiert bereinigen sowie anreichern
- Kuratierten Bestand für Modellierung, Katalog und Betrieb bereitstellen
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineers, Datenplattform-Architekten, Datasphere-Entwickler, Cloud-Spezialisten und technische Administratoren |
| Voraussetzungen: | Grundkenntnisse zu Datenintegration, Dateiformaten und Datenmodellierung; erste Erfahrungen mit verteilten Datenverarbeitungsprinzipien sind hilfreich |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
