Seminarüberblick
Dateibasierte Datenprodukte benötigen mehr als einen Ablageort. Verzeichnisstruktur, Format, Schema, Zeichencodierung, Benennung, Teilung und Prüfbarkeit werden so vorbereitet, dass automatisierte Aufnahme und wiederholbare Bereitstellung zuverlässig funktionieren.
Inhaltsübersicht
- Zielsetzung
- Zielgruppe und Voraussetzungen
- Seminarinhalte
- Praxisübungen
- Arbeitsweise
Zielsetzung
Ein dateibasiertes Datenprodukt wird nach verbindlichen Readiness-Regeln vorbereitet, validiert und für die technische Anbindung dokumentiert.
Zielgruppe und Voraussetzungen
Zielgruppe: Data Engineers, Datenlieferanten, Plattformbetrieb, Data Product Owner, Integrationsverantwortliche und Qualitätssicherung
Voraussetzungen: Grundkenntnisse zu CSV oder Parquet sowie zu mindestens einem Objektspeicher oder SFTP; Beispiel- oder Testdateien sollten verfügbar sein.
Seminarinhalte
1. Produktordner und Benennung standardisieren
- Schritt 1: Pro Datenprodukt einen eindeutig abgegrenzten Ablagebereich festlegen.
- Schritt 2: Ordner, Dateien und Zeitbezug nach einer stabilen Konvention benennen.
- Schritt 3: Temporäre, technische und freizugebende Dateien trennen.
- Schritt 4: Beispielstruktur gegen den automatisierten Aufnahmeprozess prüfen.
2. Format und Schema vorbereiten
- Schritt 1: CSV und Parquet anhand Volumen, Typinformation und Verbrauchersystem auswählen.
- Schritt 2: Spaltennamen, Datentypen und Reihenfolge verbindlich definieren.
- Schritt 3: Schemaänderungen in kompatible und brechende Änderungen einteilen.
- Schritt 4: Datenwörterbuch und Beispielwerte ergänzen.
3. CSV-Dateien robust gestalten
- Schritt 1: UTF-8, Trennzeichen, Dezimalzeichen und Zeilenende verbindlich festlegen.
- Schritt 2: Kopfzeile, Anführungszeichen und Escape-Regeln kontrollieren.
- Schritt 3: Leere Werte von echten Nullwerten unterscheiden.
- Schritt 4: Datei mit Positiv- und Negativfällen validieren.
4. Große Dateien und Lieferpakete planen
- Schritt 1: Dateigröße und Verarbeitungslimit der beteiligten Systeme erfassen.
- Schritt 2: Große Bestände nach fachlich stabilen Schlüsseln partitionieren.
- Schritt 3: Kompression und Entpackbarkeit im Zielprozess testen.
- Schritt 4: Vollbestand, Delta und Korrekturlieferung eindeutig kennzeichnen.
5. Readiness-Prüfung automatisieren
- Schritt 1: Pflichtdateien, Schema, Encoding, Größe und Namensmuster als Prüfregeln formulieren.
- Schritt 2: Prüfungen vor Freigabe oder Upload ausführen.
- Schritt 3: Fehler mit Datei, Regel und Korrekturhinweis protokollieren.
- Schritt 4: Freigabe erst nach vollständiger Wiederholungsprüfung erteilen.
6. S3, SFTP, Blob und GCS anbinden
- Schritt 1: Endpunkt, Pfad, Berechtigung und Netzwerkzugang je Zieltyp erfassen.
- Schritt 2: Minimal erforderliche Lese- oder Schreibrechte konfigurieren.
- Schritt 3: Testdatei übertragen und Integrität prüfen.
- Schritt 4: Betriebsübergabe mit Kontakt-, Fehler- und Rotationsverfahren dokumentieren.
Praxisübungen
- Eine fehlerhafte CSV-Datei systematisch prüfen und korrigieren.
- Eine produktfähige Ordner- und Dateinamenskonvention entwickeln.
- Eine Readiness-Checkliste mit automatisierbaren Prüfkriterien erstellen.
Arbeitsweise
Fachliche Einordnung, Demonstrationen, geführte Schritt-für-Schritt-Arbeit, Fallanalysen und kontrollierte Prüfungen werden verbunden. Jede Konfiguration wird mit einem erwarteten Ergebnis, einem Negativfall und einer dokumentierten Nachkontrolle abgeschlossen.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 1 Tag ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 599 zzgl. MwSt. Inhaus: € 1.700 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineers, Datenlieferanten, Plattformbetrieb, Data Product Owner, Integrationsverantwortliche und Qualitätssicherung |
| Voraussetzungen: | Grundkenntnisse zu CSV oder Parquet sowie zu mindestens einem Objektspeicher oder SFTP; Beispiel- oder Testdateien sollten verfügbar sein. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Fachvortrag, Demonstrationen, geführte Schritt-für-Schritt-Übungen, Fallanalysen und praktische Arbeit am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
