Seminar / Training
Pandas-DataFrames eignen sich für Exploration, Notebook-Arbeit, Tests und kleinere Datenpipelines. Das Seminar zeigt den direkten GX-Core-Zugriff auf In-Memory-Daten, die Organisation mehrerer Pipeline-Stufen als Data Assets und den vollständigen Validierungsablauf bis zum Checkpoint.
Inhaltsübersicht
- Zielsetzung und fachliche Einordnung
- Schrittweise Seminarinhalte
- Praxisübungen und Laborszenarien
- Zielgruppe und Voraussetzungen
- Didaktik und Arbeitsweise
Zielsetzung
- Pandas Data Source, Data Asset und Batch Definition korrekt einrichten.
- DataFrames kontrolliert an GX Core übergeben und mehreren Pipeline-Stufen zuordnen.
- Geeignete Expectations für Struktur, Werte, Nullwerte und Beziehungen auswählen.
- Validation Results und unerwartete Werte für Fehleranalyse nutzen.
- DataFrame-Validierung in Funktionen, Notebooks und Tests wiederverwendbar integrieren.
Zielgruppe
Python-Entwickler, Data Analysts, Analytics Engineers, Data Scientists und Data Engineers, die pandas-Daten mit GX Core prüfen.
Voraussetzungen
Praktische Python- und pandas-Kenntnisse. Vorkenntnisse in GX Core sind nicht erforderlich; ein vorbereiteter Data Context steht zur Verfügung.
Seminarinhalte
- Schritt 1: Pandas-Einsatzmuster abgrenzen
Exploration, Unit Test, Notebook, Batch-Skript und kleine Pipeline werden hinsichtlich Persistenz, Datenvolumen und Reproduzierbarkeit unterschieden.
- Schritt 2: Pandas Data Source registrieren
Eine benannte Data Source wird im Data Context angelegt und für mehrere Data Assets wiederverwendet.
- Schritt 3: Data Assets nach Pipeline-Stufe modellieren
Rohdaten, bereinigte Daten und Ausgabedaten erhalten getrennte Assets, damit Ergebnisse eindeutig gruppiert werden.
- Schritt 4: Batch Definition erstellen
Der vollständige In-Memory-DataFrame wird als Batch bereitgestellt. Laufzeitübergabe und leere DataFrames werden behandelt.
- Schritt 5: Struktur und Datentypen prüfen
Spaltenbestand, Reihenfolge, Zeilenanzahl und geeignete Typprüfungen werden vor inhaltlichen Regeln eingesetzt.
- Schritt 6: Werte und Nullsemantik validieren
Wertemengen, Bereiche, Muster, Eindeutigkeit, leere Zeichenketten und Nullwerte werden fachlich differenziert geprüft.
- Schritt 7: Beziehungen und berechnete Logik kontrollieren
Spaltenpaare, Summenbeziehungen und bedingte Regeln werden mit Standardmitteln oder vorbereiteten Hilfsspalten umgesetzt.
- Schritt 8: Validation Results analysieren
Statistik, observed values, unerwartete Werte und Indizes werden zur gezielten Fehlerlokalisierung verwendet.
- Schritt 9: Integration in Python-Code absichern
Validierungsfunktion, Checkpoint-Aufruf, Exception-Behandlung und Rückgabestatus werden für Skript, Notebook und automatisierten Test gestaltet.
- Schritt 10: Grenzen und Übergang zu Spark oder SQL erkennen
Speicherbedarf, Datenvolumen, Parallelität und Pushdown-Fähigkeit bestimmen, wann eine andere Execution Engine geeigneter ist.
Praxisübungen
- Pandas Data Source und drei Assets für Pipeline-Stufen anlegen.
- DataFrame mit Struktur-, Werte- und Beziehungsregeln validieren.
- Leeren und schemafehlerhaften DataFrame kontrolliert behandeln.
- Unerwartete Werte und Indizes für eine Fehleranalyse ausgeben.
- Validierung als wiederverwendbare Python-Funktion und automatisierten Test einbauen.
Methodik
Die Übungen arbeiten direkt mit DataFrames und kurzen Python-Funktionen. Jede Regel wird an positiven und negativen Beispielen geprüft; Notebook-Komfort und reproduzierbarer Produktionscode werden bewusst voneinander getrennt.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 1 Tag ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 599 zzgl. MwSt. Inhaus: € 1.700 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Python-Entwickler, Data Analysts, Analytics Engineers, Data Scientists und Data Engineers, die pandas-Daten mit GX Core prüfen. |
| Voraussetzungen: | Praktische Python- und pandas-Kenntnisse. Vorkenntnisse in GX Core sind nicht erforderlich; ein vorbereiteter Data Context steht zur Verfügung. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, strukturierte Schritt-für-Schritt-Übungen und praktische Laboraufgaben am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
