Das Intensivformat bündelt die Kerninhalte aller Spezialseminare zu einem durchgängigen Data-Quality-Engineering-Programm. Die Lernstrecke führt von lokaler Contract-Entwicklung über Cloud-Zusammenarbeit und Observability bis zu Runner-Betrieb, Diagnose und Governance.
Die maximale Dauer von fünf Tagen wird durch konsequente Integration der Themen eingehalten. Detailvarianten einzelner Spezialseminare werden zugunsten eines gemeinsamen End-to-End-Systems verdichtet, ohne die produktionsrelevanten Kontrollschritte auszulassen.
Lernziele
- eine vollständige Soda-Architektur von Datenquelle bis Governance aufbauen
- Data Contracts lokal entwickeln, automatisieren und in Soda Cloud betreiben
- Observability, Alerts, Incidents und Diagnostics in einen Betriebsprozess integrieren
- Runner, Sicherheit, APIs und Migration als kontrollierte Plattformaufgaben umsetzen
Inhaltsübersicht
- Tag 1: Architektur, Arbeitsumgebung und Datenquelle
- Tag 1: Data Contract von Grund auf erstellen
- Tag 2: Advanced Checks, Reconciliation und Failed Rows
- Tag 2: Python, CI/CD und Orchestrierung
- Tag 3: Cloud-Onboarding und Vertragszusammenarbeit
- Tag 3: Observability und Metric Monitoring
- Tag 4: Incidents, Rollen, Sicherheit und Datenschutz
- Tag 4: Soda Runner bereitstellen und betreiben
- Tag 5: APIs, Integrationen und Diagnostics Warehouse
- Tag 5: Governance, Migration und Gesamtübung
Seminarinhalte
1. Tag 1: Architektur, Arbeitsumgebung und Datenquelle
- Schritt 1: Zielbild, Rollen, Ausführungsorte und Datenflüsse für ein Beispielprodukt festlegen.
- Schritt 2: Soda Core und passendes Datenquellenpaket in einer isolierten Umgebung installieren.
- Schritt 3: Datenquelle und optionale Cloud-Verbindung mit minimalen Rechten konfigurieren.
- Schritt 4: Verbindung, Secrets und Laborstruktur mit Smoke-Tests abnehmen.
2. Tag 1: Data Contract von Grund auf erstellen
- Schritt 1: Dataset-Identität, Schema und kritische Qualitätsdimensionen definieren.
- Schritt 2: Dataset- und Spaltenchecks mit Schwellenwerten in YAML modellieren.
- Schritt 3: Vertrag syntaktisch testen und gegen gute sowie fehlerhafte Daten verifizieren.
- Schritt 4: Ergebnisse, Exitcodes und Diagnosehinweise auswerten.
3. Tag 2: Advanced Checks, Reconciliation und Failed Rows
- Schritt 1: Fachliche SQL-Metriken und benannte Custom Checks entwickeln.
- Schritt 2: Quell-Ziel-Abgleich mit Schlüsseln, Toleranzen und Normalisierung konfigurieren.
- Schritt 3: Differenzen und Failed Rows datenschutzgerecht untersuchen.
- Schritt 4: Performance, Teilprüfungen und Fehlerdiagnose optimieren.
4. Tag 2: Python, CI/CD und Orchestrierung
- Schritt 1: Verifikation über Python API kapseln und testen.
- Schritt 2: Pull-Request- und Produktions-Quality-Gates mit klaren Exitcodes implementieren.
- Schritt 3: Partitionen, Variablen, Check-Filter und Secret-Bereitstellung integrieren.
- Schritt 4: Retry, Quarantäne und Ergebnisveröffentlichung abnehmen.
5. Tag 3: Cloud-Onboarding und Vertragszusammenarbeit
- Schritt 1: Dataset inventarisieren, entdecken, klassifizieren und einem Owner zuweisen.
- Schritt 2: Vertrag in Soda Cloud veröffentlichen oder cloud-verwaltet weiterführen.
- Schritt 3: Verifikationszeitplan, Verantwortlichkeiten und Freigaben festlegen.
- Schritt 4: Änderungsanfrage und Vorschlag im Collaboration-Prozess bearbeiten.
6. Tag 3: Observability und Metric Monitoring
- Schritt 1: Monitore für Zeilenzahl, Freshness, Schema, Partition und Spaltenmetriken einrichten.
- Schritt 2: Baselines und erwartete Bereiche anhand historischer Daten beurteilen.
- Schritt 3: Anomalien kontrolliert erzeugen und Alarmregeln tunen.
- Schritt 4: Triage und Dashboard-Kennzahlen für den Betrieb definieren.
7. Tag 4: Incidents, Rollen, Sicherheit und Datenschutz
- Schritt 1: Alert-Routing, Schweregrade und Incident-Lebenszyklus konfigurieren.
- Schritt 2: Globale Rollen, Gruppen und Dataset-Verantwortlichkeiten prüfen.
- Schritt 3: API-Schlüssel, technische Konten und Secret-Rotation organisieren.
- Schritt 4: Failed-Row-Schutz, Audit und Offboarding als Runbook dokumentieren.
8. Tag 4: Soda Runner bereitstellen und betreiben
- Schritt 1: Kubernetes-, Netzwerk- und Identitätsvoraussetzungen prüfen.
- Schritt 2: Runner mit kontrollierter Konfiguration und externen Secrets bereitstellen.
- Schritt 3: Datenquellenzugriff, Jobausführung, Logs und Skalierung testen.
- Schritt 4: Upgrade, Wiederanlauf und Störungsszenario durchführen.
9. Tag 5: APIs, Integrationen und Diagnostics Warehouse
- Schritt 1: REST-, Webhook-, CLI- und Python-Schnittstellen nach Anwendungsfall kombinieren.
- Schritt 2: Alert oder Incident mit Deduplizierung an ein Zielsystem übergeben.
- Schritt 3: Scan- und Fehlerdaten im Diagnostics Warehouse analysieren.
- Schritt 4: Historischen Bericht und technische Betriebsmetriken erstellen.
10. Tag 5: Governance, Migration und Gesamtübung
- Schritt 1: Data Standard, Verantwortlichkeiten und Freigaberegeln für mehrere Datasets definieren.
- Schritt 2: v3-Artefakte inventarisieren und einen kontrollierten v4-Migrationspfad planen.
- Schritt 3: End-to-End-Fehler von Contract über Monitor und Incident bis Diagnose beheben.
- Schritt 4: Abnahme, Betriebsübergabe und priorisierte Weiterentwicklung dokumentieren.
Praxislabor
Über fünf Tage entsteht eine integrierte Soda-Laborplattform mit Data Contract, CI/CD-Gate, Cloud-Workflow, Observability, Incident, Runner-Ausführung, Diagnoseablage und Governance. Die Abschlussübung kombiniert fachlichen Datenfehler, technische Störung und kontrollierte Wiederherstellung.
Zielgruppe und Voraussetzungen
Zielgruppe: Data Quality Engineering, Data Engineering, Analytics Engineering, Platform Engineering, DevOps, Data Governance und technische Datenproduktverantwortung.
Voraussetzungen: Gute SQL-, YAML- und Kommandozeilenkenntnisse; Python- und Datenplattformerfahrung; Grundverständnis von CI/CD und Kubernetes ist für die Betriebsanteile hilfreich.
Didaktik und Arbeitsweise
Kurze Fachimpulse werden unmittelbar durch Demonstrationen, strukturierte Konfigurationsschritte, Praxisübungen und kontrollierte Fehlerfälle vertieft. Jede Übung verwendet definierte Ausgangswerte, Prüfpunkte und Dokumentationsanforderungen, damit die erarbeiteten Abläufe als Betriebsstandard wiederholbar bleiben.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 5 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 2.995 zzgl. MwSt. Inhaus: € 8.500 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Quality Engineering, Data Engineering, Analytics Engineering, Platform Engineering, DevOps, Data Governance und technische Datenproduktverantwortung |
| Voraussetzungen: | Gute SQL-, YAML- und Kommandozeilenkenntnisse; Python- und Datenplattformerfahrung; Grundverständnis von CI/CD und Kubernetes ist für die Betriebsanteile hilfreich |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
