Ein leistungsfähiges ClickHouse-System beginnt mit einem Datenmodell, das Filter, Aggregationen, Datenaufnahme und Lebenszyklus gemeinsam berücksichtigt. Der Kurs leitet aus realen Abfragemustern geeignete Tabellen, Datentypen, Sortierschlüssel und Partitionen ab.
Die Modellentscheidungen werden nicht nur erklärt, sondern durch Messungen geprüft. Varianten werden mit identischen Datenmengen geladen, profiliert und hinsichtlich Scanmenge, Kompression, Merge-Verhalten und Wartungsaufwand verglichen.
Inhaltsübersicht
- Zielsetzung und Abgrenzung
- Tag 1: Anforderungen, Datentypen und logisches Modell
- Tag 2: MergeTree-Familie, Sortierschlüssel und Partitionierung
- Tag 3: Datenlebenszyklus, Änderungen und Modellabnahme
- Praxisaufgaben und Prüfpunkte
- Zielgruppe und Voraussetzungen
- Didaktik und Arbeitsweise
Zielsetzung und Abgrenzung
- Analytische Anforderungen in belastbare Tabellen- und Datenverträge übersetzen.
- MergeTree-Varianten passend zu Änderungs-, Deduplizierungs- und Aggregationsanforderungen auswählen.
- ORDER BY, Primärindex und Partitionierung aus konkreten Zugriffsmustern ableiten.
- Datentypen, Kompression, TTL und Datenlebenszyklus aufeinander abstimmen.
- Modelle mit reproduzierbaren Lade-, Abfrage- und Wartungstests abnehmen.
Didaktische Bemessung: Drei Tage sind notwendig, weil Anforderungsanalyse, physisches Modell und Lebenszyklus getrennte Entwurfs- und Messphasen bilden. Nur so können mehrere Modellvarianten geladen, verglichen und unter realistischen Merge- und Abfragebedingungen bewertet werden.
Seminarinhalte
Tag 1: Anforderungen, Datentypen und logisches Modell
- Schritt 1: Fachliche Ereignisse, Dimensionen, Kennzahlen, Granularität und historische Anforderungen erfassen.
- Schritt 2: Repräsentative Filter, Gruppierungen, Zeiträume, Joins und Aktualisierungswege als Abfragematrix dokumentieren.
- Schritt 3: Rohdaten auf Kardinalität, Nullwerte, Wertebereiche, Zeichenkodierung und zeitliche Qualität untersuchen.
- Schritt 4: Datentypen für Zahlen, Zeitpunkte, Zeichenketten, Enums, LowCardinality, Arrays und Nullable bewusst auswählen.
- Schritt 5: Denormalisierung, vorberechnete Attribute und Referenzdaten anhand von Änderungsfrequenz und Abfragekosten abwägen.
- Schritt 6: Ein logisches Modell mit Primärereignis, Dimensionen, Versionierung und Datenvertrag erstellen.
- Schritt 7: Testdaten mit typischen und extremen Verteilungen erzeugen und als gemeinsame Vergleichsbasis festlegen.
- Schritt 8: Abnahmekriterien für Ladegeschwindigkeit, Kompression, Scanmenge und Antwortzeit definieren.
Tag 2: MergeTree-Familie, Sortierschlüssel und Partitionierung
- Schritt 1: MergeTree-Grundprinzip, Datenparts, Granules, Sparse Index und Hintergrund-Merges anhand von Systemtabellen nachvollziehen.
- Schritt 2: Mehrere ORDER-BY-Varianten aus der Abfragematrix ableiten und ihre Präfixwirkung begründen.
- Schritt 3: Primärindex und Sortierschlüssel bewusst gleich oder unterschiedlich gestalten und die Auswirkungen messen.
- Schritt 4: Partitionierung ausschließlich für Lebenszyklus, Verwaltung und grobe Datenausscheidung dimensionieren.
- Schritt 5: Replacing-, Summing- und Aggregating-Muster anhand klarer Daten- und Abfrageanforderungen vergleichen.
- Schritt 6: Identische Daten in Modellvarianten laden und gelesene Granules, Bytes, Laufzeit und Kompression erfassen.
- Schritt 7: Ungünstige Schlüssel, zu feine Partitionen und schiefe Datenverteilungen gezielt erzeugen und diagnostizieren.
- Schritt 8: Eine Modellentscheidung mit Messwerten, Risiken und erwarteter Datenentwicklung dokumentieren.
Tag 3: Datenlebenszyklus, Änderungen und Modellabnahme
- Schritt 1: TTL-Regeln für Löschen, Verschieben und Verdichten aus Aufbewahrungs- und Kostenanforderungen ableiten.
- Schritt 2: Deduplizierung, Versionierung und verspätete Ereignisse in einen idempotenten Ladeprozess integrieren.
- Schritt 3: Mutationen und großflächige Änderungen nach Aufwand, Sperrwirkung und Alternativen bewerten.
- Schritt 4: Backfill- und Rebuild-Verfahren mit temporären Tabellen, kontrolliertem Austausch und Validierung planen.
- Schritt 5: Datenqualität durch Eindeutigkeit, Summen, Zeitreihen, Stichproben und fachliche Kontrollabfragen prüfen.
- Schritt 6: Merge-Verhalten, Part-Anzahl, Speicherbelegung und Abfrageleistung unter zusätzlicher Last beobachten.
- Schritt 7: Ein Schemaänderungsverfahren mit Kompatibilitätsprüfung, Rolloutstufen und Rückfalloption erstellen.
- Schritt 8: Das Modell gegen die ursprüngliche Abfragematrix testen und eine formale technische Abnahme durchführen.
Praxisaufgaben und Prüfpunkte
Praxisaufgaben
- Entwurf einer Abfragematrix und eines logischen Ereignismodells
- Vergleich mehrerer ORDER-BY- und Partitionsvarianten mit Messwerten
- Auswahl und Test einer geeigneten MergeTree-Variante
- Einrichtung von TTL, Deduplizierung und kontrolliertem Backfill
Prüfpunkte
- Schlüssel und Partitionen sind aus Zugriffsmustern und Lebenszyklus begründet.
- Datentypen und Kompression passen zu Wertebereich, Kardinalität und Rechenbedarf.
- Modellvarianten wurden mit identischen Daten und nachvollziehbaren Kennzahlen verglichen.
- Backfill, Schemaänderung und Datenqualitätsprüfung sind dokumentiert und wiederholbar.
Zielgruppe und Voraussetzungen
Zielgruppe: Data Engineering, Analytics Engineering, Datenarchitektur, Datenbankentwicklung, Plattformteams und technische Fachverantwortung
Voraussetzungen: Gute SQL-Kenntnisse, Verständnis relationaler und analytischer Datenmodelle sowie grundlegende ClickHouse-Erfahrung
Didaktik und Arbeitsweise
Kurze Fachimpulse werden unmittelbar durch Demonstrationen, klar nummerierte Arbeitsschritte, praktische Übungen und kontrollierte Fehlerfälle vertieft. Für jede Aufgabe werden Ausgangszustand, erwartetes Ergebnis, technische Prüfabfrage und Rückfallweg dokumentiert. Dadurch lassen sich die erarbeiteten Verfahren als wiederholbare Entwicklungs- oder Betriebsstandards übernehmen.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineering, Analytics Engineering, Datenarchitektur, Datenbankentwicklung, Plattformteams und technische Fachverantwortung |
| Voraussetzungen: | Gute SQL-Kenntnisse, Verständnis relationaler und analytischer Datenmodelle sowie grundlegende ClickHouse-Erfahrung |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
