Seminar / Training
Gleiche reale Objekte erscheinen in Quellsystemen häufig mit abweichenden Namen, Schreibweisen, Kennungen oder Adressen. Ohne kontrollierte Verknüpfung entstehen getrennte Ressourcen, doppelte Kennzahlen und widersprüchliche Sichten.
Das Seminar behandelt regelbasiertes Linking und die unterstützte Ableitung von Regeln durch Active Learning. Vergleichspfade, Transformatoren, Distanzmaße, Gewichtung, Schwellenwerte und fachliche Bewertung werden zu einem nachvollziehbaren Matchingprozess verbunden.
Inhaltsübersicht
- Seminarziel
- Zielgruppe
- Voraussetzungen
- Seminarinhalte
- Schritt 1: Matchingproblem und Goldstandard
- Schritt 2: Quell- und Zielpfade vorbereiten
- Schritt 3: Distanzmaße und Transformatoren
- Schritt 4: Aggregation, Gewichtung und Schwellenwerte
- Schritt 5: Linking-Aufgabe ausführen und prüfen
- Schritt 6: Active Learning einsetzen
- Schritt 7: Veröffentlichung und Governance
- Praxisübungen
- Arbeitsweise
Seminarziel
- Matchingfälle analysieren und geeignete Vergleichsmerkmale auswählen
- Linking-Regeln mit Transformatoren, Distanzmaßen und Aggregation erstellen
- Schwellenwerte anhand von Qualitätskennzahlen kalibrieren
- Active Learning kontrolliert für neue und verbesserte Regeln einsetzen
Zielgruppe
Data Engineers, MDM-Spezialisten, Data Stewards, Knowledge-Graph-Entwickler und Fachverantwortliche für Dublettenprüfung oder Stammdatenabgleich.
Voraussetzungen
Grundkenntnisse in Build, Datenprofiling und RDF. Für Active Learning ist die fachliche Beurteilung von Match- und Nicht-Match-Beispielen erforderlich.
Seminarinhalte
Schritt 1: Matchingproblem und Goldstandard
Der fachliche Begriff der Identität wird präzisiert. Positive, negative und unklare Beispiele bilden einen Goldstandard, an dem Regeln später gemessen werden.
- Identitätskriterien
- Trainings-, Test- und Prüfmenge
- unklare Fälle und Eskalation
Schritt 2: Quell- und Zielpfade vorbereiten
Vergleichsmerkmale werden aus beiden Datasets ausgewählt und auf vergleichbare Repräsentationen gebracht. Fehlende Werte, Listen und zusammengesetzte Merkmale werden berücksichtigt.
- Property Paths
- Normalisierung und Tokenisierung
- fehlende und mehrwertige Felder
Schritt 3: Distanzmaße und Transformatoren
Zeichenketten-, numerische, zeitliche und geografische Vergleiche werden passend zum Merkmal eingesetzt. Vorverarbeitung und Distanzmaß werden als gemeinsame Regel betrachtet.
- Levenshtein, Jaro und Tokenmaße
- numerische und Datumsvergleiche
- geografische Distanz
Schritt 4: Aggregation, Gewichtung und Schwellenwerte
Einzelbewertungen werden zu einem Gesamtscore verbunden. Gewichtung und Entscheidungsschwellen werden mit Präzision, Trefferquote und den Kosten falscher Zuordnungen abgestimmt.
- gewichtete Aggregation
- Accept- und Verify-Schwellen
- Precision, Recall und F-Maß
Schritt 5: Linking-Aufgabe ausführen und prüfen
Die Regel wird auf realen Daten ausgeführt. Ergebnisstichproben, Verteilungsanalyse und Grenzfälle zeigen, an welchen Stellen die Regel nachgeschärft werden muss.
- Ausführungsbericht
- Scoreverteilung
- Fehleranalyse nach Merkmal
Schritt 6: Active Learning einsetzen
Das System schlägt informative Kandidaten zur Bewertung vor. Fachliche Labels werden in mehreren Runden genutzt, um Regeln zu erzeugen oder zu verfeinern, ohne die Entscheidungshoheit abzugeben.
- interaktive Labelrunden
- Regelvorschläge und Bewertung
- Abbruch- und Qualitätskriterien
Schritt 7: Veröffentlichung und Governance
Geprüfte Regeln werden versioniert, dokumentiert und mit Freigabestatus versehen. Linkprädikat, Provenienz, Ausnahmen und erneute Ausführung werden in den Datenprozess integriert.
- Linkprädikate und Ergebnisgraphen
- Versionierung und Freigabe
- Provenienz und manuelle Ausnahmen
Praxisübungen
- Aufbau einer Linking-Regel für abweichende Personen- oder Organisationsdaten
- Kalibrierung von Gewichten und Schwellenwerten anhand einer Testmenge
- Durchführung einer Active-Learning-Runde mit fachlicher Bewertung und Regelvergleich
Arbeitsweise
Die Themen werden in aufeinander aufbauenden Arbeitsschritten vermittelt. Fachliche Einordnung, Demonstration, angeleitete Konfiguration und selbstständige Übungen wechseln sich ab. Jeder größere Arbeitsschritt wird mit einer Prüfung des erzeugten Ergebnisses und einer kurzen technischen Dokumentation abgeschlossen.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, 2. Tag: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Data Engineers, MDM-Spezialisten, Data Stewards, Knowledge-Graph-Entwickler und Fachverantwortliche für Dublettenprüfung oder Stammdatenabgleich. |
| Voraussetzungen: | Grundkenntnisse in Build, Datenprofiling und RDF. Für Active Learning ist die fachliche Beurteilung von Match- und Nicht-Match-Beispielen erforderlich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
