Seminar OpenEuroLLM: Datenaufbereitung und mehrsprachige Trainingskorpora

Die Qualität eines Sprachmodells beginnt bei den Daten. Dieses Seminar vermittelt einen nachvollziehbaren Prozess für die Auswahl, Prüfung und Aufbereitung mehrsprachiger Textbestände im OpenEuroLLM-Umfeld. Untersucht werden sowohl Material für weitere Trainingsschritte als auch Instruktionsbeispiele und getrennte Bestände für die spätere Bewertung.

An einem überschaubaren Übungskorpus werden Herkunft, Nutzungsbedingungen, Sprachmerkmale und technische Qualität gemeinsam betrachtet. Die Pipeline wird schrittweise aufgebaut und nach jeder Stufe anhand von Stichproben überprüft. Besonderes Gewicht erhält die Frage, ob automatische Filter einzelne Sprachen, Textsorten oder Schreibweisen unverhältnismäßig stark entfernen.

Der OpenEuroLLM-Trainingsdatenkatalog unterstützt die fachliche Orientierung; ein Katalogeintrag ersetzt die Prüfung des tatsächlich verwendeten Datensatzes nicht. Verarbeitet werden freigegebene oder synthetische Übungen. Das vollständige Sammeln großer Webkorpora und das Vortraining eines Foundation Models gehören nicht zum Umfang dieses Seminars.

Lernziele

  • Daten für Vortraining, Instruktionsanpassung und Evaluation anhand ihres Zwecks unterscheiden.
  • Eine versionierte Verarbeitungskette für einen mehrsprachigen Übungskorpus aufbauen.
  • Dubletten, Datenleckagen und unausgewogene Sprachanteile systematisch untersuchen.
  • Qualitätsentscheidungen, Nutzungsbedingungen und verbleibende Unsicherheiten nachvollziehbar dokumentieren.

Inhaltsverzeichnis

  1. Datenarten und Auswahlkriterien
  2. Herkunft und überprüfbare Datenstände
  3. Bereinigung und Sprachbestimmung
  4. Deduplizierung und Datensplits
  5. Tokenisierung und mehrsprachige Mischungen
  6. Freigabe und reproduzierbare Verarbeitung

Seminarinhalte

Datenarten und Auswahlkriterien

  • Textkorpora, Dialogdaten, Präferenzdaten und Benchmarks hinsichtlich Struktur und Verwendungszweck unterscheiden.
  • Den OpenEuroLLM-Datenkatalog nach Sprache, Herkunft und vorgesehenem Trainingsschritt auswerten.
  • Eine Auswahlmatrix mit Qualitätskriterien, Nutzungsbedingungen und Ausschlussgründen anlegen.

Herkunft und überprüfbare Datenstände

  • Datensatzversion, Bezugsstand, ursprüngliche Kennungen und Bearbeitungsschritte in Metadaten festhalten.
  • Bedingungen für Daten, Modellgewichte und Verarbeitungscode getrennt erfassen.
  • Datenübernahme, Freigabe und spätere Löschbarkeit bereits im Verarbeitungskonzept berücksichtigen.

Bereinigung und Sprachbestimmung

  • Zeichencodierung, Normalisierung, leere Texte und wiederkehrende Navigationsbestandteile behandeln.
  • Sprachen und gemischte Texte mit automatischen Verfahren markieren und durch Stichproben überprüfen.
  • Qualitätsfilter gegen fachlich relevante Kurztexte, Minderheitensprachen und besondere Schreibweisen testen.

Deduplizierung und Datensplits

  • Exakte Dubletten und ähnliche Dokumente erkennen und die Auswirkungen verschiedener Schwellen untersuchen.
  • Trainings-, Validierungs- und Testdaten auf Dokument- oder Gruppenebene trennen.
  • Übersetzungen, Dokumentversionen und Antwortvorlagen als mögliche Verbindung zwischen den Splits prüfen.

Tokenisierung und mehrsprachige Mischungen

  • Zeichen-, Dokument- und Tokenanteile voneinander unterscheiden und mit einem festgelegten Tokenizer messen.
  • Längenverteilungen und überlange Beispiele prüfen; Kürzung und Segmentierung anhand des Lernziels auswählen.
  • Sprachmischungen definieren, kleine Sprachbestände bewusst berücksichtigen und Qualitätsverluste sichtbar machen.

Freigabe und reproduzierbare Verarbeitung

  • Eine Datenbeschreibung mit vorgesehenem Zweck, bekannten Grenzen und zulässiger Weitergabe erstellen.
  • Konfiguration, Zufallsstartwerte, Protokolle und Zählstände jeder Pipeline-Stufe sichern.
  • Einen identischen Verarbeitungslauf wiederholen und unerwartete Abweichungen untersuchen.

Praktische Übungen

  1. Einen mehrsprachigen Übungskorpus inventarisieren und die Herkunft jedes Teilbestands erfassen.
  2. Eine Bereinigungspipeline aufbauen und verworfene Beispiele in einer Stichprobe fachlich prüfen.
  3. Dubletten einschließlich sprachübergreifender Dokumentvarianten markieren und bereinigte Splits erzeugen.
  4. Tokenanteile pro Sprache ermitteln und zwei Datenmischungen mit unterschiedlichen Gewichtungen vergleichen.
  5. Die freigegebene Version samt Datenbeschreibung exportieren und den Lauf aus der gespeicherten Konfiguration wiederholen.

Schulungsumgebung

Der Kunde stellt eine Python-Arbeitsumgebung mit ausreichend Speicherplatz für den abgestimmten Übungskorpus. Die Basisübungen benötigen keine GPU. Datensätze und benötigte Tokenizer werden vorab bereitgestellt; produktive personenbezogene Daten sind für die Übungen nicht erforderlich.

Fachliche Ansprechpartner

Seminardetails

Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Data Engineers, Data Scientists, NLP-Entwickler und technische Verantwortliche für unternehmensinterne Trainings- und Evaluationsdaten.
Voraussetzungen: Python-Grundkenntnisse, sicherer Umgang mit JSONL oder vergleichbaren Datenformaten sowie Grundverständnis von Sprachmodellen. Kenntnisse aus dem Grundlagenseminar werden empfohlen.
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Schulungsumgebung: Wird vom Kunden gestellt und vorab technisch abgestimmt
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Stream gespeichert 3 Tage
Innsbruck 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Stream live 3 Tage
Inhaus / Firmenseminar 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.at All rights reserved.  | Kontakt | Impressum | Cookie-Einstellungen | Nach oben