Seminar Continued Pretraining und Tokenizer-Anpassung für domänenspezifische Sprachmodelle

Continued Pretraining passt die statistische Sprach- und Wissensrepräsentation eines vorhandenen Basismodells an umfangreiche Domänentexte an. Es ist deutlich aufwendiger als ein LoRA-basiertes Instruction Tuning und nur dann sinnvoll, wenn Terminologie, Sprachmuster oder fachliche Zusammenhänge mit Prompting, RAG und aufgabenspezifischem Fine-Tuning nicht ausreichend erfasst werden.

Das Seminar trennt drei häufig vermischte Entscheidungen: Fortsetzung des Sprachmodelltrainings, Anpassung des Tokenizers und anschließendes Instruction Tuning. Jede Maßnahme wird gegen eine unveränderte Baseline geprüft, damit Domänengewinne nicht mit dem Verlust allgemeiner Sprach-, Sicherheits- oder Instruktionsfähigkeiten erkauft werden.

Lernziele

Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.

  • Continued Pretraining von RAG, Supervised Fine-Tuning und Präferenzoptimierung fachlich abgrenzen
  • Einen ausreichend großen und ausgewogenen Domänencorpus mit Replay-Daten zusammenstellen
  • Tokenisierungseffizienz, Fachterminologie und Sequenzlängen systematisch analysieren
  • Tokenizer-Erweiterung oder Neutraining einschließlich Embedding-Anpassung risikobasiert planen
  • Causal-Language-Modeling mit reproduzierbaren Checkpoints und Speicheroptimierung ausführen
  • Domänengewinn, allgemeine Fähigkeiten und unerwünschtes Vergessen gemeinsam evaluieren

Seminarinhalte

Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.

Entscheidung und Trainingsziel

  • Geeignete Fälle: stark abweichende Fachsprache, seltene Terminologie, Spezialsyntax und umfangreiche Domänencorpora
  • Ungeeignete Fälle: häufig wechselnde Fakten, kleine Datensätze, reine Ausgabeformatierung und fehlende Evaluationsbasis
  • Causal-Language-Modeling, Domain-Adaptive und Task-Adaptive Continued Pretraining
  • Vollständige Gewichtsanpassung, Adapter-basiertes Continued Pretraining und abgestufte Alternativen

Corpus und Datenmischung

  • Domänenabdeckung, Zeitstände, Quellenklassen, Sprachverteilung und Qualitätsfilter
  • Deduplizierung, Sequenzbildung, Packing und Vermeidung überrepräsentierter Dokumenttypen
  • Replay- oder General-Domain-Anteile zum Erhalt vorhandener Fähigkeiten
  • Trainings-, Validierungs- und Holdout-Corpora ohne Dokument- oder Zeitüberschneidungen
  • Tokenbudget, Epochenäquivalent und Abbruchkriterien statt bloßer Dokumentanzahl

Tokenizer-Diagnose und -Anpassung

  • Fertility, Zeichen pro Token, Sequenzaufblähung und Zerlegung von Fachbegriffen
  • Auswirkungen schlechter Tokenisierung auf Kontextbudget, Latenz und Lernbarkeit
  • Erweiterung eines vorhandenen Vokabulars und Größenanpassung der Embedding-Matrizen
  • Initialisierung neuer Token-Embeddings und kontrolliertes Einlernen
  • Risiken eines vollständig neu trainierten Tokenizers für Kompatibilität und vorhandene Modellgewichte

Training und Ressourcensteuerung

  • Datentypen, Batch- und Sequenzlänge, Gradient Accumulation und Checkpointing
  • Lernrate, Warmup, Scheduler, Optimizer, Gradientennormen und stabile Fortsetzung vorhandener Gewichte
  • Verteiltes Training, Sharding, Wiederanlauf und konsistente Datenreihenfolge
  • Experimentprotokoll, Seeds, Checkpoints, Tokenizer-Version und Abhängigkeitsbindung
  • Loss-Verlauf, Validierungsperplexität, Datenfehler und Anzeichen von Überanpassung

Evaluation und nachgelagerte Anpassung

  • Perplexität auf Domänen-, Allgemein- und Sicherheitscorpora
  • Fachaufgaben, Sprachqualität, seltene Terminologie und lange Kontexte
  • Regression allgemeiner Fähigkeiten und Vergleich gegen RAG- oder SFT-Baselines
  • Erforderliches Instruction Tuning nach dem Continued Pretraining
  • Dokumentation von Basismodell, Trainingsdaten, Rechenlauf, Änderungen und bekannten Grenzen

Praktische Übungen

Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.

  • Domänencorpus und Replay-Mischung anhand messbarer Kriterien planen
  • Tokenizer-Fertility und Sequenzaufblähung für Fachtexte auswerten
  • Tokenizer kontrolliert erweitern und Embedding-Größe anpassen
  • Einen begrenzten Continued-Pretraining-Lauf konfigurieren und überwachen
  • Domänenperplexität, Fachaufgabe und allgemeine Regression gemeinsam vergleichen
  • Entscheidungsvorlage für Continued Pretraining, RAG oder SFT erstellen

Zielgruppe

Das Seminar richtet sich an erfahrene technische Teams mit einem belastbaren Domänencorpus und eigenen Trainingsressourcen. Drei Tage sind erforderlich, weil Tokenizer-Diagnose, Trainingslauf und Evaluation jeweils praktisch durchgeführt werden; für umfangreiche Produktionsläufe wird anschließend zusätzliche Rechenzeit benötigt.

Methodik

Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage: 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: ML Engineers, Data Scientists, NLP Engineers, KI-Forscher und technische Verantwortliche für eigene Modellanpassungen
Voraussetzungen: Gute Python- und Linux-Kenntnisse, praktische Grundlagen in PyTorch und Transformer-Modellen sowie Erfahrung mit Trainingspipelines
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.at All rights reserved.  | Kontakt | Impressum | Nach oben