Continued Pretraining passt die statistische Sprach- und Wissensrepräsentation eines vorhandenen Basismodells an umfangreiche Domänentexte an. Es ist deutlich aufwendiger als ein LoRA-basiertes Instruction Tuning und nur dann sinnvoll, wenn Terminologie, Sprachmuster oder fachliche Zusammenhänge mit Prompting, RAG und aufgabenspezifischem Fine-Tuning nicht ausreichend erfasst werden.
Das Seminar trennt drei häufig vermischte Entscheidungen: Fortsetzung des Sprachmodelltrainings, Anpassung des Tokenizers und anschließendes Instruction Tuning. Jede Maßnahme wird gegen eine unveränderte Baseline geprüft, damit Domänengewinne nicht mit dem Verlust allgemeiner Sprach-, Sicherheits- oder Instruktionsfähigkeiten erkauft werden.
Lernziele
Nach Abschluss des Seminars können die behandelten Verfahren fachlich eingeordnet, technisch angewendet und anhand nachvollziehbarer Kriterien bewertet werden.
- Continued Pretraining von RAG, Supervised Fine-Tuning und Präferenzoptimierung fachlich abgrenzen
- Einen ausreichend großen und ausgewogenen Domänencorpus mit Replay-Daten zusammenstellen
- Tokenisierungseffizienz, Fachterminologie und Sequenzlängen systematisch analysieren
- Tokenizer-Erweiterung oder Neutraining einschließlich Embedding-Anpassung risikobasiert planen
- Causal-Language-Modeling mit reproduzierbaren Checkpoints und Speicheroptimierung ausführen
- Domänengewinn, allgemeine Fähigkeiten und unerwünschtes Vergessen gemeinsam evaluieren
Seminarinhalte
Die Inhalte verbinden Grundlagen, Architekturentscheidungen und praktische Umsetzung in einer konsistenten Arbeitsumgebung.
Entscheidung und Trainingsziel
- Geeignete Fälle: stark abweichende Fachsprache, seltene Terminologie, Spezialsyntax und umfangreiche Domänencorpora
- Ungeeignete Fälle: häufig wechselnde Fakten, kleine Datensätze, reine Ausgabeformatierung und fehlende Evaluationsbasis
- Causal-Language-Modeling, Domain-Adaptive und Task-Adaptive Continued Pretraining
- Vollständige Gewichtsanpassung, Adapter-basiertes Continued Pretraining und abgestufte Alternativen
Corpus und Datenmischung
- Domänenabdeckung, Zeitstände, Quellenklassen, Sprachverteilung und Qualitätsfilter
- Deduplizierung, Sequenzbildung, Packing und Vermeidung überrepräsentierter Dokumenttypen
- Replay- oder General-Domain-Anteile zum Erhalt vorhandener Fähigkeiten
- Trainings-, Validierungs- und Holdout-Corpora ohne Dokument- oder Zeitüberschneidungen
- Tokenbudget, Epochenäquivalent und Abbruchkriterien statt bloßer Dokumentanzahl
Tokenizer-Diagnose und -Anpassung
- Fertility, Zeichen pro Token, Sequenzaufblähung und Zerlegung von Fachbegriffen
- Auswirkungen schlechter Tokenisierung auf Kontextbudget, Latenz und Lernbarkeit
- Erweiterung eines vorhandenen Vokabulars und Größenanpassung der Embedding-Matrizen
- Initialisierung neuer Token-Embeddings und kontrolliertes Einlernen
- Risiken eines vollständig neu trainierten Tokenizers für Kompatibilität und vorhandene Modellgewichte
Training und Ressourcensteuerung
- Datentypen, Batch- und Sequenzlänge, Gradient Accumulation und Checkpointing
- Lernrate, Warmup, Scheduler, Optimizer, Gradientennormen und stabile Fortsetzung vorhandener Gewichte
- Verteiltes Training, Sharding, Wiederanlauf und konsistente Datenreihenfolge
- Experimentprotokoll, Seeds, Checkpoints, Tokenizer-Version und Abhängigkeitsbindung
- Loss-Verlauf, Validierungsperplexität, Datenfehler und Anzeichen von Überanpassung
Evaluation und nachgelagerte Anpassung
- Perplexität auf Domänen-, Allgemein- und Sicherheitscorpora
- Fachaufgaben, Sprachqualität, seltene Terminologie und lange Kontexte
- Regression allgemeiner Fähigkeiten und Vergleich gegen RAG- oder SFT-Baselines
- Erforderliches Instruction Tuning nach dem Continued Pretraining
- Dokumentation von Basismodell, Trainingsdaten, Rechenlauf, Änderungen und bekannten Grenzen
Praktische Übungen
Die Übungen werden an einem durchgängigen, produktneutralen Beispielszenario durchgeführt und mit prüfbaren Kriterien ausgewertet.
- Domänencorpus und Replay-Mischung anhand messbarer Kriterien planen
- Tokenizer-Fertility und Sequenzaufblähung für Fachtexte auswerten
- Tokenizer kontrolliert erweitern und Embedding-Größe anpassen
- Einen begrenzten Continued-Pretraining-Lauf konfigurieren und überwachen
- Domänenperplexität, Fachaufgabe und allgemeine Regression gemeinsam vergleichen
- Entscheidungsvorlage für Continued Pretraining, RAG oder SFT erstellen
Zielgruppe
Das Seminar richtet sich an erfahrene technische Teams mit einem belastbaren Domänencorpus und eigenen Trainingsressourcen. Drei Tage sind erforderlich, weil Tokenizer-Diagnose, Trainingslauf und Evaluation jeweils praktisch durchgeführt werden; für umfangreiche Produktionsläufe wird anschließend zusätzliche Rechenzeit benötigt.
Methodik
Fachliche Einordnung, Trainerdemonstrationen, geführte Laborabschnitte, eigenständige Übungen und gemeinsame Auswertung wechseln einander ab. Konfigurationen und Entscheidungen werden so dokumentiert, dass sie nach dem Seminar reproduzierbar bleiben.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage: 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.797 zzgl. MwSt. Inhaus: € 5.100 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | ML Engineers, Data Scientists, NLP Engineers, KI-Forscher und technische Verantwortliche für eigene Modellanpassungen |
| Voraussetzungen: | Gute Python- und Linux-Kenntnisse, praktische Grundlagen in PyTorch und Transformer-Modellen sowie Erfahrung mit Trainingspipelines |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
