Seminar OpenEuroLLM: Evaluation, Benchmarking und Qualitätssicherung

Ein einzelner Benchmarkwert reicht für die Entscheidung über eine KI-Anwendung selten aus. Dieses Seminar entwickelt ein mehrstufiges Bewertungsverfahren, das technische Lauffähigkeit, Sprachleistung, Aufgabenqualität und betriebliche Anforderungen getrennt untersucht. Im OpenEuroLLM-Kontext werden Forschungsmodelle und experimentelle Instruktionsvarianten anhand ihrer dokumentierten Zwecke eingeordnet.

Die Übungen verbinden standardisierte Aufgaben mit einem kleinen, selbst entworfenen Abnahmekatalog. Identische Testfälle werden unter kontrollierten Bedingungen auf verschiedenen Modellständen oder Konfigurationen ausgeführt. Neben Mittelwerten werden Unterschiede zwischen Sprachen, kritische Einzelfehler und die Stabilität der Beurteilung betrachtet.

Das Projektwerkzeug oellm-eval dient insbesondere der Planung und Sammlung von Evaluationen auf HPC-Systemen. Seine Aufgaben und Konfigurationen werden analysiert; lokale Übungen nutzen eine dafür geeignete vorbereitete Ausführungsumgebung. Clusteraufträge werden nur bei entsprechend bereitgestelltem Zugang ausgeführt. Ein vollständiger HPC-Benchmarklauf ist keine Voraussetzung für den Lernerfolg.

Lernziele

  • Einen fachlichen Testkatalog mit eindeutigen Bewertungskriterien erstellen.
  • Modellvergleiche einschließlich Versionen, Parametern und Datensplits reproduzierbar ausführen.
  • Unterschiede zwischen Sprachen und Fehlertypen bewerten, ohne aus kleinen Stichproben unbelegte Garantien abzuleiten.
  • Freigabegrenzen und Regressionstests für Modell- und Anwendungsänderungen festlegen.

Inhaltsverzeichnis

  1. Bewertungsziele und Modellrollen
  2. Mehrsprachige Testdaten
  3. Werkzeuge und reproduzierbare Messung
  4. Bewertung und Fehleranalyse
  5. Langkontext und Anwendungsqualität
  6. Freigabe und Regression

Seminarinhalte

Bewertungsziele und Modellrollen

  • Basismodell, Instruktionsmodell und vollständige Anwendung anhand unterschiedlicher Aufgaben bewerten.
  • Einfache Funktionstests, Forschungsbenchmarks und fachliche Abnahmeprüfungen voneinander abgrenzen.
  • Messziele für Textverständnis, Antwortformat, Aufgabenlösung und Laufzeit festlegen.

Mehrsprachige Testdaten

  • Ein Testset mit festgelegten Sprachen, Fachbegriffen und Schwierigkeitsstufen entwerfen.
  • Übersetzungseffekte, kulturelle Besonderheiten und unterschiedliche Tokenlängen berücksichtigen.
  • Testdaten von Trainings- und Abstimmungsdaten trennen und Herkunft sowie Version dokumentieren.

Werkzeuge und reproduzierbare Messung

  • Aufgabenfamilien wie Belebele oder Global MMLU anhand einer kleinen freigegebenen Auswahl einordnen.
  • Die Rollen von oellm-eval, lokalen Evaluationswerkzeugen, Containerumgebungen und Slurm verstehen.
  • Checkpoint, Tokenizer, Eingabeformat, Decodierungsparameter und Rohantworten für jeden Lauf speichern.

Bewertung und Fehleranalyse

  • Korrektheit, Vollständigkeit, Formatkonformität und unbelegte Aussagen getrennt bewerten.
  • Menschliche Bewertung mit einem Kriterienraster durchführen und Abweichungen zwischen Prüfern klären.
  • Modellgestützte Bewertung auf Positions-, Stil- und Sprachverzerrungen untersuchen.

Langkontext und Anwendungsqualität

  • Konfigurierte Kontextlänge, tatsächlich verarbeitete Länge und zuverlässige Informationsnutzung getrennt messen.
  • Abruf einfacher Textstellen von der Zusammenführung mehrerer widersprüchlicher Dokumente unterscheiden.
  • Bei Wissensassistenten Fehler im Retrieval und Fehler in der Antwortgenerierung getrennt diagnostizieren.

Freigabe und Regression

  • Mindestwerte, kritische Ausschlussfehler und Regeln für unzureichende Stichproben festlegen.
  • Zwei Modellstände anhand identischer Daten vergleichen und Messstreuung transparent darstellen.
  • Eine wiederholbare Abnahme für Änderungen an Modell, Prompt, Adapter oder Wissensbestand einrichten.

Praktische Übungen

  1. Für eine fiktive interne Auskunftsanwendung einen Abnahmekatalog mit drei Sprachen erstellen.
  2. Einen Baseline-Lauf mit festgehaltener Modellrevision und unveränderten Decodierungsparametern durchführen.
  3. Rohantworten unabhängig bewerten, Abweichungen abgleichen und das Kriterienraster verbessern.
  4. Eine Modell- oder Promptänderung einführen und dieselben Aufgaben erneut ausführen.
  5. Fehler nach Ursache und Sprache aufschlüsseln und eine begründete Freigabe- oder Rückstellungsentscheidung dokumentieren.

Schulungsumgebung

Der Kunde stellt Python-Arbeitsplätze und einen geprüften Modellzugang bereit. Für lokale Übungen genügen begrenzte Datenausschnitte und abgestimmte Kontextlängen. Ein optionaler Slurm-Zugang wird separat vorbereitet; aus der Teilnahme ergibt sich kein Zugang zu EuroHPC-Ressourcen.

Fachliche Ansprechpartner

Seminardetails

Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: KI-Entwickler, Data Scientists, Qualitätssicherungsverantwortliche, technische Produktverantwortliche und Fachprüfer für KI-Anwendungen.
Voraussetzungen: Grundlagen von Sprachmodellen, erste Python-Erfahrung und die Fähigkeit, einen vorhandenen Inferenzendpunkt oder eine vorbereitete Modelllaufzeit zu verwenden. Grundbegriffe der deskriptiven Statistik sind hilfreich.
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Schulungsumgebung: Wird vom Kunden gestellt und vorab technisch abgestimmt
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Stream gespeichert 3 Tage
Innsbruck 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Stream live 3 Tage
Inhaus / Firmenseminar 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.at All rights reserved.  | Kontakt | Impressum | Cookie-Einstellungen | Nach oben