Seminar AgentOps Evaluation und Qualitätsmetriken

Bei Agenten genügt es nicht, nur die letzte Textantwort zu bewerten. Auch Werkzeugauswahl, Argumente, Reihenfolge, Zustandsänderungen, Abbruchverhalten und Ressourceneinsatz entscheiden über Qualität. Das Seminar entwickelt daraus eine mehrdimensionale Evaluationsstrategie.

Nutzen

Teilnehmende können messbare Qualitätsziele definieren, geeignete Evaluatoren auswählen und Ergebnisse statistisch wie fachlich einordnen. Ein vollständiger Ablauf von der Datensatzpflege über Experimente bis zur Online-Überwachung wird praktisch aufgebaut.

Lernziele

  • fachliche, technische, sicherheitsbezogene und wirtschaftliche Qualitätsdimensionen operationalisieren
  • textuelle und multimodale Datensätze mit Referenzantworten, Rubriken, Metadaten und Schwierigkeitsklassen erstellen
  • deterministische, modellgestützte und menschliche Bewertungen kombinieren
  • Evaluatoren kalibrieren und Regressionen mit belastbaren Freigabeschwellen erkennen
  • Offline- und Online-Evaluation in einen kontinuierlichen Verbesserungsprozess integrieren

Für wen ist das Seminar geeignet?

AI Engineers, Data Scientists, QA-Fachkräfte, Fachverantwortliche, Product Owner, Prompt Engineers und Teams für AI Governance.

Voraussetzungen

Grundkenntnisse in generativer KI und agentischen Abläufen; grundlegende Python-Kenntnisse sind für die Übungen hilfreich.

Seminarinhalte

Evaluationsarchitektur

  • Outcome-, Trajectory-, Step-, State- und Systembewertung
  • Fachliche Korrektheit, Vollständigkeit, Relevanz, Sicherheit, Latenz und Kosten
  • Task-Erfolg, Tool-Erfolg, Eskalation und kontrollierter Abbruch
  • RAG-Groundedness, Retrieval-Qualität, Memory-Korrektheit und Zustandskonsistenz

Datensätze und Ground Truth

  • Golden Set, Grenzfälle, Fehlersammlung und adversariale Fälle
  • Text-, Bild-, Audio-, Datei- und strukturierte Eingaben
  • Produktionsbeispiele, Datenschutz, Anonymisierung und Datenleckage
  • Versionierung, Splits, Schwierigkeitsgrade und Abdeckungsmatrix

Evaluatoren

  • Exakte Assertions, Schema- und Vertragstests
  • Heuristiken, domänenspezifische Regeln und externe Prüffunktionen
  • LLM-as-a-Judge mit Rubrik, strukturierter Ausgabe und Begründung
  • Paarvergleich, Ranking und zusammengesetzte Scores

Kalibrierung und Statistik

  • Human Review und Richtlinien für Annotierende
  • Inter-Rater-Übereinstimmung und Konfliktklärung
  • Judge-Bias, Positionseffekte, Selbstbevorzugung und Kontamination
  • Konfidenzintervalle, Varianz und sinnvolle Schwellenwerte

Experimente und Regression

  • Baseline-Vergleich für Modell-, Prompt-, Tool- und Retriever-Änderungen
  • Fehlercluster, Segmentierung und Ursachenanalyse
  • Qualitätsgates und gewichtete Risikoklassen

Online-Evaluation

  • Stichproben, gezielte Trigger und kontinuierliche Bewertung
  • Nutzerfeedback, operative Signale, Verhaltens- und Daten-Drift
  • Bewertung mehrturniger Sitzungen und langlaufender Tasks
  • Rückführung geeigneter Produktionsfälle in kuratierte Tests

Praxisanteil

Ein Evaluationspaket für einen mehrstufigen Serviceagenten wird erstellt: Qualitätsrubrik, Golden Set, deterministische Prüfer, ein kalibrierter Judge, Vergleich zweier Varianten und ein Freigabebericht mit Fehlerclustern.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 3 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.797 zzgl. MwSt.
Inhaus: € 5.100 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: AI Engineers, Data Scientists, QA-Fachkräfte, Fachverantwortliche, Product Owner, Prompt Engineers und Teams für AI Governance.
Voraussetzungen: Grundkenntnisse in generativer KI und agentischen Abläufen; grundlegende Python-Kenntnisse sind für die Übungen hilfreich.
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, Gruppenarbeit und praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Stream gespeichert 3 Tage
Innsbruck 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Linz 3 Tage
Salzburg 3 Tage
Graz 3 Tage
Wien 3 Tage
Inhaus / Firmenseminar 3 Tage
Stream live 3 Tage
Innsbruck 3 Tage
Stream gespeichert 3 Tage
Klagenfurt 3 Tage
Bregenz 3 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.at All rights reserved.  | Kontakt | Impressum | Nach oben