Kursbeschreibung
LLM-Evaluation macht die Qualität generativer AI-Produkte vor dem Release prüfbar. In dieser zweitägigen Schulung entwickelst du ein Evaluationsdesign für LLM-Features, Chatbots und RAG-Systeme. Du leitest aus fachlichen Anforderungen konkrete Qualitätskriterien ab, strukturierst repräsentative Eval-Sets und formulierst Rubrics für automatisierte Bewertungen und Human-Reviews. So lassen sich Halluzinationen, fehlender Quellenbezug und unerwünschte Änderungen nach einem Modell- oder Promptwechsel früher erkennen.
Die Übungen führen von produktnahen Testfällen über Bewertungsskalen bis zu Schwellenwerten für Go-live, manuelle Prüfung und Rollback. Für RAG-Anwendungen trennst du die Qualität des Retrievals von der Qualität der generierten Antwort. Du verbindest automatische Checks mit menschlicher Beurteilung und bereitest Regressionstests für Entwicklungs-Pipelines vor. Das schafft eine gemeinsame Entscheidungsbasis für Produkt, Entwicklung und QA, bevor fehlerhafte Antworten Nutzer erreichen. Fachliche Grundlagen zu Retrieval und Vektorsuche vertieft das RAG- und Vektordatenbanken-Training. Weitere Themen findest du bei den KI-Schulungen von Kebel Training. Sprich mit uns über den passenden Termin für dich oder dein Produktteam.
Die wichtigsten Themen im Überblick
- Eigene Eval-Sets entwerfen
- RAG-Qualität getrennt bewerten
- Human-Review mit Rubrics kalibrieren
- Regressionen vor Releases erkennen
- Go-Live-Kriterien dokumentieren
Zielgruppe
- AI-Leads mit Verantwortung für produktive LLM-Systeme
- ML-Engineers und Data Scientists in AI-Produktteams
- Product Owner und QA-Verantwortliche für AI-Features
- Technische Teams mit Freigabeverantwortung bei anstehenden Modellwechseln
Voraussetzung für die Schulung
- KI- und LLM-Grundlagen sowie ein Verständnis generativer AI-Systeme
- Prompting-Grundlagen, etwa aus dem Prompt Engineering Grundkurs
- Grundverständnis von RAG-Systemen oder vergleichbaren Retrieval-Workflows
- Erfahrung mit Produktentwicklung, Software-Testing oder AI-Projekten ist hilfreich
Kursinhalte
Evaluationsstrategie für LLM-Produkte
- Evaluation im AI-Produktlebenszyklus
- Benchmarks und produktbezogene Eval-Sets
- Monitoring und Nutzerfeedback aus der produktiven Nutzung
- Korrektheit, Nützlichkeit und Konsistenz
- Sicherheit, Quellenbezug und Nutzerwert
- Risiken durch Modell- und Promptwechsel
- Messbare Kriterien aus Fachanforderungen
- Priorisierung nach Risiko und Nutzung
Eval-Sets entwerfen und pflegen
- Repräsentative Nutzungsszenarien auswählen
- Produktnahe Dialoge als Testfälle
- Golden-Datasets und Referenzantworten
- Edge-Cases und Negativbeispiele
- Sicherheitskritische Testfälle erfassen
- Akzeptable Abweichungen definieren
- Testdaten und Prompts versionieren
- Evaluations-Backlog für Produktänderungen
Automatisierte Bewertung und RAG-Evaluation
- Regelbasierte Struktur- und Formatprüfungen
- Checks für Pflichtinformationen und Policies
- LLM-as-a-Judge mit Rubrics
- Nachvollziehbare Score-Definitionen
- Retrieval-Relevanz und Vollständigkeit
- Quellenbezug generierter Antworten
- Halluzinationsrisiken in Testläufen
- Nichtdeterminismus und Score-Schwankungen
- Kosten und Laufzeit automatisierter Evals
Human-Review und Kalibrierung
- Leitlinien für fachliche Reviews
- Sprachliche und sicherheitsbezogene Kriterien
- Stichproben und Doppelbewertungen
- Eskalationsregeln für Grenzfälle
- Abweichende Bewertungen systematisch auswerten
- Gemeinsame Bewertungsmaßstäbe kalibrieren
- Automatische und menschliche Scores verbinden
- Review-Ergebnisse für Audits dokumentieren
Regressionstests und Release-Entscheidungen
- Test-Suites für Prompts und Systemnachrichten
- Regressionstests für RAG-Komponenten
- Prüfung von Tools und Modell-Upgrades
- Schwellenwerte für Go-live-Entscheidungen
- Kriterien für Rollback und Eskalation
- Testläufe in Entwicklungs-Pipelines
- Vergleich von Modellversionen und Prompts
- Scores für Reporting und Freigaben
- Feedback-Schleifen für Produktänderungen





