Kursbeschreibung
Dieses Seminar ist für Dich, wenn Du aus Dokumenten nicht nur Zusammenfassungen, sondern belastbare Fakten mit Quellenbelegen gewinnen willst. Du entwickelst eine End-to-End-Architektur für automatisierte Dokumentenanalyse mit LLMs, die sich in reale Prozesse integrieren lässt. Zuerst klärst Du die fachliche Zielsetzung: Welche Informationen sind entscheidend, zum Beispiel Zahlungsbedingungen, Kündigungsfristen, Haftungspassagen oder Leistungszusagen, und wie soll das Ergebnis aussehen, damit Teams damit arbeiten können. Du lernst außerdem, wie Du Risiken wie Halluzinationen und Datenschutz früh in die Architektur einbaust. Danach geht es in die Umsetzung: Du strukturierst die Ingestion, wählst passende Parsing- und OCR-Wege und legst fest, wie Layout, Tabellen und Anhänge verarbeitet werden. Mit geeigneten Chunking-Strategien stellst Du sicher, dass lange Dokumente zuverlässig analysiert werden. Im nächsten Schritt baust Du die Extraktion als kontrollierten Prozess: JSON-Schema, Validierung, mehrstufige Prompt-Flows und Self-Checks. Du übst, wie Du Unsicherheiten sichtbar machst, statt sie zu verstecken. Für Nachvollziehbarkeit setzt Du RAG ein, damit jede Kernaussage eine passende Textstelle als Beleg erhält. Du lernst Stellschrauben wie Top-k, Re-Ranking, Kontextfenster und Deduplizierung kennen und nutzt sie, um stabile Ergebnisse zu erzielen. Abschließend etablierst Du Qualitätssicherung, Tests, Logging, Monitoring und Kostenkontrolle, damit die Lösung im Betrieb nicht aus dem Ruder läuft. Ergebnis ist ein praxistauglicher Blueprint, den Du direkt in Projekten anwenden kannst.
Die wichtigsten Themen im Überblick
- Belastbare LLM-Pipelines für PDFs, Mails und Verträge
- Parsing, OCR und Chunking für lange Dokumente einsetzen
- JSON-Extraktion für Entitäten, Beträge, Fristen und Risiken
- RAG mit Seiten- und Abschnittsbelegen praktisch umsetzen
- Auditierbare Zusammenfassungen mit Claim-Evidence erstellen
- Qualität mit Gold-Sets, Stichproben und Reviews sichern
- PII-Handling, Logging und Zugriffskonzepte planen
- Use Cases, Grenzen und Erfolgskriterien realistisch bewerten
Zielgruppe
- Data Analysts und Data Engineers, die Dokumentdaten nutzbar machen
- Softwareentwicklerinnen und Softwareentwickler, die LLM-Features produktivisieren
- Fachverantwortliche aus Legal, Einkauf, Revision, Compliance
- Produktmanagerinnen und Produktmanager für Dokument-Workflows
- Für alle, die aus Dokumenten prüfbare Fakten mit Quellenbelegen gewinnen wollen
Voraussetzung für die Schulung
- Grundverständnis von APIs und Datenformaten wie JSON
- Erfahrung mit Dokumentprozessen oder Datenanalyse ist hilfreich
Kursinhalte
- Use Cases, Grenzen, Erfolgskriterien
- Dokumenttypen: PDF, E-Mail, Scans, Office
- Qualitätsziele: Genauigkeit, Abdeckung, Nachvollziehbarkeit
- Risiken: Halluzinationen, Datenschutz, Bias
- Dokument-Ingestion und Vorverarbeitung
- Parsing, OCR-Optionen, Layout-Erhalt
- Chunking-Strategien für lange Dokumente
- Metadaten: Seiten, Absätze, Tabellen, Anhänge
- Informations-Extraktion mit LLMs
- Schema-basierte Extraktion (JSON), Validierung
- Entitäten, Beträge, Fristen, Pflichten, Risiken
- Mehrstufige Prompts und Self-Check
- RAG für Belege und Quellenstellen
- Embeddings, Vektorsuche, Re-Ranking
- Zitate mit Seiten- und Abschnittsverweisen
- Kontextfenster, Top-k, Deduplizierung
- Zusammenfassungen, die auditierbar sind
- Executive Summary vs. Fachzusammenfassung
- Claim-Evidence-Format: Aussage plus Beleg
- Konflikte und Unsicherheiten markieren
- Qualitätssicherung und Tests
- Gold-Set, Stichproben, Review-Workflows
- Messgrößen: Extraktions-Accuracy, Coverage, Latency
- Prompt-Regressionstests und Versionierung
- Security, Compliance und Betrieb
- PII-Handling, Redaction, Zugriffskonzepte
- Logging, Monitoring, Kostenkontrolle
- Deployment-Optionen: API, On-Prem, Hybrid