Kursbeschreibung
In produktiven KI-Systemen ist die wichtigste Frage nicht, ob ein Job heute läuft, sondern ob die Datenpipeline über Monate stabil bleibt, Änderungen verkraftet und dabei reproduzierbare Trainingsdaten liefert. In diesem Aufbau-Seminar entwickelst Du genau diese Fähigkeiten. Du startest mit Architekturentscheidungen für KI-Datenpipelines und lernst, wie Du Batch- und Streaming-Flows so kombinierst, dass Freshness-Anforderungen erfüllt werden, ohne die Plattform zu überfrachten. Du ordnest Lakehouse, Data Warehouse und Feature Store ein und definierst eine Serving-Schicht, die Training und Inferenz konsistent versorgt. Du setzt Datenverträge ein, um Schnittstellen zwischen Teams zu stabilisieren, und übst den Umgang mit Schema Evolution inklusive Contract Testing. Für reale Betriebsfälle planst Du Idempotenz, Retries, Reprocessing und Backfills, damit Korrekturen kontrolliert und nachvollziehbar ablaufen. PII-Handling, Rollen und Audit Trails werden dabei als feste Bestandteile der Pipeline behandelt. Im weiteren Verlauf baust Du Transformationen mit inkrementellen Modellen, etablierst Data-Quality-Checks und nutzt Lineage für Impact Analysis und Dokumentation. Du machst Deine Pipeline beobachtbar: Logs, Metriken, Traces, SLAs und Runbooks sorgen dafür, dass Störungen schnell eingegrenzt werden. Zum Abschluss entwickelst Du Feature-Patterns mit Point-in-time Correctness, Leakage-Vermeidung, Versionierung und Low-Latency-Serving. So kannst Du KI-Pipelines liefern, die Teams vertrauen und die sich wirtschaftlich betreiben lassen.
Die wichtigsten Themen im Überblick
- KI-Datenpipelines für Training und Inferenz entwerfen
- Batch, Streaming und Lakehouse für KI-Workloads einordnen
- Datenverträge testen und Schema Evolution sicher umsetzen
- Inkrementelle ETL- und ELT-Modelle produktiv einsetzen
- Data Quality, Lineage und Anomalien systematisch überwachen
- DAGs, SLAs, Retries und Runbooks für den Betrieb planen
- Feature Stores mit Offline- und Online-Konsistenz nutzen
- Governance, Sicherheit und Kosten in KI-Pipelines steuern
Zielgruppe
- Data Engineers mit erster Pipeline-Erfahrung
- Analytics Engineers, die KI-Use-Cases bedienen
- ML Engineers, die Datenflüsse produktiv machen
- Plattform- und Cloud Engineers im Datenumfeld
- Alle, die KI-Systeme mit verlässlichen Datenpipelines versorgen wollen
Voraussetzung für die Schulung
- Grundverständnis von Datenpipelines (z. B. ETL/ELT, Batch oder Streaming).
- Basiswissen zu SQL und Datenmodellierung ist hilfreich.
Kursinhalte
- Architektur für KI-Datenpipelines
- Batch vs. Streaming und typische KI-Workloads
- Lakehouse, Data Warehouse, Feature Store: Abgrenzung
- Schichtenmodell: Raw, Clean, Curated, Serving
- Schnittstellen zu Training und Inferenz
- Ingestion und Datenverträge
- Quellen anbinden: APIs, Events, Dateien, Datenbanken
- Schema Evolution und Contract Testing
- Idempotenz, Reprocessing, Backfills
- PII-Handling und Zugriffskonzepte
- Transformationen, Qualität und Lineage
- ELT/ETL-Patterns und inkrementelle Modelle
- Data Quality Checks und Anomalie-Erkennung
- Lineage und Impact Analysis für Änderungen
- Dokumentation und Datenkatalog-Grundlagen
- Orchestrierung und zuverlässiger Betrieb
- DAG-Design, Abhängigkeiten, SLAs und Retries
- Scheduling, Event-driven Trigger, Sensoren
- Observability: Logs, Metriken, Traces
- Runbooks und Incident-Playbooks
- Feature Engineering als Produkt
- Offline/Online Features und Konsistenz
- Point-in-time Correctness und Leakage vermeiden
- Feature Versioning und Wiederverwendbarkeit
- Serving Patterns für Low Latency
- Governance, Sicherheit und Kosten
- Rollen, Policies, Secrets und Audit Trails
- Retention, Löschkonzepte und Datenminimierung
- Kostenhebel: Storage, Compute, Egress
- FinOps-Prinzipien für Datenplattformen
- Produktionsreife KI-Datenflüsse
- Drift-Signale: Daten, Features, Labels
- Monitoring für Datenqualität und Freshness
- Reproduzierbarkeit: Snapshots und Time Travel
- Übergabe an MLOps: Artefakte und Schnittstellen