Kursbeschreibung
In vielen Organisationen existieren Data Lake und Data Warehouse nebeneinander, aber KI-Teams kämpfen trotzdem mit widersprüchlichen Zahlen, fehlender Historie oder Daten, die nicht für Training und Inferenz taugen. Dieses Seminar zeigt dir, wie du Cloud-Datenmanagement so organisierst, dass aus Rohdaten verlässliche, sichere und wiederverwendbare Datenprodukte entstehen. Du beginnst mit einer klaren Einordnung der Plattform-Optionen: Data Lake, Data Warehouse und Lakehouse. Du lernst, welche Workloads wohin gehören, wie sich Compute- und Storage-Entkopplung in der Cloud auf Skalierung auswirkt und welche Anti-Patterns zu Kostenexplosionen führen. Danach baust du eine Ingestion-Strategie auf, die Landing Zone, Raw und Curated sauber trennt, und du verstehst die Auswirkungen von ETL und ELT. Inkrementelle Loads und CDC-Konzepte helfen dir, Aktualität zu erreichen, ohne alles ständig neu zu laden. Ein weiterer Schwerpunkt ist die Modellierung: Du strukturierst Daten für Analytics und KI, setzt Historisierung mit Slowly Changing Dimensions um und achtest auf korrekte Zeitfenster, damit Features später reproduzierbar sind. Governance wird konkret: Data Catalog, Lineage, Verantwortlichkeiten, Qualitätschecks und Sicherheitsmodelle bis hin zu Row- und Column-Level Security sowie DSGVO-relevanten Maßnahmen. Zum Abschluss verbindest du Technik und Betrieb: Du wählst passende Dateiformate, planst Partitionierung und Clustering, nutzt ACID-Tabellen im Lake und definierst, wie Trainingsdaten-Sets versioniert bereitgestellt werden. Damit schaffst du die Grundlage für stabile KI-Pipelines und belastbare Auswertungen.
Die wichtigsten Themen im Überblick
- Data Lake, Warehouse und Lakehouse sicher einordnen
- Cloud-Pipelines für Batch und Streaming passend planen
- ELT, ETL und CDC für saubere Ingestion nutzen
- KI-taugliche Datenmodelle mit Zeitbezug gestalten
- Data Quality, Lineage und Governance praxisnah umsetzen
- IAM, DSGVO und Zugriffsschutz in Cloud-Daten steuern
- Parquet, Iceberg und Delta für Performance einsetzen
- Trainingsdaten reproduzierbar für KI bereitstellen
Zielgruppe
- Data Engineers und Analytics Engineers
- Data Architects und Cloud Architects
- BI-Verantwortliche und Data Product Owner
- ML Engineers und AI Engineers mit Datenverantwortung
- Für alle, die Data Lakes und Data Warehouses als Grundlage für KI in der Cloud aufbauen oder verbessern wollen.
Voraussetzung für die Schulung
- Grundverständnis von Datenbanken und SQL ist hilfreich.
- Erste Berührungspunkte mit Cloud-Services oder Analytics-Projekten sind von Vorteil.
Kursinhalte
- KI braucht Daten: Architektur-Entscheidungen
- Data Lake, Data Warehouse, Lakehouse: Abgrenzung und Einsatz
- Batch vs. Streaming: wann welche Pipeline sinnvoll ist
- Compute- und Storage-Entkopplung in der Cloud
- Typische Anti-Patterns, die KI-Projekte ausbremsen
- Datenaufnahme und -integration
- Ingestion-Muster: Landing Zone, Raw, Curated
- ELT vs. ETL und Auswirkungen auf Qualität und Kosten
- CDC-Grundlagen und inkrementelle Loads
- Umgang mit semi-strukturierten Daten (JSON, Logs)
- Datenmodellierung für Analytics und KI
- Star Schema, Data Vault: wann es sich lohnt
- Feature-taugliche Daten: Aggregationen, Zeitbezug, Leakage
- Dimensionen, Slowly Changing Dimensions (SCD)
- Semantische Schicht und Self-Service-Analytics
- Datenqualität, Governance und Sicherheit
- Data Quality Checks: Vollständigkeit, Plausibilität, Drift
- Data Catalog, Lineage und Ownership
- IAM, Rollenmodelle, Row- und Column-Level Security
- DSGVO-Praxis: Pseudonymisierung, Aufbewahrung, Löschung
- Formate, Tabellen und Performance
- Parquet, ORC, JSON: Auswirkungen auf Kosten und Laufzeit
- Partitionierung, Clustering und Dateigrößen
- ACID-Tabellen im Lake (z. B. Delta/Apache Iceberg/Hudi)
- Abfrage-Optimierung und Kostenkontrolle
- Bereitstellung für KI-Workloads
- Trainingsdaten-Sets reproduzierbar bereitstellen
- Feature Store Grundlagen und wann er sinnvoll ist
- Offline/Online-Serving: Datenpfade für Inferenz
- Monitoring: Datendrift, Schema-Änderungen, SLAs