Kursbeschreibung
Die Dagster-Schulung für KI-Pipelines zeigt dir, wie du verteilte Python-Skripte, Cronjobs und Notebook-Schritte in einem asset-zentrierten Projekt zusammenführst. Du baust ein ausführbares Repository auf, dessen Module Assets, Resources, Jobs und Konfiguration voneinander trennen. Abhängigkeiten zwischen Datenquellen, Transformationen und KI-Komponenten werden im Asset-Graph sichtbar. So erkennt dein Team, welche Datenprodukte von einer Änderung betroffen sind und welche Schritte erneut ausgeführt werden müssen.
Du steuerst die Pipeline über Schedules und Sensors, zerlegst Batch-Daten in Partitionen und berechnest fehlende oder korrigierte Zeiträume per Backfill neu. Tests, Asset-Checks und eine CI/CD-Anbindung prüfen den Pipeline-Code vor der gemeinsamen Nutzung. In der Dagster-UI untersuchst du Runs, Materialisierungen, Fehler und Metadaten. Das abschließende KI-Beispiel verarbeitet Feature-Daten oder Embeddings als beobachtbare Assets. Am Ende steht ein übertragbares Dagster-Projekt, das Abhängigkeiten dokumentiert und wiederholbare Ausführungen unterstützt.
Die dreitägige Schulung gehört zu unseren Trainings für KI-Entwicklung und Programmierung. In Gruppen von 2 bis 8 Personen bleibt genug Zeit für technische Fragen zu Repository-Schnitt, Namensschema, Secrets und der Abgrenzung externer Plattformen. Frage eine Inhouse-Durchführung für dein Data- oder MLOps-Team an und nenne dabei euren eingesetzten Technik-Stack.
Die wichtigsten Themen im Überblick
- Asset-zentrierte Pipelines modellieren
- Schedules und Sensors konfigurieren
- Partitionen per Backfill aktualisieren
- Assets und Ops automatisiert testen
- KI-Pipelines in der Dagster-UI beobachten
Zielgruppe
- Data Engineers mit Python-Pipelines
- Analytics Engineers für asset-zentrierte Datenprodukte
- Python-Entwickler mit ETL-Erfahrung
- MLOps-Verantwortliche für KI-Pipelines
- Fachkräfte mit ersten Data-Engineering-Projekten und Orchestrierungsbedarf
Voraussetzung für die Schulung
- Python-Kenntnisse auf dem Niveau des Python-Aufbaukurses
- Grundverständnis für ETL-Prozesse und Datenpipelines, etwa aus dem Data-Engineering-Training für KI-Pipelines
- Grundkenntnisse in SQL-Abfragen
- Erfahrung mit Git oder Grundlagen aus dem Training für Git, GitLab und CI/CD
Kursinhalte
Asset-zentrierte Modellierung mit Dagster
- Software-Defined Assets und Asset-Graphen
- Abhängigkeiten zwischen Datenprodukten
- Python-Module im Dagster-Repository
- Metadaten für Data-Lineage
- Resources für externe Datenzugriffe
Jobs und automatisierte Ausführung
- Ops für wiederverwendbare Pipeline-Logik
- Jobs für ausgewählte Asset-Gruppen
- Schedules für zeitgesteuerte Läufe
- Sensors für ereignisbasierte Starts
- Run-Konfiguration pro Umgebung
Partitionen, Backfills und Fehlerbehandlung
- Partitionen für tägliche Batch-Daten
- Backfills für fehlende Zeiträume
- Neuberechnung korrigierter Partitionen
- Retries bei transienten Fehlern
- Fehleranalyse in der Dagster-UI
Tests und CI/CD für Dagster
- Unit-Tests für Asset-Funktionen
- Unit-Tests für wiederverwendbare Ops
- Asset-Checks für Datenqualität
- Automatisierte Tests im Git-Runner
- Umgebungsvariablen und Secrets
- Packaging für wiederholbare Deployments
KI-Pipelines und Observability
- Feature-Daten als überwachte Assets
- Embeddings als wiederholbarer Asset-Schritt
- Materialization-Events und Lauf-Metadaten
- Asset-Lineage für KI-Komponenten
- Deployment-Muster für Data-Teams




.webp)


