Kursbeschreibung
Die DataHub Schulung führt dich von den grundlegenden Architekturentscheidungen bis zu einer Pilotstruktur für den produktiven Einsatz. Du arbeitest an einer DataHub-Umgebung und untersuchst, wie GMS, Frontend, Suchindex und Graph zusammenspielen. Entities, Aspects, URNs und Metadata Change Proposals zeigen dir, wie DataHub Metadaten abbildet und Änderungen verarbeitet. Auf dieser Basis entsteht ein durchsuchbarer Open-Source-Data-Catalog für Datasets, Jobs und Dashboards.
Du konfigurierst Ingestion-Recipes, bindest Datenbanken und BI-Systeme an und wertest Ingestion-Logs aus. Die Integrationsübungen beziehen dbt, Airflow und Kafka ein. Dadurch kannst du Lineage vom Report über Transformationen bis zur Quelle verfolgen und Auswirkungen geänderter Pipelines schneller untersuchen. Ownership-Typen, Domains, Glossar-Terme und Policies verbinden die technische Sicht mit den Zuständigkeiten der Fachbereiche. Assertions sowie vorhandene Testergebnisse ergänzen den Catalog um Qualitätssignale und Review-Schritte.
Ein Arbeitsblatt hält Connectoren, Rollen, Glossarregeln und erste Qualitätsprüfungen für dein Pilotprojekt fest. Diese Struktur lässt sich nach der Schulung mit dem Plattformteam und den Fachbereichen weiterbearbeiten. Der Kompaktkurs ergänzt unsere Datenbanken-Schulungen; die Data-Engineering-Schulung für KI-Pipelines führt den Lernpfad auf Ebene produktiver Datenflüsse fort. Die Übungen finden in kleinen Gruppen mit 2 bis 8 Personen statt. Frage einen Termin für dein Plattformteam an, wenn ihr euren DataHub-Pilot fachlich vorbereiten möchtet.
Die wichtigsten Themen im Überblick
- Data Catalog mit echten Assets
- Ingestion-Connectoren konfigurieren
- Lineage im Graph prüfen
- Ownership und Policies modellieren
- Pilotstruktur für den Rollout
Zielgruppe
- Data Engineers mit Verantwortung für Metadatenflüsse
- Data Stewards für Ownership und Glossarregeln
- Analytics Engineers mit dbt-Erfahrung
- Fachkräfte in Plattformteams für Daten- und KI-Produkte
Voraussetzung für die Schulung
- Grundwissen zu Datenplattformen, SQL oder BI-Berichten
- Erfahrung mit ETL-Jobs, dbt oder Airflow hilfreich
- SQL-Grundlagen bei fehlender Abfrageerfahrung
- Docker-Grundlagen zur Vorbereitung auf containerisierte Umgebungen
Kursinhalte
Architektur und Metadatenmodell
- GMS und Frontend im Zusammenspiel
- Entities und Aspects im Modell
- Metadata Change Proposals
- URNs für eindeutige Asset-Identität
- Suchindex und Graph-Beziehungen
Assets und Data Catalog
- Dataset- und Dashboard-Profile
- Pipeline-Profile für Data Jobs
- Domains für Datenprodukt-Gruppen
- Tags und Glossar-Terme
- Suchfilter für Asset-Profile
Ingestion und Quellenanbindung
- Ingestion-Recipes mit Secrets
- Connectoren für Datenbanken
- BI-Systeme als Metadatenquellen
- Scheduling von Ingestion-Läufen
- Fehleranalyse in Ingestion-Logs
Lineage für Pipelines und Reports
- Column-Level-Lineage aus dbt
- Airflow-Jobs als Prozessknoten
- Kafka-Topics und Stream-Beziehungen
- BI-Lineage für Reports
- Manuelle Lineage-Korrekturen
Governance und Verantwortlichkeiten
- Ownership-Typen und Rollen
- Glossar-Terme für Geschäftsdefinitionen
- Policies für Sichtbarkeit
- Policies für Änderungsaktionen
- Domains und Data Products
Datenqualität und Pilotplanung
- Assertions für Qualitätsregeln
- dbt-Tests als Qualitätssignale
- Great-Expectations-Ergebnisse in DataHub
- Reviews bei Qualitätsabweichungen
- API und Actions für Erweiterungen
- Kriterien für die Tool-Auswahl







