Kursbeschreibung
In vielen Unternehmen entstehen Segmentierungen als einmalige Data-Science-Übung und verschwinden dann, weil niemand sie erklären, messen oder betreiben kann. In diesem Seminar lernst du, Clustering und Segmentierung als „end-to-end“ Workflow aufzubauen: von der sauberen Datenbasis bis zur operativen Nutzung und zum Monitoring. Du startest mit Use-Cases wie Kundensegmenten, Produktgruppen oder der Vorstufe für Anomalieerkennung. Du definierst, welche Variablen wirklich segmentieren sollen, und bereitest Daten so vor, dass Clustering-Verfahren nicht durch Skalierung, Ausreißer oder Missing Values verzerrt werden. Danach wählst du Algorithmen anhand klarer Kriterien aus: K-Means und MiniBatchKMeans für skalierbare Baselines, hierarchisches Clustering für erklärbare Dendrogramme, DBSCAN und HDBSCAN für komplexe Formen und Rauschen sowie Gaussian Mixture Models für überlappende Segmente. Ein wichtiger Block ist die Geometrie: Du vergleichst Distanzmaße, verstehst den Einfluss von Cosine versus Euclidean und lernst, warum hochdimensionale Räume Cluster „gleich weit“ machen können. Für gemischte Datentypen besprichst du praktikable Kodierungen und deren Nebenwirkungen. Mit PCA verbesserst du Clusterbarkeit und Interpretierbarkeit, während UMAP und t-SNE dir helfen, Ergebnisse zu visualisieren und zu erklären. Abschließend bewertest du Qualität und Stabilität, wählst k begründet, erstellst Cluster-Profile, formulierst Segment-Regeln und setzt Monitoring für Drift und Re-Training auf. Damit kannst du Segmentierung nachhaltig in Teams und Systeme bringen.
Die wichtigsten Themen im Überblick
- Clustering-Verfahren passend zum Use Case auswählen
- Datenbasis mit Skalierung und Missing Values vorbereiten
- K-Means, DBSCAN, HDBSCAN und GMM praxisnah vergleichen
- Distanzen und Ähnlichkeiten für saubere Cluster bewerten
- PCA, UMAP und t-SNE für Segmentierung richtig einsetzen
- Cluster-Qualität mit Silhouette, Elbow und Stabilität messen
- Segmente interpretieren und in Business-Regeln übersetzen
- Monitoring für Drift, Re-Training und Governance planen
Zielgruppe
- Data Analysts und Business Analysts mit Statistikbezug
- Data Scientists, die Clustering belastbar einsetzen wollen
- Marketing-, CRM- und Product-Teams mit Segmentbedarf
- BI- und Analytics-Engineers an der Schnittstelle zu Fachbereichen
- Alle, die Segmentierungen nicht nur berechnen, sondern im Alltag nutzbar machen wollen
Voraussetzung für die Schulung
- Grundkenntnisse in Statistik und Datenaufbereitung (z. B. Skalierung, Ausreißer, Missing Values).
- Grundverständnis von Machine Learning Begriffen; Programmierung ist hilfreich, aber nicht zwingend.
Kursinhalte
- Problemverständnis und Datenbasis
- Use-Cases: Kundensegmente, Anomalien, Produktgruppen
- Feature-Auswahl, Skalierung, Missing Values
- Bias, Leakage und typische Datenfallen
- Clustering-Verfahren richtig auswählen
- K-Means, MiniBatchKMeans und Grenzen
- Hierarchisches Clustering und Linkage-Strategien
- DBSCAN und HDBSCAN für dichtebasierte Cluster
- Gaussian Mixture Models für weiche Zuordnung
- Distanz, Ähnlichkeit und Geometrie
- Euclidean, Cosine, Manhattan, Mahalanobis
- Kategoriale Daten: One-Hot, Embeddings, Gower
- High-Dimensionality und Curse of Dimensionality
- Dimensionality Reduction für Segmentierung
- PCA als robuste Basis für Clusterbarkeit
- UMAP und t-SNE für Visualisierung, richtig eingesetzt
- Interpretierbarkeit vs. Projektionseffekte
- Cluster-Qualität, Stabilität und Auswahl von k
- Silhouette, Calinski-Harabasz, Davies-Bouldin
- Elbow, Gap Statistic und praktische Heuristiken
- Stabilität über Resampling und Zeitfenster
- Interpretation und Business-Übersetzung
- Cluster-Profile, Treiberanalyse und Naming
- Segment-Regeln, Scorecards und einfache Deployments
- Monitoring: Drift, Re-Training, Governance