Kursbeschreibung
NoSQL wird in KI-Projekten oft aus einem einzigen Grund eingeführt: Skalierung. In der Praxis geht es aber um mehr: Du brauchst Datenmodelle, die schnelle Retrieval-Abfragen erlauben, inkrementelle Updates sauber verarbeiten und gleichzeitig Governance-Anforderungen erfüllen. In diesem Seminar entwickelst du genau diese Fähigkeiten anhand typischer KI-Szenarien wie Feature Stores, RAG mit Vector Search und Echtzeit-Inferenz. Du lernst, wie du die passende NoSQL-Kategorie auswählst und welche Konsequenzen CAP, Konsistenzlevel und Latenz für dein Design haben. Danach gehst du in die Modellierung: Query-first Design, Denormalisierung, Aggregates, sinnvolle Metadaten und eine Versionierungsstrategie für Features und Trainingsdaten. Ein Schwerpunkt ist die Vektor-Datenhaltung: Wie du Embeddings speicherst, filterbar machst, Indizes auswählst und wartest, und wie Hybrid Search die Qualität von Antworten verbessern kann, ohne die Latenz zu sprengen. Für laufende Systeme brauchst du robuste Update-Pipelines. Darum behandelst du Event Sourcing, CDC, Idempotenz und Strategien für Backfills, wenn du Features neu berechnest oder Embeddings erneuerst. Abschließend arbeitest du an Performance, Zuverlässigkeit und Sicherheit: Partitionierung gegen Hot Keys, Caching, Load-Tests, Observability, Backup und Disaster Recovery sowie Zugriffskontrollen und PII-Minimierung. Nach dem Seminar kannst du NoSQL-Architekturen für KI-Anwendungen entwerfen, bewerten und in den Betrieb überführen, ohne dich von Datenwachstum und Änderungsdruck überraschen zu lassen.
Die wichtigsten Themen im Überblick
- Passende NoSQL-Datenmodelle für KI-Workloads auswählen
- RAG-Datenhaltung mit Embeddings und Metadaten planen
- Feature Stores mit Versionierung und CDC aufbauen
- Vector Search für Recall, Kosten und Latenz optimieren
- Streaming-Updates mit Idempotenz und Upserts absichern
- Hot Keys durch Partitionierung und Sharding vermeiden
- Latenztests für Retrieval und Echtzeit-Inferenz umsetzen
- KI-Daten mit Governance und Zugriffskontrollen schützen
Zielgruppe
- Data Engineers und Analytics Engineers
- Machine-Learning Engineers und MLOps Engineers
- Softwarearchitektinnen und Softwarearchitekten
- Backend-Entwicklerinnen und Backend-Entwickler mit KI-Bezug
- Für alle, die NoSQL als Datenbasis für RAG, Feature Stores oder Echtzeit-Inferenz robust aufsetzen wollen
Voraussetzung für die Schulung
- Grundverständnis von Datenbanken und API-basierten Anwendungen
- Hilfreich: erste Berührung mit Machine Learning, RAG oder Data Pipelines
Kursinhalte
- NoSQL-Auswahl für KI-Workloads
- Dokument, Key-Value, Wide-Column, Graph, Vector: wofür welches Modell
- Lese- und Schreibprofile: Training, Serving, Streaming
- CAP, Konsistenzlevel und Latenz als Designparameter
- Cloud-Managed vs. Self-Hosted: Betrieb und Kosten
- Datenmodellierung, die KI wirklich hilft
- Schema-on-read vs. Schema-Governance
- Denormalisierung, Aggregates und Query-first Design
- Versionierung von Features und Trainingsdaten
- TTL, Soft Deletes und Datenlebenszyklen
- Vector Search und RAG-Datenhaltung
- Embeddings speichern: Dimensionen, Metadaten, Filter
- Index-Typen (z. B. HNSW) und Recall vs. Latenz
- Chunking, Deduplizierung und Re-Embedding Strategien
- Hybrid Search: Keyword plus Vektor
- Streaming, Events und inkrementelle Updates
- Event Sourcing Grundlagen und typische Stolperfallen
- Idempotenz, Upserts und Exactly-once Illusionen
- Change Data Capture (CDC) für Feature Updates
- Backfills und Reprocessing ohne Datenchaos
- Performance, Kosten und Zuverlässigkeit
- Partitionierung, Hot Keys und Sharding-Strategien
- Caching, Read-Models und Materialized Views
- Load- und Latenztests für Retrieval und Inferenz
- Observability: Metriken, Tracing, Slow Queries
- Security, Governance und Compliance
- Mandantenfähigkeit, Row-Level Security und Tokenization
- PII in Trainingsdaten: Minimierung und Zugriffskontrollen
- Auditierbarkeit, Datenherkunft und Reproduzierbarkeit
- Backup, Restore und Disaster Recovery