Kursbeschreibung
Nach der dreitägigen KServe Schulung stellst du Modelle als InferenceServices auf Kubernetes bereit und prüfst direkt im Cluster, wie KServe daraus Pods, Services und Revisionen erzeugt. Du verbindest Modellartefakte mit einer geeigneten Serving-Runtime, konfigurierst Ressourcen und testest den Inferenz-Endpunkt unter Last. Die Schulung gehört zum Themenbereich MLOps und Model Deployment.
Mit Canary-Traffic und Rollbacks rollst du neue Modellversionen kontrolliert aus. Du vergleichst den Serverless-Modus mit Knative und den Standard-Modus (RawDeployment), passt Concurrency-Werte an und untersuchst das Verhalten beim Scale-to-zero. Für GPU-Workloads behandelst du Ressourcendefinitionen, Node-Selektoren und die Grundlagen der Device-Plug-ins. Prometheus-Metriken, Kubernetes-Events, Pod-Logs und der Controller-Status liefern die Daten für die Fehlersuche.
In den Übungen bearbeitest du konkrete Fehlerbilder: defekte Image-Referenzen, falsche Modellpfade, fehlende Artefakte und ungeeignete Readiness-Konfigurationen. So erkennst du vor einem Release, warum ein Endpunkt nicht bereit ist oder unter Last falsch skaliert. Trainer aus der Praxis begleiten dich bei der Konfiguration und der systematischen Analyse. Die Durchführung ist bereits ab einer Person garantiert. Wähle einen verfügbaren Termin für die KServe-Schulung und bringe dein Model Serving auf Kubernetes in einen kontrollierbaren Betriebszustand.
Die wichtigsten Themen im Überblick
- InferenceService bereitstellen
- Serving-Runtime passend wählen
- Canary-Traffic und Rollback steuern
- Autoscaling für Lastprofile konfigurieren
- Metriken, Logs und Events auswerten
Zielgruppe
- MLOps-Fachkräfte mit Verantwortung für Model Serving
- DevOps-Engineers für Kubernetes-basierte KI-Infrastruktur
- Data Scientists mit Deployment-Aufgaben
- SRE-Teams für Inferenz-Plattformen
- Fachkräfte mit Kubernetes-Grundlagen, die Modellendpunkte betreiben sollen
Voraussetzung für die Schulung
- Grundkenntnisse zu Pods, Services und Deployments, zum Beispiel aus dem Kubernetes Grundkurs
- Sicherer Umgang mit kubectl und YAML-Manifesten
- Erfahrung mit Container-Images, etwa aus dem Docker Linux Container Workshop
- Grundverständnis von Modellartefakten und Inferenz-Endpunkten
Kursinhalte
KServe-Architektur und Bereitstellung
- KServe-Controller und Custom Resource Definitions
- Serverless-Modus mit Knative Serving
- Standard-Modus (RawDeployment) ohne Knative
- Ingress und Gateway für Inferenz
InferenceServices und Serving-Runtimes
- InferenceService und Predictor-Spezifikation
- ServingRuntime und ClusterServingRuntime
- Runtime-Auswahl nach Modellformat
- Custom Predictor mit Container-Images
- Readiness- und Liveness-Prüfungen
Modellartefakte und Ressourcen
- ONNX Runtime für Inferenz
- SKLearn Runtime für scikit-learn
- TensorFlow Serving für Modellendpunkte
- Storage-Pfade und Modellversionen
- GPU-Ressourcen für Predictor-Pods
- Node-Selektoren für GPU-Scheduling
Releases und Traffic-Steuerung
- Canary-Releases im Serverless-Modus
- Traffic-Anteile mit canaryTrafficPercent
- Rollback auf fehlerfreie Revisionen
- Versionierte YAML-Manifeste
- Image-Tags und Modellversionen
- CI/CD-Anbindung der Serving-Manifeste
Autoscaling und Lastverhalten
- Knative Pod Autoscaler
- Horizontal Pod Autoscaler
- Scale-to-zero für Inferenzdienste
- Concurrency-Targets pro Revision
- Resource-Requests und -Limits
- Lasttests für Inferenz-Endpunkte
Monitoring und Troubleshooting
- Prometheus-Metriken für Latenz
- Fehlerquoten und Statuscodes
- Alert-Regeln für Endpoint-Ausfälle
- Kubernetes-Events und Pod-Logs
- Image-Pull- und Startfehler
- Fehlende Modellartefakte im Storage
- Fehlerhafte Runtime- und Pfadangaben
- Controller-Status und CRD-Events







