vLLM-Schulung: LLM-Inferenz performant betreiben

Bringe Open-Source-LLMs vom GPU-Test zu einem vLLM-Endpunkt mit dokumentierten Messwerten

vLLM-Schulung: LLM-Inferenz performant betreiben
vLLM-Schulung: LLM-Inferenz performant betreiben

Kursbeschreibung

  • Kurs-ID:VLLM-SRV
  • Kursdauer:3 Tage
  • Uhrzeit:09:00 - 16:00 Uhr

Die vLLM-Schulung führt ein GPU-basiertes LLM-Deployment bis zu einem getesteten Serving-Endpunkt. Du installierst vLLM in einer isolierten Linux-Umgebung, stellst ein Open-Source-Modell über den vLLM-Server bereit und prüfst die OpenAI-kompatible API mit Chat-Completions und Streaming. Das Ergebnis ist kein reiner Prototyp: Am Ende stehen gemessene Werte für Durchsatz, Time to First Token, Token-Latenz und VRAM-Auslastung sowie dokumentierte Startparameter für ein definiertes Lastprofil.

An drei Tagen untersuchst du, wie Continuous Batching, KV-Cache und PagedAttention das Serving-Verhalten beeinflussen. Lasttests zeigen, wie sich parallele Requests und lange Kontexte auf Antwortzeit und GPU-Speicher auswirken. Bei der Quantisierung vergleichst du Modellvarianten anhand ihres Speicherbedarfs, ihres Antwortverhaltens und des nötigen Prüfaufwands. Aus der Modellgröße, der Kontextlänge und der Ziellatenz leitest du anschließend ein begründetes GPU-Sizing ab.

Monitoring gehört zum Deployment. Prometheus-Metriken, die GPU-Auslastung und Server-Logs zeigen, wann ein Endpunkt an seine Grenzen stößt. Auch Fehlerraten und Health-Checks weisen auf diese Grenzen hin. In der kleinen Gruppe von 2 bis 8 Personen kannst du Konfigurationen nachvollziehen, Messwerte vergleichen und Fehler systematisch untersuchen. Weitere technische KI-Themen findest du bei den KI-Schulungen für Entwickler und Administratoren. Als Anwendungsschicht für den bereitgestellten Endpunkt eignet sich anschließend die Open-WebUI-Schulung für Self-Hosted-KI. Frag den passenden Termin für dich oder dein Team an und nenne dabei Modell, GPU-Umgebung und gewünschtes Lastprofil.

Die wichtigsten Themen im Überblick

  • vLLM-Endpunkt selbst bereitstellen
  • Latenz und Durchsatz messen
  • VRAM-Bedarf dokumentieren
  • GPU-Sizing aus Lastprofilen ableiten
  • Serving mit Metriken überwachen

Zielgruppe

  • Fachkräfte in der KI-Entwicklung mit LLM-Projekten
  • MLOps-Teams für selbst gehostete Modelle
  • Plattform-Teams mit GPU-Infrastruktur
  • Fachkräfte nach dem LLM-Self-Hosting-Training zur Vertiefung der Inferenz

Voraussetzung für die Schulung

  • Sicherer Umgang mit Linux-Shell und HTTP-APIs
  • Grundkenntnisse in Python und Container-Technik
  • Grundverständnis von LLMs und Kontextlängen
  • Kenntnisse über GPU-Ressourcen, VRAM und CUDA
  • Bei fehlender GPU-Erfahrung empfiehlt sich die Linux-Administration für KI-Workloads mit GPUs

Kursinhalte

vLLM-Architektur und Labor-Setup

  • vLLM-Runtime im Serverbetrieb
  • Isolierte Installation unter Linux
  • Modellbezug und Tokenizer-Konfiguration
  • Open-Source-Modell als Serving-Endpunkt

OpenAI-kompatible Serving-API

  • Chat-Completions über HTTP-Clients
  • Streaming von generierten Tokens
  • Sampling-Parameter und Antwortverhalten
  • Startfehler und erneutes Laden von Modellen

Performance-Mechaniken der LLM-Inferenz

  • PagedAttention im GPU-Speicherprofil
  • KV-Cache bei langen Kontexten
  • Continuous Batching unter Last
  • Parallele Requests im Scheduler

Lasttests und Quantisierung

  • Time to First Token
  • Token-Latenz und Gesamtdurchsatz
  • Präzisionsformate und Speicherbedarf
  • Prompt-basierte Qualitätsprüfung
  • Benchmarks für quantisierte Modellvarianten

GPU-Sizing und Deployment

  • VRAM-Bedarf nach Modellgröße
  • Kontextlänge und parallele Requests
  • Tensor-Parallelismus auf mehreren GPUs
  • Out-of-Memory-Fehler analysieren
  • Startparameter für produktionsnahe Endpunkte

Monitoring und Fehleranalyse

  • Prometheus-Metriken des vLLM-Servers
  • GPU-Auslastung und Speichernutzung
  • Logs für Fehler und Timeouts
  • Fehlerraten unter Last
  • Health-Checks für API-Endpunkte

Termin finden

Termine auf Anfrage

Kebel Training – Das spricht für uns

  • Über 1.200 Kurse im Portfolio

    Wähle deinen passenden Kurs zu einem festen Termin und erhalte dein Zertifikat. Lerne Live Online oder in Präsenz. Unser Kebel Team berät dich  kostenlos und unverbindlich.

    Seminarprogramm entdecken

  • Durchführungs- und Qualitätsgarantie

    Dein Seminar findet garantiert statt, wenn es von uns bestätigt wurde – schon ab dem ersten Teilnehmenden. Und falls du nicht zufrieden warst, kannst du es kostenlos wiederholen.

    Unsere Durchführungsgarantie

  • Firmenschulungen nach Maß – In Präsenz, Live Online oder hybrid

    Damit du deine Ziele sicher erreichst, passen wir jedes Training exakt an deine Vorkenntnisse und Bedürfnisse an. Spare dir unnötige Anfahrtswege: Auf Wunsch kommen wir für eine maßgeschneiderte Inhouse-Schulung direkt zu dir.

  • Mehr als 30 Jahre Schulungserfahrung

    Profitiere von unserer Erfahrung: Wir planen deine Weiterbildung zuverlässig und exakt zugeschnitten auf deine Ziele. Unsere über 1.000 Trainer und Trainerinnen begleiten dich mit jahrelanger Praxisexpertise und wertvollem Know-how aus der Erwachsenenbildung.

  • 21 Standorte in deiner Nähe

    Deutschlandweit stehen dir unsere modernen Schulungszentren für deine berufliche Fortbildung zur Verfügung.

    21 Schulungszentren

  • Seminarbewertungen auf www.eKomi.de

    Erlebe Weiterbildung, die wirklich hält, was sie verspricht! Mit über 1.700 Bewertungen und einem Schnitt von 4,8 Sternen profitierst du bei Kebel Training von einer nachweislich exzellenten Qualität, der du voll und ganz vertrauen kannst.

  • Bester Business-Partner 2026

    Eine gute Wahl – du buchst bei einem der 3 besten IT-Schulungs- & Zertifizierungsanbietern in Deutschland! Quelle: Award „Deutschlands Beste Business-Partner 2026″ von  dem DUP UNTERNEHMER-Magazin und dem Deutschen Institut für Service-Qualität (DISQ) – 13.8.2026.

  • Praxisorientierte Seminare & immer up to date

    Damit du immer einen Schritt voraus bist, erweitern und aktualisieren wir unser Seminarprogramm rund um IT, KI und Soft Skills kontinuierlich für dich.

     

  • Familienunternehmen in zweiter Generation

    Als familiengeführtes Unternehmen in zweiter Generation vereinen wir das Beste aus Tradition und Zukunft. Das bedeutet für dich: Absolute Zuverlässigkeit, kontinuierliche Weiterentwicklung und ein langjähriger Partner an deiner Seite.

Verwandte Kurse

  • GLM-5.1 Kurs: Open Source LLM produktiv nutzen

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 12.10.2026

    Weitere Kursinfos
  • LLM Security Kurs: Injections erkennen und abwehren

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 08.10.2026

    Weitere Kursinfos
  • OpenClaw Grundkurs: Sicher betreiben und täglich nutzen

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 05.11.2026

    Weitere Kursinfos
  • Kimi K2.5 Kurs: OpenSource LLM sofort produktiv

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 14.09.2026

    Weitere Kursinfos
  • LLM-Evaluation: Evaluation. Praxis. Sicherheit

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 12.11.2026

    Weitere Kursinfos
  • Mistral-KI Training: Europas LLM-Stack im Einsatz

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 23.11.2026

    Weitere Kursinfos
  • Agentic AI betreiben: Architektur. Sicherheit. Betrieb.

    Nächste und weitere Termine:
    In Präsenz: 21.09.2026
    Live Online: 21.09.2026

    Weitere Kursinfos
  • MCP-Training: Server sicher entwickeln und betreiben

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 07.09.2026

    Weitere Kursinfos

FAQ

vLLM ist eine Serving-Engine für die Inferenz großer Sprachmodelle. Sie stellt Modelle über APIs bereit und verwaltet GPU-Speicher sowie parallele Anfragen. PagedAttention, KV-Cache und Continuous Batching beeinflussen dabei, wie viele Requests verarbeitet werden und wie sich Latenz und Durchsatz entwickeln.

vLLM eignet sich, wenn ein kompatibles Open-Source-Modell über einen eigenen API-Endpunkt auf GPU-Infrastruktur bereitgestellt werden soll. Besonders relevant ist die Engine bei parallelen Requests, langen Kontexten und Anforderungen an messbaren Durchsatz.

Die benötigte GPU hängt von der Modellgröße, dem Präzisionsformat, der Kontextlänge und der Zahl paralleler Requests ab. In der Schulung leitest du den VRAM-Bedarf aus einem definierten Lastprofil ab, statt eine GPU allein anhand der Modellbezeichnung auszuwählen.

Verwendet wird ein für vLLM geeignetes Open-Source-Modell, an dem Installation, API-Serving, Quantisierung und Lasttests nachvollzogen werden. Die konkrete Modellwahl kann von der verfügbaren Laborumgebung und dem vorgesehenen GPU-Profil abhängen.

Du solltest sicher mit der Linux-Shell und HTTP-APIs umgehen sowie LLMs, Container und GPU-Ressourcen grundsätzlich verstehen. Python-Grundkenntnisse erleichtern die Client-Tests und die Auswertung der Messwerte.

Du erhältst nach der Schulung ein Zertifikat von Kebel Training als Nachweis deiner Weiterbildung. Es dokumentiert die behandelten Inhalte, ist jedoch keine offizielle Herstellerzertifizierung von vLLM.

Ob eine Inhouse-Durchführung möglich ist, klären wir anhand eurer GPU-Infrastruktur, Modellwahl und gewünschten Deployment-Umgebung. Nenne diese Eckdaten bei der Anfrage, damit der technische Zuschnitt vorab geprüft werden kann.

Ja, nach erfolgreicher Teilnahme am vLLM-Schulung: LLM-Inferenz performant betreiben erhältst Du ein Teilnahmezertifikat. Dieses bestätigt Deine erweiterten Kenntnisse im professionellen Einsatz von vLLM-Schulung: LLM-Inferenz performant betreiben .

Ja, wir garantieren die Durchführung aller von uns bestätigten Termine. Der vLLM-Schulung: LLM-Inferenz performant betreiben findet auch bereits ab einem Teilnehmer statt, sodass Du Deine Weiterbildung sicher und zuverlässig planen kannst.

Ja, wir bieten den vLLM-Schulung: LLM-Inferenz performant betreiben als Inhouse Training oder Firmenschulung an. Zusätzlich kann die Schulung auch als Online-Firmenschulung durchgeführt werden. Inhalte, Prozesse und Schwerpunkte passen wir individuell an die Anforderungen Deines Unternehmens an.

Name