vLLM-Schulung: LLM-Inferenz performant betreiben

Bringe Open-Source-LLMs vom GPU-Test zu einem vLLM-Endpunkt mit dokumentierten Messwerten

vLLM-Schulung: LLM-Inferenz performant betreiben
vLLM-Schulung: LLM-Inferenz performant betreiben

Kursbeschreibung

  • Kurs-ID:VLLM-SRV
  • Kursdauer:3 Tage
  • Uhrzeit:09:00 - 16:00 Uhr

Die vLLM-Schulung führt ein GPU-basiertes LLM-Deployment bis zu einem getesteten Serving-Endpunkt. Du installierst vLLM in einer isolierten Linux-Umgebung, stellst ein Open-Source-Modell über den vLLM-Server bereit und prüfst die OpenAI-kompatible API mit Chat-Completions und Streaming. Das Ergebnis ist kein reiner Prototyp: Am Ende stehen gemessene Werte für Durchsatz, Time to First Token, Token-Latenz und VRAM-Auslastung sowie dokumentierte Startparameter für ein definiertes Lastprofil.

An drei Tagen untersuchst du, wie Continuous Batching, KV-Cache und PagedAttention das Serving-Verhalten beeinflussen. Lasttests zeigen, wie sich parallele Requests und lange Kontexte auf Antwortzeit und GPU-Speicher auswirken. Bei der Quantisierung vergleichst du Modellvarianten anhand ihres Speicherbedarfs, ihres Antwortverhaltens und des nötigen Prüfaufwands. Aus der Modellgröße, der Kontextlänge und der Ziellatenz leitest du anschließend ein begründetes GPU-Sizing ab.

Monitoring gehört zum Deployment. Prometheus-Metriken, die GPU-Auslastung und Server-Logs zeigen, wann ein Endpunkt an seine Grenzen stößt. Auch Fehlerraten und Health-Checks weisen auf diese Grenzen hin. In der kleinen Gruppe von 2 bis 8 Personen kannst du Konfigurationen nachvollziehen, Messwerte vergleichen und Fehler systematisch untersuchen. Weitere technische KI-Themen findest du bei den KI-Schulungen für Entwickler und Administratoren. Als Anwendungsschicht für den bereitgestellten Endpunkt eignet sich anschließend die Open-WebUI-Schulung für Self-Hosted-KI. Frag den passenden Termin für dich oder dein Team an und nenne dabei Modell, GPU-Umgebung und gewünschtes Lastprofil.

Die wichtigsten Themen im Überblick

  • vLLM-Endpunkt selbst bereitstellen
  • Latenz und Durchsatz messen
  • VRAM-Bedarf dokumentieren
  • GPU-Sizing aus Lastprofilen ableiten
  • Serving mit Metriken überwachen

Zielgruppe

  • Fachkräfte in der KI-Entwicklung mit LLM-Projekten
  • MLOps-Teams für selbst gehostete Modelle
  • Plattform-Teams mit GPU-Infrastruktur
  • Fachkräfte nach dem LLM-Self-Hosting-Training zur Vertiefung der Inferenz

Voraussetzung für die Schulung

  • Sicherer Umgang mit Linux-Shell und HTTP-APIs
  • Grundkenntnisse in Python und Container-Technik
  • Grundverständnis von LLMs und Kontextlängen
  • Kenntnisse über GPU-Ressourcen, VRAM und CUDA
  • Bei fehlender GPU-Erfahrung empfiehlt sich die Linux-Administration für KI-Workloads mit GPUs

Kursinhalte

vLLM-Architektur und Labor-Setup

  • vLLM-Runtime im Serverbetrieb
  • Isolierte Installation unter Linux
  • Modellbezug und Tokenizer-Konfiguration
  • Open-Source-Modell als Serving-Endpunkt

OpenAI-kompatible Serving-API

  • Chat-Completions über HTTP-Clients
  • Streaming von generierten Tokens
  • Sampling-Parameter und Antwortverhalten
  • Startfehler und erneutes Laden von Modellen

Performance-Mechaniken der LLM-Inferenz

  • PagedAttention im GPU-Speicherprofil
  • KV-Cache bei langen Kontexten
  • Continuous Batching unter Last
  • Parallele Requests im Scheduler

Lasttests und Quantisierung

  • Time to First Token
  • Token-Latenz und Gesamtdurchsatz
  • Präzisionsformate und Speicherbedarf
  • Prompt-basierte Qualitätsprüfung
  • Benchmarks für quantisierte Modellvarianten

GPU-Sizing und Deployment

  • VRAM-Bedarf nach Modellgröße
  • Kontextlänge und parallele Requests
  • Tensor-Parallelismus auf mehreren GPUs
  • Out-of-Memory-Fehler analysieren
  • Startparameter für produktionsnahe Endpunkte

Monitoring und Fehleranalyse

  • Prometheus-Metriken des vLLM-Servers
  • GPU-Auslastung und Speichernutzung
  • Logs für Fehler und Timeouts
  • Fehlerraten unter Last
  • Health-Checks für API-Endpunkte

Termin finden

Termine auf Anfrage

21 Schulungszentren

Lerne an 21 Standorten, inhouse oder Live Online

Als bundesweit tätiger und renommierter Seminaranbieter bietet dir die Kebel Training GmbH ein umfangreiches Angebot an IT-Schulungen, KI-Seminaren und Soft-Skills Trainings an.

Unser vLLM-Schulung: LLM-Inferenz performant betreiben findet in der Regel als Präsenzseminar in Berlin, Bremen, Dortmund, Dresden, Düsseldorf, Erfurt, Essen, Frankfurt, Hamburg, Hannover, Koblenz, Köln, Krefeld, Leipzig, München, Münster, Nürnberg, Regensburg, Saarbrücken, Siegen und Stuttgart statt.

Alternativ kann deine Fortbildung als Inhouse-Schulung bei dir vor Ort, Workshop und als Live Online Training organisiert werden. Unser Kebel Team berät dich gerne.

Zur Standortübersicht

eKomi Seminarbewertungen für www.kebel.de

eKomi Seminarbewertungen

Qualität ist bei Kebel kein Versprechen, sondern belegbar. Deshalb setzen wir auf das unabhängige Bewertungsportal eKomi. Nach jeder IT-, KI- oder Soft Skills Schulung – live online oder in Präsenz durchgeführt – erhalten unsere Teilnehmer:innen die Möglichkeit, uns anonym und freiwillig zu bewerten.

Mit über 1.700 Bewertungen in den letzten 12 Monaten zählen wir zu den bestbewerteten Anbietern für IT-Weiterbildungen.  Alle Bewertungen, ob positiv oder kritisch, fließen transparent in unsere offizielle Bewertungsstatistik ein und bilden die Grundlage unserer eKomi Trust-Zertifikate.

Für dich als Personalverantwortliche, IT-Fachkraft oder Entscheider:in bedeutet das: verifizierte Teilnehmerstimmen, geprüfte Qualität und maximale Transparenz bei der Auswahl deines Weiterbildungspartners.

Zum Bewertungsportal

Kebel Training – Das spricht dafür…

  • Über 1.200 Kurse im Portfolio

    Wähle deinen passenden Kurs zu einem festen Termin und erhalte dein Zertifikat. Lerne Live Online oder in Präsenz. Unser Kebel Team berät dich  kostenlos und unverbindlich.

    Seminarprogramm entdecken

  • Durchführungs- und Qualitätsgarantie

    Dein Seminar findet garantiert statt, wenn es von uns bestätigt wurde – schon ab dem ersten Teilnehmenden. Und falls du nicht zufrieden warst, kannst du es kostenlos wiederholen.

    Unsere Durchführungsgarantie

  • Firmenschulungen nach Maß – In Präsenz, Live Online oder hybrid

    Wir richten unsere Trainings individuell nach euren Anforderungen und Zielen aus. Auf Wunsch kann eure Schulung vor Ort als Inhouse- Schulung organisiert werden.

  • Mehr als 30 Jahre Schulungserfahrung

    Seit 1995 planen wir erfolgreich und zuverlässig Weiterbildungen im IT- und Soft-Skills Bereich.

  • 21 Standorte in deiner Nähe

    Deutschlandweit stehen dir unsere modernen Schulungszentren für deine berufliche Fortbildung zur Verfügung.

    21 Schulungszentren

  • Familienunternehmen in zweiter Generation

    Als Familienunternehmen in zweiter Generation verbinden wir Tradition mit Zukunft.

Verwandte Kurse

  • GLM-5.1 Kurs: Open Source LLM produktiv nutzen

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 12.10.2026

    Weitere Kursinfos
  • LLM Security Kurs: Injections erkennen und abwehren

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 08.10.2026

    Weitere Kursinfos
  • OpenClaw Grundkurs: Sicher betreiben und täglich nutzen

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 05.11.2026

    Weitere Kursinfos
  • Kimi K2.5 Kurs: OpenSource LLM sofort produktiv

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 14.09.2026

    Weitere Kursinfos
  • LLM-Evaluation: Evaluation. Praxis. Sicherheit

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 12.11.2026

    Weitere Kursinfos
  • Mistral-KI Training: Europas LLM-Stack im Einsatz

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 24.08.2026

    Weitere Kursinfos
  • Agentic AI betreiben: Architektur. Sicherheit. Betrieb.

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 21.09.2026

    Weitere Kursinfos
  • MCP-Training: Server sicher entwickeln und betreiben

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 07.09.2026

    Weitere Kursinfos

FAQ

vLLM ist eine Serving-Engine für die Inferenz großer Sprachmodelle. Sie stellt Modelle über APIs bereit und verwaltet GPU-Speicher sowie parallele Anfragen. PagedAttention, KV-Cache und Continuous Batching beeinflussen dabei, wie viele Requests verarbeitet werden und wie sich Latenz und Durchsatz entwickeln.

vLLM eignet sich, wenn ein kompatibles Open-Source-Modell über einen eigenen API-Endpunkt auf GPU-Infrastruktur bereitgestellt werden soll. Besonders relevant ist die Engine bei parallelen Requests, langen Kontexten und Anforderungen an messbaren Durchsatz.

Die benötigte GPU hängt von der Modellgröße, dem Präzisionsformat, der Kontextlänge und der Zahl paralleler Requests ab. In der Schulung leitest du den VRAM-Bedarf aus einem definierten Lastprofil ab, statt eine GPU allein anhand der Modellbezeichnung auszuwählen.

Verwendet wird ein für vLLM geeignetes Open-Source-Modell, an dem Installation, API-Serving, Quantisierung und Lasttests nachvollzogen werden. Die konkrete Modellwahl kann von der verfügbaren Laborumgebung und dem vorgesehenen GPU-Profil abhängen.

Du solltest sicher mit der Linux-Shell und HTTP-APIs umgehen sowie LLMs, Container und GPU-Ressourcen grundsätzlich verstehen. Python-Grundkenntnisse erleichtern die Client-Tests und die Auswertung der Messwerte.

Du erhältst nach der Schulung ein Zertifikat von Kebel Training als Nachweis deiner Weiterbildung. Es dokumentiert die behandelten Inhalte, ist jedoch keine offizielle Herstellerzertifizierung von vLLM.

Ob eine Inhouse-Durchführung möglich ist, klären wir anhand eurer GPU-Infrastruktur, Modellwahl und gewünschten Deployment-Umgebung. Nenne diese Eckdaten bei der Anfrage, damit der technische Zuschnitt vorab geprüft werden kann.

Ja, nach erfolgreicher Teilnahme am vLLM-Schulung: LLM-Inferenz performant betreiben erhältst Du ein Teilnahmezertifikat. Dieses bestätigt Deine erweiterten Kenntnisse im professionellen Einsatz von vLLM-Schulung: LLM-Inferenz performant betreiben .

Ja, wir garantieren die Durchführung aller von uns bestätigten Termine. Der vLLM-Schulung: LLM-Inferenz performant betreiben findet auch bereits ab einem Teilnehmer statt, sodass Du Deine Weiterbildung sicher und zuverlässig planen kannst.

Ja, wir bieten den vLLM-Schulung: LLM-Inferenz performant betreiben als Inhouse Training oder Firmenschulung an. Zusätzlich kann die Schulung auch als Online-Firmenschulung durchgeführt werden. Inhalte, Prozesse und Schwerpunkte passen wir individuell an die Anforderungen Deines Unternehmens an.

Name