Linux Administration für KI-Workloads mit GPUs Kurs

Treiber, CUDA-Stack, Performance und stabile Deployments für Training und Inference

Linux Administration für KI-Workloads mit GPUs Kurs
Linux Administration für KI-Workloads mit GPUs Kurs

Kursbeschreibung

  • Kurs-ID:KKC_0240
  • Kursdauer:3 Tage
Du betreibst Linux-Systeme, auf denen Data Science, Training oder Inference laufen sollen, und willst weniger „mysteriöse“ GPU-Probleme und mehr reproduzierbare Ergebnisse? Dieses Seminar führt Dich durch die entscheidenden Bausteine eines stabilen KI-Stacks auf Linux. Du beginnst bei den NVIDIA-Treibern und lernst, wie Kernel, Module, DKMS und Secure Boot zusammenspielen. Du übst, wie Du Treiber-Updates und Kernel-Updates so orchestrierst, dass Du Rollbacks beherrschst und Ausfälle vermeidest. Darauf aufbauend setzt Du CUDA, cuDNN und NCCL so ein, dass die Kompatibilität nachvollziehbar bleibt. Du lernst, welche Checks wirklich aussagekräftig sind, wie Du Persistenced einordnest und wie Du mit kurzen Tests die GPU-Funktion und grundlegende Performance verifizierst. Multi-GPU-Aspekte wie PCIe-Topologie, NVLink und NUMA werden so erklärt, dass Du sie in Troubleshooting und Kapazitätsplanung einsetzen kannst. Ein zentraler Teil ist der Container-Betrieb: Docker mit NVIDIA Container Toolkit, GPU-Durchreichung, Berechtigungen und typische Ursachen für fehlschlagende Jobs trotz „grünem“ Container-Start. Ergänzend behandelst Du Ressourcensteuerung mit cgroups v2, ulimits und Shared Memory sowie Performance-Tuning bei Storage und Netzwerk. Abschließend baust Du ein Betriebsset aus Monitoring-Pfaden, Incident-Playbooks und einer Go-Live-Checkliste, damit KI-Workloads nicht nur starten, sondern dauerhaft zuverlässig laufen.

Die wichtigsten Themen im Überblick

  • GPU-Stack unter Linux stabil aufsetzen
  • NVIDIA-Treiber, CUDA, cuDNN und NCCL sicher abstimmen
  • KI-Container mit Docker reproduzierbar bauen
  • GPU-Ressourcen mit cgroups v2 und MIG gezielt isolieren
  • Training und Inference mit NUMA und Storage optimieren
  • GPU-Monitoring für Auslastung und Thermals einrichten
  • Treiber- und Kernel-Probleme systematisch beheben
  • Go-Lives mit Checks, Runbooks und Rollback absichern

Zielgruppe

  • Linux-Administratorinnen und Linux-Administratoren mit Betriebsverantwortung für GPU-Server
  • DevOps- und Platform-Engineers, die KI-Workloads containerisiert ausrollen
  • ML-Engineers und MLOps-Verantwortliche mit Bedarf an stabilem Infrastruktur-Setup
  • IT-Betrieb und SRE-Teams, die Training und Inference absichern
  • Für alle, die GPU-Workloads unter Linux reproduzierbar, performant und wartbar betreiben wollen

Voraussetzung für die Schulung

  • Sichere Linux-Kenntnisse (Shell, Systemdienste, Paketmanagement, Logs)
  • Grundverständnis von Docker ist hilfreich, aber nicht zwingend

Kursinhalte

  • GPU-Stack unter Linux stabil aufsetzen
    • NVIDIA-Treiber: Versionierung, DKMS, Secure Boot, Kernel-Updates
    • CUDA, cuDNN, NCCL: Kompatibilität und typische Fallstricke
    • Multi-GPU-Grundlagen: Topologie, PCIe, NVLink, NUMA
    • Validierung: nvidia-smi, Persistenced, Smoke-Tests
  • Container für KI: Docker, NVIDIA Container Toolkit
    • GPU in Containern: Runtime, Device-Plugin-Logik, Berechtigungen
    • Images reproduzierbar bauen: Base-Images, Pinning, SBOM-Idee
    • Fehlerbilder: „CUDA driver too old“, fehlende Libs, Mount-Probleme
    • Best Practices für Training vs. Inference
  • Ressourcen, Scheduling und Isolation
    • cgroups v2: CPU, RAM, IO und GPU-Device-Zugriff
    • MIG und GPU-Slicing (Überblick): sinnvolle Einsatzmuster
    • Ulimits, Shared Memory, Hugepages: typische KI-Engpässe
    • Mehrbenutzerbetrieb: Rechte, Gruppen, Policy-Ansätze
  • Performance-Tuning für Training und Inference
    • Storage-Pfade: NVMe, RAID, Filesystem-Optionen, Dataset-Caching
    • Netzwerk: MTU/Jumbo Frames, RDMA-Grundlagen, Latenz-Checks
    • CPU-Pinning, NUMA-Affinität, IRQ-Balancing
    • Monitoring: GPU-Utilization, Thermals, Power-Limits
  • Observability, Troubleshooting und Betrieb
    • Logs und Metriken: journald, dmesg, DCGM-Ansatz, Exporter-Idee
    • Kernel- und Treiber-Debugging: Module, Signaturen, tainted Kernel
    • Incident-Playbooks: Rollback, Canary, Wartungsfenster
    • Hardening: Updates, Repo-Strategie, minimaler Angriffsvektor
  • Praxis: Referenz-Setup und Abnahmecheck
    • Golden Path: von Bare Metal bis Container-Workload
    • Kompatibilitätsmatrix als Betriebsdokument
    • Checkliste für Go-Live: Tests, Limits, Monitoring, Backup
    • Übergabe an Betrieb: Runbooks und Verantwortlichkeiten

Termin finden

Linux Administration für KI-Workloads mit GPUs Kurs
16.11. - 18.11.2026 Online Garantiekurs Rabatt
1.490 € netto
Linux Administration für KI-Workloads mit GPUs Kurs
01.02. - 03.02.2027 Online Garantiekurs Rabatt
1.490 € netto
Linux Administration für KI-Workloads mit GPUs Kurs
05.04. - 07.04.2027 Online Garantiekurs Rabatt
1.490 € netto
Linux Administration für KI-Workloads mit GPUs Kurs
14.06. - 16.06.2027 Online Garantiekurs Rabatt
1.490 € netto
Plätze frei Wenige Plätze frei Nicht buchbar

Verwandte Kurse

  • Beyond Machine Learning Kurs: Was kommt danach?

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 11.12.2026

    Weitere Kursinfos
  • Neo4j Graph-Datenbanken für KI Kurs

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 28.12.2026

    Weitere Kursinfos
  • LinkedIn Leads mit KI Kurs - Pipeline statt Posts

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 26.10.2026

    Weitere Kursinfos
  • UI/UX Design mit KI Kurs: Nutzerführung, die wirkt

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 07.12.2026

    Weitere Kursinfos
  • KI-Sicherheit in der Cloud Grundkurs

    Nächste und weitere Termine:
    In Präsenz: 05.10.2026
    Live Online: 05.10.2026

    Weitere Kursinfos
  • KI für Datenvisualisierung und Infografiken Kurs

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 14.12.2026

    Weitere Kursinfos
  • KI in Legacy-Software Kurs: Modernisieren ohne Rebuild

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 07.12.2026

    Weitere Kursinfos
  • Google Cloud AI Kurs: Vision, Translation, Video

    Nächste und weitere Termine:
    In Präsenz: -
    Live Online: 30.11.2026

    Weitere Kursinfos

Kebel Training – Das spricht für uns

  • Über 1.200 Kurse im Portfolio

    Wähle deinen passenden Kurs zu einem festen Termin und erhalte dein Zertifikat. Lerne Live Online oder in Präsenz. Unser Kebel Team berät dich kostenlos und unverbindlich.

    Seminarprogramm entdecken

  • Durchführungs- und Qualitätsgarantie

    Dein Seminar findet garantiert statt, wenn es von uns bestätigt wurde – schon ab dem ersten Teilnehmenden. Und falls du nicht zufrieden warst, kannst du es kostenlos wiederholen.

    Unsere Durchführungsgarantie

  • Firmenschulungen nach Maß – In Präsenz, Live Online oder hybrid

    Damit du deine Ziele sicher erreichst, passen wir jedes Training exakt an deine Vorkenntnisse und Bedürfnisse an. Spare dir unnötige Anfahrtswege: Auf Wunsch kommen wir für eine maßgeschneiderte Inhouse-Schulung direkt zu dir.

  • Mehr als 30 Jahre Schulungserfahrung

    Profitiere von unserer Erfahrung: Wir planen deine Weiterbildung zuverlässig und exakt zugeschnitten auf deine Ziele. Unsere über 1.000 Trainer und Trainerinnen begleiten dich mit jahrelanger Praxisexpertise und wertvollem Know-how aus der Erwachsenenbildung.

  • 21 Standorte in deiner Nähe

    Deutschlandweit stehen dir unsere modernen Schulungszentren für deine berufliche Fortbildung zur Verfügung.

    21 Schulungszentren

  • Seminarbewertungen auf www.eKomi.de

    Erlebe Weiterbildung, die wirklich hält, was sie verspricht! Mit über 1.700 Bewertungen und einem Schnitt von 4,8 Sternen profitierst du bei Kebel Training von einer nachweislich exzellenten Qualität, der du voll und ganz vertrauen kannst.

  • Bester Business-Partner 2026

    Eine gute Wahl – du buchst bei einem der 3 besten IT-Schulungs- & Zertifizierungsanbietern in Deutschland! Quelle: Award „Deutschlands Beste Business-Partner 2026″ von dem DUP UNTERNEHMER-Magazin und dem Deutschen Institut für Service-Qualität (DISQ) – 13.8.2026.

  • Praxisorientierte Seminare & immer up to date

    Damit du immer einen Schritt voraus bist, erweitern und aktualisieren wir unser Seminarprogramm rund um IT, KI und Soft Skills kontinuierlich für dich.

     

  • Familienunternehmen in zweiter Generation

    Als familiengeführtes Unternehmen in zweiter Generation vereinen wir das Beste aus Tradition und Zukunft. Das bedeutet für dich: Absolute Zuverlässigkeit, kontinuierliche Weiterentwicklung und ein langjähriger Partner an deiner Seite.

FAQ

Du lernst, GPU-Server unter Linux für Training und Inference stabil aufzusetzen, zu validieren und im Betrieb zu überwachen. Schwerpunkte sind NVIDIA-Treiber, CUDA, Container, Ressourcen-Isolation, Performance-Tuning und Troubleshooting.

Du brauchst sichere Linux-Kenntnisse, insbesondere Shell, Systemdienste, Paketmanagement und Logs. Docker-Grundverständnis ist hilfreich, aber nicht zwingend erforderlich.

Der Kurs behandelt NVIDIA-Treiber, DKMS, Secure Boot, Kernel-Updates sowie die Kompatibilität von CUDA, cuDNN und NCCL. Außerdem lernst Du Validierung mit nvidia-smi, Persistenced und Smoke-Tests.

Behandelt werden Docker, NVIDIA Container Toolkit, GPU-Zugriff in Containern, Runtime-Konfiguration und Berechtigungen. Dazu kommen reproduzierbare Images, Base-Images, Version-Pinning und typische Fehler wie „CUDA driver too old“.

Du bekommst Grundlagen zu Multi-GPU-Topologie, PCIe, NVLink und NUMA. Zusätzlich behandelt der Kurs cgroups v2, MIG, GPU-Slicing, Ulimits, Shared Memory und Rechte im Mehrbenutzerbetrieb.

Der Kurs behandelt Storage-Pfade mit NVMe, RAID, Filesystem-Optionen und Dataset-Caching sowie Netzwerk-Themen wie MTU, Jumbo Frames, RDMA-Grundlagen und Latenz-Checks. Auch CPU-Pinning, NUMA-Affinität, IRQ-Balancing, GPU-Utilization, Temperaturen und Power-Limits sind Teil des Seminars.

Du lernst, Logs und Metriken über journald, dmesg, DCGM-Ansätze und Exporter auszuwerten. Außerdem geht es um Kernel- und Treiber-Debugging, Rollback-Strategien, Canary-Vorgehen und Wartungsfenster.

Der Kurs dauert 3 Tage. In dieser Zeit werden Setup, Container-Betrieb, Ressourcen-Steuerung, Performance, Observability und ein Referenz-Setup mit Abnahmecheck behandelt.

Ja, nach erfolgreicher Teilnahme am Linux Administration für KI-Workloads mit GPUs Kurs erhältst Du ein Teilnahmezertifikat. Dieses bestätigt Deine erweiterten Kenntnisse im professionellen Einsatz von Linux Administration für KI-Workloads mit GPUs Kurs .

Ja, wir garantieren die Durchführung aller von uns bestätigten Termine. Der Linux Administration für KI-Workloads mit GPUs Kurs findet auch bereits ab einem Teilnehmer statt, sodass Du Deine Weiterbildung sicher und zuverlässig planen kannst.

Ja, wir bieten den Linux Administration für KI-Workloads mit GPUs Kurs als Inhouse Training oder Firmenschulung an. Zusätzlich kann die Schulung auch als Online-Firmenschulung durchgeführt werden. Inhalte, Prozesse und Schwerpunkte passen wir individuell an die Anforderungen Deines Unternehmens an.

Name