Alle Online-Kurse mit Sofortzugang · Bundles bis zu 75 % günstiger · Teams: 5 Plätze zum Preis von 3
Kursfinder starten Bundles ansehen
KI & Agentic Coding · Neu

CUDA & NVIDIA Software-Plattform: GPU-Beschleunigung für KI-Entwickler

Wer Modelle trainiert oder ausliefert, verbringt die meiste Zeit auf der GPU – und verschenkt dort oft den größten Teil der Leistung. In fünf Lerntagen lernst du, wie eine NVIDIA-GPU wirklich rechnet: Streaming Multiprocessors, Warps und Speicherhierarchie, eigene CUDA-Kernels mit globalem Index und Bounds-Check, Speicherverwaltung ohne Leaks, Coalescing, Shared Memory und Occupancy. Danach geht es in den Deep-Learning-Stack: cuDNN-Convolutions, cuBLAS und Tensor-Cores, Mixed Precision mit Loss-Scaling, eigene PyTorch-Operationen mit Backward und C++/CUDA-Extension, Streams, Multi-GPU-Training mit NCCL, Serving mit dem Triton Inference Server und Monitoring gegen SLOs. Python läuft direkt im Browser; der Simulator gpusim rechnet die Ergebnisse echt mit NumPy und bildet Kernel-Launches, Transfers und Metriken einer A100 nach – ohne eigene GPU, ohne Installation.

Level: Fortgeschritten Online5 Lerntage Deutsch Teilnahmezertifikat
Lernziele

Was du lernst.

  • Die Architektur einer NVIDIA-GPU (SMs, Warps, CUDA- und Tensor-Cores, Speicherhierarchie) verstehen und Durchsatz, Latenz und arithmetische Intensität einschätzen
  • CUDA-Kernels mit Threads, Blocks und Grids schreiben, Speicher mit cudaMalloc, cudaMemcpy und cudaFree sauber verwalten und gegen eine Referenz testen
  • Kernels mit Coalescing, Shared Memory, Tiling und passender Occupancy beschleunigen und mit nvcc und Nsight-Profilen begründen
  • cuDNN, cuBLAS, Tensor-Cores und Mixed Precision (FP16, BF16, TF32, Loss-Scaling) gezielt für Training und Inferenz einsetzen
  • Eigene PyTorch-Operationen mit autograd.Function, gradcheck und C++/CUDA-Extension (pybind11) bauen und Datentransfers mit Streams überlappen
  • Training auf mehrere GPUs skalieren (DDP, NCCL, NVLink), Modelle mit Triton ausliefern und GPU-Cluster mit Alarmen und SLOs überwachen
Ablauf

So ist der Kurs aufgebaut.

  1. Tag 1 · GPU-Architektur & CUDA-GrundlagenGPU vs. CPU, SMs, Warps und Speicherhierarchie, Threads, Blocks und Grids, globaler Index und Bounds-Check, erster Kernel für die Vektor-Addition, Transfer- gegen Kernelzeit.
  2. Tag 2 · CUDA-Programmierung & Memory-ManagementKernels und Qualifier, Speicher-Lebenszyklus ohne Leaks, Speichertypen, Coalescing, Bank-Conflicts und Padding, Occupancy-Limits, 2D-Grids, Matrix-Multiplikation mit Tiling, nvcc und Nsight.
  3. Tag 3 · cuDNN, Tensor-Cores & Deep-Learning-BeschleunigungcuDNN-Convolution und Algorithmenwahl, im2col, cuBLAS und GEMM, Tensor-Cores mit FP16, BF16 und TF32, Mixed Precision mit Loss-Scaling, Profiling.
  4. Tag 4 · PyTorch-CUDA, C++-Extensions & Custom-Opstorch.cuda, autograd.Function mit eigenem Backward, gradcheck, Custom-Ops wie RMSNorm, C++/CUDA-Extensions mit pybind11, Streams und Pinned Memory.
  5. Tag 5 · Production, Multi-GPU & CapstoneDDP und NCCL über NVLink, PCIe und InfiniBand, Triton Inference Server mit Dynamic Batching, Monitoring mit nvidia-smi und DCGM, SLOs und eine von fünf agentischen Freitags-Challenges.
Für wen?

Für KI-Entwicklerinnen und -Entwickler, ML-Engineers und Data Scientists, die verstehen wollen, was ihr Code auf der GPU tut, Trainings- und Inferenzzeiten senken und eigene GPU-Operationen bauen möchten.

Voraussetzungen

Solide Python- und NumPy-Kenntnisse, ein erster Kontakt mit PyTorch oder einem anderen Deep-Learning-Framework hilft. C++ ist nicht nötig. Für die Übungen genügt ein aktueller Browser, eine eigene NVIDIA-GPU ist optional.

Danach kannst du

Du schreibst und optimierst CUDA-Kernels, triffst begründete Entscheidungen zu Speicher, Präzision und Bibliotheken, baust eigene PyTorch-Operationen und planst Multi-GPU-Training und Serving gegen messbare SLOs – belegt durch ein Wochenprojekt, das jeden Tag wächst.

FAQ

Häufige Fragen zu CUDA & NVIDIA Software-Plattform.

Brauche ich eine eigene NVIDIA-GPU?

Nein. Der Simulator gpusim im Browser rechnet die Ergebnisse echt mit NumPy und bildet Kernel-Launches, Speichertransfers, Occupancy, cuDNN, Tensor-Cores, NCCL und Triton einer A100 nach. Wer eine GPU hat, überträgt den gezeigten CUDA-C++- und PyTorch-Code direkt.

Läuft echtes CUDA im Browser?

Nein. nvcc, cuDNN, NCCL und PyTorch-CUDA laufen nicht im Browser. Kernels schreibst du in Python im CUDA-Stil (Thread-Index, Bounds-Check, Grid und Block), die Zeiten und Metriken sind Modellschätzungen des Simulators. Die Konzepte und Entscheidungen sind dieselben wie auf echter Hardware.

Wie viele Übungen gibt es?

15 Übungen und Mini-Projekte im Tagesablauf, dazu 210 Zusatzaufgaben in der Challenge-Arena (Challenges, Knobeleien, Spiele und Rätsel), ein Wochenprojekt in fünf Stufen, 200 Quizfragen sowie Gruppenarbeiten und Mini-Vorträge für jeden Tag.

Für wen ist der Kurs zu schwer?

Ohne Python- und NumPy-Grundlagen wird es zäh. Dann lohnen sich vorher Python Grundlagen oder AI & ML Grundlagen.

Kostenlos

Der CLAUDE.md-Spickzettel.

Vorlage, Regeln und häufige Fehler auf zwei Seiten – dazu etwa zwei Praxis-Tipps im Monat. Jederzeit abbestellbar.

Double-Opt-in: Du bekommst zuerst eine E-Mail mit Bestätigungslink.

CUDA & NVIDIA Software-Plattform · 399 €