CUDA & NVIDIA Software-Plattform: GPU-Beschleunigung für KI-Entwickler
Wer Modelle trainiert oder ausliefert, verbringt die meiste Zeit auf der GPU – und verschenkt dort oft den größten Teil der Leistung. In fünf Lerntagen lernst du, wie eine NVIDIA-GPU wirklich rechnet: Streaming Multiprocessors, Warps und Speicherhierarchie, eigene CUDA-Kernels mit globalem Index und Bounds-Check, Speicherverwaltung ohne Leaks, Coalescing, Shared Memory und Occupancy. Danach geht es in den Deep-Learning-Stack: cuDNN-Convolutions, cuBLAS und Tensor-Cores, Mixed Precision mit Loss-Scaling, eigene PyTorch-Operationen mit Backward und C++/CUDA-Extension, Streams, Multi-GPU-Training mit NCCL, Serving mit dem Triton Inference Server und Monitoring gegen SLOs. Python läuft direkt im Browser; der Simulator gpusim rechnet die Ergebnisse echt mit NumPy und bildet Kernel-Launches, Transfers und Metriken einer A100 nach – ohne eigene GPU, ohne Installation.
Was du lernst.
- Die Architektur einer NVIDIA-GPU (SMs, Warps, CUDA- und Tensor-Cores, Speicherhierarchie) verstehen und Durchsatz, Latenz und arithmetische Intensität einschätzen
- CUDA-Kernels mit Threads, Blocks und Grids schreiben, Speicher mit cudaMalloc, cudaMemcpy und cudaFree sauber verwalten und gegen eine Referenz testen
- Kernels mit Coalescing, Shared Memory, Tiling und passender Occupancy beschleunigen und mit nvcc und Nsight-Profilen begründen
- cuDNN, cuBLAS, Tensor-Cores und Mixed Precision (FP16, BF16, TF32, Loss-Scaling) gezielt für Training und Inferenz einsetzen
- Eigene PyTorch-Operationen mit autograd.Function, gradcheck und C++/CUDA-Extension (pybind11) bauen und Datentransfers mit Streams überlappen
- Training auf mehrere GPUs skalieren (DDP, NCCL, NVLink), Modelle mit Triton ausliefern und GPU-Cluster mit Alarmen und SLOs überwachen
So ist der Kurs aufgebaut.
- Tag 1 · GPU-Architektur & CUDA-GrundlagenGPU vs. CPU, SMs, Warps und Speicherhierarchie, Threads, Blocks und Grids, globaler Index und Bounds-Check, erster Kernel für die Vektor-Addition, Transfer- gegen Kernelzeit.
- Tag 2 · CUDA-Programmierung & Memory-ManagementKernels und Qualifier, Speicher-Lebenszyklus ohne Leaks, Speichertypen, Coalescing, Bank-Conflicts und Padding, Occupancy-Limits, 2D-Grids, Matrix-Multiplikation mit Tiling, nvcc und Nsight.
- Tag 3 · cuDNN, Tensor-Cores & Deep-Learning-BeschleunigungcuDNN-Convolution und Algorithmenwahl, im2col, cuBLAS und GEMM, Tensor-Cores mit FP16, BF16 und TF32, Mixed Precision mit Loss-Scaling, Profiling.
- Tag 4 · PyTorch-CUDA, C++-Extensions & Custom-Opstorch.cuda, autograd.Function mit eigenem Backward, gradcheck, Custom-Ops wie RMSNorm, C++/CUDA-Extensions mit pybind11, Streams und Pinned Memory.
- Tag 5 · Production, Multi-GPU & CapstoneDDP und NCCL über NVLink, PCIe und InfiniBand, Triton Inference Server mit Dynamic Batching, Monitoring mit nvidia-smi und DCGM, SLOs und eine von fünf agentischen Freitags-Challenges.
Für KI-Entwicklerinnen und -Entwickler, ML-Engineers und Data Scientists, die verstehen wollen, was ihr Code auf der GPU tut, Trainings- und Inferenzzeiten senken und eigene GPU-Operationen bauen möchten.
Solide Python- und NumPy-Kenntnisse, ein erster Kontakt mit PyTorch oder einem anderen Deep-Learning-Framework hilft. C++ ist nicht nötig. Für die Übungen genügt ein aktueller Browser, eine eigene NVIDIA-GPU ist optional.
Du schreibst und optimierst CUDA-Kernels, triffst begründete Entscheidungen zu Speicher, Präzision und Bibliotheken, baust eigene PyTorch-Operationen und planst Multi-GPU-Training und Serving gegen messbare SLOs – belegt durch ein Wochenprojekt, das jeden Tag wächst.
Häufige Fragen zu CUDA & NVIDIA Software-Plattform.
Brauche ich eine eigene NVIDIA-GPU?
Nein. Der Simulator gpusim im Browser rechnet die Ergebnisse echt mit NumPy und bildet Kernel-Launches, Speichertransfers, Occupancy, cuDNN, Tensor-Cores, NCCL und Triton einer A100 nach. Wer eine GPU hat, überträgt den gezeigten CUDA-C++- und PyTorch-Code direkt.
Läuft echtes CUDA im Browser?
Nein. nvcc, cuDNN, NCCL und PyTorch-CUDA laufen nicht im Browser. Kernels schreibst du in Python im CUDA-Stil (Thread-Index, Bounds-Check, Grid und Block), die Zeiten und Metriken sind Modellschätzungen des Simulators. Die Konzepte und Entscheidungen sind dieselben wie auf echter Hardware.
Wie viele Übungen gibt es?
15 Übungen und Mini-Projekte im Tagesablauf, dazu 210 Zusatzaufgaben in der Challenge-Arena (Challenges, Knobeleien, Spiele und Rätsel), ein Wochenprojekt in fünf Stufen, 200 Quizfragen sowie Gruppenarbeiten und Mini-Vorträge für jeden Tag.
Für wen ist der Kurs zu schwer?
Ohne Python- und NumPy-Grundlagen wird es zäh. Dann lohnen sich vorher Python Grundlagen oder AI & ML Grundlagen.
Der CLAUDE.md-Spickzettel.
Vorlage, Regeln und häufige Fehler auf zwei Seiten – dazu etwa zwei Praxis-Tipps im Monat. Jederzeit abbestellbar.