Alle Online-Kurse mit Sofortzugang · Bundles bis zu 75 % günstiger · Teams: 5 Plätze zum Preis von 3
Kursfinder starten Bundles ansehen
KI & Agentic Coding · Neu

Hardware für lokale KI-Modelle: Local LLMs & Workstation-Engineering

Lokale Sprachmodelle halten Daten im Haus – aber nur, wenn die Hardware passt. In fünf Lerntagen lernst du, warum zuerst der Grafikspeicher und dann die Speicherbandbreite über Erfolg entscheiden, wie du VRAM-Bedarf und Tokens pro Sekunde selbst ausrechnest und welche Hardware zu welchem Modell passt: von RTX 4090 und 5090 über RTX PRO 6000, A100 und H100 bis zu Mac Studio und DGX Spark. Du betreibst Modelle mit Ollama, vLLM und llama.cpp, quantisierst sie bewusst (Q4, Q5, Q8, AWQ, FP8), planst Workstations und Server mit Netzteil, Kühlung, NVLink und InfiniBand und bringst alles mit Monitoring, Alarmen, TCO-Rechnung und Sicherheitskonzept in Produktion. Python läuft echt im Browser, GPU, Ollama, vLLM und llama.cpp sind nachvollziehbar simuliert – ohne eigene Grafikkarte.

Level: Fortgeschritten Online5 Lerntage Deutsch Teilnahmezertifikat
Lernziele

Was du lernst.

  • VRAM-Bedarf (Gewichte, KV-Cache, Overhead) und Tokens pro Sekunde für Modell, Quantisierung und Hardware selbst berechnen
  • GPU-Typen von RTX bis H100, Mac Studio und DGX Spark nach Speicher, Bandbreite, Preis/Performance und TCO vergleichen
  • Modelle mit Ollama, vLLM und llama.cpp starten, konfigurieren und Performance, Latenz und Durchsatz testen
  • Quantisierung, Pruning und Distillation gezielt einsetzen und den Qualitätsverlust mit Evals prüfen
  • Workstations und GPU-Server mit Netzteil, Kühlung, PCIe/NVLink, InfiniBand und Scaling-Strategie planen
  • Local LLMs production-ready betreiben: HA, Monitoring mit DCGM und Prometheus, Alarme, Kosten pro Token, Auth, RBAC, Audit und TLS
Ablauf

So ist der Kurs aufgebaut.

  1. Tag 1 · Hardware-Grundlagen für Local LLMsGPU, CPU, RAM, NVMe und PCIe, GPU-Typen im Vergleich, VRAM, Bandbreite und Tensor Cores, Use-Cases von Single-GPU bis Rack, Preis/Performance und TCO, Mini-Projekt Hardware-Config für 8B, 14B und 70B.
  2. Tag 2 · Ollama, vLLM & llama.cpp SetupModelle holen und starten, PagedAttention und Continuous Batching, Tensor Parallel, GGUF und Layer-Offload, Tokens/s, TTFT und parallele Anfragen, Mini-Projekt Local LLM betreiben und testen.
  3. Tag 3 · Model-Optimierung: Quantization, Pruning, DistillationFP16, INT8, FP8, INT4 und GGUF-Typen, KV-Cache-Quantisierung, Pruning und Distillation, Trade-offs zwischen Qualität, Tempo und VRAM, Mini-Projekt Q4 und Q5 erzeugen und vergleichen.
  4. Tag 4 · Workstation-Setup, Server-Architektur & ScalingNetzteil, Kühlung und Power-Limit, Rack und Multi-GPU, PCIe gegen NVLink, 10GbE gegen InfiniBand, vertikales und horizontales Scaling, Mini-Projekt Workstation-Architektur.
  5. Tag 5 · Production, Monitoring & CapstoneHA, Load Balancing und DR, GPU-Monitoring und Alarme, TCO und Break-even gegenüber der Cloud, Auth, RBAC, Audit und Secrets, eine von fünf agentischen Freitags-Challenges und das Capstone.
Für wen?

Für IT-Leute, Admins, Entwicklerinnen und Entwickler sowie Entscheider, die Sprachmodelle datenschutzkonform auf eigener Hardware betreiben und Hardware-Käufe fundiert begründen wollen.

Voraussetzungen

Python-Grundkenntnisse (Variablen, Listen, Funktionen) und etwas Erfahrung mit der Kommandozeile. Eine eigene GPU ist nicht nötig, für die Übungen genügt ein aktueller Browser.

Danach kannst du

Du rechnest für jedes Modell VRAM, Tempo und Kosten aus, wählst passende Hardware und Engine, betreibst Modelle mit Ollama, vLLM und llama.cpp und präsentierst eine eigene, abgesicherte Local-LLM-Architektur im Capstone.

FAQ

Häufige Fragen zu Hardware für lokale KI-Modelle.

Brauche ich eine eigene Grafikkarte?

Nein. Python läuft echt im Browser, GPU, Ollama, vLLM und llama.cpp sind im Hardware-Labor simuliert. Der Simulator rechnet mit Herstellerangaben zu Speicher und Bandbreite und einem offengelegten Modell für Tokens pro Sekunde. Wer eine GPU hat, überträgt die Befehle direkt.

Sind die Benchmark-Werte echte Messungen?

Nein, es sind nachvollziehbare Lernwerte aus einer Modellrechnung (Tokens/s ≈ Bandbreite × Effizienz / gelesene GB pro Token). Sie liegen in der Größenordnung echter Messungen und zeigen die richtigen Zusammenhänge. Hardwarepreise sind gerundete Richtwerte, keine Angebote.

Wie viele Übungen und Quizfragen gibt es?

20 Übungen und Mini-Projekte mit automatischer Prüfung, 223 Quizfragen (davon 79 „Was gibt der Code aus?“) mit Fehlerheft, fünf agentische Freitags-Challenges, ein Capstone mit Präsentationsmodus und ein PDF-Spickzettel.

Wie unterscheidet sich der Kurs von LLMOps & KI-Modell-Deployment?

Dieser Workshop konzentriert sich in fünf Tagen auf die Hardware und den Betrieb lokaler Modelle. Der LLMOps-Kurs geht in acht Wochen breiter auf Deployment, CI/CD, Evaluation und FinOps ein.

Kostenlos

Der CLAUDE.md-Spickzettel.

Vorlage, Regeln und häufige Fehler auf zwei Seiten – dazu etwa zwei Praxis-Tipps im Monat. Jederzeit abbestellbar.

Double-Opt-in: Du bekommst zuerst eine E-Mail mit Bestätigungslink.

Hardware für lokale KI-Modelle · 399 €