LLMOps & KI-Modell-Deployment: Open-Source-Modelle produktiv betreiben
Ein Sprachmodell lokal zu starten ist einfach – es zuverlässig, sicher und bezahlbar in Produktion zu betreiben nicht. In acht Wochen hostest du Llama 3/4 und Mistral mit Ollama, vLLM und Hugging Face, machst sie mit Quantisierung, Batching und Caching schnell und günstig, deployst lokal, in der Cloud und hybrid, überwachst sie mit Tracing, Prometheus und Grafana, automatisierst Releases mit CI/CD und Model-Registry und steuerst die Kosten mit FinOps. Python läuft direkt im Browser; GPU-Server, Cloud und Tools sind realistisch simuliert – ohne GPU, ohne Cloud-Konto, ohne Kosten.
Was du lernst.
- Open-Source-LLMs mit Ollama, vLLM, TGI und Hugging Face Inference Endpoints hosten und per OpenAI-kompatibler API ansprechen
- GPU-Speicher, Durchsatz und Latenz berechnen und mit Quantisierung (AWQ, GPTQ, GGUF), Batching und Caching optimieren
- Deployment-Muster wählen: lokal, EC2, SageMaker, Serverless, Kubernetes und Hybrid mit Cloud-Burst
- Pipelines mit LangSmith, OpenTelemetry, Arize, Prometheus und Grafana beobachten und Alerts definieren
- CI/CD mit GitHub Actions, MLflow-Registry, Eval-Gates und Canary-Rollouts aufbauen
- Kosten pro Token steuern, Budgets und FinOps einführen und Endpunkte nach DSGVO und EU AI Act absichern
So ist der Kurs aufgebaut.
- Woche 1 · LLMOps & Model-HostingLifecycle, Ollama, vLLM auf EC2, Hugging Face Endpoints, Cost-Calculator, Inference-APIs testen.
- Woche 2 · Optimization & PerformanceQuantisierung (INT8, AWQ, GPTQ, GGUF), Dynamic vs. Continuous Batching, KV-, Prompt- und Semantic-Cache, Lasttests.
- Woche 3 · Deployment-PatternsDocker und EC2, SageMaker, Serverless mit Lambda, Kubernetes, Hybrid mit Cloud-Burst, Managed Services im Vergleich.
- Woche 4 · Monitoring & ObservabilityTracing mit LangSmith und OpenTelemetry, Arize, Prometheus und Grafana, Alerting, zentrale Logs.
- Woche 5 · CI/CD, Registry & VersioningGitHub Actions, MLflow-Registry, Versionierung von Modellen und Prompts, Canary, Blue-Green, Tests.
- Woche 6 · Cost-Optimization & FinOpsCost Explorer, Spot-Instanzen, Budgets, Cost-per-Token, Chargeback, Forecast, FinOps-Dashboard.
- Woche 7 · Security, Compliance & GovernanceAuthN/AuthZ, Secrets, Audit-Logs, DSGVO, EU AI Act, Governance-Workflows, Risk-Mapping.
- Woche 8 · CapstoneEigene End-to-End-Pipeline: Deployment, Monitoring, Kosten, Security – Portfolio und Präsentation.
Für ML- und Software-Engineers, DevOps- und Plattform-Teams sowie technische Verantwortliche, die Open-Source-Sprachmodelle selbst betreiben wollen – besonders dort, wo Datenhoheit und Kosten zählen.
Solide Python-Kenntnisse und Grundverständnis von LLMs; Erfahrung mit Linux, Docker oder Cloud hilft. AI Bootcamp oder Python Fortgeschritten sind eine gute Vorbereitung.
Du betreibst Open-Source-LLMs produktionsreif: messbar schnell, überwacht, versioniert, abgesichert und mit Kosten pro Token im Griff – belegt durch ein eigenes Capstone-Projekt fürs Portfolio.
Häufige Fragen zu LLMOps & KI-Modell-Deployment.
Brauche ich eine GPU oder ein Cloud-Konto?
Nein. Python mit NumPy, Pandas und Matplotlib läuft über Pyodide im Browser. Ollama, vLLM, Hugging Face, Docker, Kubernetes, AWS, LangSmith, Arize, MLflow und Prometheus sind realistisch simuliert – inklusive typischer Logs, Fehlermeldungen, Metriken und Kostenberichte.
Welche Modelle behandelt der Kurs?
Llama 3.1/3.3 und Llama 4, Mistral 7B und Mistral Small, Qwen 2.5 und Phi – mit Lizenz, Speicherbedarf und Einsatzempfehlung.
Wie viele Übungen gibt es?
80 Übungen mit automatischer Prüfung der Lernziele, 40 Quiz-Sprints und jeden Freitag eine von fünf agentischen Challenges – insgesamt 40 zur Auswahl.
Geht es auch um DSGVO und EU AI Act?
Ja, Woche 7 behandelt Authentifizierung, Secrets, Audit-Logs, DSGVO-Pflichten und die Einstufung nach EU AI Act – praxisnah für den Betrieb eigener Modelle.
Der CLAUDE.md-Spickzettel.
Vorlage, Regeln und häufige Fehler auf zwei Seiten – dazu etwa zwei Praxis-Tipps im Monat. Jederzeit abbestellbar.