
LLM Inference Optimierung
Die größten Kostentreiber beim LLM-Betrieb sind Latenz und GPU-Ressourcen. Mit den richtigen Inference-Optimierungen lässt sich der Durchsatz um den Faktor 5–20 steigern und die Kosten drastisch senken. Sie lernen, wie vLLM, Quantisierung (GGUF, AWQ, GPTQ) und Continuous Batching funktionieren und wie Self-Hosted-Modelle kosteneffizient auf Runpod, Modal oder eigener Hardware deployt werden.






Ziele
Sie können nach diesem Kurs eigene LLMs mit vLLM serving betreiben, die richtige Quantisierungsstufe für Ihren Use Case wählen und Inference-Kosten systematisch optimieren. Sie kennen den Tradeoff zwischen Modellgröße, Qualität und Kosten und können einen Self-Hosted-LLM-Endpoint aufsetzen.
Behandelte Themen
Die Module im Überblick
Modul 1: LLM-Inference-Grundlagen und Bottlenecks
- Wie LLM-Inference funktioniert: Prefill, Decode und KV-Cache
- Typische Bottlenecks: Memory-Bandwidth, Compute und Latenz vs. Throughput
- Kostenrechnung: Token-Kosten bei API-Anbietern vs. Self-Hosted
- Entscheidungsrahmen: wann Self-Hosting sich lohnt
Modul 2: Quantisierung — Modelle verkleinern ohne Qualitätsverlust
- Quantisierungs-Grundlagen: FP16, INT8, INT4 und ihre Auswirkungen
- GGUF: llama.cpp-Format für CPU und Mixed-GPU-Inference
- AWQ und GPTQ: GPU-optimierte Quantisierung für vLLM
- Qualitäts-Benchmarks: Perplexity und Task-Performance nach Quantisierung
Modul 3: vLLM — Hochperformantes LLM-Serving
- vLLM-Architektur: PagedAttention und Continuous Batching
- vLLM aufsetzen: Installation, Modell laden und OpenAI-kompatibler Endpoint
- Throughput-Optimierung: Batch-Größe, Max-Sequences und GPU-Memory-Utilization
- Streaming, Sampling-Parameter und Guided Generation (JSON-Mode)
Modul 4: Cloud-Deployment auf Runpod und Modal
- Runpod: GPU-Pods mieten, Templates nutzen und vLLM-Server starten
- Modal: serverless GPU-Functions für On-Demand-Inference
- Autoscaling: 0 bis N GPU-Instances je nach Last
- Kostenmonitoring und Budget-Alerts einrichten
Kodschul-Trainer & Team
Lernen Sie von Experten - erfahrene Fachleute mit praktischem Know-how
Erfahrene Trainer mit praktischer Technik-Erfahrung
Über 3000 Fachkräfte in zwei Jahren geschult
Praxisnahe Expertise und tiefes Branchenwissen
Wirkungsvolles Lernen mit realen Anwendungen
Über 300+ Projekte gemeinsam abgeschlossen






Selina Schmid
Seminar Manager

Elisa Saleh
Back Office

Lars Gerigk
Portfolio Manager

Sebastian Carnal
HR & People

Ömer Akgeyik
Tech Lead
So läuft das Training ab
Unsere Schulungen sind 100% hands-on, mit einem praktischen Anteil von 70% und 30% Theorie. Sie finden vor Ort, bei uns oder online (auf allen gängigen Plattformen) statt. Zusätzlich erhalten die Teilnehmenden kostenfrei Hands-outs und Unterlagen, die sie zur Vertiefung und weiteren Anwendung nutzen können.
Grundlagen
Zu Beginn sorgen wir dafür, dass alle Teilnehmenden auf denselben Wissensstand gebracht werden, unabhängig von ihrem Ausgangsniveau. So wird jeder optimal auf die weiteren Themen vorbereitet, und niemand bleibt zurück.
Durchführung
Wir starten mit einer Einführung in das Thema, gefolgt von Demos und praxisnahen Beispielen. Anschließend üben die Teilnehmenden eigenständig, während der Trainer individuelles Feedback gibt und bei Bedarf Korrekturen vornimmt.
Anwendungsfälle
Das Gelernte wird auf konkrete Anwendungsfälle der Teilnehmenden angewendet. In einer praxisorientierten Session erarbeiten wir gemeinsam Lösungen, die den Teilnehmern helfen, das Wissen direkt in ihren Arbeitsalltag zu integrieren.
Am häufigsten gestellte Fragen
Für wen ist dieser Kurs konzipiert?
+Wie kann ich mich für den Kurs anmelden?
+Wie hoch sind die Kosten für den Kurs?
+Brauche ich Vorkenntnisse zum Thema des Kurses?
+Werde ich das Gelernte in diesem Kurs anwenden können?
+Welche Software oder Tools benötige ich für den Kurs?
+Lassen Sie uns über Ihr nächstes Training sprechen.
Unser Team steht Ihnen rund um die Uhr zur Verfügung und freut sich auf Ihre Anfrage. Einfach anrufen oder eine Nachricht hinterlassen – wir kümmern uns schnellstmöglich um Ihre Anfrage, ob es um eine Schulung, einen Vortrag oder eine Präsentation geht. Jetzt loslegen!

Selina Schmid
Leiterin Kodschul