LLM-Inferenz mit klaren Grenzen und messbarer Leistung betreiben
vLLM-Schulung: Open-Source-LLMs bereitstellen vermittelt praxisnah, wie Sie Open-Source-LLMs performant bereitstellen, konfigurieren und überwachen. Produktiver LLM-Betrieb verlangt reproduzierbare Starts, messbare Antwortzeiten und definierte Grenzen für den GPU-Speicher.
vLLM-Serverprozesse zu starten und OpenAI-kompatible Endpunkte bereitzustellen sowie Modelle, Kontextgrenzen und Chat-Templates passend zu konfigurieren, stehen dabei im Mittelpunkt. Die Inhalte verbinden fachliche Einordnung, konkrete Umsetzung und die Anforderungen an Qualität, Sicherheit und Nachvollziehbarkeit.
Damit eignet sich das Angebot für Unternehmen, die neue KI-, Daten- oder Automatisierungslösungen nicht nur testen, sondern strukturiert in belastbare Arbeitsabläufe überführen möchten.
AngebotszielvLLM-Schulung: Open-Source-LLMs bereitstellen
- vLLM-Serverprozesse starten und OpenAI-kompatible Endpunkte bereitstellen
- Modelle, Kontextgrenzen und Chat-Templates passend konfigurieren
- Requests für Chat Completions, Tool-Calling und Embeddings testen
- GPU-Speicher, Antwortzeiten und Durchsatz systematisch bewerten
- Betriebsparameter für reproduzierbare LLM-Starts festlegen
- Open-Source-LLMs sicher und skalierbar in Anwendungen integrieren
ZielgruppevLLM-Schulung: Open-Source-LLMs bereitstellen
Das Angebot richtet sich an ML Engineers, DevOps-Teams, Plattformverantwortliche und Entwickler/innen, die Open-Source-LLMs mit vLLM produktiv bereitstellen möchten.
VoraussetzungenvLLM-Schulung: Open-Source-LLMs bereitstellen
Linux-, Container- oder Servergrundkenntnisse sowie Verständnis von LLMs und APIs werden empfohlen. Erfahrung mit GPU-Umgebungen ist hilfreich.
InhaltevLLM-Schulung: Open-Source-LLMs bereitstellen
vLLM-Server und Architektur
- Installation und Laufzeitvoraussetzungen für vLLM
- Modellstart mit
vllm serve - PagedAttention und blockbasierter KV-Cache
- Parameter der OpenAI-kompatiblen Serverkonfiguration
- Unterstützte Modellarchitekturen und Modellformate
GPU-Speicher und Batching
- Speicherbedarf von Modell und KV-Cache
- Continuous Batching für parallele Anfragen
- GPU-Speichergrenze mit
--gpu-memory-utilization - Kontextlänge und maximale Sequenzanzahl
- Quantisierung nach Modell und GPU
APIs und Modellfunktionen
- OpenAI-kompatible Chat-Completions-Endpunkte
- Streaming-Antworten und Abbruchverhalten
- Tool-Calling mit Modell und Parser
- Embeddings mit unterstützten Pooling-Modellen
Parallelisierung über mehrere GPUs
- Tensor Parallelism über mehrere GPUs
- Pipeline Parallelism für große Modelle
- Kommunikationskosten zwischen GPU-Prozessen
- Strategiewahl nach Modell und Hardware
Hosting mit Containern
- Container-Image für den vLLM-Server
- Modell-Cache auf persistenten Volumes
- GPU-Zugriff aus der Container-Laufzeit
vLLM auf Kubernetes
- GPU-Ressourcen für Kubernetes-Pods
- Readiness- und Liveness-Probes
- Horizontale Skalierung über Replikate
- Rollouts mit großen Modellgewichten
Benchmarks und Betriebsbeobachtung
- Lastprofile für parallele API-Anfragen
- Durchsatz in Tokens pro Sekunde
- Zeit bis zum ersten Token
- Zeit zwischen ausgegebenen Tokens
- Prometheus-Metriken und Server-Logs
BildungspfadvLLM-Schulung: Open-Source-LLMs bereitstellen
- LLM Self-Hosting und Deployment
- LiteLLM Schulung: AI-Gateway sicher betreiben
- Llama-Modelle im Vergleich: Nutzen statt Hype
- Kimi K2.5: OpenSource LLM sofort produktiv
- Python Deep-Dive Kurs: Deep Learning, Neuronale Netze & Visualisierung
- Python Machine Learning Grundkurs: Professioneller Einstieg
- Large Language Model Grundkurs: Einsatz und Überblick
- Python Einstieg mit Machine Learning: Grundkurs
- Large Language Model Strategie: Alles für Entscheider
- Open-Source-LLMs lokal betreiben: Grundkurs
- Neo4j Graph-Datenbanken für KI
- LLM-Evaluation: Evaluation. Praxis. Sicherheit
- LangChain: RAG und Agents Intensiv-Training
- Experimente, Prompts, Modelle und GenAI-Qualität mit MLflow nachvollziehbar steuern
- vLLM-Schulung: Open-Source-LLMs bereitstellen
- KI-gestützte Datenbanksuche: Aufbaukurs
- Open-Source LLM Fine-Tuning für Entwickler
- Large Language Models Aufbaukurs: RAG, Anpassung und Training
- Pytorch Grundkurs: Deep Learning mit MLP und CNN
- Python mit Tensorflow: Grundkurs
- Natural Language Processing Grundkurs: Plattformen und Frameworks im Überblick
- Qdrant-Schulung: RAG und Hybrid Search im Betrieb
- LLM Security: Injections erkennen & abwehren
- Large Language Models Advanced: Eigene LLMs und Tuning
- Cursor IDE: Agentische Entwicklung Grundkurs
AusbildungsnachweisvLLM-Schulung: Open-Source-LLMs bereitstellen
Zertifikat der IAD GmbH
Sie erhalten ein Teilnahmezertifikat der IAD GmbH. Damit können Sie Ihr erworbenes Wissen dokumentieren.
im Angebot

