Belastbare Qualität statt plausibel scheinender Antworten
LLM-Evaluation: Evaluation. Praxis. Sicherheit vermittelt praxisnah, wie Sie LLM-Anwendungen systematisch testen, bewerten und sicher weiterentwickeln. LLM-Systeme verhalten sich anders als klassische Software: Antworten variieren, Qualitätsfehler sind oft kontextabhängig und kleine Änderungen an Prompt, Retrieval oder Modell können unerwartete Nebenwirkungen erzeugen.
Besonderheiten der Evaluation von Large Language Models zu verstehen sowie Eval-Sets, Benchmarks und Testfälle für reale Nutzungsszenarien aufzubauen, stehen dabei im Mittelpunkt. Die Inhalte verbinden fachliche Einordnung, konkrete Umsetzung und die Anforderungen an Qualität, Sicherheit und Nachvollziehbarkeit.
Damit eignet sich das Angebot für Unternehmen, die neue KI-, Daten- oder Automatisierungslösungen nicht nur testen, sondern strukturiert in belastbare Arbeitsabläufe überführen möchten.
AngebotszielLLM-Evaluation: Evaluation. Praxis. Sicherheit
- Besonderheiten der Evaluation von Large Language Models verstehen
- Eval-Sets, Benchmarks und Testfälle für reale Nutzungsszenarien aufbauen
- Prompt-, Retrieval- und Modelländerungen über Regressionstests absichern
- Human-Review und automatisierte Metriken sinnvoll kombinieren
- Risiken durch Halluzinationen, Bias und Sicherheitslücken bewerten
- Evaluationsprozesse für produktive LLM-Anwendungen etablieren
ZielgruppeLLM-Evaluation: Evaluation. Praxis. Sicherheit
Das Angebot richtet sich an AI Leads, ML Engineers, Product Owner/innen, Qualitätsverantwortliche und Entwicklungsteams, die LLM-Anwendungen belastbar bewerten und sicher betreiben möchten.
VoraussetzungenLLM-Evaluation: Evaluation. Praxis. Sicherheit
Grundkenntnisse zu LLM-Anwendungen, Prompting oder RAG sind empfehlenswert. Erfahrung mit Softwaretests oder Produktentwicklung ist hilfreich.
InhalteLLM-Evaluation: Evaluation. Praxis. Sicherheit
Evaluations-Strategie für LLM-Systeme
- Rolle von LLM-Evaluation im Produkt-Lebenszyklus
- Abgrenzung von Benchmarks, Eval-Sets und Monitoring
- Qualitätsdimensionen wie Korrektheit, Nützlichkeit, Sicherheit und Konsistenz
- Risiken durch Prompt-Änderungen, Modellwechsel und RAG-Anpassungen
Eval-Sets entwerfen und pflegen
- Aufbau repräsentativer Testfälle aus echten Nutzer-Szenarien
- Golden-Datasets, Edge-Cases und Negativbeispiele
- Kategorisierung nach Risiko, Fachlichkeit und Nutzerintention
- Versionierung von Testdaten und erwarteten Ergebnissen
Automatisierte LLM-Bewertung
- Regelbasierte Checks für Struktur, Fakten und Policies
- LLM-as-a-Judge mit klaren Rubrics und Bewertungs-Skalen
- Messung von Retrieval-Qualität in RAG-Systemen
- Umgang mit Nichtdeterminismus und Score-Schwankungen
Human-Review sinnvoll einsetzen
- Review-Guidelines für fachliche und sicherheitsrelevante Bewertungen
- Stichproben, Doppelbewertungen und Eskalationsregeln
- Auswertung von Reviewer-Abweichungen
- Feedback-Schleifen für Produkt, Prompt und Datenbasis
Regressionstests und CI/CD-Integration
- Test-Suites für Prompts, Tools, RAG und Modell-Upgrades
- Schwellwerte für Release-Entscheidungen
- Automatisierte Testläufe in Entwicklungs-Pipelines
- Dokumentation von Changes, Scores und Freigaben
Praxis-Setup für produktive Teams
- Evaluations-Backlog für AI-Produkt-Teams
- Reporting für Product Ownerinnen, AI Leads und Stakeholder
- Kosten-, Laufzeit- und Qualitäts-Trade-offs
- Governance für wiederholbare LLM-Qualitätssicherung
BildungspfadLLM-Evaluation: Evaluation. Praxis. Sicherheit
- LLM Self-Hosting und Deployment
- LiteLLM Schulung: AI-Gateway sicher betreiben
- Llama-Modelle im Vergleich: Nutzen statt Hype
- Kimi K2.5: OpenSource LLM sofort produktiv
- Python Deep-Dive Kurs: Deep Learning, Neuronale Netze & Visualisierung
- Python Machine Learning Grundkurs: Professioneller Einstieg
- Large Language Model Grundkurs: Einsatz und Überblick
- Python Einstieg mit Machine Learning: Grundkurs
- Large Language Model Strategie: Alles für Entscheider
- Open-Source-LLMs lokal betreiben: Grundkurs
- Neo4j Graph-Datenbanken für KI
- LLM-Evaluation: Evaluation. Praxis. Sicherheit
- LangChain: RAG und Agents Intensiv-Training
- Experimente, Prompts, Modelle und GenAI-Qualität mit MLflow nachvollziehbar steuern
- vLLM-Schulung: Open-Source-LLMs bereitstellen
- KI-gestützte Datenbanksuche: Aufbaukurs
- Open-Source LLM Fine-Tuning für Entwickler
- Large Language Models Aufbaukurs: RAG, Anpassung und Training
- Pytorch Grundkurs: Deep Learning mit MLP und CNN
- Python mit Tensorflow: Grundkurs
- Natural Language Processing Grundkurs: Plattformen und Frameworks im Überblick
- Qdrant-Schulung: RAG und Hybrid Search im Betrieb
- LLM Security: Injections erkennen & abwehren
- Large Language Models Advanced: Eigene LLMs und Tuning
- Cursor IDE: Agentische Entwicklung Grundkurs
AusbildungsnachweisLLM-Evaluation: Evaluation. Praxis. Sicherheit
Zertifikat der IAD GmbH
Sie erhalten ein Teilnahmezertifikat der IAD GmbH. Damit können Sie Ihr erworbenes Wissen dokumentieren.
im Angebot

