• Informationsverarbeitung und angewandte Datentechnik GmbH
    Seit 43 Jahren Ihr Bildungspartner
  • 0 64 21 96 58-0

Informationsverarbeitung und angewandte Datentechnik GmbH

KKC_0312 | LLM-Evaluation: Evaluation. Praxis. Sicherheit

LLM-Anwendungen systematisch testen, bewerten und sicher weiterentwickeln

Zusammenfassung
Infos zum Download

Belastbare Qualität statt plausibel scheinender Antworten

LLM-Evaluation: Evaluation. Praxis. Sicherheit vermittelt praxisnah, wie Sie LLM-Anwendungen systematisch testen, bewerten und sicher weiterentwickeln. LLM-Systeme verhalten sich anders als klassische Software: Antworten variieren, Qualitätsfehler sind oft kontextabhängig und kleine Änderungen an Prompt, Retrieval oder Modell können unerwartete Nebenwirkungen erzeugen.

Besonderheiten der Evaluation von Large Language Models zu verstehen sowie Eval-Sets, Benchmarks und Testfälle für reale Nutzungsszenarien aufzubauen, stehen dabei im Mittelpunkt. Die Inhalte verbinden fachliche Einordnung, konkrete Umsetzung und die Anforderungen an Qualität, Sicherheit und Nachvollziehbarkeit.

Damit eignet sich das Angebot für Unternehmen, die neue KI-, Daten- oder Automatisierungslösungen nicht nur testen, sondern strukturiert in belastbare Arbeitsabläufe überführen möchten.

Angebotsziel
LLM-Evaluation: Evaluation. Praxis. Sicherheit

  • Besonderheiten der Evaluation von Large Language Models verstehen
  • Eval-Sets, Benchmarks und Testfälle für reale Nutzungsszenarien aufbauen
  • Prompt-, Retrieval- und Modelländerungen über Regressionstests absichern
  • Human-Review und automatisierte Metriken sinnvoll kombinieren
  • Risiken durch Halluzinationen, Bias und Sicherheitslücken bewerten
  • Evaluationsprozesse für produktive LLM-Anwendungen etablieren

Zielgruppe
LLM-Evaluation: Evaluation. Praxis. Sicherheit

Das Angebot richtet sich an AI Leads, ML Engineers, Product Owner/innen, Qualitätsverantwortliche und Entwicklungsteams, die LLM-Anwendungen belastbar bewerten und sicher betreiben möchten.

Voraussetzungen
LLM-Evaluation: Evaluation. Praxis. Sicherheit

Grundkenntnisse zu LLM-Anwendungen, Prompting oder RAG sind empfehlenswert. Erfahrung mit Softwaretests oder Produktentwicklung ist hilfreich.

Inhalte
LLM-Evaluation: Evaluation. Praxis. Sicherheit

Evaluations-Strategie für LLM-Systeme

  • Rolle von LLM-Evaluation im Produkt-Lebenszyklus
  • Abgrenzung von Benchmarks, Eval-Sets und Monitoring
  • Qualitätsdimensionen wie Korrektheit, Nützlichkeit, Sicherheit und Konsistenz
  • Risiken durch Prompt-Änderungen, Modellwechsel und RAG-Anpassungen

Eval-Sets entwerfen und pflegen

  • Aufbau repräsentativer Testfälle aus echten Nutzer-Szenarien
  • Golden-Datasets, Edge-Cases und Negativbeispiele
  • Kategorisierung nach Risiko, Fachlichkeit und Nutzerintention
  • Versionierung von Testdaten und erwarteten Ergebnissen

Automatisierte LLM-Bewertung

  • Regelbasierte Checks für Struktur, Fakten und Policies
  • LLM-as-a-Judge mit klaren Rubrics und Bewertungs-Skalen
  • Messung von Retrieval-Qualität in RAG-Systemen
  • Umgang mit Nichtdeterminismus und Score-Schwankungen

Human-Review sinnvoll einsetzen

  • Review-Guidelines für fachliche und sicherheitsrelevante Bewertungen
  • Stichproben, Doppelbewertungen und Eskalationsregeln
  • Auswertung von Reviewer-Abweichungen
  • Feedback-Schleifen für Produkt, Prompt und Datenbasis

Regressionstests und CI/CD-Integration

  • Test-Suites für Prompts, Tools, RAG und Modell-Upgrades
  • Schwellwerte für Release-Entscheidungen
  • Automatisierte Testläufe in Entwicklungs-Pipelines
  • Dokumentation von Changes, Scores und Freigaben

Praxis-Setup für produktive Teams

  • Evaluations-Backlog für AI-Produkt-Teams
  • Reporting für Product Ownerinnen, AI Leads und Stakeholder
  • Kosten-, Laufzeit- und Qualitäts-Trade-offs
  • Governance für wiederholbare LLM-Qualitätssicherung

Bildungspfad
LLM-Evaluation: Evaluation. Praxis. Sicherheit

Lernstufe 1
  • LLM Self-Hosting und Deployment
  • LiteLLM Schulung: AI-Gateway sicher betreiben
  • Llama-Modelle im Vergleich: Nutzen statt Hype
  • Kimi K2.5: OpenSource LLM sofort produktiv
  • Python Deep-Dive Kurs: Deep Learning, Neuronale Netze & Visualisierung
  • Python Machine Learning Grundkurs: Professioneller Einstieg
  • Large Language Model Grundkurs: Einsatz und Überblick
  • Python Einstieg mit Machine Learning: Grundkurs
  • Large Language Model Strategie: Alles für Entscheider
  • Open-Source-LLMs lokal betreiben: Grundkurs
  • Neo4j Graph-Datenbanken für KI
  • LLM-Evaluation: Evaluation. Praxis. Sicherheit
  • LangChain: RAG und Agents Intensiv-Training
Lernstufe 2
  • Experimente, Prompts, Modelle und GenAI-Qualität mit MLflow nachvollziehbar steuern
  • vLLM-Schulung: Open-Source-LLMs bereitstellen
  • KI-gestützte Datenbanksuche: Aufbaukurs
  • Open-Source LLM Fine-Tuning für Entwickler
  • Large Language Models Aufbaukurs: RAG, Anpassung und Training
  • Pytorch Grundkurs: Deep Learning mit MLP und CNN
  • Python mit Tensorflow: Grundkurs
  • Natural Language Processing Grundkurs: Plattformen und Frameworks im Überblick
  • Qdrant-Schulung: RAG und Hybrid Search im Betrieb
Lernstufe 3
  • LLM Security: Injections erkennen & abwehren
  • Large Language Models Advanced: Eigene LLMs und Tuning
  • Cursor IDE: Agentische Entwicklung Grundkurs

Ausbildungsnachweis
LLM-Evaluation: Evaluation. Praxis. Sicherheit

Zertifikat der IAD GmbH

Sie erhalten ein Teilnahmezertifikat der IAD GmbH. Damit können Sie Ihr erworbenes Wissen dokumentieren.

NEU
im Angebot

KKC_0312 | LLM-Evaluation: Evaluation. Praxis. Sicherheit
1.390,00 €(1.654,10 € inkl. 19% Mwst)