• Informationsverarbeitung und angewandte Datentechnik GmbH
    Seit 43 Jahren Ihr Bildungspartner
  • 0 64 21 96 58-0

Informationsverarbeitung und angewandte Datentechnik GmbH

KKC_0109 | Reinforcement Learning: Lernen durch Belohnung

Reinforcement Learning von MDP bis Deep RL praxisnah verstehen

Zusammenfassung
Infos zum Download

Trainieren Sie Agenten mit Feedback, Experimenten und klaren Metriken

Reinforcement Learning ist dann stark, wenn Sie Entscheidungen nicht aus gelabelten Beispielen ableiten, sondern aus Interaktion und Feedback. In diesem Seminar lernen Sie die zentralen Bausteine von RL so, dass Sie sie in eigenen Projekten anwenden können: Markov Decision Processes, Zustände, Aktionen, Rewards, Episoden sowie die Rolle von Policy und Value Function. Sie arbeiten Sie von tabellarischen Verfahren zu Deep Reinforcement Learning vor und verstehen, warum Exploration und Exploitation in der Praxis oft wichtiger sind als die „richtige“ Modellarchitektur.

Auf der Algorithmus-Seite setzen Sie Sie mit Dynamic Programming, Monte-Carlo-Methoden und Temporal-Difference-Lernen auseinander und implementieren darauf aufbauend Q-Learning und SARSA. Danach gehen Sie in Richtung DQN und lernen, wie Experience Replay und Target Networks Trainings stabilisieren. Als zweites Standbein behandeln Sie Policy Gradients und Actor-Critic-Methoden inklusive Advantage und GAE, um schließlich PPO als praxisbewährtes Verfahren einzuordnen.

Ein besonderer Teil des Seminars ist Reward Design: Sie lernen Reward Shaping so zu gestalten, dass der Agent nicht „Reward Hacking“ betreibt, sondern das gewünschte Verhalten entwickelt. Abschließend bauen Sie ein sauberes Experiment-Setup mit Logging, Seed-Management und passenden Metriken, interpretieren Trainingskurven und leiten konkrete Debugging-Schritte ab. So können Sie RL-Prototypen in simulierten Umgebungen belastbar trainieren und fair evaluieren.

Angebotsziel
Reinforcement Learning: Lernen durch Belohnung

  • Zentrale RL-Begriffe wie Zustände, Aktionen, Rewards und Policies verstehen
  • Markov Decision Processes und Value Functions einordnen
  • Exploration und Exploitation praxisnah bewerten
  • Dynamic Programming, Monte Carlo und Temporal Difference Learning anwenden
  • Q-Learning, SARSA, DQN und Experience Replay einordnen
  • Policy Gradients, Actor-Critic und PPO fachlich verstehen
  • Reward Design, Logging, Seed-Management und Debugging für Experimente nutzen

Zielgruppe
Reinforcement Learning: Lernen durch Belohnung

Das Seminar richtet sich an Data Scientists, ML-Engineer/innen, Entwickler/innen und technische Teams, die Reinforcement Learning in simulierten Umgebungen anwenden möchten.

Voraussetzungen
Reinforcement Learning: Lernen durch Belohnung

Vorausgesetzt werden Grundlagen in Python, Machine Learning oder mathematischer Modellierung. Erfahrung mit neuronalen Netzen ist hilfreich.

Inhalte
Reinforcement Learning: Lernen durch Belohnung

  • RL-Grundlagen, Begriffe, Denkmodelle
    • MDP, Zustände, Aktionen, Rewards, Episoden
    • Policy, Value Function, Return, Discounting
    • Exploration vs. Exploitation und typische Fallstricke
  • Value-based Methoden: Von Tabular bis Deep
    • Dynamic Programming, Monte Carlo, Temporal Difference
    • Q-Learning, SARSA, Eligibility Traces
    • Deep Q-Networks (DQN): Stabilität, Replay, Target Networks
  • Policy Gradients und Actor-Critic
    • REINFORCE, Baselines und Varianzreduktion
    • Advantage, GAE und Actor-Critic-Intuition
    • PPO: warum es in der Praxis oft gewinnt
  • Reward Design und sichere Lernumgebungen
    • Reward Shaping ohne „Reward Hacking“
    • Constraints, Penalties, Safety Checks
    • Offline vs. Online RL: Datenqualität und Risiken
  • Experiment-Setup, Debugging, Evaluation
    • Trainingskurven richtig lesen: Instabilität, Collapse, Overfitting
    • Seed-Management, Reproduzierbarkeit, Ablations
    • Metrics: Sample Efficiency, Regret, Robustheit
  • Praxisprojekte: Von der Idee zum lauffähigen Agenten
    • Gymnasium-Umgebungen und eigene Environments
    • Hyperparameter, Normalisierung, Logging
    • Deployment-Denken: Grenzen, Monitoring, Drift

Ausbildungsnachweis
Reinforcement Learning: Lernen durch Belohnung

Zertifikat der IAD GmbH

Sie erhalten ein Teilnahmezertifikat der IAD GmbH. Damit können Sie Ihr erworbenes Wissen dokumentieren.

NEU
im Angebot

KKC_0109 | Reinforcement Learning: Lernen durch Belohnung
1.490,00 €(1.773,10 € inkl. 19% Mwst)