Trainieren Sie Agenten mit Feedback, Experimenten und klaren Metriken
Reinforcement Learning ist dann stark, wenn Sie Entscheidungen nicht aus gelabelten Beispielen ableiten, sondern aus Interaktion und Feedback. In diesem Seminar lernen Sie die zentralen Bausteine von RL so, dass Sie sie in eigenen Projekten anwenden können: Markov Decision Processes, Zustände, Aktionen, Rewards, Episoden sowie die Rolle von Policy und Value Function. Sie arbeiten Sie von tabellarischen Verfahren zu Deep Reinforcement Learning vor und verstehen, warum Exploration und Exploitation in der Praxis oft wichtiger sind als die „richtige“ Modellarchitektur.
Auf der Algorithmus-Seite setzen Sie Sie mit Dynamic Programming, Monte-Carlo-Methoden und Temporal-Difference-Lernen auseinander und implementieren darauf aufbauend Q-Learning und SARSA. Danach gehen Sie in Richtung DQN und lernen, wie Experience Replay und Target Networks Trainings stabilisieren. Als zweites Standbein behandeln Sie Policy Gradients und Actor-Critic-Methoden inklusive Advantage und GAE, um schließlich PPO als praxisbewährtes Verfahren einzuordnen.
Ein besonderer Teil des Seminars ist Reward Design: Sie lernen Reward Shaping so zu gestalten, dass der Agent nicht „Reward Hacking“ betreibt, sondern das gewünschte Verhalten entwickelt. Abschließend bauen Sie ein sauberes Experiment-Setup mit Logging, Seed-Management und passenden Metriken, interpretieren Trainingskurven und leiten konkrete Debugging-Schritte ab. So können Sie RL-Prototypen in simulierten Umgebungen belastbar trainieren und fair evaluieren.
AngebotszielReinforcement Learning: Lernen durch Belohnung
- Zentrale RL-Begriffe wie Zustände, Aktionen, Rewards und Policies verstehen
- Markov Decision Processes und Value Functions einordnen
- Exploration und Exploitation praxisnah bewerten
- Dynamic Programming, Monte Carlo und Temporal Difference Learning anwenden
- Q-Learning, SARSA, DQN und Experience Replay einordnen
- Policy Gradients, Actor-Critic und PPO fachlich verstehen
- Reward Design, Logging, Seed-Management und Debugging für Experimente nutzen
ZielgruppeReinforcement Learning: Lernen durch Belohnung
Das Seminar richtet sich an Data Scientists, ML-Engineer/innen, Entwickler/innen und technische Teams, die Reinforcement Learning in simulierten Umgebungen anwenden möchten.
VoraussetzungenReinforcement Learning: Lernen durch Belohnung
Vorausgesetzt werden Grundlagen in Python, Machine Learning oder mathematischer Modellierung. Erfahrung mit neuronalen Netzen ist hilfreich.
InhalteReinforcement Learning: Lernen durch Belohnung
- RL-Grundlagen, Begriffe, Denkmodelle
- MDP, Zustände, Aktionen, Rewards, Episoden
- Policy, Value Function, Return, Discounting
- Exploration vs. Exploitation und typische Fallstricke
- Value-based Methoden: Von Tabular bis Deep
- Dynamic Programming, Monte Carlo, Temporal Difference
- Q-Learning, SARSA, Eligibility Traces
- Deep Q-Networks (DQN): Stabilität, Replay, Target Networks
- Policy Gradients und Actor-Critic
- REINFORCE, Baselines und Varianzreduktion
- Advantage, GAE und Actor-Critic-Intuition
- PPO: warum es in der Praxis oft gewinnt
- Reward Design und sichere Lernumgebungen
- Reward Shaping ohne „Reward Hacking“
- Constraints, Penalties, Safety Checks
- Offline vs. Online RL: Datenqualität und Risiken
- Experiment-Setup, Debugging, Evaluation
- Trainingskurven richtig lesen: Instabilität, Collapse, Overfitting
- Seed-Management, Reproduzierbarkeit, Ablations
- Metrics: Sample Efficiency, Regret, Robustheit
- Praxisprojekte: Von der Idee zum lauffähigen Agenten
- Gymnasium-Umgebungen und eigene Environments
- Hyperparameter, Normalisierung, Logging
- Deployment-Denken: Grenzen, Monitoring, Drift
AusbildungsnachweisReinforcement Learning: Lernen durch Belohnung
Zertifikat der IAD GmbH
Sie erhalten ein Teilnahmezertifikat der IAD GmbH. Damit können Sie Ihr erworbenes Wissen dokumentieren.
im Angebot

