Оглавление секции

  • Постановка задачи
    Дисконтирование
    Уравнение Беллмана
    Q-learning
    Exploration/exploitation
    DQN
    Проблемы сходимости
    Reward reshaping
    Стохастические награды