В обучении с подкреплением (reinforcement learning, RL) мы хотим построить алгоритм, моделирующий обучение методом проб и ошибок. Вместо получения обучающей выборки на вход такой алгоритм будет взаимодействовать с некоторой средой (environment), окружающим миром, а в роли «разметки» будет выступать награда (reward) — скалярная величина, которая выдается после каждого шага взаимодействия со средой и показывает, насколько хорошо алгоритм справляется с поставленной ему задачей. Например, если вы печёте тортики, то за каждый испеченный тортик вы получаете +1, а если вы пытаетесь кататься на велосипеде, то за каждое падение с велосипеда вам прилетает -1.
Метод активно используется в игровой индустрии.
К примеру, мы погружаем модель в условия игры. За каждый шаг она получает либо штраф, либо поощрение. Допустим, она потеряла жизнь или встретилась с привидением — это штраф. Нашла кристалл — поощрение и поддерживающая обратная связь. Скоро она улавливает стратегию игры и начинает себя прекрасно в ней проявлять.