Добавил:
ИВТ (советую зайти в "Несортированное")rnПИН МАГА Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Баранов_Вадим_Пин11М (1).docx
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
2 Мб
Скачать

2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)

Разработка финальной функции вознаграждения, описанной в разделе 2.2, не была единовременным решением, а явилась результатом серии итеративных экспериментов. В задачах обучения с подкреплением формализация цели (Reward Engineering) часто оказывает большее влияние на итоговый результат, чем выбор архитектуры нейронной сети. В ходе исследования были протестированы три гипотезы формирования сигнала подкрепления.

Итерация 1: Разреженное вознаграждение (Sparse Reward) На первом этапе использовалась простейшая бинарная логика: агент получал +1.0 только при касании целевого объекта и -1.0 при падении с платформы. В промежуточных шагах награда была равна нулю. Эксперименты показали несостоятельность этого подхода для лабиринтов среднего и большого размера. Вероятность случайного нахождения выхода агентом, действующим хаотично (random walk), стремилась к нулю. Градиенты не обновлялись тысячами шагов, и нейросеть не могла выявить причинно-следственную связь между действиями и редким успехом. Это явление, известное как проблема исчезающего градиента в RL, потребовало перехода к более плотному (dense) вознаграждению.

Итерация 2: Вознаграждение на основе дистанции (Distance-based Reward) Для решения проблемы «слепого поиска» была введена награда, пропорциональная уменьшению евклидова расстояния до цели:

Хотя это ускорило начальное обучение, агент попал в ловушку локальных минимумов. В условиях П-образных стен лабиринта агент, руководствуясь жадным алгоритмом, упирался в стену, которая находилась геометрически близко к цели, но не имел стимула обойти её, так как любое движение в сторону или назад увеличивало дистанцию и давало отрицательную награду. Агент демонстрировал поведение «биения о стену», не пытаясь найти обходной путь.

Итерация 3: Гибридная схема с экзистенциальным штрафом Финальная версия функции вознаграждения объединила преимущества предыдущих подходов и устранила их недостатки. Ключевым решением стало введение малого, но постоянного штрафа за каждый такт времени (экзистенциальный штраф).

Эта компонента кардинально изменила мотивацию агента. Теперь «ничегонеделание» или топтание на месте (локальный минимум) стало «дорогим» с точки зрения кумулятивной награды. Единственным способом максимизировать функцию полезности стало скорейшее завершение эпизода. В сочетании с данными лидара, позволяющими видеть стены, это привело к формированию сложного поведения: агент научился жертвовать сиюминутной близостью к цели (двигаться назад или вбок), чтобы обойти препятствие и в конечном итоге прекратить накопление штрафов за время.

Таким образом, экспериментально доказано, что для навигационных задач в средах с препятствиями (Non-Convex Environments) использование функции вознаграждения, основанной исключительно на дистанции, является ошибочным. Оптимальной стратегией является использование разреженных терминальных наград в сочетании со штрафом за время, что вынуждает нейросеть самостоятельно аппроксимировать функцию навигации, а не следовать заранее заданному эвристическому правилу.