Добавил:
ИВТ (советую зайти в "Несортированное")rnПИН МАГА Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Баранов_Вадим_Пин11М (1).docx
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
2 Мб
Скачать

3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения

Для подтверждения гипотезы о необходимости сложной сенсорной системы был проведен анализ поведения агента в условиях ограниченной наблюдаемости.

Анализ влияния Ray Perception Sensor 3D:

В базовой версии агента, получавшего только вектор координат цели, наблюдался эффект «слепого движения»: агент пытался минимизировать расстояние до цели по прямой, упираясь в стены лабиринта. Внедрение лидара (Ray Perception Sensor 3D) с конфигурацией лучей (3 луча на 90 градусов) позволило агенту детектировать препятствия с тегом Wall.

Анализ обученной модели показал, что нейронная сеть научилась интерпретировать сигналы сенсора как «отрицательный стимул». При сокращении дистанции луча до стены (значение сенсора стремится к 0), сеть генерировала управляющее воздействие в противоположную сторону, реализуя маневр уклонения. Агента с включенными красными лучами сенсора можно увидеть на рисунке 3.3.

Рисунок 3.3 - Агент в Unity с включенными красными лучами сенсоров

Анализ функции вознаграждения (Reward Shaping):

Введение «экзистенциального штрафа» (existential penalty) в размере -1 / MaxSteps на каждом шаге оказало решающее влияние на скорость прохождения лабиринта. Сравнительный анализ показал, что без данного штрафа агент склонен к «ленивому» поведению: он мог совершать циклические движения в безопасной зоне, не стремясь к цели, чтобы избежать риска падения (награды -1.0). Штраф за время перестроил функцию полезности: агенту стало «невыгодно» существовать долго, что вынудило его искать кратчайшие траектории к целевому объекту (награда +1.0).

3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo

Достижение оптимальной производительности агента, продемонстрированной в разделе 3.2, потребовало проведения серии экспериментов по настройке гиперпараметров (Hyperparameter Tuning). В алгоритмах семейства Actor-Critic крайне важно соблюдать баланс между скоростью обучения (learning rate) и размером пакета обновления (batch size). В ходе исследования было протестировано три конфигурации гиперпараметров.

Конфигурация 1 (Высокая скорость обучения): learning_rate = 1.0e-3, batch_size = 64.

Гипотеза заключалась в том, что агрессивный шаг градиентного спуска ускорит поиск оптимальной политики. Однако на практике это привело к расходимости алгоритма. Агент слишком резко менял политику поведения при получении первого положительного вознаграждения, что приводило к «катастрофическому забыванию». На графике функции потерь (Loss) наблюдались резкие скачки, а кумулятивная награда не превышала нулевой отметки.

Конфигурация 2 (Большой размер буфера, малый пакет): buffer_size = 4096, batch_size = 32.

Данная конфигурация показала более стабильные, но критически медленные результаты. Нейронная сеть обучалась слишком долго, так как градиенты вычислялись на слишком малых порциях данных, не репрезентативных для общей картины лабиринта. Эффективность использования данных (sample efficiency) резко упала.

Конфигурация 3 (Оптимальная): learning_rate = 3.0e-4 (с линейным убыванием), batch_size = 128, buffer_size = 2048.

Линейное убывание скорости обучения (learning rate schedule) позволило агенту активно исследовать среду на ранних этапах (при высоком LR) и совершать ювелирные корректировки весов на поздних этапах (когда LR стремится к нулю), закрепляя успешный опыт обхода препятствий. Размер пакета в 128 опытов обеспечил достаточную статистическую значимость для расчета стабильного градиента, что полностью нивелировало проблему расходимости сети. Именно эта конфигурация легла в основу итоговой модели.