Добавил:
ИВТ (советую зайти в "Несортированное")rnПИН МАГА Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Баранов_Вадим_Пин11М (1).docx
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
2 Мб
Скачать

2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров

Для реализации функции отображения наблюдений в действия (policy function) была спроектирована архитектура полносвязной нейронной сети прямого распространения (Multi-Layer Perceptron, MLP).

Поскольку агент обрабатывает разнородные данные (детерминированные векторы и массивы данных лучевого зондирования), входной слой сети выполняет конкатенацию этих признаков.

Общая архитектура сети (Actor-Critic) для алгоритма PPO состоит из следующих слоев:

  1. Входной слой (Input Layer): размерность определяется суммой размерности непрерывных наблюдений (Space Size = 6) и нормализованных выходных данных компонента Ray Perception Sensor 3D.

  2. Скрытые слои (Hidden Layers): конфигурация включает 2 скрытых слоя по 128 искусственных нейронов в каждом. Выбор размерности 128 обусловлен необходимостью сохранения баланса между выразительной способностью сети (способностью запоминать сложную геометрию препятствий) и вычислительной эффективностью при инференсе. В качестве функции активации скрытых слоев применяется Swish, демонстрирующая лучшую сходимость в задачах глубокого RL по сравнению с классической ReLU за счет гладкости производной.

  3. Выходной слой (Output Layer): так как используется непрерывное пространство действий (Continuous Action Space), выходной слой актора генерирует два значения: вектор средних значений (Mean) и вектор стандартных отклонений (Standard Deviation) для нормального распределения, из которого сэмплируются финальные управляющие сигналы по осям X и Z.

Конфигурация гиперпараметров алгоритма PPO задавалась через конфигурационный YAML-файл ML-Agents.

Тонкая настройка данных параметров критически важна для успешного обучения. В таблице 2.X представлен итоговый набор гиперпараметров, обеспечивший успешную сходимость модели.

Таблица 2.1- Конфигурация гиперпараметров обучения (PPO)

Параметр

Значение

Описание

batch_size

128

Количество опытов в одной итерации градиентного спуска.

buffer_size

2048

Общее количество опытов, собираемых до обновления весов модели.

learning_rate

3.0e-4

Шаг (скорость) обучения. Использовалось линейное убывание (linear schedule).

beta

5.0e-3

Сила регуляризации энтропии. Увеличивает случайность действий на старте.

epsilon

0.2

Порог клиппинга (ограничения) изменения политики PPO.

lambd

0.95

Параметр обобщенной оценки преимущества (GAE), контролирующий дисперсию.

num_epoch

3

Количество проходов по буферу данных при обновлении.

  • batch_size | 128 | Количество опытов в одной итерации градиентного спуска.

  • buffer_size | 2048 | Общее количество опытов, собираемых до обновления весов модели.

  • learning_rate | 3.0e-4 | Шаг (скорость) обучения. Использовалось линейное убывание (linear schedule).

  • beta | 5.0e-3 | Сила регуляризации энтропии. Увеличивает случайность действий на старте.

  • epsilon | 0.2 | Порог клиппинга (ограничения) изменения политики PPO.

  • lambd | 0.95 | Параметр обобщенной оценки преимущества (GAE), контролирующий дисперсию.

  • num_epoch | 3 | Количество проходов по буферу данных при обновлении.

Особое внимание при настройке среды уделялось синхронизации физического движка PhysX и шагов принятия решений (Decision Steps). Для обеспечения стабильности физических расчетов

параметр Time.fixedDeltaTime в Unity был установлен на значение 0.02 секунды (50 физических обновлений в секунду). Агент принимает решение каждый 5-й физический шаг (Decision Period = 5). К компоненту Rigidbody агента применялся режим Continuous Collision Detection (CCD), что предотвратило эффект туннелирования (прохождения агента сквозь стены лабиринта при высоких скоростях на поздних этапах обучения).