Добавил:
ИВТ (советую зайти в "Несортированное")rnПИН МАГА Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Баранов_Вадим_Пин11М (1).docx
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
2 Мб
Скачать

1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде

Разработка интеллектуальных агентов для навигации, управления и принятия решений в виртуальных средах является одной из ключевых областей применения глубокого обучения с подкреплением (Deep Reinforcement Learning, DRL). Такие среды, созданные на игровых движках, предоставляют безопасные, масштабируемые и контролируемые полигоны для обучения сложному поведению, которое впоследствии может быть перенесено в реальные системы, например, в робототехнику или автономные транспортные средства. Среди множества алгоритмов DRL три метода заслуживают особого внимания благодаря своей эффективности и широкому распространению: Deep Q-Network (DQN), Proximal Policy Optimization (PPO) и Soft Actor-Critic (SAC). Каждый из них представляет разные подходы к решению проблемы последовательного принятия решений и демонстрирует различные характеристики применительно к задачам непрерывного управления и навигации в трехмерных пространствах [25].

Алгоритм Deep Q-Network (DQN) стал прорывом, доказавшим возможность использования глубоких нейронных сетей для аппроксимации функций ценности в сложных средах с высокоразмерными наблюдениями, такими как изображения. Будучи методом, основанным на ценностях (value-based) и обучающимся на данных прошлого опыта (off-policy), DQN эффективно изучает, какое действие является наилучшим в каждом состоянии. Однако его принципиальным ограничением является работа исключительно с дискретным и конечным пространством действий. Это делает классический DQN менее пригодным для задач плавного управления физическими объектами, где требуются точные непрерывные значения, например, углы поворота руля или величины тяги двигателей. Для таких задач чаще применяются алгоритмы, напрямую оптимизирующие параметризованную политику, которая может выдавать непрерывные действия [26].

Методы, основанные на градиентах политики (policy gradient), такие как Proximal Policy Optimization (PPO), были разработаны для преодоления этого ограничения. PPO оптимизирует политику агента напрямую, что позволяет ему работать в непрерывных пространствах действий. Ключевым нововведением PPO является специальная функция потерь, которая ограничивает величину изменения политики на каждом шаге обучения. Это обеспечивает удивительную стабильность и надежность процесса, сводя к минимуму риск катастрофического забывания или деградации производительности. Благодаря этому балансу между простотой реализации, вычислительной эффективностью и устойчивостью, PPO стал одним из самых популярных алгоритмов для практического применения в виртуальных средах, часто служа надежным выбором «по умолчанию» для широкого спектра задач [27].

В то время как PPO является алгоритмом, обучающимся на данных текущей политики (on-policy), что может снижать эффективность использования собранного опыта, алгоритм Soft Actor-Critic (SAC) был разработан, чтобы объединить лучшие черты разных подходов. SAC относится к семейству актор-критиков и, как и DQN, обучается на данных из буфера воспроизведения опыта (off-policy), что значительно повышает эффективность использования данных. Его отличительной и инновационной особенностью является максимизация энтропии политики в дополнение к ожидаемой награде.

Это означает, что агент не только стремится максимизировать возврат, но и поощряется за случайность своих действий в процессе обучения. Такой подход способствует более активному исследованию среды, предотвращает преждевременную сходимость к субоптимальным стратегиям и часто приводит к более стабильному и надежному конечному поведению. В сложных задачах навигации с динамическими препятствиями или в средах с разреженными вознаграждениями SAC, как правило, демонстрирует более высокую скорость сходимости и итоговую производительность по сравнению с PPO [28].

Выбор между DQN, PPO и SAC для конкретной задачи в виртуальной среде зависит от множества факторов. Если пространство действий по своей природе дискретно, DQN или его современные производные могут быть отличным выбором. Для большинства задач непрерывного управления, где важны стабильность и простота настройки, PPO остается предпочтительным вариантом. Когда же задача является особенно сложной, требует активного исследования или высокой эффективности использования данных, SAC и другие современные off-policy алгоритмы часто оказываются впереди. Понимание фундаментальных принципов, сильных и слабых сторон каждого из этих методов является ключом к успешной реализации интеллектуального агента, способного к автономной навигации и принятию решений в динамическом виртуальном мире [29].