- •Курсовая работа
- •Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
- •Аннотация
- •Содержание
- •Список сокращений и условных обозначений
- •Введение
- •Системный анализ разработки интеллектуального агента с применением обучения с подкреплением
- •1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях
- •1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования
- •1.3 Описание потоков данных и бизнес-процессов
- •1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением
- •1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения
- •1.6 Патентный поиск
- •1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
- •1.7.1 Математическая формализация процесса обучения и алгоритмов ppo и sac
- •1.8 Применимость алгоритмов dqn, ppo и sac для задач манипуляции нежёсткими объектами в роботизированной сборке
- •1.9 Выводы по главе 1
- •2. Методы и технологии разработки и исследования интеллектуального агента в среде unity
- •2.1 Применение фреймворка Unity ml-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей
- •2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров
- •2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения
- •2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента
- •2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)
- •2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях
- •2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (c#/Unity)
- •2.6 Выводы по главе 2
- •3.Экспериментальные исследования и анализ результатов работы интеллектуального агента
- •3.1 Характеристика экспериментального стенда и условий проведения эксперимента
- •3.2 Сравнительный анализ эффективности алгоритмов ppo и sac в задаче навигации
- •3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения
- •3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo
- •3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения
- •3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени
- •3.7 Программная реализация алгоритмов поведения и управления агентом
- •3.8 Тестирование и валидация обученной модели в режиме инференса
- •3.9 Выводы по главе 3
- •Заключение
- •Список использованных источников
- •Приложение а
- •Приложение б
1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
Разработка интеллектуальных агентов для навигации, управления и принятия решений в виртуальных средах является одной из ключевых областей применения глубокого обучения с подкреплением (Deep Reinforcement Learning, DRL). Такие среды, созданные на игровых движках, предоставляют безопасные, масштабируемые и контролируемые полигоны для обучения сложному поведению, которое впоследствии может быть перенесено в реальные системы, например, в робототехнику или автономные транспортные средства. Среди множества алгоритмов DRL три метода заслуживают особого внимания благодаря своей эффективности и широкому распространению: Deep Q-Network (DQN), Proximal Policy Optimization (PPO) и Soft Actor-Critic (SAC). Каждый из них представляет разные подходы к решению проблемы последовательного принятия решений и демонстрирует различные характеристики применительно к задачам непрерывного управления и навигации в трехмерных пространствах [25].
Алгоритм Deep Q-Network (DQN) стал прорывом, доказавшим возможность использования глубоких нейронных сетей для аппроксимации функций ценности в сложных средах с высокоразмерными наблюдениями, такими как изображения. Будучи методом, основанным на ценностях (value-based) и обучающимся на данных прошлого опыта (off-policy), DQN эффективно изучает, какое действие является наилучшим в каждом состоянии. Однако его принципиальным ограничением является работа исключительно с дискретным и конечным пространством действий. Это делает классический DQN менее пригодным для задач плавного управления физическими объектами, где требуются точные непрерывные значения, например, углы поворота руля или величины тяги двигателей. Для таких задач чаще применяются алгоритмы, напрямую оптимизирующие параметризованную политику, которая может выдавать непрерывные действия [26].
Методы, основанные на градиентах политики (policy gradient), такие как Proximal Policy Optimization (PPO), были разработаны для преодоления этого ограничения. PPO оптимизирует политику агента напрямую, что позволяет ему работать в непрерывных пространствах действий. Ключевым нововведением PPO является специальная функция потерь, которая ограничивает величину изменения политики на каждом шаге обучения. Это обеспечивает удивительную стабильность и надежность процесса, сводя к минимуму риск катастрофического забывания или деградации производительности. Благодаря этому балансу между простотой реализации, вычислительной эффективностью и устойчивостью, PPO стал одним из самых популярных алгоритмов для практического применения в виртуальных средах, часто служа надежным выбором «по умолчанию» для широкого спектра задач [27].
В то время как PPO является алгоритмом, обучающимся на данных текущей политики (on-policy), что может снижать эффективность использования собранного опыта, алгоритм Soft Actor-Critic (SAC) был разработан, чтобы объединить лучшие черты разных подходов. SAC относится к семейству актор-критиков и, как и DQN, обучается на данных из буфера воспроизведения опыта (off-policy), что значительно повышает эффективность использования данных. Его отличительной и инновационной особенностью является максимизация энтропии политики в дополнение к ожидаемой награде.
Это означает, что агент не только стремится максимизировать возврат, но и поощряется за случайность своих действий в процессе обучения. Такой подход способствует более активному исследованию среды, предотвращает преждевременную сходимость к субоптимальным стратегиям и часто приводит к более стабильному и надежному конечному поведению. В сложных задачах навигации с динамическими препятствиями или в средах с разреженными вознаграждениями SAC, как правило, демонстрирует более высокую скорость сходимости и итоговую производительность по сравнению с PPO [28].
Выбор между DQN, PPO и SAC для конкретной задачи в виртуальной среде зависит от множества факторов. Если пространство действий по своей природе дискретно, DQN или его современные производные могут быть отличным выбором. Для большинства задач непрерывного управления, где важны стабильность и простота настройки, PPO остается предпочтительным вариантом. Когда же задача является особенно сложной, требует активного исследования или высокой эффективности использования данных, SAC и другие современные off-policy алгоритмы часто оказываются впереди. Понимание фундаментальных принципов, сильных и слабых сторон каждого из этих методов является ключом к успешной реализации интеллектуального агента, способного к автономной навигации и принятию решений в динамическом виртуальном мире [29].
