- •Курсовая работа
- •Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
- •Аннотация
- •Содержание
- •Список сокращений и условных обозначений
- •Введение
- •Системный анализ разработки интеллектуального агента с применением обучения с подкреплением
- •1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях
- •1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования
- •1.3 Описание потоков данных и бизнес-процессов
- •1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением
- •1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения
- •1.6 Патентный поиск
- •1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
- •1.7.1 Математическая формализация процесса обучения и алгоритмов ppo и sac
- •1.8 Применимость алгоритмов dqn, ppo и sac для задач манипуляции нежёсткими объектами в роботизированной сборке
- •1.9 Выводы по главе 1
- •2. Методы и технологии разработки и исследования интеллектуального агента в среде unity
- •2.1 Применение фреймворка Unity ml-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей
- •2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров
- •2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения
- •2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента
- •2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)
- •2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях
- •2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (c#/Unity)
- •2.6 Выводы по главе 2
- •3.Экспериментальные исследования и анализ результатов работы интеллектуального агента
- •3.1 Характеристика экспериментального стенда и условий проведения эксперимента
- •3.2 Сравнительный анализ эффективности алгоритмов ppo и sac в задаче навигации
- •3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения
- •3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo
- •3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения
- •3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени
- •3.7 Программная реализация алгоритмов поведения и управления агентом
- •3.8 Тестирование и валидация обученной модели в режиме инференса
- •3.9 Выводы по главе 3
- •Заключение
- •Список использованных источников
- •Приложение а
- •Приложение б
1.9 Выводы по главе 1
В первой главе был проведен всесторонний системный анализ предметной области, посвященной разработке, обучению и тестированию автономных интеллектуальных агентов в виртуальных симуляционных средах. На основании изученного теоретического материала сформулированы следующие выводы:
Детально изучены современные мировые тенденции применения методов машинного обучения в интерактивных симуляциях. Выявлен и обоснован концептуальный переход от классических скриптовых методов (конечные автоматы, деревья поведения) к парадигме глубокого обучения с подкреплением (Deep Reinforcement Learning, DRL). Доказано, что применение DRL позволяет создавать адаптивных агентов, способных не просто следовать жестко запрограммированным правилам, а самостоятельно вырабатывать оптимальные стратегии поведения и принятия решений в динамически меняющихся условиях путем максимизации функции вознаграждения.
Сформирован комплексный пул архитектурных и функциональных требований к интеллектуальному агенту. Доказана необходимость проектирования гибридной сенсорной системы восприятия, объединяющей точные математические векторы (координаты, направляющие векторы скоростей) и эмуляцию физического лидара (пространственное лучевое зондирование Ray Perception Sensor 3D). Обоснована критическая важность способности агента обучаться в строго недетерминированных (стохастических) условиях. Это необходимо для предотвращения "зазубривания" конкретных маршрутов (переобучения) и гарантирует высокую обобщающую способность (generalization) финальной нейросетевой модели.
Проведен сравнительный анализ платформ и научно обоснован выбор технологического стека: игровой движок Unity в связке с нативным фреймворком ML-Agents Toolkit и библиотекой тензорных вычислений PyTorch. Установлено, что данная программная архитектура обеспечивает идеальный компромисс: Unity гарантирует высокую фотореалистичность и физическую достоверность симуляции (благодаря движку PhysX), а ML-Agents формирует высокоскоростной коммуникационный мост с Python-окружением, предоставляя максимальную гибкость для проектирования и математической оптимизации глубоких нейронных сетей.
Выполнен глубокий сравнительный анализ математического аппарата алгоритмов DRL для задач непрерывного управления. Для проведения дальнейших экспериментальных исследований обоснованно отобраны два передовых метода семейства Actor-Critic: алгоритм Proximal Policy Optimization (PPO), выступающий в качестве индустриального стандарта вычислительной стабильности и защиты от «катастрофического забывания», а также Soft Actor-Critic (SAC) — off-policy метод, отличающийся механизмами максимизации энтропии и высочайшей эффективностью использования собранного опыта (sample efficiency). На теоретическом уровне идентифицированы ключевые риски предстоящего обучения, главным из которых является фундаментальная проблема разреженных наград (sparse reward). Подтверждено, что преодоление данного барьера потребует разработки комплексной функции вознаграждения (Reward Shaping) на последующем этапе проектирования среды.
Проведен теоретический анализ применимости алгоритмов DQN, PPO и SAC для роботизированной сборки нежёстких объектов. Установлено, что алгоритм DQN эффективен лишь для дискретных задач выбора точки захвата, в то время как для сложной манипуляции гибкими деталями (кабели, ткани) требуются алгоритмы непрерывного управления. Теоретически обосновано, что SAC обладает преимуществом в скорости обучения (sample efficiency) благодаря off-policy архитектуре, а PPO — в безопасности и стабильности управления кинематикой, что делает их основными кандидатами для тестирования в физической симуляции на практическом этапе работы.
