- •Курсовая работа
- •Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
- •Аннотация
- •Содержание
- •Список сокращений и условных обозначений
- •Введение
- •Системный анализ разработки интеллектуального агента с применением обучения с подкреплением
- •1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях
- •1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования
- •1.3 Описание потоков данных и бизнес-процессов
- •1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением
- •1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения
- •1.6 Патентный поиск
- •1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
- •1.7.1 Математическая формализация процесса обучения и алгоритмов ppo и sac
- •1.8 Применимость алгоритмов dqn, ppo и sac для задач манипуляции нежёсткими объектами в роботизированной сборке
- •1.9 Выводы по главе 1
- •2. Методы и технологии разработки и исследования интеллектуального агента в среде unity
- •2.1 Применение фреймворка Unity ml-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей
- •2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров
- •2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения
- •2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента
- •2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)
- •2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях
- •2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (c#/Unity)
- •2.6 Выводы по главе 2
- •3.Экспериментальные исследования и анализ результатов работы интеллектуального агента
- •3.1 Характеристика экспериментального стенда и условий проведения эксперимента
- •3.2 Сравнительный анализ эффективности алгоритмов ppo и sac в задаче навигации
- •3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения
- •3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo
- •3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения
- •3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени
- •3.7 Программная реализация алгоритмов поведения и управления агентом
- •3.8 Тестирование и валидация обученной модели в режиме инференса
- •3.9 Выводы по главе 3
- •Заключение
- •Список использованных источников
- •Приложение а
- •Приложение б
3.9 Выводы по главе 3
В третьей главе был выполнен комплекс практических и экспериментальных исследований, направленных на оценку эффективности разработанного интеллектуального агента, валидацию выбранных архитектурных решений и тестирование итоговой модели поведения в виртуальной среде. На основании анализа полученных результатов сформулированы следующие выводы:
Успешно развернут и сконфигурирован экспериментальный программно-аппаратный стенд на базе платформы Unity и фреймворка ML-Agents. Настроена высокопроизводительная мультиагентная среда обучения, включающая 20 параллельно функционирующих арен. Доказано, что такой подход позволяет кратно увеличить пропускную способность сбора данных (experience throughput), стабилизировать градиенты при пакетном обновлении весов нейронной сети и радикально сократить общее астрономическое время обучения (wall-clock time) до достижения сходимости модели.
Выполнен глубокий экспериментальный сравнительный анализ передовых алгоритмов глубокого обучения с подкреплением — Proximal Policy Optimization (PPO) и Soft Actor-Critic (SAC). Эмпирически установлено, что алгоритм SAC (Off-Policy) обладает значительно более высокой эффективностью использования выборки (sample efficiency), достигая целевых показателей за меньшее количество шагов взаимодействия со средой. Тем не менее, алгоритм PPO (On-Policy) продемонстрировал подавляющее превосходство по критериям вычислительной стабильности, монотонности роста кумулятивного вознаграждения и предсказуемости генерируемых действий. Учитывая меньшую ресурсоемкость PPO при вычислении обновлений, именно этот метод был обоснованно выбран в качестве оптимального для финальной реализации навигационной задачи.
Доказана эффективность спроектированной гибридной системы восприятия и кастомной функции вознаграждения (Reward Shaping). Подтверждено, что интеграция лидароподобных сенсоров (Ray Perception Sensor 3D) позволяет агенту успешно выходить из локальных оптимумов и определять геометрию препятствий. В свою очередь, внедрение механизма непрерывного отрицательного подкрепления («экзистенциального штрафа») успешно нивелировало фундаментальную проблему разреженного вознаграждения (sparse reward). Это заставило агента перейти от пассивного избегания стен к активной минимизации времени прохождения лабиринта и поиску кратчайших безопасных траекторий.
Разработан и верифицирован алгоритм безопасной стохастической инициализации сцены (GetRandomSafePosition). Использование метода предварительного математического зондирования пространства (через перекрытие физических сфер) полностью исключило программные сбои и ошибки коллизий при генерации новых эпизодов. Постоянная смена стартовых позиций обеспечила высокую репрезентативность обучающей выборки, предотвратив переобучение (зазубривание конкретных маршрутов) и заложив основу для высокой обобщающей способности (generalization) нейросети.
Итоговая обученная модель была успешно экспортирована в открытый кроссплатформенный стандарт .onnx и интегрирована непосредственно в ядро Unity для работы в режиме автономного инференса. Проведенные стресс-тесты показали, что агент функционирует исключительно за счет ресурсов центрального процессора, без привязки к внешнему Python-окружению. Модель продемонстрировала выдающийся уровень надежности (успешное достижение цели в 98% эпизодов), плавность маневрирования и способность к мгновенной адаптивной навигации в меняющихся топологических условиях.
