- •Курсовая работа
- •Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
- •Аннотация
- •Содержание
- •Список сокращений и условных обозначений
- •Введение
- •Системный анализ разработки интеллектуального агента с применением обучения с подкреплением
- •1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях
- •1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования
- •1.3 Описание потоков данных и бизнес-процессов
- •1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением
- •1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения
- •1.6 Патентный поиск
- •1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
- •1.7.1 Математическая формализация процесса обучения и алгоритмов ppo и sac
- •1.8 Применимость алгоритмов dqn, ppo и sac для задач манипуляции нежёсткими объектами в роботизированной сборке
- •1.9 Выводы по главе 1
- •2. Методы и технологии разработки и исследования интеллектуального агента в среде unity
- •2.1 Применение фреймворка Unity ml-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей
- •2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров
- •2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения
- •2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента
- •2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)
- •2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях
- •2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (c#/Unity)
- •2.6 Выводы по главе 2
- •3.Экспериментальные исследования и анализ результатов работы интеллектуального агента
- •3.1 Характеристика экспериментального стенда и условий проведения эксперимента
- •3.2 Сравнительный анализ эффективности алгоритмов ppo и sac в задаче навигации
- •3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения
- •3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo
- •3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения
- •3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени
- •3.7 Программная реализация алгоритмов поведения и управления агентом
- •3.8 Тестирование и валидация обученной модели в режиме инференса
- •3.9 Выводы по главе 3
- •Заключение
- •Список использованных источников
- •Приложение а
- •Приложение б
Минобрнауки России
Федеральное государственное автономное образовательное учреждение высшего образования
«Национальный исследовательский университет «Московский институт электронной техники»
Институт СПИНТех
Курсовая работа
по дисциплине «Цифровые технологии и интеллектуальные системы в производстве»
Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
Направление подготовки: 09.04.04 «Программная инженерия»
Студент гр. ПИН-11М Баранов В.С
Руководитель доктор физ.-мат. Наук Храмов А.Е
Москва, 2026
Аннотация
Курсовая работа посвящена обзору и анализу алгоритмов глубокого обучения с подкреплением (DQN, PPO, SAC) в робототехнике, а также исследованию их применимости для задач сборки и манипуляции нежёсткими объектами.
В работе проведен системный анализ предметной области, выявлены ограничения классических методов управления при работе с деформируемыми материалами (кабели, ткани, уплотнители) и обоснована необходимость перехода к алгоритмам непрерывного управления (Continuous Control). В качестве фундаментального этапа исследования спроектирована физическая симуляция на базе движка Unity и фреймворка ML-Agents для базового бенчмаркинга алгоритмов.
Проведен экспериментальный сравнительный анализ алгоритмов Proximal Policy Optimization (PPO) и Soft Actor-Critic (SAC) в мультиагентной среде. На основе метрик процесса обучения доказано, что алгоритм SAC обладает более высокой эффективностью использования выборки (sample efficiency), что критично для реальной робототехники, однако алгоритм PPO обеспечивает оптимальный баланс вычислительной стабильности для задач непрерывного пространственного управления. Итоговая модель экспортирована в формат ONNX и успешно интегрирована для автономного инференса.
ABSTRACT
The coursework is devoted to the review and analysis of deep reinforcement learning algorithms (DQN, PPO, SAC) in robotics, as well as the study of their applicability for assembly tasks and manipulation of non-rigid objects.
A system analysis of the subject area was carried out, the limitations of classical control methods when working with deformable materials were identified, and the necessity of transitioning to continuous control algorithms was justified. As a fundamental research stage, a physics simulation was designed based on the Unity engine and the ML-Agents framework for baseline algorithm benchmarking.
An experimental comparative analysis of Proximal Policy Optimization (PPO) and Soft Actor-Critic (SAC) algorithms was conducted. Based on the learning metrics, it was proven that the SAC algorithm has higher sample efficiency, which is critical for real-world robotics, while the PPO algorithm provides an optimal balance of computational stability for continuous spatial control tasks. The final model was exported to ONNX format and successfully integrated for autonomous inference.
Содержание
СПИСОК СОКРАЩЕНИЙ И УСЛОВНЫХ ОБОЗНАЧЕНИЙ 5
ВВЕДЕНИЕ 6
1. СИСТЕМНЫЙ АНАЛИЗ РАЗРАБОТКИ ИНТЕЛЛЕКТУАЛЬНОГО АГЕНТА С ПРИМЕНЕНИЕМ ОБУЧЕНИЯ С ПОДКРЕПЛЕНИЕМ 10
1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях 10
1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования 12
1.3 Описание потоков данных и бизнес-процессов 15
1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением 20
1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения 24
1.6 Патентный поиск 28
1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (DQN, PPO, SAC) для задач навигации, управления и принятия решений в виртуальной среде 30
1.7.1 Математическая формализация процесса обучения и алгоритмов PPO и SAC 33
1.8 Применимость алгоритмов DQN, PPO и SAC для задач манипуляции нежёсткими объектами в роботизированной сборке 35
1.9 Выводы по главе 1 37
2. МЕТОДЫ И ТЕХНОЛОГИИ РАЗРАБОТКИ И ИССЛЕДОВАНИЯ ИНТЕЛЛЕКТУАЛЬНОГО АГЕНТА В СРЕДЕ UNITY 40
2.1 Применение фреймворка Unity ML-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей 40
2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров 42
2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения 45
2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента 49
2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering) 53
2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях 54
2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (C#/Unity) 56
2.6 Выводы по главе 2 59
3.ЭКСПЕРИМЕНТАЛЬНЫЕ ИССЛЕДОВАНИЯ И АНАЛИЗ РЕЗУЛЬТАТОВ РАБОТЫ ИНТЕЛЛЕКТУАЛЬНОГО АГЕНТА 62
3.1 Характеристика экспериментального стенда и условий проведения эксперимента 62
3.2 Сравнительный анализ эффективности алгоритмов PPO и SAC в задаче навигации 63
3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения 66
3.4 Анализ влияния гиперпараметров на сходимость алгоритма PPO 67
3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения 69
3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени 70
3.7 Программная реализация алгоритмов поведения и управления агентом 71
3.8 Тестирование и валидация обученной модели в режиме инференса 72
3.9 Выводы по главе 3 74
ЗАКЛЮЧЕНИЕ 77
СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ 81
ПРИЛОЖЕНИЕ А 87
ПРИЛОЖЕНИЕ Б 88
