- •Курсовая работа
- •Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
- •Аннотация
- •Содержание
- •Список сокращений и условных обозначений
- •Введение
- •Системный анализ разработки интеллектуального агента с применением обучения с подкреплением
- •1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях
- •1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования
- •1.3 Описание потоков данных и бизнес-процессов
- •1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением
- •1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения
- •1.6 Патентный поиск
- •1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
- •1.7.1 Математическая формализация процесса обучения и алгоритмов ppo и sac
- •1.8 Применимость алгоритмов dqn, ppo и sac для задач манипуляции нежёсткими объектами в роботизированной сборке
- •1.9 Выводы по главе 1
- •2. Методы и технологии разработки и исследования интеллектуального агента в среде unity
- •2.1 Применение фреймворка Unity ml-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей
- •2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров
- •2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения
- •2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента
- •2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)
- •2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях
- •2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (c#/Unity)
- •2.6 Выводы по главе 2
- •3.Экспериментальные исследования и анализ результатов работы интеллектуального агента
- •3.1 Характеристика экспериментального стенда и условий проведения эксперимента
- •3.2 Сравнительный анализ эффективности алгоритмов ppo и sac в задаче навигации
- •3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения
- •3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo
- •3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения
- •3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени
- •3.7 Программная реализация алгоритмов поведения и управления агентом
- •3.8 Тестирование и валидация обученной модели в режиме инференса
- •3.9 Выводы по главе 3
- •Заключение
- •Список использованных источников
- •Приложение а
- •Приложение б
Список сокращений и условных обозначений
ИИ — Искусственный интеллект
API — Application Programming Interface (интерфейс программирования приложений)
CNN — Convolutional Neural Network (сверточная нейронная сеть)
DQN — Deep Q-Network (глубокая Q-сеть)
DRL — Deep Reinforcement Learning (глубокое обучение с подкреплением)
FPS — Frames Per Second (кадровая частота)
FSM — Finite State Machine (конечный автомат)
MDP —Markov Decision Process (марковский процесс принятия решений)
ML — Machine Learning (машинное обучение)
NPC — Non-Player Character (неигровой персонаж)
ONNX — Open Neural Network Exchange (открытый формат обмена нейронными сетями)
PPO —Proximal Policy Optimization (оптимизация проксимальной политики)
RL — Reinforcement Learning (обучение с подкреплением)
RNN — Recurrent Neural Network (рекуррентная нейронная сеть)
SAC — Soft Actor-Critic (мягкий актор-критик)
Введение
Актуальность темы. В контексте развития Индустрии 4.0 и перехода к концепции Индустрии 5.0 одной из наиболее сложных проблем промышленной автоматизации остается роботизированная сборка изделий, включающих нежёсткие (деформируемые) объекты. Манипуляция гибкими кабелями, жгутами проводов, тканями и резиновыми уплотнителями трудно поддается классическому математическому моделированию из-за бесконечного числа степеней свободы таких материалов. Традиционные алгоритмы управления роботами-манипуляторами, основанные на жестко запрограммированных траекториях, оказываются неэффективными в условиях динамической деформации объектов.
Решением данной проблемы становится применение методов глубокого обучения с подкреплением (Deep Reinforcement Learning, DRL). Развитие алгоритмов DQN, PPO и SAC открыло новые возможности для создания адаптивных роботизированных систем, способных обучаться сложной моторике методом проб и ошибок. Однако прямое обучение DRL-агентов на реальных физических роботах сопряжено с колоссальными временными затратами и риском поломки оборудования. В связи с этим актуальной задачей является проведение фундаментального сравнительного анализа этих алгоритмов и их предварительный бенчмаркинг в виртуальных физических симуляторах (таких как Unity), позволяющих оценить стабильность и сходимость моделей перед их переносом в реальную среду (Sim-to-Real transfer).
Степень разработанности проблемы. Теоретические основы обучения с подкреплением были заложены десятилетия назад, но их широкое практическое применение в робототехнике стало возможным недавно. Значительный прорыв связан с работами по внедрению глубоких нейронных сетей как аппроксиматоров политик (алгоритмы PPO, SAC), что позволило роботам работать в непрерывном пространстве действий. Несмотря на наличие исследований в области манипуляции нежёсткими телами (Deformable Object Manipulation), вопросы выбора оптимального алгоритма и настройки среды симуляции требуют дополнительной систематизации и практической валидации.
Целью работы является аналитический обзор и сравнительный анализ алгоритмов глубокого обучения с подкреплением (DQN, PPO, SAC) в контексте роботизированной сборки и манипуляции нежёсткими объектами, а также их практическое исследование на базе физической симуляции в среде Unity.
Для достижения поставленной цели необходимо решить следующие задачи:
Провести системный анализ предметной области и особенностей применения ИИ для манипуляции деформируемыми объектами в робототехнике.
Провести теоретический обзор и сравнение алгоритмов DQN, PPO и SAC, выделив их применимость для задач сборки.
Обосновать выбор технологического стека и спроектировать базовую архитектуру среды обучения (полигона) в симуляторе Unity для тестирования алгоритмов непрерывного управления.
Разработать программную реализацию агента, гибридной сенсорной системы и функции вознаграждения.
Провести экспериментальное сравнение алгоритмов обучения (PPO и SAC) в симуляции и проанализировать метрики сходимости и вычислительной стабильности.
Объект исследования — методы машинного обучения и глубокого обучения с подкреплением в системах роботизированной сборки и физических симуляциях.
Предмет исследования — алгоритмы DQN, Proximal Policy Optimization (PPO), Soft Actor-Critic (SAC) и их применимость для задач непрерывного пространственного управления и манипуляции объектами.
Методы исследования. В работе использовались методы системного анализа, анализ научно-технической литературы, математическое моделирование Марковских процессов принятия решений, теория искусственных нейронных сетей, а также экспериментальный метод (проведение симуляций в Unity).
Информационно-эмпирическая база исследования сформирована на основе данных наблюдений (координаты, скорости, данные лучевого зондирования Ray Perception Sensor 3D), генерируемых физическим движком PhysX в симуляторе Unity в режиме реального времени.
Информационные источники. В качестве информационных источников использованы официальная документация Unity ML-Agents, научные публикации по алгоритмам PPO и SAC, а также открытые репозитории и статьи в области применения искусственного интеллекта в симуляциях.
Результаты (положения), выносимые на защиту:
Архитектура интеллектуального агента с гибридной системой восприятия (векторные наблюдения и лучевое зондирование), позволяющая эффективно детектировать препятствия и формировать сложные траектории обхода.
Комбинированная функция вознаграждения с применением «экзистенциального штрафа», решающая проблему разреженных наград и стимулирующая агента к минимизации времени поиска цели.
Алгоритм безопасной стохастической инициализации (GetRandomSafePosition), исключающий ошибки физической симуляции и обеспечивающий высокую вариативность обучающей выборки.
Результаты сравнительного анализа алгоритмов PPO и SAC для задачи непрерывной навигации в Unity, доказывающие практическое преимущество алгоритма PPO по критериям стабильности и вычислительной нагрузки.
Научная новизна исследования заключается в комплексном практическом исследовании цикла «среда-алгоритм-агент» применительно к платформе Unity. Конкретная новизна включает:
экспериментальное подтверждение эффективности алгоритма PPO в сравнении с SAC для задач навигации в средах Unity с физикой твердого тела, с выявлением зависимости стабильности обучения от гиперпараметров;
разработку комбинированной функции вознаграждения, включающей «экзистенциальный штраф», позволяющей эффективно решать проблему разреженных наград в лабиринтах;
реализацию алгоритма безопасной стохастической инициализации (GetRandomSafePosition), обеспечивающего высокую вариативность обучающей выборки без возникновения физических коллизий.
Практическая значимость работы состоит в создании рабочего прототипа и набора методик, которые позволяют:
разработчикам игр и симуляторов использовать готовую модель для внедрения продвинутых AI-персонажей, способных к адаптивному поведению;
исследователям применять созданную среду Unity как настраиваемый полигон для тестирования новых алгоритмов.
