Добавил:
ИВТ (советую зайти в "Несортированное")rnПИН МАГА Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Баранов_Вадим_Пин11М (1).docx
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
2 Мб
Скачать

Список сокращений и условных обозначений

ИИ — Искусственный интеллект

API — Application Programming Interface (интерфейс программирования приложений)

CNN — Convolutional Neural Network (сверточная нейронная сеть)

DQN — Deep Q-Network (глубокая Q-сеть)

DRL — Deep Reinforcement Learning (глубокое обучение с подкреплением)

FPS — Frames Per Second (кадровая частота)

FSM — Finite State Machine (конечный автомат)

MDP —Markov Decision Process (марковский процесс принятия решений)

ML — Machine Learning (машинное обучение)

NPC — Non-Player Character (неигровой персонаж)

ONNX — Open Neural Network Exchange (открытый формат обмена нейронными сетями)

PPO —Proximal Policy Optimization (оптимизация проксимальной политики)

RL — Reinforcement Learning (обучение с подкреплением)

RNN — Recurrent Neural Network (рекуррентная нейронная сеть)

SAC — Soft Actor-Critic (мягкий актор-критик)

Введение

Актуальность темы. В контексте развития Индустрии 4.0 и перехода к концепции Индустрии 5.0 одной из наиболее сложных проблем промышленной автоматизации остается роботизированная сборка изделий, включающих нежёсткие (деформируемые) объекты. Манипуляция гибкими кабелями, жгутами проводов, тканями и резиновыми уплотнителями трудно поддается классическому математическому моделированию из-за бесконечного числа степеней свободы таких материалов. Традиционные алгоритмы управления роботами-манипуляторами, основанные на жестко запрограммированных траекториях, оказываются неэффективными в условиях динамической деформации объектов.

Решением данной проблемы становится применение методов глубокого обучения с подкреплением (Deep Reinforcement Learning, DRL). Развитие алгоритмов DQN, PPO и SAC открыло новые возможности для создания адаптивных роботизированных систем, способных обучаться сложной моторике методом проб и ошибок. Однако прямое обучение DRL-агентов на реальных физических роботах сопряжено с колоссальными временными затратами и риском поломки оборудования. В связи с этим актуальной задачей является проведение фундаментального сравнительного анализа этих алгоритмов и их предварительный бенчмаркинг в виртуальных физических симуляторах (таких как Unity), позволяющих оценить стабильность и сходимость моделей перед их переносом в реальную среду (Sim-to-Real transfer).

Степень разработанности проблемы. Теоретические основы обучения с подкреплением были заложены десятилетия назад, но их широкое практическое применение в робототехнике стало возможным недавно. Значительный прорыв связан с работами по внедрению глубоких нейронных сетей как аппроксиматоров политик (алгоритмы PPO, SAC), что позволило роботам работать в непрерывном пространстве действий. Несмотря на наличие исследований в области манипуляции нежёсткими телами (Deformable Object Manipulation), вопросы выбора оптимального алгоритма и настройки среды симуляции требуют дополнительной систематизации и практической валидации.

Целью работы является аналитический обзор и сравнительный анализ алгоритмов глубокого обучения с подкреплением (DQN, PPO, SAC) в контексте роботизированной сборки и манипуляции нежёсткими объектами, а также их практическое исследование на базе физической симуляции в среде Unity.

Для достижения поставленной цели необходимо решить следующие задачи:

  1. Провести системный анализ предметной области и особенностей применения ИИ для манипуляции деформируемыми объектами в робототехнике.

  2. Провести теоретический обзор и сравнение алгоритмов DQN, PPO и SAC, выделив их применимость для задач сборки.

  3. Обосновать выбор технологического стека и спроектировать базовую архитектуру среды обучения (полигона) в симуляторе Unity для тестирования алгоритмов непрерывного управления.

  4. Разработать программную реализацию агента, гибридной сенсорной системы и функции вознаграждения.

  5. Провести экспериментальное сравнение алгоритмов обучения (PPO и SAC) в симуляции и проанализировать метрики сходимости и вычислительной стабильности.

Объект исследования — методы машинного обучения и глубокого обучения с подкреплением в системах роботизированной сборки и физических симуляциях.

Предмет исследования — алгоритмы DQN, Proximal Policy Optimization (PPO), Soft Actor-Critic (SAC) и их применимость для задач непрерывного пространственного управления и манипуляции объектами.

Методы исследования. В работе использовались методы системного анализа, анализ научно-технической литературы, математическое моделирование Марковских процессов принятия решений, теория искусственных нейронных сетей, а также экспериментальный метод (проведение симуляций в Unity).

Информационно-эмпирическая база исследования сформирована на основе данных наблюдений (координаты, скорости, данные лучевого зондирования Ray Perception Sensor 3D), генерируемых физическим движком PhysX в симуляторе Unity в режиме реального времени.

Информационные источники. В качестве информационных источников использованы официальная документация Unity ML-Agents, научные публикации по алгоритмам PPO и SAC, а также открытые репозитории и статьи в области применения искусственного интеллекта в симуляциях.

Результаты (положения), выносимые на защиту:

  1. Архитектура интеллектуального агента с гибридной системой восприятия (векторные наблюдения и лучевое зондирование), позволяющая эффективно детектировать препятствия и формировать сложные траектории обхода.

  2. Комбинированная функция вознаграждения с применением «экзистенциального штрафа», решающая проблему разреженных наград и стимулирующая агента к минимизации времени поиска цели.

  3. Алгоритм безопасной стохастической инициализации (GetRandomSafePosition), исключающий ошибки физической симуляции и обеспечивающий высокую вариативность обучающей выборки.

  4. Результаты сравнительного анализа алгоритмов PPO и SAC для задачи непрерывной навигации в Unity, доказывающие практическое преимущество алгоритма PPO по критериям стабильности и вычислительной нагрузки.

Научная новизна исследования заключается в комплексном практическом исследовании цикла «среда-алгоритм-агент» применительно к платформе Unity. Конкретная новизна включает:

  • экспериментальное подтверждение эффективности алгоритма PPO в сравнении с SAC для задач навигации в средах Unity с физикой твердого тела, с выявлением зависимости стабильности обучения от гиперпараметров;

  • разработку комбинированной функции вознаграждения, включающей «экзистенциальный штраф», позволяющей эффективно решать проблему разреженных наград в лабиринтах;

  • реализацию алгоритма безопасной стохастической инициализации (GetRandomSafePosition), обеспечивающего высокую вариативность обучающей выборки без возникновения физических коллизий.

Практическая значимость работы состоит в создании рабочего прототипа и набора методик, которые позволяют:

  • разработчикам игр и симуляторов использовать готовую модель для внедрения продвинутых AI-персонажей, способных к адаптивному поведению;

  • исследователям применять созданную среду Unity как настраиваемый полигон для тестирования новых алгоритмов.