Добавил:
ИВТ (советую зайти в "Несортированное")rnПИН МАГА Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Баранов_Вадим_Пин11М (1).docx
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
2 Мб
Скачать

Заключение

В ходе выполнения курсовой работы была решена актуальная научно-практическая задача обзора, разработки и исследования интеллектуального агента с использованием методов глубокого обучения с подкреплением (Deep Reinforcement Learning). В качестве фундаментального этапа для задач робототехники реализован стенд автономного непрерывного управления в сложной физической среде.

В результате проведенного исследования были получены следующие основные теоретические и практические результаты:

  1. Проведен системный анализ предметной области. Изучены современные подходы к созданию искусственного интеллекта в виртуальных симуляциях. Обоснован выбор технологического стека, включающего игровой движок Unity, библиотеку ML-Agents и фреймворк PyTorch. Доказано, что использование среды Unity позволяет создавать высокоточные физические симуляции, необходимые для безопасного и эффективного обучения агентов перед их внедрением в реальные системы или игровые проекты.

  2. Проведен теоретический анализ применения алгоритмов DRL в роботизированной сборке нежёстких объектов (кабелей, тканей, уплотнителей). Систематизированы ограничения алгоритма DQN, вызванные дискретностью пространства действий. Обоснована необходимость использования алгоритмов непрерывного контроля (PPO и SAC) для задач манипуляции деформируемыми деталями. Подтверждено, что базовым этапом перед внедрением ИИ-управления на реальных роботах является бенчмаркинг алгоритмов в виртуальных физических движках (таких как Unity PhysX) на задачах пространственного позиционирования.

  3. Разработана архитектура среды обучения. Спроектирован и реализован виртуальный полигон сложной топологии (лабиринт), включающий статические препятствия, ограничивающие барьеры и целевые объекты. Реализована система мультиагентного обучения, позволяющая запускать 20 параллельных экземпляров среды в едином пространстве симуляции. Это позволило увеличить поток генерируемых данных (experience throughput) и сократить время обучения нейронной сети в десятки раз.

  4. Реализована программная логика управления агентом. На языке C# разработан программный модуль контроллера агента, обеспечивающий взаимодействие с физическим движком PhysX.

    • Внедрен алгоритм безопасной стохастической инициализации (GetRandomSafePosition), основанный на методе зондирования пространства сферическими триггерами. Это позволило полностью исключить программные ошибки, связанные с появлением объектов внутри геометрии уровня (стен), и обеспечило высокую вариативность начальных условий для повышения обобщающей способности модели.

    • Реализована гибридная система сбора наблюдений, объединяющая векторные данные (координаты, скорость) и данные лучевого зондирования (Ray Perception Sensor 3D), что наделило агента способностью «видеть» препятствия и формировать сложные траектории обхода.

  5. Проведен сравнительный анализ алгоритмов обучения. Выполнено экспериментальное сравнение двух ключевых алгоритмов обучения с подкреплением: PPO (Proximal Policy Optimization) и SAC (Soft Actor-Critic) [32].

    • Установлено, что алгоритм SAC обладает высокой эффективностью использования данных (sample efficiency), достигая целевых показателей награды (0.9+) менее чем за 5 000 шагов. Однако его высокая вычислительная сложность при обновлении весов на каждом шаге приводит к значительным задержкам симуляции при масштабировании количества агентов.

    • Алгоритм PPO продемонстрировал более плавную и стабильную динамику обучения. Несмотря на большее требуемое количество шагов (около 60 000 – 80 000), он обеспечивает стабильную производительность в реальном времени. На основании этих данных для итоговой реализации был выбран алгоритм PPO.

  6. Решена проблема разреженного вознаграждения. В ходе настройки гиперпараметров и функции полезности (Reward Function) была выявлена и устранена проблема стагнации обучения, вызванная низкой вероятностью случайного достижения цели в лабиринте. Внедрение экзистенциального штрафа (penalty за каждый шаг времени) позволило трансформировать поведение агента от пассивного существования к активному поиску кратчайшего маршрута.

  7. Создан готовый программный продукт. Обученная нейронная сеть была успешно экспортирована в формат .ONNX и интегрирована обратно в среду Unity. Проведенные тесты в режиме Inference Only (без участия Python) подтвердили, что разработанный агент способен автономно, быстро и безошибочно находить целевой объект в 98% тестовых эпизодов, избегая столкновений. Полученное решение является полностью автономным и может быть скомпилировано в исполняемый файл для конечного пользователя.

Практическая значимость работы заключается в создании универсального, масштабируемого инструментария для разработки навигационных ИИ-систем. Разработанные алгоритмы и методики настройки среды могут быть применены при создании неигровых персонажей (NPC) в индустрии видеоигр, а также при прототипировании автопилотируемых роботов и дронов в задачах логистики и складской навигации.

Перспективы дальнейшего развития темы исследования включают внедрение динамических препятствий, усложнение сенсорной системы (использование визуальных наблюдений через камеру/CNN) и перенос обученной модели на физическое робототехническое устройство.