- •Курсовая работа
- •Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
- •Аннотация
- •Содержание
- •Список сокращений и условных обозначений
- •Введение
- •Системный анализ разработки интеллектуального агента с применением обучения с подкреплением
- •1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях
- •1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования
- •1.3 Описание потоков данных и бизнес-процессов
- •1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением
- •1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения
- •1.6 Патентный поиск
- •1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
- •1.7.1 Математическая формализация процесса обучения и алгоритмов ppo и sac
- •1.8 Применимость алгоритмов dqn, ppo и sac для задач манипуляции нежёсткими объектами в роботизированной сборке
- •1.9 Выводы по главе 1
- •2. Методы и технологии разработки и исследования интеллектуального агента в среде unity
- •2.1 Применение фреймворка Unity ml-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей
- •2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров
- •2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения
- •2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента
- •2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)
- •2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях
- •2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (c#/Unity)
- •2.6 Выводы по главе 2
- •3.Экспериментальные исследования и анализ результатов работы интеллектуального агента
- •3.1 Характеристика экспериментального стенда и условий проведения эксперимента
- •3.2 Сравнительный анализ эффективности алгоритмов ppo и sac в задаче навигации
- •3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения
- •3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo
- •3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения
- •3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени
- •3.7 Программная реализация алгоритмов поведения и управления агентом
- •3.8 Тестирование и валидация обученной модели в режиме инференса
- •3.9 Выводы по главе 3
- •Заключение
- •Список использованных источников
- •Приложение а
- •Приложение б
Список использованных источников
Рассел, С. Искусственный интеллект: современный подход / С. Рассел, П. Норвиг. – 3-е изд. – Москва : Вильямс, 2015. – 1408 с.
Sutton, R. S. Reinforcement learning: An introduction / R. S. Sutton, A. G. Barto. – 2nd ed. – Cambridge : MIT press, 2018. – 548 p.
A Brief Survey of Deep Reinforcement Learning / K. Arulkumaran, M. P. Deisenroth, M. Brundage, A. A. Bharath // IEEE Signal Processing Magazine. – 2017. – Vol. 34, No. 6. – P. 26-38.
Why Unity is a Top Choice for AI and Machine Learning [Электронный ресурс] // Unity Blog. – URL: https://blogs.unity3d.com/2020/09/15/why-unity-is-a-top-choice-for-ai-and-machine-learning/ (дата обращения: 12.05.2024).
Human-level control through deep reinforcement learning / V. Mnih, K. Kavukcuoglu, D. Silver [et al.] // Nature. – 2015. – Vol. 518, No. 7540. – P. 529-533.
Unity ML-Agents Toolkit Documentation [Электронный ресурс] // GitHub. – URL: https://github.com/Unity-Technologies/ml-agents (дата обращения: 12.05.2024).
Короткий, В. В. Интеграция нейронных сетей в игровые движки и физические симуляции / В. В. Короткий // Программная инженерия. – 2021. – № 4. – С. 45-52.
Использование технологий виртуальной реальности в симуляциях [Электронный ресурс] // Habr. – URL: https://habr.com/ru/ (дата обращения: 12.05.2024).
Стратегии поддержки цифровизации ИИ[Электронный ресурс] // Министерство цифрового развития РФ. – URL: https://digital.gov.ru/ru/events/40963/ (дата обращения: 12.05.2024).
Машинное обучение и большие данные в симуляторах [Электронный ресурс] // Skillfactory. – URL: https://habr.com/ru/companies/skillfactory/articles/744380/ (дата обращения: 12.05.2024).
Создание образовательных симуляторов на игровом движке Unity: кейс НИУ ВШЭ [Электронный ресурс] // НИУ ВШЭ. – URL: https://www.hse.ru/news/edu/1108880737.html (дата обращения: 12.05.2024).
Решение задачи 3D-навигации с помощью глубокого обучения с подкреплением[Электронный ресурс] // Unity AI Solutions. – URL: https://unity.com/ru/solutions/ai-ml (дата обращения: 12.05.2024).
Архитектура интеллектуального агента [Электронный ресурс] // Microsoft Learn. – URL: https://learn.microsoft.com/ru-ru/semantic-kernel/frameworks/agent/agent-architecture (дата обращения: 12.05.2024).
Применение бизнес-симуляторов и агентного моделирования [Электронный ресурс] // Московская школа управления СКОЛКОВО. – URL: https://www.skolkovo.ru/researches/biznes-simulyatory/ (дата обращения: 12.05.2024).
Проблема безопасного ИИ и обучения с подкреплением [Электронный ресурс] // Habr. – URL: https://habr.com/ru/articles/853424/ (дата обращения: 12.05.2024).
Практический кейс обучения RL-агента в Unity [Электронный ресурс] // Timeweb Cloud. – URL: https://habr.com/ru/companies/timeweb/articles/1093175/ (дата обращения: 12.05.2024).
Основы функционального моделирования IDEF0 [Электронный ресурс] // Business Studio. – URL: https://www.businessstudio.ru/articles/article/modelirovanie_biznes_protsessov/ (дата обращения: 12.05.2024).
Диаграммы потоков данных (DFD): принципы построения [Электронный ресурс] // Habr. – URL: https://habr.com/ru/articles/668684/ (дата обращения: 12.05.2024).
Методологии моделирования бизнес-процессов: сравнительный анализ [Электронный ресурс] // BigDataSchool. – URL: https://medium.com/@bigdataschool (дата обращения: 12.05.2024).
Официальный сайт экосистемы Unity [Электронный ресурс] // Unity Technologies. – URL: https://unity.com/ (дата обращения: 12.05.2024).
Архитектура и установка фреймворка ML-Agents [Электронный ресурс] // GitHub. – URL: https://github.com/Unity-Technologies/ml-agents (дата обращения: 12.05.2024).
PyTorch: почему исследователи его выбирают [Электронный ресурс] // Habr. – URL: https://habr.com/ru/companies/wunderfund/articles/526364/ (дата обращения: 12.05.2024).
Настройка гиперпараметров для глубокого обучения с подкреплением [Электронный ресурс] // arXiv. – URL: https://arxiv.org/abs/2201.11182 (дата обращения: 12.05.2024).
Стабильность и воспроизводимость в глубоком обучении с подкреплением [Электронный ресурс] // OpenReview. – URL: https://openreview.net/forum?id=ByxZ0knC5X (дата обращения: 12.05.2024).
Schulman, J. Proximal Policy Optimization Algorithms / J. Schulman, F. Wolski, P. Dhariwal, A. Radford, O. Klimov // arXiv preprint arXiv:1707.06347. – 2017.
Сравнительное исследование традиционных алгоритмов навигации и DRL-алгоритмов [Электронный ресурс] // PMC. – URL: https://pmc.ncbi.nlm.nih.gov/articles/PMC10748032/ (дата обращения: 12.05.2024).
Симоненко, А. Обучение с подкреплением для реальных задач / А. Симоненко. – Москва : БХВ-Петербург, 2022. – 320 с.
Глубокое обучение с подкреплением для визуальной навигации БПЛА [Электронный ресурс] // MDPI. – URL: https://www.mdpi.com/2504-446X/7/4/245 (дата обращения: 12.05.2024).
Распределенное обучение с подкреплением для комплексного принятия решений [Электронный ресурс] // arXiv. – URL: https://arxiv.org/html/2412.09466v1 (дата обращения: 12.05.2024).
Подробный обзор алгоритмов глубокого обучения с подкреплением [Электронный ресурс] // Tencent Cloud. – URL: https://cloud.tencent.com/developer/article/2338285 (дата обращения: 12.05.2024).
Об обучении интеллектуальных агентов в виртуальной среде [Электронный ресурс] // КиберЛенинка. – URL: https://cyberleninka.ru/article/n/ob-obuchenii-intellektualnyh-agentov (дата обращения: 12.05.2024).
Сравнительный анализ алгоритмов DDPG, PPO и SAC для управления в симуляторе CARLA [Электронный ресурс] // КиберЛенинка. – URL: https://cyberleninka.ru/article/n/sravnitelnyy-analiz-algoritmov (дата обращения: 12.05.2024).
Глоссарий: Глубокое обучение с подкреплением [Электронный ресурс] // Ultralytics. – URL: https://www.ultralytics.com/ru/glossary/deep-reinforcement-learning (дата обращения: 12.05.2024).
Методы машинного обучения с подкреплением: теоретические основы [Электронный ресурс] // КиберЛенинка. – URL: https://cyberleninka.ru/article/n/metody-mashinnogo-obucheniya (дата обращения: 12.05.2024).
Curriculum Learning for RL [Электронный ресурс] // Hugging Face. – URL: https://huggingface.co/learn/deep-rl-course/en/unitbonus3/curriculum-learning (дата обращения: 12.05.2024).
Narvekar, S. Curriculum Learning for Reinforcement Learning Domains: A Framework and Survey / S. Narvekar [et al.] // Journal of Machine Learning Research. – 2020. – Vol. 21. – P. 1-50.
An Overview of Agent Evaluation in Reinforcement Learning[Электронный ресурс] // MDPI. – URL: https://www.mdpi.com/2504-4990/5/1/10 (дата обращения: 12.05.2024).
Использование Unity и Python для обучения агентов [Электронный ресурс] // КиберЛенинка. – URL: https://cyberleninka.ru/article/n/ispolzovanie-unity-i-python (дата обращения: 12.05.2024).
TensorBoard: Visualizing Learning [Электронный ресурс] // TensorFlow. – URL: https://www.tensorflow.org/tensorboard (дата обращения: 12.05.2024).
RL-агент: архитектура, бэктест, результаты [Электронный ресурс] // Habr. – URL: https://habr.com/ru/articles/934258/ (дата обращения: 12.05.2024).
Обобщение в обучении с подкреплением: как улучшить генерализацию [Электронный ресурс] // Comandos.ai. – URL: https://blog.comandos.ai/obobshhenie-v-obuchenii-s-podkrepleniem/ (дата обращения: 12.05.2024).
Сравнение фреймворков TensorFlow и PyTorch [Электронный ресурс] // Udacity. – URL: https://www.udacity.com/blog/2025/06/tensorflow-vs-pytorch-which-framework-should-you-learn-in-2025.html (дата обращения: 12.05.2024).
Что такое ML-Agents [Электронный ресурс] // Unity. – URL: https://unity.com/ru/glossary/ml-agents (дата обращения: 12.05.2024).
Практический пример использования Unity ML-Agents на архитектуре Arm [Электронный ресурс] // Arm Developer. – URL: https://developer.arm.com/ (дата обращения: 12.05.2024).
Гудфеллоу, Я. Глубокое обучение / Я. Гудфеллоу, И. Бенджио, А. Курвилль. – 2-е изд. – Москва : ДМК Пресс, 2018. – 652 с.
Рихтер, Д. CLR via C#. Программирование на платформе Microsoft .NET Framework 4.5 на языке C# / Д. Рихтер. – 4-е изд. – Санкт-Петербург : Питер, 2013. – 896 с.
Unity Scripting API [Электронный ресурс] // Unity Technologies. – URL: https://docs.unity3d.com/ScriptReference/ (дата обращения: 12.05.2024).
PyTorch Documentation [Электронный ресурс] // PyTorch Foundation. – URL: https://pytorch.org/docs/stable/index.html (дата обращения: 12.05.2024).
Скинер, Дж. Искусственный интеллект и машинное обучение в играх на Unity / Дж. Скинер. – Москва : ДМК Пресс, 2020. – 350 с.
Zhao, W. Sim-to-Real Transfer in Deep Reinforcement Learning for Robotics: A Survey / W. Zhao, J. Qu, K. Jia // IEEE Transactions on Neural Networks and Learning Systems. – 2020. – Vol. 32, No. 8. – P. 3313-3328.
