- •Курсовая работа
- •Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
- •Аннотация
- •Содержание
- •Список сокращений и условных обозначений
- •Введение
- •Системный анализ разработки интеллектуального агента с применением обучения с подкреплением
- •1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях
- •1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования
- •1.3 Описание потоков данных и бизнес-процессов
- •1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением
- •1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения
- •1.6 Патентный поиск
- •1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
- •1.7.1 Математическая формализация процесса обучения и алгоритмов ppo и sac
- •1.8 Применимость алгоритмов dqn, ppo и sac для задач манипуляции нежёсткими объектами в роботизированной сборке
- •1.9 Выводы по главе 1
- •2. Методы и технологии разработки и исследования интеллектуального агента в среде unity
- •2.1 Применение фреймворка Unity ml-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей
- •2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров
- •2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения
- •2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента
- •2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)
- •2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях
- •2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (c#/Unity)
- •2.6 Выводы по главе 2
- •3.Экспериментальные исследования и анализ результатов работы интеллектуального агента
- •3.1 Характеристика экспериментального стенда и условий проведения эксперимента
- •3.2 Сравнительный анализ эффективности алгоритмов ppo и sac в задаче навигации
- •3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения
- •3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo
- •3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения
- •3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени
- •3.7 Программная реализация алгоритмов поведения и управления агентом
- •3.8 Тестирование и валидация обученной модели в режиме инференса
- •3.9 Выводы по главе 3
- •Заключение
- •Список использованных источников
- •Приложение а
- •Приложение б
1.6 Патентный поиск
Патентный поиск зарегистрированных программных решений для системы автоматической генерации контента на основе машинного обучения.
Анализ патентной ситуации проводился по тематике «Unity с машинным обучением». Поиск осуществлялся с использованием ключевых слов. В качестве источника информации использовалась база данных Федерального института промышленной собственности (ФИПС): https://new.fips.ru/. В рамках ретроспективного поиска за последние 10 лет было выявлено несколько программных продуктов, которые представлены в таблице 1.5.
Таблица 1.5 – Патентный поиск
Название программы для ЭВМ |
Анализ |
Базовый класс Agent фреймворка для тренировки роботов методами машинного обучения Fluctio Sim |
Программа предназначена для интеграции машинного обучения в симуляции на основе Unity ML-Agents и MuJoCo. Она управляет поведением агентов, обрабатывает их решения через DecisionRequester, настраивает параметры симуляции (TimeLimit, DecisionsPeriod) и выполняет сброс с MujocoChainReseter. Взаимодействует с BehaviorParameters, ProxyMlAgent и другими компонентами, обеспечивая гибкость в настройке через Unity Editor. Отличается автоматической интеграцией ML-Agents и MuJoCo, возможностью адаптации поведения без изменения кода и поддержкой многоагентных сценариев. Используется в робототехнике, цифровых двойниках и моделировании сложных систем. Тип ЭВМ: мини-ЭВМ (персональный компьютер). ОС: Windows 7 SP1+, 8, 10, 64-bit версии; macOS 10.12+; Ubuntu 16.04, 18.04, 22.04, CentOS 7.
|
Продолжение таблицы 1.5 – Патентный поиск
Code AIssist |
Программа предлагает решения по дополнению кода разработчику при написании кода в среде разработки. Программа интегрируется в среду разработки в виде установленного плагина. После запуска плагина программа считывает код проекта с целью определения контекста для генерации решений, и отправляет запрос модели машинного обучения на формирование продолжения кода. Далее программа преобразует ответ на запрос от модели машинного обучения в соответствии с контекстом проекта и выдает разработчику от 1 до 3 вариантов продолжения кода. Тип ЭВМ: IBM PC - совмест. ПК; ОС: Windows 10 1809 или более поздние (Windows Server 2019 или более поздние) - macOS 10.15 или более поздние - Linux с поддержкой Gnome, KDE, Unity DE; а также более поздние Debian, Ubuntu или RHEL. Недоступно для дистрибутивов Linux, не содержащих GLIBC 2.27. Язык программирования: Java, JavaScript Объем программы для ЭВМ: 190 КБ |
Архитектоника и медиаграмматика видеоигровых кибертекстов: программный комплекс |
Программа предназначена для комплексного, автоматизированного анализа структуры игрового мира и сценария видеоигр и предоставления рекомендаций по улучшению игры. Программа может использоваться в различных областях, связанных с разработкой и системным анализом видеоигр. Программа может быть использована в качестве инструмента для анализа и оптимизации игрового процесса. Также программа может быть использована в академических исследованиях, связанных с анализом структуры игровых миров и сценариев. Например, для анализа больших объемов данных об игровых мирах и сценариях, что может помочь им выявить новые тенденции и закономерности в развитии видеоигр. Программа может быть использована в образовательных целях, чтобы обучать анализу и оптимизации игрового процесса. Программа может помочь студентам лучше понимать структуру игровых миров и сценариев, а также научить их использовать инструменты машинного обучения и визуализации данных для анализа и оптимизации игрового процесса. Программа может быть полезна для разработчиков видеоигр и всех интересующихся языком современных медиа и game studies. Функциональные возможности программы:
|
Продолжение таблицы 1.5 – Патентный поиск
|
программа может использовать алгоритмы машинного обучения для анализа данных об игровом мире и выявления общих структурных элементов, таких как типы локаций, расположение объектов и т.д.; программа может осуществлять анализ данных о сценарии и выявлять общие структурные элементы, такие как типы заданий, порядок их выполнения и т.д.; программа может создавать отчет, который содержит информацию о структуре игрового мира и сценария, а также рекомендации по улучшению игры; программа интегрироваться с другими инструментами разработки игр, такими как Unity или Unreal Engine. Тип ЭВМ: IBM РС-совмест. ПК; ОС: Windows 7/8/10/11. Программа для ЭВМ создана за счет гранта Российского научного фонда № 23-28- 00088. Язык программирования: Python Объем программы для ЭВМ: 149 МБ |
