- •Курсовая работа
- •Тема: «Обучение с подкреплением в робототехнике: обзор алгоритмов (dqn, ppo, sac) и примеров применения в сборке. Сравнение методов, их применимость для задач манипуляции нежёсткими объектами.»
- •Аннотация
- •Содержание
- •Список сокращений и условных обозначений
- •Введение
- •Системный анализ разработки интеллектуального агента с применением обучения с подкреплением
- •1.1 Общая характеристика и современные тенденции применения искусственного интеллекта и машинного обучения в игровой индустрии и симуляциях
- •1.2 Анализ задач и определение требований к интеллектуальному агенту. Характеристика целевых сред и сценариев тестирования
- •1.3 Описание потоков данных и бизнес-процессов
- •1.4 Обзор и сравнительный анализ игровых движков и фреймворков для реализации обучения с подкреплением
- •1.5 Анализ проблематики выбора архитектуры агента, настройки гиперпараметров и обеспечения стабильности обучения
- •1.6 Патентный поиск
- •1.7 Анализ существующих методов и алгоритмов обучения с подкреплением (dqn, ppo, sac) для задач навигации, управления и принятия решений в виртуальной среде
- •1.7.1 Математическая формализация процесса обучения и алгоритмов ppo и sac
- •1.8 Применимость алгоритмов dqn, ppo и sac для задач манипуляции нежёсткими объектами в роботизированной сборке
- •1.9 Выводы по главе 1
- •2. Методы и технологии разработки и исследования интеллектуального агента в среде unity
- •2.1 Применение фреймворка Unity ml-Agents Toolkit для создания среды обучения, конфигурации агентов и нейронных сетей
- •2.1.1 Архитектура искусственной нейронной сети и конфигурация гиперпараметров
- •2.2 Обзор и сравнительный анализ алгоритмов обучения с подкреплением, методов предобработки данных и техник ускорения обучения
- •2.3 Методы сбора, обработки и визуализации метрик обучения (cumulative reward, loss, entropy) для анализа поведения и эффективности агента
- •2.3.1 Итеративная настройка и эволюция функции подкрепления (Reward Engineering)
- •2.4 Методы оценки производительности, обобщающей способности и устойчивости обученного агента в детерминированных и стохастических условиях
- •2.5 Технологический стек и архитектурные решения для интеграции модели машинного обучения (Python) с игровой логикой и физическим движком (c#/Unity)
- •2.6 Выводы по главе 2
- •3.Экспериментальные исследования и анализ результатов работы интеллектуального агента
- •3.1 Характеристика экспериментального стенда и условий проведения эксперимента
- •3.2 Сравнительный анализ эффективности алгоритмов ppo и sac в задаче навигации
- •3.3 Исследование влияния сенсорной системы и формирования функции вознаграждения
- •3.4 Анализ влияния гиперпараметров на сходимость алгоритма ppo
- •3.5 Абляционные исследования: влияние архитектуры сенсоров и функции вознаграждения на процесс обучения
- •3.6 Профилирование производительности и анализ вычислительной нагрузки в режиме реального времени
- •3.7 Программная реализация алгоритмов поведения и управления агентом
- •3.8 Тестирование и валидация обученной модели в режиме инференса
- •3.9 Выводы по главе 3
- •Заключение
- •Список использованных источников
- •Приложение а
- •Приложение б
1.3 Описание потоков данных и бизнес-процессов
Моделирование бизнес-процессов и потоков данных является важным этапом при проектировании сложных систем. Оно позволяет формализовать и наглядно представить структуру процессов, движение информации и взаимодействие между компонентами системы. Для решения этих задач используются различные методологии, среди которых IDEF0 и DFD являются одними из наиболее распространенных и эффективных инструментов структурного анализа.
Методология IDEF0 представляет собой стандарт функционального моделирования, предназначенный для описания бизнес-процессов как набора взаимосвязанных функций. Основным элементом нотации является функциональный блок, который преобразует входы в выходы под воздействием управляющих сигналов и с использованием определенных механизмов. Модель строится по принципу иерархической декомпозиции, начиная с общего контекстного представления системы (диаграмма верхнего уровня) и последовательно детализируя каждую из функций до необходимого уровня [16]. Ключевой особенностью IDEF0 является четкое разделение интерфейсов функционального блока: входные данные, управляющие воздействия, выходные результаты и механизмы выполнения. Такой подход позволяет анализировать не только последовательность действий, но и организационную структуру, ресурсное обеспечение и управленческие аспекты деятельности системы.
Контекстная диаграмма главной бизнес-функции представлена на рисунках 1.1 - 1.2
Рисунок 1.1 - Контекстная диаграмма главной бизнес-функции
Как видно из представленной контекстной диаграммы (Рисунок 1.1), основным входом (Input) для системы служат «Технические требования к поведению ИИ», «Данные игровой среды» (координаты, физические ограничения) и «Действия игрока». В качестве управляющих воздействий (Control) выступают «Техническое задание (ТЗ) на ИИ», «Стандарты кодирования» и «Ограничения физического движка Unity». Механизмами (Mechanism), обеспечивающими выполнение процесса, являются непосредственно «Инструменты разработки Unity», «Система версионного контроля» и «Команда разработчиков». На выходе (Output) формируются «Реализованные алгоритмы ИИ», готовые «Интегрированные ИИ-агенты в игровой среде» и «Отчеты оценки эффективности», включающие метрики сходимости нейронной сети.
Рисунок 1.2 - Декомпозиция контекстной диаграммы главной бизнес-функции
Декомпозиция главной бизнес-функции (Рисунок 1.2) позволяет выделить три основных подпроцесса. Процесс А1 «Проектирование ИИ-поведения» отвечает за математическую формализацию марковского процесса принятия решений и выбор архитектуры сенсоров. Процесс А2 «Интеграция ИИ с игровой средой» описывает настройку моста между Unity (C#) и Python через протокол gRPC. Процесс А3 «Обучение и адаптация ИИ» является наиболее ресурсоемким и представляет собой итеративный цикл генерации опыта и обновления весов модели с использованием алгоритмов глубокого обучения. Наконец, процесс А4 «Оценка эффективности ИИ» необходим для валидации обобщающей способности агента.
В отличие от IDEF0, методология DFD (Data Flow Diagram) ориентирована на моделирование именно потоков данных. Она описывает, как информация передается между процессами, внешними сущностями и хранилищами данных в рамках системы. Основными элементами DFD являются процессы, внешние сущности, потоки данных и накопители. Эта нотация особенно полезна для проектирования информационных систем, так как позволяет выявить источники и потребители данных, точки их обработки и хранения, а также потенциальные узкие места в информационных потоках [17]. DFD эффективно дополняет функциональные модели, показывая, какие данные необходимы для выполнения бизнес-процессов и как результаты этих процессов превращаются в выходную информацию.
Выбор между IDEF0 и DFD зависит от целей моделирования. IDEF0 лучше подходит для анализа структуры деятельности организации, выявления функций и их взаимосвязей, в то время как DFD фокусируется на информационной архитектуре системы. Часто эти методологии используются совместно: сначала строится функциональная модель в IDEF0, а затем для ключевых функций детализируются потоки данных с помощью DFD. Такой комплексный подход обеспечивает всестороннее представление системы, охватывающее как бизнес-логику, так и информационные аспекты.
Диаграмма потоков данных представлена на рисунке 1.3.
Рисунок 1.3 - Диаграмма потоков данных
Таким образом, IDEF0 и DFD представляют собой взаимодополняющие методологии структурного анализа.
IDEF0 обеспечивает понимание функциональной структуры системы и организационного контекста, в то время как DFD детализирует информационные потоки, поддерживающие эти функции. Грамотное комбинирование этих подходов позволяет создавать целостные и непротиворечивые модели сложных систем, что является важным этапом их проектирования, оптимизации и внедрения [18].
Для успешного применения этих методологий важно понимать их семантику и области эффективного использования, что позволяет выбирать правильный инструмент в зависимости от конкретных задач анализа и проектирования.
