Добавил:
ИВТ (советую зайти в "Несортированное")rnПИН МАГА Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Баранов_Вадим_Пин11М (1).docx
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
2 Мб
Скачать

3.9 Выводы по главе 3

В третьей главе был выполнен комплекс практических и экспериментальных исследований, направленных на оценку эффективности разработанного интеллектуального агента, валидацию выбранных архитектурных решений и тестирование итоговой модели поведения в виртуальной среде. На основании анализа полученных результатов сформулированы следующие выводы:

  1. Успешно развернут и сконфигурирован экспериментальный программно-аппаратный стенд на базе платформы Unity и фреймворка ML-Agents. Настроена высокопроизводительная мультиагентная среда обучения, включающая 20 параллельно функционирующих арен. Доказано, что такой подход позволяет кратно увеличить пропускную способность сбора данных (experience throughput), стабилизировать градиенты при пакетном обновлении весов нейронной сети и радикально сократить общее астрономическое время обучения (wall-clock time) до достижения сходимости модели.

  2. Выполнен глубокий экспериментальный сравнительный анализ передовых алгоритмов глубокого обучения с подкреплением — Proximal Policy Optimization (PPO) и Soft Actor-Critic (SAC). Эмпирически установлено, что алгоритм SAC (Off-Policy) обладает значительно более высокой эффективностью использования выборки (sample efficiency), достигая целевых показателей за меньшее количество шагов взаимодействия со средой. Тем не менее, алгоритм PPO (On-Policy) продемонстрировал подавляющее превосходство по критериям вычислительной стабильности, монотонности роста кумулятивного вознаграждения и предсказуемости генерируемых действий. Учитывая меньшую ресурсоемкость PPO при вычислении обновлений, именно этот метод был обоснованно выбран в качестве оптимального для финальной реализации навигационной задачи.

  3. Доказана эффективность спроектированной гибридной системы восприятия и кастомной функции вознаграждения (Reward Shaping). Подтверждено, что интеграция лидароподобных сенсоров (Ray Perception Sensor 3D) позволяет агенту успешно выходить из локальных оптимумов и определять геометрию препятствий. В свою очередь, внедрение механизма непрерывного отрицательного подкрепления («экзистенциального штрафа») успешно нивелировало фундаментальную проблему разреженного вознаграждения (sparse reward). Это заставило агента перейти от пассивного избегания стен к активной минимизации времени прохождения лабиринта и поиску кратчайших безопасных траекторий.

  4. Разработан и верифицирован алгоритм безопасной стохастической инициализации сцены (GetRandomSafePosition). Использование метода предварительного математического зондирования пространства (через перекрытие физических сфер) полностью исключило программные сбои и ошибки коллизий при генерации новых эпизодов. Постоянная смена стартовых позиций обеспечила высокую репрезентативность обучающей выборки, предотвратив переобучение (зазубривание конкретных маршрутов) и заложив основу для высокой обобщающей способности (generalization) нейросети.

  5. Итоговая обученная модель была успешно экспортирована в открытый кроссплатформенный стандарт .onnx и интегрирована непосредственно в ядро Unity для работы в режиме автономного инференса. Проведенные стресс-тесты показали, что агент функционирует исключительно за счет ресурсов центрального процессора, без привязки к внешнему Python-окружению. Модель продемонстрировала выдающийся уровень надежности (успешное достижение цели в 98% эпизодов), плавность маневрирования и способность к мгновенной адаптивной навигации в меняющихся топологических условиях.