Внешнеторговая деятельность инфраструктурное обеспечение цифровизации экономики. Учебное пособие
.pdf– поиск по категориям, ключевым словам, пространственному кри-
терию и заданным параметрам (форма представления, временной период,
используемый источник метаданных и т. п.) [4].
Геопортал делает возможным дополнять карту результатами поиска
искачивать данные в требуемом формате, составе и структуре.
Сточки зрения обеспечения информационной безопасности защита
иуправление сервисами основаны на политиках и правах доступа, опре-
деленных группам пользователей в соответствии с решаемыми ими задачами, и позволяют осуществить разграничение прав доступа к сервисам геоинформационной платформы.
Дополнительно к разграничению доступа к сервисам группам пользователей геопортал позволяет осуществлять лицензирование их исполь-
зования. С помощью функций лицензирования можно выполнять тарификацию использования сервисов потребителями в зависимости от выполня-
емых операций, объема использованных данных, региона и времени ис-
пользования.
Геопортал позволяет выполнять мониторинг качества веб-сервисов на основе сбора и отображения на сервисе статистической информации о качестве и доступности и оповещать администратора о появлении про-
блем с доступом к сервису.
Дополнительно в геопортале есть функция управления ГИС-про-
ектами, для этого используется инструментарий Portal for ArcGIS. У поль-
зователя есть возможность создания и публикации на портале картогра-
фических приложений. Публикация приложений базируется на использо-
вании сервисов геоинформационной платформы ИПД РФ, а также внеш-
них сервисов, опубликованных по стандартам OGC или ArcGIS [4].
Перспективной разработкой компаний Esri CIS и DATA+ является типовое решение для оперативного формирования ИПД регионального
61
и ведомственного уровня – «ИПД Регион», дающее возможность за не-
сколько месяцев сформировать необходимую инфраструктуру простран-
ственных данных – территориальный узел ИПД РФ. Типовой подход к внедрению этой системы позволяет не разрабатывать модели, концепцию,
техническое задание, а адаптировать и настроить имеющиеся программные компоненты под особенности задач, решаемых в конкретном регионе.
Следует отметить один немаловажный факт: в «ИПД Регион» и на портале ИПД федерального уровня используются одни и те же техноло-
гии, что дает возможность достаточно просто технически выполнить их быструю интеграцию. Также при разработке решения были учтены требо-
вания стандартов ISO, OGC, ГОСТ и INSPIRE[4].
«ИПД Регион» структурно состоит из четырех основных компонентов:
1.ГИС-платформа на базе Esri ArcGIS Server для опубликования пространственных данных, метаданных и веб-сервисов.
2.Esri Geoportal Server, используемый для представления сервиса метаданных и интерфейса портала.
3.Программное обеспечение con terra sdi.suite для решения следующих задач: разграничения прав доступа для групп пользователей; управления по-
литикой лицензирования, тарификации и правами пользователей.
4. ArcGIS Desktop ArcEditor – рабочее место ИТ-специалиста подго-
товки данных к опубликованию и управления ГИС-платформой [4].
3.2.ВНЕДРЕНИЕ ТЕХНОЛОГИЙ РАБОТЫ С ДАННЫМИ
ВЦИФРОВОЙ ЭКОНОМИКЕ
Косновным технологиям работы с цифровыми данными, указанным
впрограмме «Цифровая экономика», относятся:
большие данные (Big Data);
62
оперативная аналитическая обработка данных (OLAP), интеллектуальный анализ больших данных (Data Mining), интеграция OLAP и Data
Mining;
искусственный интеллект (AI);
технологии нейронных сетей;
когнитивные технологии;
блокчейн (использование одинаковых данных, которые хранятся на разных компьютерах и которые можно применять в любой сфере);
промышленный интернет;
сети 5G и т. д.;
виртуальная и дополненная реальность;
сенсорика;
имитационное моделирование;
визуальное интерактивное моделирование.
3.2.1. Большие данные (Big Data)
Большие данные (англ. Big Data) – это обозначение структурированных и неструктурированных данных огромных объемов, эффективно обрабатываемых горизонтально масштабируемыми программными инструментами.
Большие данные в настоящее время применяются для организации «умных домов», увеличения доходов банков и торговых сетей, повышения эффективности производства и т. д.
Технологии больших данных – это целый комплекс различных инструментов, подходов и методов работы с информацией, позволяющих решать несколько глобальных задач:
1. Управление гигантскими массивами информации, с которыми не справляются технологии обычных баз данных.
63
2.Работа с неструктурированной или частично структурированной информацией, записанной в различных форматах.
3.Обработка и анализ полученной информации, используемой для реализации различных проектов, формирования высокоточных прогнозов
ит. п. [5].
Для Big Data актуальны: объем хранимой информации, ее достовер-
ность и актуальность, скорость, разнообразие форматов хранимой инфор-
мации. Для хранения информации рекомендованы облачные технологии.
Три самых популярных облачных хранилища – iCloud, DropBox
и Google Drive [6]. Предпочтительней работать с Google Drive, поскольку обладает простой навигацией и программу легко освоить. Программа мо-
жет быть установлена на мобильном телефоне. Зарегистрировавшись
вGmail, можно получить 15 ГБ «облака» Google Drive бесплатно.
Впоследнее время актуально применение озера данных (data lake).
Озером данных называют хранилище в облаке большого объема неструк-
турированных данных, собранных в одной компании или госучреждении или сгенерированных в этой компании или госучреждении в результате их деятельности.
В озеро поступают данные из различных информационных систем,
каталогов, банковских программ, датчиков или умных устройств, поэтому все данные в Big Data разнородные и неструктурированные, хранятся в разных форматах и их перед загрузкой в базы нужно долго обраба-
тывать.
Для этого можно использовать Hadoop – программное обеспечение,
которое на базе собранных данных может распределять и структурировать данные, настраивать аналитику для построения моделей с целью прогно-
зирования, применять машинное обучение. После сохранения полученных
64
данных можно извлекать данные определенного формата в классические базы данных или работать с данными внутри data lake.
При реализации этого направления очень важно решить кадровый вопрос, поскольку для работы с большими данными очень нужны анали-
тики этих данных. По мере более широкого внедрения цифровых техноло-
гий значение данной профессии будет возрастать.
3.2.2. Оперативная аналитическая обработка данных (OLAP)
Под OLAP (англ. online analytical processing – интерактивная анали-
тическая обработка) понимают технологию работы с данными, основан-
ную на подготовке агрегированной информации, извлекаемой из имею-
щихся массивов данных, структурированных по многомерному принципу.
Данные, используемые в OLAP для анализа, формируются в информаци-
онных системах (ERP, CRM, HRM и т. д.).
OLAP-системы включены в структуру большинства приложений для бизнес-аналитики, «корпоративных» редакций СУБД компаний (IBM, Microsoft, Oracle). Технологии OLAP – неотъемлемая часть современных
ERP-систем. В государственном секторе РФ используется OLAP-инстру-
ментарий Группы компаний БАРС Групп [7].
Основные характеристики OLAP-систем:
–использование многомерных моделей;
–интуитивно понятный интерфейс;
–архитектура «клиент – сервер»;
–многопользовательский режим работы с данными;
–возможность пакетной обработки данных;
–доступ к инструментам OLAP-системы и к источникам данных;
–высокое быстродействие.
65
Используемые OLAP-системы подразделяются на три класса по типу исходной базы данных:
1. MOLAP. Системы работают только с многомерными базами данных.
Данные организованы в виде упорядоченных многомерных массивов:
1) гиперкубов данных, содержащих одно или более измерений и пред-
ставляющих собой упорядоченный набор ячеек; 2) поликубов (каждая переменная описывается в собственной систе-
ме измерений), где обработка осуществляется внутренним инструмента-
рием MOLAP.
Достоинства многомерных БД в OLAP:
1) применение многомерных СУБД дает возможность значительно быстрее осуществлять поиск и выборку данных;
2) при работе с MOLAP можно использовать различные встроенные функции.
Ограничения применения многомерных БД в OLAP:
1)ограничение по объему базы данных;
2)неэффективное использование внешней памяти.
Исходя из вышеизложенного, следует отметить, что использование
MOLAP возможно, если:
1)данные представлены в агрегатированном виде;
2)набор информационных измерений не меняется, иначе БД нужно будет перестраивать;
3)время ответа системы на нерегламентированные запросы невелико;
4)можно для работы с данными использовать как сложные встроен-
ные функции, так и написанные пользователем функции.
Стоимость MOLAP велика, но эта система гарантирует полный цикл
OLAP-обработки. Для работы с такой системой требуются высококвали-
66
фицированные сотрудники, которые могут выполнять работы по установ-
ке и сопровождению системы, формированию данных для конечных поль-
зователей в удобном для них виде.
2. ROLAP. Системы работают с данными, представленными взаимо-
связанными таблицами в многомерной форме.
Особенность ROLAP в том, что система ориентирована на использо-
вание больших хранилищ.
Достоинства ROLAP:
1) размер хранилища не так важен, как в случае MOLAP;
2) ROLAP – системы с динамической размерностью, что является оптимальным решением, так как в них не нужно реорганизовывать базу данных;
3) высокий уровень защиты данных и организация прав доступа к данным.
Главный недостаток ROLAP по сравнению с MOLAP – меньшая производительность. Для обеспечения высокой производительности тре-
буется постоянная большая работа со стороны администраторов БД. Ре-
жим работы таких систем также многопользовательский. Персонал для работы с такой системой должен иметь высокую квалификацию в области современных информационных технологий.
3. HOLAP. Гибридные системы (Hybrid OLAP, HOLAP) совмещают достоинства и минимизируют недостатки MOLAP и ROLAP. Они имеют гибкость и скорость обработки MOLAP и доступ к табличным данным
ROLAP.
HOLAP осуществляют выборку и преобразование данных из необхо-
димых пользователю источников, перемещают их в динамическую много-
мерную БД, хранящуюся на клиентской станции конечного пользователя.
67
3.2.3. Интеллектуальный анализ данных (Data Mining)
ИАД (англ. Data Mining) – это система поддержки принятия реше-
ний, базирующаяся на выявлении скрытых закономерностей. При этом накопленные варианты выявления скрытых закономерностей помещаются в базу знаний [8].
Процесс ИАД включает три стадии:
1)поиск закономерностей;
2)прогностическое моделирование;
3)выявление отклонений в найденных закономерностях.
Интеллектуальный анализ данных выявляет следующие типы зако-
номерностей: ассоциация, последовательность, классификация, кластери-
зация и прогнозирование. Возможна проверка на промежуточной стадии достоверности этих найденных закономерностей.
Для выявления закономерностей могут быть использованы мето-
ды: кросс-табуляция, логическая индукция, вывод уравнений и др.
Рассмотрим ассоциацию в контексте анализируемых вопросов.
Ассоциация – это вариант закономерности, когда несколько событий связаны друг с другом. Например, после приобретения дома в большин-
стве случаев приобретаются мебель и бытовая техника.
Последовательность рассматривается как пронумерованный набор определенных объектов, среди которых допускаются повторения, причем порядок объектов имеет значение.
Классификация – это вид закономерности, когда выявляются при-
знаки, характерные для группы, к которой принадлежит тот или иной объ-
ект. Это делается на основе формулирования заданного набора правил.
Один из примеров практического применения – оценка платежеспособно-
68
сти заемщика в банке с учетом его принадлежности к определенному классу клиентов.
Особенностью кластеризации является то, что заранее неизвестны сами группы объектов. Группы формируются посредством анализа дан-
ных средствами Data Mining. Практическое применение – это сегментация рынка клиентов.
Основой прогнозирования в ИАД служат исторические данные, хра-
нящиеся в системе в виде временных массивов. Если правильно построить шаблоны, адекватно отражающие динамику поведения целевых показате-
лей, есть возможность прогнозирования поведения системы. Этот метод применяют для оценки спроса на услуги и товары, прогнозирования структуры сбыта.
Прогностическое моделирование в ИАД – это вторая стадия ИАД,
базирующаяся на результатах выполнения первого этапа по выявлению закономерностей. На этом этапе выполняется предсказание неизвестных значений.
Часто случается так, что полученные результаты прогноза значи-
тельно отличаются от ожидаемых. В этом случае используется третий этап интеллектуального анализа данных – выявление отклонений в найденных закономерностях. Если причиной отклонений стали ошибки в данных, то-
гда эти выявленные ошибочные данные могут быть удалены из хранили-
ща данных.
3.2.4. Интеграция OLAP и Data Mining
Оперативная аналитическая обработка и интеллектуальный анализ данных – две технологии, применяемые в системах поддержки принятия решений (СППР). С учетом того, что OLAP работает с массивами данных
69
различной размерности с большим быстродействием, а Data Mining хотя работает чаще с одномерными массивами, но позволяет выявлять в масси-
ве данных скрытые закономерности, для повышения эффективности СППР были разработаны программные продукты, сочетающие преимуще-
ства этих двух технологий. Эти программные продукты обозначают тер-
мином «многомерный интеллектуальный анализ» (OLAP Data Mining).
Применение СППР, например, в государственном и муниципальном управлении показывает, что интеллектуальный анализ – инструмент по-
строения гипотез и прогнозирования, а OLAP-анализ позволяет их эффек-
тивно проверить. Повышение же эффективности обработки больших объ-
емов данных происходит за счет единого интерфейса.
3.2.5.Технология искусственного интеллекта
Впрактике разработки управленческих решений очень часто встре-
чаются слабоструктурированные или неструктурированные задачи, поэто-
му возникает необходимость в использовании систем поддержки принятия решений, в составе компонентов которых предусмотрены базы данных и знаний, блок создания заключений, хранилищ информации и моделей.
СППР опирается на следующие технологии: искусственный интел-
лект, инженерию знаний, обработку данных и применение математических моделей.
Искусственный интеллект (ИИ) – это область компьютерных техно-
логий, занимающихся автоматизацией разумного поведения.
Автоматизация решения задач управления в цифровой экономике путем использования интеллектуальных функций базируется:
– на использовании нейронных сетей для классификации на уровне распознавания и обобщения объектов и ситуаций;
70
