Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Технологии искусственного интеллекта в банковской сфере. Учебное пособие
.pdf
Глава 1
АХД — программное решение для извлечения, консолидации, обработки и преобразования данных из учетных систем и
последующего их использования для оперативного и аналитического бизнес-анализа [8].
АХД относится к классу BI-систем (Business Intelligence) и
позволяет наблюдать и анализировать результаты бизнеспроцессов организации [9].
Основные принципы организации АХД:
1. Проблемно-предметная ориентация. Данные объединя-
ются в
категории и хранятся в соответствии с областями, ко-
торые они описывают.
2. Интегрированность. Данные из различных источников
проходят ETL-процесс (Extract, Transform, Load — извлечение,
преобразование, загрузка) с целью приведения к соответствию
всем аналитическим требованиям предприятия [10].
3. Привязка ко времени. Данные, постепенно накапливаемые в ХД, привязаны строго к определенному периоду времени, что позволяет проводить временной
анализ, выявлять тенденции и закономерности. АХД сохраняет исторические данные для тех объектов, по которым историчность поддерживается на уровне источника данных.
4. Некорректируемость. Данные в хранилище не создаются, то есть после загрузки из внешних источников не корректируются и не удаляются.
Архитектура АХД использует принципы OLAP-кубов (On-
Line Analytical Processing — аналитическая
обработка в реальном времени) — технологии обработки данных, заключающейся в подготовке суммарной (агрегированной) информации
на основе больших массивов данных, структурированных в
виде многомерных таблиц [11].
Главные элементы АХД:
1. Измерения — коллекция объектов (атрибутов), при помощи агрегатов по которым группируются, сортируются и
фильтруются показатели. С целью уменьшения количества рутинных операций
отдельные атрибуты могут объединяться в
11

Технологии искусственного интеллекта в банковской сфере
иерархии — преднастроенный набор атрибутов одного измерения. Например, измерение «Календарь» имеет иерархию
Год-Квартал-Месяц-Дата, состоящую из соответствующих атрибутов.
2. Меры — статистически вычисленные числовые значения, по которым производится анализ. Меры представляют
некоторые аспекты организационных действий, выраженных в
денежном (доход, прибыль, затраты) или числовом выражении
(количество клиентов, счетов, договоров
), или как более слож-
ные вычисления, включающие в себя бизнес-логику [10]. В зависимости от фактов, которые отражают меры, они объединяются в группы мер. Гибкая настройка мер и измерений позволяет формировать необходимые для пользователей показатели
под их конкретную задачу. Пример куба данных представлен
на рисунке 1.
Мера «Комиссионный доход»
Измерения
Факты
Статья
доходов
Агрегаты
Доходы ЮЛ
150
РКО
ТЭ
Кредитование
Январь
2024
80
Февраль
2024
Март
2024
75
Офис №2
Офис №1
Центральный офис
Время
1 кв 2024
Агрегаты
Рис. 1. Многомерный куб данных, отражающий доходы по офисам
12

Глава 1
В зависимости от решаемых задач организации загрузка
данных в АХД может производиться с разной периодичностью:
1. В режиме реального времени совместно с операционной
деятельностью. Актуально для организаций, решающих задачи предоставления регулярной отчетности в сжатые сроки, или
для компаний, которым необходимо отслеживать производственный процесс с целью его контроля, выявления причин
про-
стоя, оптимизации (логистика, складской учет, товарооборот).
2. Ежедневная загрузка данных за предыдущий день, что
позволяет оперативно отслеживать интересующие пользователей показатели. Актуально для организаций, где АХД выступает средством принятия управленческих решений, например
для банковской сферы.
Основные преимущества использования хранилища данных:
— консолидация данных из множества источников;
— исторический анализ данных;
— высокое качество, непротиворечивость и точность данных;
— возможность принимать обоснованные решения.
Традиционное АХД построено по принципу независимых
витрин данных Ральфа Кимбалла — каждое бизнес-направление организуется в отдельную витрину данных, не связанную
с другими. Таким образом, пользователи работают только с
той информацией, которая необходима им в соответствии с
профилем их деятельности
[12].
Само по себе АХД хоть и является прогрессивным шагом
для хранения данных, но при его неправильной настройке
возможны различные проблемы. Наиболее типичные из них:
1) может отсутствовать отраслевая банковская модель данных: не выделены стандартные банковские бизнес-объекты с
их полными атрибутами, сущностями и взаимосвязями. Данный недостаток связан с тем
, что перед АХД изначально ставились одни задачи, например автоматизации управленческой
отчетности, и в итоге это сузило его возможности для решения
других задач и ограничило использование всеми заинтересованными подразделениями банка. Ориентация ХД на подго-
13

Технологии искусственного интеллекта в банковской сфере
товку той или иной отчетности вызывает необходимость постоянной доработки модели при изменении метрик и состава
отчетности;
2) могут быть не реализованы процессы и алгоритмы контроля качества загружаемых данных, отсутствовать средства
оповещения заинтересованных подразделений о наличии инцидентов качества данных [13]. Это снижает доверие к хранилищу и делает невозможным его
применение в бизнес-процессах, чувствительных к качеству данных, таких как маркетинговые акции, внутренний скоринг, управление проблемными
долгами и т.
д.;
3) конечные пользователи АХД (сотрудники банка) могут
испытывать затруднения при использовании витрин данных
при подготовке отчетов и аналитики по следующим причинам:
— отсутствие знаний, в каких витринах находятся необхо-
димые данные;
— интуитивно непонятные названия полей (атрибутов / мер)
в витринах;
— длительный срок построения отчетов в случае исполь-
зования большого количества полей
и фильтров;
4) может не выполняться поддержка процессов повышения
эффективности и доходности;
5) нет поддержки процессов управления кредитными рис-
ками. Например, не рассчитывается показатель риск-профиля
ЮЛ; не обеспечивается поддержка процессов возврата проблемной задолженности;
6) отсутствует интеграция со средствами визуализации данных, что затрудняет построение дашбордов (интерактивных
информационных панелей), которые используются
руковод-
ством банка при принятии управленческих решений [14].
Если в АХД банка присутствует хотя бы несколько из перечисленных выше проблем, то можно смело утверждать, что
полноценное хранилище данных в банке отсутствует. В этом
случае функциональность АХД не позволяет рассматривать данные как актив банка, развивать процессы управления данными и
использовать
их для реализации бизнес-стратегии банка.
14

Глава 1
Одной из наиболее оптимальных технологий организации
хранения данных является внедрение АХД в концепции Data
Vault.
АХД, построенное на концепции Data Vault, позволяет решить проблемы схемы «звезда» и 3-й нормальной формы: негибкость, затруднение масштабируемости, низкая производительность, избыточность данных. Данная методология была
разработана Дэном Линстедтом в 2000 г. [15].
Data Vault состоит из трех основных компонентов:
1.
Хаб (Hub) — основное представление сущности (клиент,
продукт) с позиции бизнеса. Данная таблица представляет собой отношение, позволяющее идентифицировать сущности,
актуальные для того или иного бизнес-процесса. Также здесь
содержатся уникальные ключи.
2. Ссылка (Link). Таблицы-ссылки связывают несколько
хабов связью многие-ко-многим, как в 3-й нормальной форме.
Она содержит те же метаданные,
что и хаб. Ссылки вместе с
хаб-таблицами выстраивают взаимосвязи между сущностями
для формирования модели бизнес-процессов.
3. Сателлит (Satellite). Все описательные атрибуты хаба или
ссылки (контекст) помещаются в таблицы-сателлиты. В сателлитах можно хранить историю изменения контекста, каждый раз добавляя новую запись при обновлении контекста в
системе-источнике. Satellite-таблицы
описывают бизнес-ключ
на наиболее доступном детальном уровне, что обеспечивает
основу для развития контекста, описывающего бизнес, позволяет ответить на вопросы «кто?», «что?», «почему?», «когда?»
д. [16].
и т.
Основные преимущества построения ХД в концепции Data
Vault:
— гибкость и масштабируемость. По мере необходимости
возможно изменение уже имеющегося ХД, в том числе добавление данных из новых источников без существенных изменений разработанной структуры;
15

Технологии искусственного интеллекта в банковской сфере
— сокращение избыточности данных;
— быстрота и удобство разработки ETL-процессов, кото-
рые реализуют последовательный подход к загрузке информации в хранилище с возможностью распараллеливания одного
потока работ на несколько конвейеров.
Традиционное ХД, основанное на подходе Ральфа Кимбалла, обладает ключевыми проблемами: дублирование данных в витринах и отсутствие возможности объединения данных
, содержащихся в разных витринах.
Хранилище в концепции Data Vault решает указанные проблемы за счет единого многомерного куба, содержащего все
необходимые для анализа данные (представление данных в
виде многомерной таблицы), универсальность которого позволяет пользователям легко формировать большое многообразие отчетов / выгрузок под их конкретную задачу (от простого
отчета по операциям клиентов
за период до кредитной отчетности). Концептуальная схема подобного АХД представлена
на рисунке 2.
ETL
SQL
bQo rt
SQL
АСВКБ
Stage‐
обла сть
SQL
CRM
Храни лище
данных
Единаявитрина
данных
Рис. 2. Концептуальная архитектура АХД в концепции Data Vault
Модернизация хранилища данных является большой и
важной задачей. АХД может стать стратегическим цифровым
16

Глава 1
активом банка и позволит решить большинство вопросов бизнес-аналитики, а также при появлении новых задач не потребует глобальной перенастройки логики системы. Помимо преимуществ АХД как аналитической системы, сам процесс его
внедрения позволит навести порядок на источниках данных,
что также является ценным для работы любого банка.
Как к любой
информационной системе, используемой в бан-
ковской сфере, к АХД предъявляются базовые требования.
Требования к надежности.
Система должна сохранять работоспособность и обеспечивать восстановление своих функций при возникновении следующих внештатных ситуаций:
— при сбоях в системе энергоснабжения аппаратной части, приводящих к перезагрузке операционной системы (ОС),
восстановление программы должно происходить после
переза-
пуска ОС и запуска исполняемого файла системы;
— при ошибках в работе аппаратных средств (кроме носителей данных и программ) восстановление функции системы
возлагается на ОС;
— при ошибках, связанных с программным обеспечением,
восстановление работоспособности возлагается на ОС.
Требования к защите информации от несанкционированного доступа.
Компоненты подсистемы должны обеспечивать
защиту от
несанкционированного доступа путем:
— идентификации пользователя;
— проверки полномочий пользователя;
— разграничения прав доступа пользователей.
Требования по сохранности информации.
Должна быть предусмотрена возможность организации ручного и автоматического резервного копирования данных системы средствами системного и базового программного обеспечения (ПО) (ОС, СУБД), входящего в состав программно-технологического комплекса
банка.
17

Технологии искусственного интеллекта в банковской сфере
Требования к эргономике определены в соответствии с
ГОСТ 34.602-2020 «Комплекс стандартов на автоматизированные системы. Техническое задание на создание автоматизированной системы».
Взаимодействие пользователей с ПО, входящим в состав
системы, должно осуществляться посредством визуального
графического интерфейса. Интерфейс системы должен быть
понятным, обеспечивать быстрое отображение экранных форм,
а также быть рассчитан на преимущественное
использование
типа «мышь», то есть управление должно осуществляться с
помощью набора экранных меню, кнопок, значков. Клавиатурный режим ввода должен использоваться главным образом
при заполнении и / или редактировании текстовых и числовых
полей экранных форм.
Система должна обеспечивать корректную обработку аварийных ситуаций, вызванных неверными действиями пользователей, неверным форматом или
недопустимыми значениями входных данных. В указанных случаях Система должна
выдавать пользователю соответствующие сообщения, после
чего возвращаться в рабочее состояние, предшествовавшее
неверной (недопустимой) команде или некорректному вводу
данных.
Требования к программно-аппаратной архитектуре АХД.
В настоящее время основным типом архитектуры ХД яв-
ляется трехуровневая архитектура (рис. 3):
1) нижний уровень — промежуточный слой
базы данных
(staging), предназначенный для импорта данных из разных источников;
2) средний уровень содержит сервер OLAP, который производит обработку, обогащение и нормализацию данных, преобразовывая их в структуру, подходящую для анализа и сложных запросов;
3) верхний уровень — уровень клиента содержит инструменты, позволяющие подключаться к АХД, создавать аналитические отчеты
и проводить анализ данных.
18

Глава 1
Operational
Syste m
Flat Files
Operational
Syste m
Datasources
MetaDa ta
Summary
Data
Stagingarea Users
Dat awarehouse
RawData
Analyt ics
Reporting
Рис. 3. Трехуровневая архитектура хранилища данных
Также необходимо отметить, что важной частью АХД являются метаданные (Metadata). Метаданные представляют собой репозиторий, который играет роль справочника о данных.
Он включает терминологию предметной области, сведения об
источниках данных, описание источников исходных данных и
т.
д. Метаданные содержат всю информацию, необходимую
для извлечения, преобразования и загрузки данных из исходных систем, а также для последующего использования содержимого ХД [9].

Технологии искусственного интеллекта в банковской сфере
Глава 2
ПРИМЕНЕНИЕ ИСКУССТВЕННОГО ИНТЕЛЛЕКТА
В БАНКОВСКОЙ СФЕРЕ
2.1. Основные виды нейронных сетей
Искусственный интеллект («способ заставить компьютеры
думать, как люди») — свойство какой-либо системы решать
интеллектуальные задачи, которые свойственны человеку. Соответственно, системы, обладающие данным свойством, будем
называть интеллектуальными системами.
Иногда выделяют так называемый сильный искусственный
интеллект и слабый искусственный интеллект
вым считается, если он проходит тест Алана Тьюринга (экспериментатор должен определить, является ли «собеседник», с
которым ведется обмен сообщениями по дистанционной клавиатуре, человеком или ИИ. Тест пройден искусственным интеллектом, если экспериментатор посчитал его человеком).
Как правило, некоторыми специалистами считается, что первый тип должен базироваться
на строгом логическом основании, в отличие от второго, который базируется, например, на
искусственных нейронных сетях [17].
Термин искусственный интеллект неразрывно связан с понятием нейронной сети. В различных источниках определение
нейронной сети описывается по-разному, но в более общем
смысле представить его можно следующим образом.
Нейронная сеть (НС) — это программно-вычислительная
система, работающая по принципу организации и функционирования нейронов в головном мозге человека. Используя специальные алгоритмы, она может распознавать скрытые шаблоны, корреляции в необработанных данных и в дальнейшем
их классифицировать, а возможности самообучения позволяют ей показывать лучшие результаты со временем.
. Первый тако-
20
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
