Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Методы бизнес-аналитики. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
21
в пространстве образуют компактные сгустки, отличимые друг от друга.
=
случаях. остальныхх в,1
y,xесли ,0
Кластеры в k-means используют евклидову метрику и имеют форму сферы.
Такой алгоритм никогда не разделит вложенные друг в друга множества объектов (рис. 2.2). Поэтому в условиях, когда объекты описываются десятками и сотнями свойств, становится сложно оценить взаимное расположение объектов и подобрать адекватный алгоритм.
Рис. 2.2. Случай, когда нецелесообразно использовать алгоритм k-means
Различная природа данных, в свою очередь, определяет трудность выбора меры близости между объектами.
Для вычисления расстояний между объектами, описываемыми количественными признаками, применяется метрика в виде евклидова расстояния.
Для порядковых признаков также можно использовать евклидово расстояние, закодировав значения признака по возрастанию целыми числами. Для номинальных признаков эта мера не подходит. Здесь нужно применять специальную меру расстояния, например, функцию отличия:
d(x, y) =
где x и y – номинальные признаки.
Выбор числа кластеров
Любая кластеризация субъективна, потому что выполняется на основе конечного подмножества свойств объектов. Двух или трех кластеров, как правило, недостаточно: кластеризация будет слишком грубой, приводящей к потере информации об индивидуальных свойствах объектов. Больше десяти кластеров превышает число Миллера 7 – аналитику трудно держать в
22
кратковременной памяти столько кластеров. В подавляющем большинстве случаев число кластеров варьируется от четырех до девяти.
Если алгоритм не поддерживает автоматическое определение оптимального количества кластеров, следует провести содержательную интерпретацию каждого выявленного кластера, понять, почему объекты были сгруппированы в определенный кластер, что их объединяет. Для этого можно использовать визуальный анализ, графики, кластерограммы, статистические характеристики кластеров, карты. Полезно каждому кластеру дать емкое название, состоящее из нескольких слов.
Если алгоритм кластеризации не выделил групп, возможно, набор данных и до кластеризации был однороден, не расслаивался на изолированные подмножества, а кластеризация лишь подтвердила эту гипотезу.

2.3. Методы классификации (обучение с учителем)

Решение задачи классификации сводится к определению класса объекта по его признакам, при этом множество классов, к которым может быть отнесен объект, известно заранее. То есть классификационная модель устанавливает закономерности между входными и выходной переменной, которая является дискретной (метка класса), например, степень кредитного риска со значениями «Высокий», «Средний» или «Низкий». Такая модель строится на основе обучающей выборки. Если аналитику известны свойства объектов каждого класса, то когда новое наблюдение относится к определенному классу, данные свойства автоматически распространяются и на него.
В случае, если выходная переменная имеет непрерывный тип, для построения модели классификации можно сделать переменную дискретной с помощью обработчика «Квантование» в программе Deductor.
Формально модель классификации выполняет распознавание образов с помощью разбиения пространства признаков на области, в пределах каждой из которых многомерные векторы рассматриваются как идентичные. Иными словами, если объект попал в область пространства, ассоциированную с определенным классом, он к нему и относится.
Для классификации в Data Mining используются различные модели:
− деревья решений,
− решающие правила,
− нейронные сети,
− алгоритмы покрытия
− и другие,
при построении которых применяется обучение с учителем (supervised learning, машинное обучение), когда выходная переменная (метка класса) задана для
каждого объекта ОВ.
Модель классификации на основе решающего дерева является наиболее наглядной и легко интерпретируемой.
Мерой оценки разбиения на классы является чистота класса, что означает отсутствие в классе посторонних объектов (примесей).
23
Существуют различные алгоритмы разбиения на классы, которые
n
,
1
основываются на том, что разбиение производится по очереди по каждому входному признаку {X
Вначале выбирается один из входных признаков X n объектов ОВ
Ω
} и проверяется степень увеличения чистоты разбиения.
j
, после чего множество
j
= {
ω
}, i =
i
, разбивается на подмножества
Ω
. Затем
m
выбирается другой признак и проверяется разбивка на классы. Данная процедура будет повторяться до тех пор, пока подмножества не будут содержать объекты только одного класса. Процедура не является однозначной.
В зависимости от последовательности выбора признаков могут быть получены различные деревья решений. Эффективность разбиения выбранным признаком можно оценить по чистоте полученных дочерних узлов. Существуют различные критерии разбиения. Наиболее популярными являются: индекс Gini, информационный критерий, Хи-квадрат, метод Naive Bayes и др. При информационном подходе определяется значение энтропии в зависимости от долей классов в узле [5]. Если все классы присутствуют в узле с равной вероятностью, то энтропия максимальна.
3. НЕЙРОКОМПЬЮТИНГ И ОСНОВНЫЕ НАПРАВЛЕНИЯ ЕГО
РАЗВИТИЯ
Нейрокомпьютинг – технология создания вычислительных систем нового поколения – нейрокомпьютеров, которые состоят из большого числа параллельно работающих простых вычислительных элементов (нейронов).
Нейронные сети представляют собой вычислительные структуры, которые моделируют простые биологические процессы человеческого мозга
(рис. 3.1).
Рис. 3.1. Схема нейрона
Нейронная сеть является самообучающейся системой, способной анализировать вновь поступающую информацию, находить в ней закономерности, производить прогнозирование и пр.
Входные сигналы нейрона X
, X2, …, XN могут приходить от других
1
нейронов. Связь между нейронами осуществляют синапсы, которые умножают входной сигнал на число, характеризующее силу связи. Состояние нейрона
24
определяется сложением сигналов, поступающих по синапсическим связям от
∑
=
=
N
1j
j
j
w
x
S
 
≥
=
.иначе,
0
S,
1
)S(f
θ
Рис. 3.2. Пороговая функция
активации
S
e1
1
)S
(
f
α
−
+
=
Рис. 3.3. Сигмоидальная функция
активации
SS
SS
ee
ee
)S(th)S(
f
αα
α
α
α
−
−
+
−
==
Рис. 3.4. Гипертангенс
других нейронов, по формуле
,
где N – число входов нейрона; х
– значение j-го входа нейрона; wj – вес j-го си-
j
напса.
На входах нейрона имеются возбуждающие и тормозящие синапсы. При превышении суммы входов порога нейрона вырабатывается выходной сигнал.
Аксон нейрона реализует нелинейную функцию у = f(S), которая называется функцией активации или передаточной функцией нейрона.
Используются различные виды активационных функций.
Пороговая функция (рис. 3.2).
Сигмоидальная (логистическая) функция (рис. 3.3) наиболее часто используется в качестве функции активации. Ее особенностью является способность усиливать слабые сигналы сильнее, чем большие, и предотвращать насыщение нейронов от отдельных больших сигналов.
При уменьшении α наклон кривой становится более пологим, при α = 0 формируется прямая линия.
Также в качестве активационной функции используется гиперболический тангенс (рис. 3.4).
.
.
25
Работа нейронной сети состоит в преобразовании входного вектора признаков в выходную переменную или вектор. Это преобразование задается весами нейронной сети.
Целью обучения является поиск синапсических весов нейронов, которые минимизируют выходную ошибку сети в обучающем и тестовых множествах. Процесс обучения заключается в подстройке весов нейронов.
Если рассматривать нейронную сеть как способ представления знаний, то в ней хранятся знания об ассоциативных связях между входными и выходными векторами (откликами). Знания формируются в процессе обучения в форме весов связей между нейронами.
Достоинством нейронных сетей является их способность решать широкий спектр задач: классификации, прогнозирования, аппроксимации функции, оптимизации при больших пространствах поиска и пр. [4], [6], [7].
Недостатками нейронных сетей являются трудность вербализации результатов работы нейронной сети и объяснений, почему она приняла то или иное решение, невозможность гарантировать повторяемость и однозначность получения результатов, что увеличивает риск их применения для управления дорогостоящими техническими объектами.
Нейронные сети могут работать с числовыми переменными, лежащими в определенном ограниченном диапазоне. Поэтому числовые переменные масштабируются в подходящий для сети диапазон, а пропущенные значения можно заменить, например, на среднее значение.
Номинальные (нечисловые) переменные следует использовать лишь в определенных случаях.
Выходные номинальные переменные используются в нейронных сетях в задачах классификации.
Входные номинальные переменные могут быть преобразованы к числовому виду. Двузначная номинальная переменная, например, Пол = {Муж, Жен} приводится к числовому виду с помощью уникальных индексов, например, Муж=-1, Жен=1.
Многозначная номинальная переменная тоже может быть приведена к числовому виду с помощью индексов. Однако при этом возможно ложное упорядочивание значений переменной, например, значение переменной
Турпоездки. В таких случаях лучше присвоить каждому значению переменной
Цель ссуды окажется чем-то средним между Покупка товара и
Оплата услуг
определенный рейтинг влияния на выходную переменную (основываясь на экспертных оценках), либо объявить переменную неиспользуемой (незначащей), либо преобразовать ее к нескольким фиктивным бинарным переменным. Например, при оценивании стоимости объектов недвижимости определенный рейтинг может быть присвоен каждому району города. Фиктивные переменные моделируются в Deductor при нормализации с помощью битовой маски, основанной на позиции бита.
Следует иметь в виду, что номинальная переменная с большим числом категорий потребует большого количества бинарных переменных, что приведет
26
к росту размеров сети и создаст трудности при ее обучении, поскольку каждой бинарной переменной соответствует свой узел сети.

4. ПРАКТИКУМ

4.1. Аналитические платформы, используемые в задачах бизнес-
аналитики
На рынке представлено более 20 BI-платформ. Наиболее популярные из них:
− QlikView;
− Tableau;
− Prognoz Platform;
− IBM Cognos;
− Micro soft Power BI (SQL S erver, SharePoint Online и Power BI для Office
365);
− Tibco Spotfire;
− Deductor Studio Academ ic.
Аналитическая платформа Deductor
Аналитическая платформа Deductor, разработанная компанией BaseGroup Labs, является одной из лучших отечественных разработок в области бизнес-
аналитики. В ней сосредоточены современные методы очистки, манипулирова­ния и визуализации данных, извлечения знаний и построения моделей. Deductor представляет собой комплекс программных продуктов, связанных единой архитектурой [4], [8]. В настоящее время создана новая версия платформы – Loginom, которая использует современный веб-интерфейс и обеспечивает доступ к разнородным источникам: офисным приложениям, 1C:Предприятие, СУБД, ERP-, CRM-системам, веб-сервисам.
Вся работа по анализу данных в Deductor базируется на выполнении следующих действий:
− импорт данных;
− обработка данных;
− визуализация;
− экспорт данных.
Обработка включает в себя как предварительные манипуляции над набором данных, например, фильтрация, устранение выбросов, так и применение методов интеллектуального анализа данных (Data Mining), например, построение нейронной сети. Обработчик можно представить в виде «черного ящика», на вход которого подается набор данных, а на выходе формируется преобразованный набор данных (рис. 4.1). Визуализация предназначена для представления скрытых в данных закономерностей в явном, понятном исследователю виде.
27
Исходные данные
Предварительная
обработка
Преобразованные
данные
Методы
Data Mining
Результаты
Визуализация
результатов
Рис. 4.1. Порядок анализа данных
Обработчики в Deductor реализуют различные алгоритмы:
− очистка данных (редактирование аномалий, заполнение пропусков,
сглаживание и др.);
− трансформация данных (квантование значений, преобразование даты,
группировка, снижение размерности и др.);
− Data Mining (регрессия, деревья решений, нейронные сети и др.).
Предусмотрены следующие способы визуализации данных:
− многомерное OLAP представление данных;
− стандартное табличное представление с возможностью фильтрации
данных;
− график изменения любого показателя (диаграмма);
− график гистограммы;
− статистические показатели набора данных;
− диаграмма рассеяния. Может быть построена только для непрерывных
величин после построения модели, например, линейной регрессии. Используется для визуальной оценки качества построенной модели;
− таблица и диаграмма «Что-если». Позволяют «прогонять» через
построенную модель любые интересующие пользователя данные и оценивать влияние того или иного фактора на результат;
− обучающая выборка (набор исходных данных);
− граф нейросети. Отображается структура обученной нейронной сети и
значения весов;
− дерево решений;
− дерево правил. Отображение в иерархическом виде ассоциативных
правил;
− правила. Отображение в текстовом виде правил, полученных при
построении деревьев решений или поиске ассоциаций;
− карта Кохонена. Представляет результаты классификации данных
нейросетью с помощью цветовых полей;
− описание. Текстовое описание параметров импорта (обработки)
экспорта в дереве сценариев обработки.
Последовательность обработки и визуализации наборов данных представляется в Deductor с помощью иерархического сценария (рис. 4.2). Сценарий – наиболее естественный с точки зрения аналитика способ представления этапов построения модели. После импорта может следовать произвольное число обработчиков любой степени глубины и вложенности.
28
Каждой операции обработки соответствует отдельный узел дерева, или объект сценария. Любой объект можно визуализировать тем или иным доступным средством.
Рис. 4.2. Пример сценария в Deductor
Интерфейс Deductor состоит из главного окна, внутри которого располагаются панель сценариев и результаты моделирования (таблицы, графики, диаграммы, правила и т. д.). Все сценарии создаются на основе запуска мастеров из панели сценариев.
В распоряжение аналитика имеются 4 мастера
:
− визуализация,
− импорт,
− обработка,
− экспорт.

4.1.1. Импорт данных

Аналитическое приложение Deductor Studio предназначено для анализа информации из различных источников данных. Оно может функционировать без хранилища данных Deductor Warehouse, получая информацию из любых других источников.
В коммерческих поставках импорт может осуществляться из популярных форматов хранения данных, таких как Excel, Access, MS SQL, Oracle и прочих. Deductor Studio Academic версия предназначена для образовательных целей. В ней поддерживается только три источника и приемника данных: Deductor Warehouse, Deductor Data File и текстовые файлы. Поэтому в бесплатной версии возможен импорт только из файлов типа *.ded, *.txt и *.csv.
Таким образом, для использования данных, подготовленных во внешних приложениях, следует выполнять их конвертацию в текстовый формат. Экспорт таблицы MS Excel в формат *.txt выполняется с помощью команды Файл >> Сохранить как >> Текстовые файла (с разделителями табуляции).
Импорт данных из текстового файла с разделителями осуществляется путем вызова мастера импорта
. Импорт данных включает в себя:
29
− выбор типа файла с данными;
− выбор файла (рис. 4.3);
− указание параметров импорта;
− указание параметров столбцов. На данном шаге можно указать тип
данных и назначение переменной (входная или выходная);
− выбор способов отображения данных (таблица, статистика, графики).
От того, какие способы отображения будут выбраны, зависят дополнительные параметры построения;
− на последнем шаге указывается название ветки в дереве сценариев.
Рис. 4.3. Выбор файла с данными
В дереве сценариев появляется новый узел с необходимыми данными. В главном окне программы представлены все выбранные отображения данных этого узла. Для просмотра графика другой переменной следует нажать на значок лупы Отображать поля.
4.1.2. Подготовка данных, применение инструментов очистки и
преобразования данных
«Грязные данные» представляют собой проблему, которая затрудняет поиск закономерностей. Обычно «сырые» данные содержат пропущенные значения, различные шумы, а также аномальные выбросы. Влияние этих факторов на итоговую модель требуется минимизировать, чтобы модель была адекватной.
30
Следует учитывать, что методы очистки должны быть привязаны к предметной области: то, что в одном случае является шумом, в другой ситуации может являться ценной информацией.
Инструменты очистки данных Deductor служат для восстановления пропущенных данных, редактирования аномальных значений и спектральной обработки в целях сглаживания данных. Коротко рассмотрим основные из них.
Мастер качества данных
дает рекомендации к обработке данных и
возможность автоматического исправления На рис. 4.4 в данных по месячному потреблению электроэнергии найдены три пропущенных значения, предложено заменять их медианой.
Рис. 4.4. Рекомендации по заполнению пропущенных значений
Мастер заполнения пропусков
предлагает ряд методов обработки, выполняя восстановление данных. Если данные упорядочены, в качестве восстановления пропущенных значений можно использовать интерполяцию. Тогда автоматически подбирается значение, основанное на близлежащих данных. Если же данные не упорядочены, то следует использовать режим поиска наиболее вероятного значения, который основан на анализе всей выборки.
Мастер квантования предназначен для преобразования непрерывных
данных в дискретные.
Обработчик замена значений
предназначен для повышения информативности изменяемых значений: муж – мужчины, жен –женщины, а также для замены пустых значений на константу.
Обработчик конечные классы
позволяет уменьшить число значений
входного признака за счет их объединения в пределах некоторого интервала с использованием информации о бинарной выходной переменной y. Снижение разнообразия значений признака осуществляется без существенного уменьше­ния его разделяющей (классифицирующей) силы, т.е. с сохранением информативности признака для разделения объектов выборки на два класса, соответствующих значениям бинарной переменной y.
4.1.3. Создание структуры метаданных и разработка системы
аналитической отчетности
Отчетность является неотъемлемой частью анализа бизнес-процессов предприятия. Всю необходимую для анализа предметной области информацию аккумулирует многомерное хранилище данных. Многомерная визуализация является вспомогательным инструментом в понимании анализируемой информации, облегчающим восприятие данных и интерпретацию полученных результатов: выявление сложных аналитических зависимостей, представленных
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]