Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы бизнес-аналитики. Учебное пособие.pdf
X
- •ВВЕДЕНИЕ
- •1.5.3. Фреймовая модель представления знаний
- •1.5.4. Продукционная модель представления знаний
- •1. Основы систем интеллектуального анализа данных
- •1.1. История искусственного интеллекта
- •1.2. Экспертные системы
- •1.3. Системы бизнес-аналитики
- •1.4. Данные и знания
- •1.5. Модели представления знаний
- •1.5.1. Логическая модель представления знаний
- •1.5.2. Семантическая модель представления знаний
- •1.5.5. Нейронная сеть как модель представления знаний
- •2.1. Технология интеллектуального анализа данных
- •2.1.1. Виды данных
- •2.1.2. Data Mining
- •2.1.3. Статистические методы многомерного анализа данных
- •2.1.4. Машинное обучение
- •2.1.5. Общие методы поиска решений в продукционных системах
- •2.1.6. Классификация и кластеризация
- •2.2. Методы кластерного анализа (обучение без учителя)
- •2.3. Методы классификации (обучение с учителем)
- •4. Практикум
- •4.1.1. Импорт данных
- •4.2. Кластерный анализ
- •Практическое занятие 1. Сегментация данных
- •4.3. Самоорганизующиеся карты признаков
- •Практическое задание 2. Построение и анализ самоорганизующихся карт признаков
- •4.4. Классификация с помощью дерева решений
- •4.4.1. Алгоритм построения дерева решений
- •Задание для самостоятельной работы
- •4.4.3. Построение дерева решений в автоматическом режиме
- •4.5. Нейросетевые модели
- •4.5.1. Классифицирующая нейросеть
- •4.5.2. Нейросетевая модель прогнозирования
- •4.6. Поиск ассоциативных правил
- •Практическое задание 6. Поиск ассоциативных правил
- •ЗАКЛЮЧЕНИЕ
- •ВОПРОСЫ К Экзамену
- •БИБЛИОГРАФИЧЕСКИЙ СПИСОК

31
в графическом виде, и определение общих тенденций в рассматриваемых
процессах.
Для поддержки процесса анализа данных, обеспечивающего целостность,
непротиворечивость и хронологию данных, а также высокую скорость
выполнения аналитических запросов используется хранилище данных (ХД).
Информация в хранилище находится в структурах типа «снежинка», где в
центре расположены таблицы фактов, а «лучами» являются измерения, причем
измерение может ссылаться на другие измерения.
Каждая «снежинка» называется процессом и описывает определенное
действие, например, продажи товара, отгрузки, поступления денежных средств
и проч. В Deductor Warehouse может одновременно храниться множество
процессов, имеющих общие измерения, например,
процессах
Поступления и в Отгрузка.
Товар, фигурирующий в
Все загружаемые в хранилище данные обязательно должны быть
определены как измерение, атрибут либо факт [6], [9].
Механизм, позволяющий оперировать данными посредством терминов
предметной области, – семантический слой. В нем сохраняются метаданные.
Технологии, которые реализуют аналитическую обработку информации,
ориентированы на решение стратегических вопросов компаний – для принятия
управленческих, финансовых и кадровых решений. Они получили название
аналитического оснащения процессов обработки информации в реальном
времени On-Lіne Analytіcal Processіng, или OLAP. Технологии OLAP никогда ни
оперируют данными реального времени. Такие данные постоянно изменяются,
поэтому строить анализ на их основе нельзя.
OLAP оперирует итоговыми значениями: например, общий объем продаж
за определенный период времени без учета специфики отдельной продажи.
OLAP-системы построены на нескольких базовых принципах:
1) данные, используемые для принятия решений, предварительно агрегированы и организованы так, чтобы обеспечить максимально быстрый доступ к
ним;
2) принцип многомерного представления данных;
3) язык манипулирования данными основан на использовании бизнеспонятий.
В OLAP-системах предварительно подготовленная информация преобра-
зуется в форму многомерного куба; такими данными легче манипулировать,
используя необходимые для анализа срезы.
Многомерный куб можно рассматривать как систему координат, осями
которой являются измерения, например
Дата, Товар, Покупатель. По осям
откладываются значения измерений – даты, наименования товаров, названия
фирм-покупателей, ФИО физических лиц и т. д.
Каждому набору значений измерений (например, дата – товар –
покупатель) будет соответствовать ячейка, в которой можно разместить
числовые показатели (то есть факты), связанные с данным набором. Фактами
могут быть
Цена, Количество, Сумма.

32
Таким образом, между объектами бизнес-процесса и их числовыми
характеристиками будет установлена однозначная связь.
Визуализация OLAP-куба производится с помощью таблиц специального
вида, которые строятся на основе срезов OLAP-куба (рис. 4.5). Срезы являются
результатом выполнения соответствующего запроса к базе или хранилищу
данных.
Рис. 4.5. Технология OLAP
Кросс-таблица является основным и наиболее распространенным
способом отображения куба. Она отличается от обычной плоской таблицы
наличием нескольких уровней вложенности (например, она допускает
разбиение строк на подстроки, а столбцов – на подстолбцы). Кросс-диаграмма
представляет собой диаграмму заданного типа (гистограмму, линейную
диаграмму и т. д.), построенную на основе кросс-таблицы.
4.2. Кластерный анализ
Импортируем файл CreditSample.txt и запустим обработчик
«Кластеризация». Почти все признаки имеют назначение «Входные».
Ряд признаков укажем как «Неиспользуемые». Признаки
паспорта
– так как их значения уникальны и не подходят для группировки
Код и №
объектов. Номинальные признаки (цель ссуды, наличие недвижимости и пр.) по
своей природе являются классификационными. Зададим их неиспользуемыми,
поскольку обработка данных в полях, значения которых нельзя упорядочить,
будет приводить к некорректным результатам.
Признак
Давать кредит, принимающий два значения «Да» (Истина) или
«Нет» (Ложь), заданный по умолчанию как «Выходной», установим как
«Информационный». Признак исключается из обработки, но остается
возможность оценки его значений для выявленных кластеров.
Замечание. В обработчиках «Кластеризация» и «карта Кохонена»
допускается задавать выходной признак. Этот признак не будет принимать
участие в алгоритме кластеризации, однако после обучения по этому признаку

33
будет собрана прогнозная статистика, что дает возможность для решения
задачи классификации или регрессии.
Параметры обучения оставим заданными по умолчанию.
На следующем шаге мастера выберем алгоритм кластеризации g-means
для автоматического определения количества кластеров.
Процесс обучения запускается с помощью кнопки «Пуск». В качестве
визуализаторов выберем «Связи кластеров», «Профили кластеров», «Матрицу
сравнения».
Связи кластеров (рис. 4.6) определяют три выделенных группы объектов.
Рис.4.6. Связи кластеров
Профили кластеров (рис. 4.7) показывают, насколько значим тот или иной
признак для отнесения записи к каждому кластеру. Значения же признаков для
объектов выделенного кластера приводятся в таблице под профилями.

34
Рис. 4.7. Профили кластеров (фрагмент)
Наиболее значимыми являются первые четыре приведенных на рис. 4.7
признака. Развернув их представление можно дать каждому кластеру описание.
Признак «Срок проживания в данной местности» отличается для всех
трех кластеров – его доверительные интервалы практически не пересекаются.
Значимость признака «Среднемесячный доход» достаточно высокая (92,5 %).
Почти все объекты, относящиеся к Кластеру 0, полностью определяются
значениями этого признака (значимость 94,3 %).
Кластер 0. Мощность 18,8 %. Представляет клиентов, которые дольше
всего проживают в данной местности (в среднем 26 лет) и работают на данном
предприятии (в среднем 8 лет). Их возраст – наибольший, в среднем 49–50 лет.
Среднемесячный доход клиентов в данном кластере наименьший – около
8000 руб. Срок и размер ссуды клиентов имеют наиболее широкий диапазон
значений. Подавляющая часть записей в данном кластере содержит описания
клиентов, которым можно выдавать кредит.
Кластер 1. Мощность 25,5 %. Представляет клиентов, которые в среднем
проживают в данной местности 21 год и работают на данном предприятии 3–4
года. Их средний возраст – 43 года. Среднемесячный доход клиентов в данном
кластере наибольший – около 10 000 руб. Кластер содержит описания клиентов,
в отношении которых требуется рассматривать дополнительные атрибуты,
чтобы решить вопрос с выдачей кредита.
Кластер 2. Наибольший кластер с мощностью 55,7 %. Представляет
клиентов, которые меньше всего проживают в данной местности (в среднем

35
13,5 лет) и работают на данном предприятии 5–6 лет. Их средний возраст – 25
Номер
объекта
1
2
…
n
лет. Среднемесячный доход клиентов в данном кластере – около 9000–
10 000 руб. Кластер содержит описания клиентов, в отношении которых
требуется рассматривать дополнительные атрибуты, чтобы решить вопрос с
выдачей кредита.
Матрица сравнения (рис. 4.8) показывают, что больше всех от остальных
отличается Кластер 2, представляющий наиболее молодых клиентов.
Рис. 4.8. Матрица сравнения кластеров
Практическое занятие 1. Сегментация данных
Целью исследования является кластеризация или разбиение множества
объектов на схожие группы. Кластеризация помогает выявить структуру
данных, увеличить наглядность их представления, понять, насколько
информативны свойства объектов. Использование кластеров позволяет
обосновать выбор, опираясь на значения измеримых признаков найденного
прототипа внутри кластера.
Выполнить один из предлагаемых вариантов.
Вариант 1. Собрать описания устройств или технических объектов в
выбранной предметной области в виде табл. 4.1. Использовать данные
электронных магазинов или агрегаторов, например, https://market.yandex.ru.
Данные сохранить в MS Excel.
Таблица 4.1. Исходные данные
(наименование)
X1 X2 … XN
Для описания объектов составить набор наименований признаков {X
,…, XN}. Подобрать описания для n объектов, n = 20–50, N = 5–10.
X
2
При описании объектов может учитываться множество различных
факторов: технические характеристики, массо-габаритные показатели, функция
объекта, конструкция, эргономичность и пр.
Вариант 2. На сайте Федеральной службы государственной статистики
http://www.gks.ru [11] в разделе «База данных муниципальных образований»
выбрать 10 показателей оценки эффективности экономики России. Собрать
,… ,
1

36
статистические данные по всем областям одного из федеральных округов в
виде таблицы Excel.
Определить число основных кластеров, построить профили кластеров и
дать их содержательную интерпретацию.
4.3. Самоорганизующиеся карты признаков
Самоорганизующаяся карта Кохонена (Self-organizing map, SOM) –
нейронная сеть с обучением без учителя, выполняющая задачу кластеризации и
визуализации результатов. Является методом проецирования многомерного
пространства в пространство с более низкой размерностью, обычно двумерное.
Идея сети Кохонена принадлежит финскому ученому Тойво Кохонену (1982 г.).
Сеть Кохонена представляет собой два слоя: входной и выходной (слой
Кохонена) [11]. Входной слой содержит число нейронов, равное числу
признаков, характеризующих объекты. Каждый нейрон входного слоя связан со
всеми нейронами выходного. Каждый выходной нейрон имеет вектор весов,
размерность которого равна размерности пространства признаков. Количество
нейронов в выходном слое равно числу кластеров, формируемых моделью: в
зависимости от того, какой из нейронов возбуждается при подаче на вход сети
определенного объекта, он относится к соответствующему кластеру.
В результате обучения сети Кохонена с каждым выходным нейроном
будет связана некоторая область пространства признаков, расположение и
размеры которой будут определяться распределением объектов обучающего
множества. Сети Кохонена являются слабосвязнными нейронными сетями.
Нейроны располагаются в узлах прямоугольной (гексогональной) решетки и
связаны с ближайшими соседями.
Для содержательной интерпретации кластеров используются специальные средства визуализации. Вместо представления объектов непосредственно в
многомерном пространстве выполняется построение двумерных карт, которые
сохраняют сходство или различие объектов (топологическое подобие). Карта
Кохонена представляет собой сеть, в которой число выходных нейронов много
больше, чем число потенциальных кластеров (рис. 4.9).

37
Рис. 4.9. Структура карты Кохонена
В первом приближении карту можно представить в виде «гибкой» сети,
брошенной в пространство признаков. В процессе обучения объект подтягивает
ближайший узел. Вместе с этим узлом, но с меньшей силой, подтягиваются и
соседние узлы. Процесс повторяется для всех объектов обучающего множества.
Полученная карта обладает таким свойством, что объекты, похожие между
собой, со схожими признаками попадают в один узел или в соседние узлы.
В результате расположение узлов в карте совпадает с расположением
основных скоплений объектов в исходном пространстве признаков.
Карта представляет информацию в простой и наглядной форме путем
нанесения раскраски ее узлов цветами, соответствующими исследуемым
признакам объектов. Атлас с картами для различных признаков дает
возможность выполнять анализ расположения цветов, тем самым устанавливая
зависимости между признаками и классифицирующей переменной.
Карта Кохонена состоит из ячеек, центром каждой из которых является
нейрон выходного слоя. По окончанию обучения каждый нейрон отвечает за
определение кластера. В ячейку попадает один или несколько объектов [4].
В гексагональной сетке каждый узел соединен с шестью ближайшими
узлами. Шестиугольные ячейки более корректно отражают расстояния между
объектами на карте, так как у них равны расстояния между центрами смежных
ячеек.
На карте признака цвет в определенной точке зависит от данных, которые
туда попали. Ячейки, в которые попали объекты с минимальными значениями
признака или не попало вообще ни одного объекта, окрашиваются синим
цветом, а ячейки с максимальным значением признака окрашиваются красным
цветом.
Раскраска карты Кластеры позволяет оценить результаты кластеризации.
Если ячейки с одинаковой расцветкой образуют обособленные области, то
результаты кластеризации хорошие. Если ячейки разных цветов разбросаны

38
вперемешку по всей карте, то результаты неудовлетворительные. Элементы
карты, попавшие в область одного цвета (кластер), имеют сходные признаки.
В Deductor сети и карты Кохонена реализованы в обработчике Карта
Кохонена, где содержатся сам алгоритм обучения Кохонена и специальный
визуализатор Карта Кохонена [6].
Алгоритм Кохонена ориентирован на работу преимущественно с
количественными (числовыми) типами данных, а также с ординальными
(упорядоченными) типами. Упорядочивание ординальных типов
осуществляется в Deductor при назначении входных признаков на вкладке
Настройка нормализации. Обработка данных для номинальных признаков,
значения которых нельзя упорядочить, будет приводить к некорректным
результатам.
По умолчанию размер карты равен 16 × 12, что соответствует 192
ячейкам (нейронам). Число ячеек, а соответственно и нейронов, которое
обеспечит наилучшее представление результатов кластеризации, заранее
неизвестно. Если разброс значений признаков в обучающей выборке сильный
(векторы объектов в пространстве признаков разрежены), то, возможно,
следует уменьшить число нейронов карты, чтобы избежать большого
количества пустых ячеек. И наоборот, если векторы объектов расположены в
пространстве признаков плотно, то для получения лучших результатов можно
увеличить число нейронов [6].
Практика показывает, что карта Кохонена хорошо представляет
результаты кластеризации, если число ячеек примерно равно или чуть больше
(на 10–15 %) числа обучающих примеров [11]. Поскольку в одной ячейке может
располагаться несколько объектов, то некоторые ячейки могут оказаться
пустыми. Однако поскольку карта в дальнейшем будет применяться к новым
данным, ячейки, оставшиеся пустыми в процессе обучения, могут оказаться
«востребованными», что делает их избыточность необходимой. Если же
выбрать число ячеек карты слишком большим (в 1,5 – 2 раза больше числа
обучающих примеров), то данные на карте будут представлены очень редко,
что затруднит ее визуальное восприятие и интерпретацию.
Импортируем файл CreditSample.txt и запустим обработчик «Карта
Кохонена» [7]. Почти все признаки имеют назначение «Входные».
Ряд признаков укажем как «Неиспользуемые», например, признаки «Код»
и «№ паспорта», так как их значения уникальны и не подходят для группировки
объектов. Номинальные признаки (цель ссуды, наличие недвижимости и пр.) по
своей природе являются классификационными. Зададим их неиспользуемыми,
поскольку обработка данных в полях, значения которых нельзя упорядочить,
будет приводить к некорректным результатам.
Признак «Давать кредит», принимающий два значения «Да» (Истина) или
«Нет» (Ложь), оставим по умолчанию как «Выходной».
Настройку разбиения на тестовое и обучающее множество, параметры
карты (рис. 4.10), условия остановки обучения и параметры обучения оставим
заданными по умолчанию.

39
Рис. 4.10. Параметры карты Кохонена
Правилом остановки обучения является условие “Считать пример
распознанным, если ошибка меньше 0,05”, т. е. расстояние от “нейрона –
победителя” будет меньше заданного. При выборе нескольких условий останов
процесса обучения происходит по достижении хотя бы одного из них.
Параметры обучения приведены на рис. 4.11. Обучение карты
производится итерационными циклами, каждый из которых называется эпохой.
Рис. 4.11. Параметры обучения карты Кохонена
Во время каждой итерации происходит подстройка весов нейронов карты
Кохонена: каждый входной вектор значений признаков объекта (строка
таблицы) обучающей выборки “подтягивает” к себе ближайший нейрон
(нейрон-победитель) с определенной силой, зависящей от заданной скорости
обучения. Вместе с нейроном-победителем подтягиваются и его соседи.
Соседство определяется положением нейронов на двумерной шестиугольной
сетке. Расстояние до нейрона-победителя определяется как Евклидово
расстояние между двумя точками в многомерном пространстве, заданными
значениями признаков входного вектора и весами нейрона-победителя.
Способ начальной инициализации карты определяет, как будут
установлены начальные веса нейронов карты. Если объем обучающей выборки

40
значительно (более чем в 100 раз) превышает количество признаков (нейронов
карты) и время обучения не играет большой роли, то лучше выбрать
инициализацию случайными значениями, которая обеспечивает меньшую
вероятность попадания в локальный минимум ошибки кластеризации. Если
объем обучающей выборки невелик или ограничено время обучения, или
необходимо уменьшить вероятность появления после обучения пустых ячеек, в
которые не попало ни одного объекта ОВ, то следует использовать
инициализацию примерами из обучающего множества. Инициализацию из
собственных векторов можно использовать при любых обстоятельствах.
Скорость обучения в начале и конце обучения карты обеспечивает
грубую, а затем точную подстройку весов нейронов при выполнении
последовательности итераций.
Радиус обучения определяет, сколько нейронов кроме нейронапобедителя участвуют в обучении. В процессе обучения радиус постепенно
уменьшается так, что на заключительных этапах в обучении участвует только
нейрон-победитель.
Автоматическое определение количества кластеров (алгоритм g-means)
связано с заданным уровнем значимости: чем больше его значение, тем
большее количество кластеров будет получено. При отмене автоматической
кластеризации появляется возможность задания фиксированного количества
кластеров (алгоритм k-means).
На следующем шаге с помощью кнопки «Пуск» запускается процесс
обучения карты с заданными параметрами. Обучение может считаться
успешным, если выводимый процент распознанных примеров на обучающем и
тестовом множествах близок к 100 %. При повторном запуске будет иметь
место “дообучение сети”, которое начинается с текущими весами. Если
требуется переобучить сеть, то следует установить флажок “Рестарт”.
В качестве визуализатора выберем «карта Кохонена».
На последнем шаге настраиваются отображения карты (рис. 4.12). Их
список содержит три группы – входные поля, выходные поля и специальные.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
