Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы бизнес-аналитики. Учебное пособие.pdf
X
- •ВВЕДЕНИЕ
- •1.5.3. Фреймовая модель представления знаний
- •1.5.4. Продукционная модель представления знаний
- •1. Основы систем интеллектуального анализа данных
- •1.1. История искусственного интеллекта
- •1.2. Экспертные системы
- •1.3. Системы бизнес-аналитики
- •1.4. Данные и знания
- •1.5. Модели представления знаний
- •1.5.1. Логическая модель представления знаний
- •1.5.2. Семантическая модель представления знаний
- •1.5.5. Нейронная сеть как модель представления знаний
- •2.1. Технология интеллектуального анализа данных
- •2.1.1. Виды данных
- •2.1.2. Data Mining
- •2.1.3. Статистические методы многомерного анализа данных
- •2.1.4. Машинное обучение
- •2.1.5. Общие методы поиска решений в продукционных системах
- •2.1.6. Классификация и кластеризация
- •2.2. Методы кластерного анализа (обучение без учителя)
- •2.3. Методы классификации (обучение с учителем)
- •4. Практикум
- •4.1.1. Импорт данных
- •4.2. Кластерный анализ
- •Практическое занятие 1. Сегментация данных
- •4.3. Самоорганизующиеся карты признаков
- •Практическое задание 2. Построение и анализ самоорганизующихся карт признаков
- •4.4. Классификация с помощью дерева решений
- •4.4.1. Алгоритм построения дерева решений
- •Задание для самостоятельной работы
- •4.4.3. Построение дерева решений в автоматическом режиме
- •4.5. Нейросетевые модели
- •4.5.1. Классифицирующая нейросеть
- •4.5.2. Нейросетевая модель прогнозирования
- •4.6. Поиск ассоциативных правил
- •Практическое задание 6. Поиск ассоциативных правил
- •ЗАКЛЮЧЕНИЕ
- •ВОПРОСЫ К Экзамену
- •БИБЛИОГРАФИЧЕСКИЙ СПИСОК

71
7.794
–9.416
–0.488
2.79
–0.3
0.308
5.926
–2.018
–0.777
0.63
Рис. 4.51. Граф нейросети с весовыми коэффициентами
Тем самым структура и набор весовых коэффициентов определяют
расчетную модель, позволяющую по комбинации значений четырех признаков
выполнять оценку выходного показателя – рентабельности совокупного
капитала.
Данная модель для нормализованного к диапазону [0, 1] выходного
показателя Y
может быть записана в виде уравнения вида
н
Y
= f[0.814 – f[9.416(–0.748 + (–0.488X1 + … +0.308X4))] +
н
+ f[7.794(–0.341 + (5.926X
+ … + 0.63X4))]]
1
или, с использованием обозначений для сигналов нейронов промежуточного
слоя – в виде системы уравнений (в отчете записать полностью). Где f[x] =
1/(1+EXP(–x)) – функция активации нейрона.
Прогностическую способность построенной нейронной сети подтверждает
визуализатор «Диаграмма рассеяния» (рис. 4.52).

72
Рис. 4.52. Диаграмма рассеяния
Рассчитанные моделью непрерывные значения выходного признака
«Рентабельность совокупного капитала» отложены по оси Y, соответствующие
значения для объектов выборки – по оси X. Видно, что рассчитанные значения
рентабельности распределены внутри доверительного интервала на идеальной
линии. Ширина доверительного интервала определяется допустимой ошибкой,
которая устанавливается в одноименном поле над графиком. По умолчанию ее
величина равна 0,05. Ошибка нейронной модели для каждой строки данных
выводится в столбце <Имя выходного признака>_ERR. Если она меньше
допустимой, то соответствующая точка попадает в доверительный интервал.
Качество модели нейросетевого прогнозирования может быть оценено с
помощью графика (рис. 4.53). Большая часть объектов выборки, равная 75 %,
имеет среднеквадратичное отклонение рассчитанного моделью значения
рентабельности, отличающееся от заданного не более чем на 2 × 10
-7
.
Рис. 4.53. График качества нейросетевой модели

73
4.5.3. Практическое занятие 4. Построение нейросетевой модели
классификации многомерных бизнес-объектов
Составить набор входных переменных, формирующих цены на
недвижимость: жилая площадь, этаж, наличие балкона, количество санузлов,
наличие телефона, площадь кухни, материал стен, состояние, остальная
площадь, район и проч. Используя информацию о рынке недвижимости от
различных агентств, опыт предыдущих продаж, собрать данные для обучения
нейронной сети. С помощью обработчика Квантование выполнить разбиение
выходного признака на три-четыре интервала одинаковой длины (см. подразд.
4.4.2). Дать имена интервалам, например, цена квартиры: низкая, средняя,
высокая. Построить нейросетевую модель классификации квартир. Описать
архитектуру нейронной сети. Оценить адекватность и точность построенной
нейросетевой модели прогнозирования.
4.5.4. Практическое занятие 5: Построение нейросетевой модели
прогнозирования
Использовать собранные данные о ценах на недвижимость и значениях
признаков: жилая площадь, этаж, наличие балкона, количество санузлов,
наличие телефона, площадь кухни, материал стен, состояние, остальная
площадь, район и проч. Построить нейросетевую модель для оценивания
значения выходного показателя – стоимости недвижимости на основе значений
входных признаков. Описать архитектуру нейронной сети. Оценить
адекватность и точность построенной нейросетевой модели прогнозирования.
4.6. Поиск ассоциативных правил
Поиск ассоциативных правил (Association Rules) был предложен для
нахождения типичных шаблонов покупок, совершаемых в супермаркетах,
поэтому иногда его еще называют анализом рыночной корзины [6], [7].
Исходные данные содержатся в базе данных, состоящей из
покупательских транзакций. Каждая транзакция – это набор товаров,
купленных покупателем за один визит. Такую транзакцию еще называют
рыночной корзиной.
Целью анализа является установление зависимостей вида: если в
транзакции встретился некоторый набор элементов X, то другой набор
элементов Y также должен появиться в этой транзакции.
Ассоциация возникает, если несколько событий связаны друг с другом.
Например, когда анализ продаж в компьютерном супермаркете показывает, что
55 % купивших компьютер берут также принтер или сканер, а при наличии
скидки за такой комплект принтер приобретают в 80 % случаев. Ассоциации
позволяют менеджерам оценить, насколько действенна предоставляемая
скидка.
Если появление событий связано во времени, то говорят о
последовательных шаблонах. Последовательности похожи на ассоциации, но
при анализе добавляется временной показатель. Например, после покупки дома

74
в 45 % случаев в течение месяца приобретается и новая кухонная плита. Если
)YX(S →
%100
транзакций количество
общее
Уи Х содержащих ,транзакций количество
⋅
)X(
S
%100
транзакций количество общее
Х содержащих ,транзакций количество
⋅
)
YX
(C
→
%100
Х содержащих ,транзакций
количество
Уи Х содержащих ,транзакций количество
⋅
заемщик взял потребительский кредит, то с вероятностью 60 % через полгода
он оформит кредитную карту.
Ассоциативное правило состоит из двух частей:
«Если условие (antecedent), то следствие (consequent)»;
X → Y;
«Из X следует Y».
Объективными показателями значимости таких ассоциативных правил
являются поддержка и достоверность.
Поддержка ассоциативного правила (support) S – процент транзакций,
содержащих как условие, так и следствие:
=
.
Поддержка может использоваться как характеристика набора товаров X:
=
.
То есть S(Х) – это относительная частота появления набора X среди всех чеков.
Достоверность (confidence) С представляет собой меру точности правила
и определяется, как отношение количества транзакций, содержащих условие и
следствие, к количеству транзакций, содержащих только условие:
=
.
Например, если 75 % транзакций, содержащих хлеб, также содержат
молоко, а 3 % от общего числа всех транзакций содержат оба товара, тогда
75 % – это достоверность правила: «Если хлеб, то молоко», – а 3 % –
поддержка.
Пусть поддержка правила: «Если макаронные изделия, то кетчупы» –
равна 37,5 %, а достоверность – 75 %. Это означает, что ожидаемая вероятность
покупки набора макаронные изделия + кетчупы равна 37,5 %. А если
покупатель купит макаронные изделия, то с вероятностью 75 % он купит и
кетчупы.
Алгоритмы поиска ассоциативных правил основаны на том, что
поддержка и достоверность этих правил должны находиться в рамках
некоторых наперед заданных границ, называемых соответственно минимальной
и максимальной поддержкой и минимальной и максимальной достоверностью.
Один из первых алгоритмов, эффективно решающих подобный класс задач, –
это алгоритм APriori.

75
Границы значений параметров поддержки и достоверности выбираются
таким образом, чтобы ограничить количество найденных правил.
Если границы поддержки имеют большое значение, то будут находиться
очевидные правила. При низком значении поддержки генерируется огромное
количество невостребованных правил, среди которых тем не менее может
находиться большинство интересных правил. Если же велико значение
верхнего предела поддержки, то в правилах основную часть будут составлять
товары – лидеры продаж.
Уменьшение порога достоверности также приводит к увеличению
количества правил. Кроме того, правила с низкой достоверностью имеют
низкую ценность.
Еще одним параметром, ограничивающим количество найденных правил,
является максимальная мощность часто встречающихся множеств –
максимальное число элементов в правиле. Параметр ограничивает
вычислительную мощность алгоритмов, которая экспоненциально растет с
числом элементов в наборе. Если максимальная мощность равна двум, то все
найденные правила будут иметь вид: «Если Товар I, то Товар J».
Дополнительно в качестве показателей значимости ассоциативных
правил используются Лифт (lift), Левередж (leverage), Улучшение
(improvement) [6].
Связь меду двумя предметными наборами отсутствует, если значение
лифта = 1. В остальных случаях связь положительная (lift > 1) или
отрицательная (lift < 1). Значение лифта меньше, чем единица, показывает, что
условие чаще появляется в транзакциях, не содержащих следствие, чем в
транзакциях, содержащих следствие.
Если Левередж ≈ 0, то правило не значимо.
Если Левередж ≈ 0, то правило не значимо.
Если Улучшение > 1, это значит, что вероятнее предсказать наличие
набора-следствия с помощью правила, чем угадать случайно.
Рассмотрим поиск ассоциативных правил в Deductor на примере данных о
продажах товаров, содержащихся в файле Supermarket.txt. Цель поиска –
применения результатов для стимулирования продаж. При импорте укажем вид
данных признака «Номер чека» – дискретный. Тип импортируемых данных для
признака «Товар» – строковый (рис. 4.54).
Рис. 4.54. Фрагмент данных о продажах товаров

76
Запустим обработчик «Ассоциативные правила». Установим назначение
признака «Номер чека» – транзакция, а признака «Товар» – элемент.
По умолчанию в обработчике установлены следующие минимальные и
максимальные границы поддержки – 1 и 20 %, и достоверности 40 и 90 %. С
данными параметрами количество популярных наборов и ассоциативных
правил равно 0.
Варьируя верхним и нижним пределами поддержки и достоверности,
следует постараться избавиться от очевидных, тривиальных и непонятных
закономерностей, которые могут быть получены или на основе аномальных
значений, или глубоко скрытых знаний, и найти интересные и полезные
правила. Укажем границы поддержки – 7 и 50 %, и достоверности – 45 и 90 %.
В результате, найдены 11 популярных наборов и 5 правил (рис. 4.55).
Рис. 4.55. Запуск процесса построения ассоциативных правил
Используем визуализаторы «Популярные наборы», «Правила», «Дерево
правил», «Что–Если».
Популярные наборы содержат множества, состоящие из одного и более
элементов (товаров), которые наиболее часто встречаются в транзакциях
одновременно (рис. 4.56). Поддержка показывает, как часто встречается
множество в исходном наборе транзакций.

77
Рис. 4.56. Популярные наборы
Ассоциативные правила отображаются визуализатором «Правила»
(рис. 4.57). Правила описывают поведение покупателей, например, если
покупатель купил вафли и мед, то он с вероятностью 66,7 % также купит и
сухари (правило № 4).
Рис. 4.57. Правила
Дерево правил может быть построено по условию или по следствию. В
более удобной для анализа форме правила отображаются по следствию
(рис. 4.58). В левой части на верхнем уровне находятся узлы со следствием, а на
втором уровне – узлы с условиями. Справа от дерева находится список
условий, построенный по выбранному узлу дерева. Для каждого правила
отображаются поддержка и достоверность.

78
Рис. 4.58. Дерево правил (по следствию)
Эти правила отвечают на вопрос, что нужно, чтобы было заданное
следствие. Например, если покупатель приобрел вафли, то он с вероятностью
71,4 % также приобретет сухари.
Анализ «Что–Если» позволяет ответить на вопрос: «Какие товары
приобретаются совместно с выбранными товарами?» или «Что получится в
качестве следствия, если выбрать данные условия?» Слева расположен список
всех товаров транзакций (рис. 4.59). В правом верхнем углу формируется
список товаров, входящих в условие (с помощью двойного щелчка мыши).
Рис. 4.59. Визуализатор «Что если»
После нажатия на кнопку «Вычислить правила»
в списке следствий
появятся товары, совместно приобретаемые с выбранными. В данном случае
совместно с вафлями, кетчупами, соусами с вероятностью 71,4 % будут
куплены сухари.
Результаты анализа можно применять для анализа предпочтений
клиентов, для сегментации покупателей по поведению при покупках и для
планирования расположения товаров в супермаркетах.
В данном примере найденные правила можно использовать для
сегментации клиентов на две категории: клиенты, покупающие макаронные
изделия и соусы к ним, и клиенты, покупающие все к чаю (на рис. 4.56 –
элементы с наибольшей поддержкой). Анализ предпочтений показывает, что
наибольшей популярностью в данном магазине пользуются чай, мед,
макаронные изделия, кетчупы, соусы и аджика. При размещении товаров в
супермаркете можно следует располагать чай рядом с медом, а кетчупы, соусы
и аджику – рядом с макаронными изделиями.
Практическое задание 6. Поиск ассоциативных правил
Соберите данные о 150 транзакциях в выбранном магазине. Каждый
элемент транзакции представьте одной записью в таблице исходных данных,
товары, принадлежащие одной транзакции, должны иметь одинаковый номер

79
чека (см. рис. 4.54). Подберите параметры и найдите ассоциативные правила.
Назовите 5 самых популярных наборов товаров (в наборе может быть один или
несколько товаров). Опишите 4-5 ассоциативных правил, полученных в ходе
исследования. Сформулируйте, какой товар с наибольшей достоверностью
выбирают с одним из популярных наборов.

80
ЗАКЛЮЧЕНИЕ
Современное информационное общество достигло такого уровня, когда с
ростом мощности компьютерной техники, развитием информационных систем,
средств связи и передачи данных накоплены огромные массивы информации (в
корпорациях, государственных департаментах, службах социального
обеспечения и т. д.) в виде корпоративных баз данных и информационных
ресурсов Интернет. Доступные хранилища данных привели к потребности в
новых средствах взаимодействия с данными, включая появление систем,
управляемых данными.
Материал дисциплины дает комплекс ориентирующих знаний в области
разработки информационных систем, поддерживающих процесс принятия
решений, использования моделей представления и методов извлечения знаний.
Эти знания могут служить отправной точкой в дальнейшем изучении обширной
и актуальной области бизнес-аналитики.
Учебное пособие позволяет получить навыки работы бизнес-аналитика с
использованием средств интеллектуального анализа данных. Понять основы
разработки простых экспертных систем, выбирать процедуры подготовки
данных, выполнять поиск ассоциативных правил, выполнять построение
самоорганизующихся карт признаков, осуществлять кластеризацию
многомерных объектов, выполнять прогнозирование на основе моделей
решающего дерева и нейронных сетей.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
