Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Методы бизнес-аналитики. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
41
Рис. 4.12. Список отображений карты Кохонена
Специальные отображения служат для анализа структуры кластеров.
Карта «Кластеры» (рис. 4.13) показывает ячейки карты Кохонена, объединенные в три кластера алгоритмом g-means.
Рис. 4.13. Карта «Кластеры»
Нажатием на левую клавишу мыши по любому шестиугольнику на любой карте выделятся соответствующие ячейки на остальных картах. При этом на шкалах в нижней части карт отображаются значения соответствующих параметров.
Матрица плотности попадания (рис. 4.14) отображает количество объектов, попавших в ячейку. Нижняя шкала указывает, что в ячейках содержатся от одного до трех объектов. Значительная часть ячеек с точечным узором является пустыми.
42
Рис. 4.14. Матрица плотности попадания
Матрица расстояний (рис. 4.15) используется для визуального определения эффективности кластеризации по выраженности кластеров и границ, оценки числа потенциальных кластеров по числу обособленных синих (темных) областей. Она показывает расстояния между вектором весов нейрона и его ближайшими соседями. Чем больше расстояние, тем “теплее” (светлее) цвет ячейки. Таким образом, ячейкам с наибольшим расстоянием между ними и соседями соответствует красный (белый) цвет, а близлежащим ячейкам – синий (черный).
Рис. 4.15. Матрица расстояний
Рис. 4.15 подтверждает недостаточно высокий процент распознанных примеров. Хорошими являются результаты кластеризации, когда внутри кластеров, где расстояния между векторами объектов малы, ячейки будут иметь преимущественно синий (темный) цвет, а на границах кластеров, где эти расстояния велики, желто-красный (светлый). Тогда на матрице расстояний кластеры образуют группы синих (темных) ячеек, окруженных узкими границами из более светлых ячеек. Чем более выраженной является данная структура, тем лучше ожидаемые результаты кластеризации.
43
Проекция Саммона (рис. 4.16) демонстрирует результат проецирования многомерных объектов на плоскость с сохранением топологического подобия, без искажения расстояний между объектами.
Рис. 4.16. Проекция Саммона
Карты, построенные для отдельных признаков, показывают распределе­ние объектов с различными значениями признаков по кластерам. Их анализ позволяет обнаружить влияние признака на принадлежность объекта к тому или иному кластеру. Если в пределах каждого кластера ячейки имеют приблизительно один оттенок, отличный от других кластеров, то по данному признаку хорошо выражена группировка объектов и можно сделать вывод об общих значениях признака для объектов одного кластера.
Признак «Срок работы на данном предприятии» хорошо разделяет все три кластера (рис. 4.17). Дольше всего на предприятии работают клиенты, относящиеся к Кластеру 0 (8–14 лет). Меньше всего – клиенты, относящиеся к
Кластеру 1 (2–7 лет). Для клиентов Кластера 2 преобладают средние значения (4–8 лет).
Рис. 4.17. Карта признака «Срок работы на данном предприятии»
44
Высокую разделительную силу также имеет признак «Срок проживания в данной местности» (рис. 4.18). Его значения наибольшие для Кластера 0 и наименьшие для Кластера 2.
Рис. 4.18. Карта признака «Срок проживания в данной местности»
Если карта равномерно заполнена одним цветом для всех кластеров, то соответствующий признак одинаков для объектов всех кластеров и малоин­формативен с точки зрения их распознавания.

Практическое задание 2. Построение и анализ самоорганизующихся карт признаков

Использовать описания устройств (технических объектов) в выбранной предметной области или данные сайта Федеральной службы государственной статистики http://www.gks.ru, характеризующие показатели оценки эффектив­ности одного из федеральных округов.
С помощью карт Кохонена произвести оценку результатов кластеризации. Сделать вывод о том, какие из признаков вносят наибольший клад в кластеризацию.
Произвести содержательную интерпретацию кластеров.

4.4. Классификация с помощью дерева решений

Деревья решений (decision trees) – иерархические древовидные структу-
ры, состоящие из решающих правил вида «если... то...» и позволяющие вы­полнять классификацию объектов. Являются самым популярным инструментом Data Mining, позволяющим эффективно решать задачи классификации. Относятся к наиболее наглядным и легко интерпретируемым моделям.
В отличие от методов, использующих статистический подход, таких как классификатор Байеса, линейная и логистическая регрессия, деревья решений основаны на машинном обучении и в большинстве случаев не требуют предположений о статистическом распределении значений признаков.
Для построения дерева решений используется обучающая выборка, в которой вся информация об объектах должна быть выражена совокупностью
45
значений признаков и указанием принадлежности к одному из классов. Количество объектов выборки должно быть намного больше, чем количество классов.
Пример решающего дерева показан на рис. 4.19 [14].
Рис. 4.19. Дерева решений на примере кредитоспособности клиентов банка
В узлах содержатся правила, с помощью которых производится проверка признаков. Множество объектов в узле разбивается на подмножества. Листья – это конечные узлы дерева, в которых содержатся подмножества объектов, ассоциированные с классами. Отличием листа от узла является то, что в листе не производится проверка, разбивающая подмножество, и, соответственно, нет ветвления.
В основе работы деревьев решений лежит процесс последовательного разбиения исходного множества объектов на подмножества, ассоциированные с классами. Разбиение производится с помощью решающих правил, в которых осуществляется проверка значений признаков объектов по заданному условию. Поэтому деревья не только классифицируют объекты и наблюдения, но и объясняют, почему объект был отнесен к данному классу. Обладая высокой объясняющей способностью, они могут использоваться как инструмент исследования предметной области.
При оценке кредитоспособности клиентов банка можно сформулировать следующие правила: – если {(Возраст от 30 до 60) и (Доход высокий или Доход средний), то (Класс “Выдать кредит”)};
46
– если {(Возраст от 30 до 60) и (Доход низкий) и (Недвижимость есть), то (Класс “Выдать кредит”)}; – если {(Возраст меньше 30 или больше 60), то (Класс “Не выдавать кредит”)}.
Для каждого узла нужно выбрать признак, по которому будет производиться проверка правила. Его принято называть признаком ветвления, или разбиения (splitting attribute), и от того, насколько удачно он выбран, зависит классифицирующая сила правила.
В Deductor разделяющая сила признака характеризуется показателем Gain Ratio, основанном на понятии энтропии. Он вычисляется как отношение прироста информации после разделения множества объектов к существующему до разделения количеству информации.
Оценка качества классификации в узле выполняется с помощью следующих показателей:
где n
поддержка (support) Supp = (n
достоверность (confidence) Conf = (n
– число объектов, попавших в узел; n – общее число объектов; nкл –
уз
/n) × 100 %,
уз
) × 100 %,
кл/nуз
число объектов одного класса в узле, для листа – число правильно классифицированных объектов соответствующего класса.
Предположим, всего объектов ОВ – 10 000, в рассматриваемый узел попало 200 объектов, из них 150 относятся к классу
Ω
, 50 – к классу
1
Ω
. Тогда
2
Supp = (200/10000) × 100 = 2 %,
Conf (класс
Conf (класс
Ω
) = (150/200) × 100 = 75 %,
1
Ω
) = (50/200) × 100 = 25 %.
2
Для определения меры эффективности деревьев решений используют тестовое множество – набор объектов, которые ранее не использовались при построении дерева решений. Пропуская набор тестовых объектов через построенное дерево решений, вычисляется, для какого процента объектов класс был определен правильно. Это позволяет оценить качество всего классификатора.
Для эффективного построения дерева решений должны выполняться следующие условия:
1) признаковое пространство обеспечивает различимость классов;
2) количество объектов ОВ должно быть намного больше, чем количество
классов.

4.4.1. Алгоритм построения дерева решений

Дерево решений последовательно разбивает исходное множество объектов на подмножества. Для ускорения поиска нужного решения при построении деревьев используются оптимизирующие процедуры, основанные на выборе наиболее информативных признаков и исключении незначащих, не предоставляющих существенной информации для разделения объектов на классы.
47
Рассмотрим пример построения продукционных правил для
Номер
Положение
Место
Участие
соперника
Дождь
Победа
1
Выше
Дома
Играют
Да
Нет
2
>>
>>
>>
Нет
Да
3
>>
>>
Пропускают
>>
>>
4
Ниже
>>
>>
>>
>> 5 >>
В гостях
>>
>>
Нет 6 >>
Дома
>>
Да
Да
7
Выше
В гостях
Играют
>>
Нет
прогнозирования результатов игры в пляжный волейбол [13]. Условия проведения игр и результаты игры приведены в табл. 4.2.
Данные представляют собой описание 7 объектов с помощью 4 номинальных признаков: «Положение соперника в турнирной таблице», «Место игры», «Участие лидеров соперника», «Дождь».
Признак «Победа» разбивает все множество объектов { на два класса = Нет» } = {
ω
Ω
= {
ω
1
,
ω
1
5
«Победа = Да»} = {
i
,
ω
}.
7
ω
,
ω
,
ω
,
2
3
ω
4
6
},
ω
}, i = 1, 2, …, 7,
i
Ω
= {
ω
2
«Победа =
i
Таблица 4.2. Исходные данные «Победа в пляжный волейбол»
объекта
соперника
в турнирной
таблице
игры
лидеров
Для поиска продукционных правил построим поле знаний в рассматриваемой области в виде дерева решений.
Вид дерева решений «Победа в пляжный волейбол» для исходного неупорядоченного множества признаков (в порядке их следования в таблице исходных данных) представлен на рис. 4.20.
48
Ниже
Положение соперника
Место игры
Место игры
Участие лидеров
Нет
Дождь
Да
Нет
Выше
Да
Нет
Дома
В гостях
Дома
В гостях
Пропускают
Играют
Да
Да
Нет
Рис. 4.20. Дерево решений «Победа в пляжный волейбол»
Дерево решений позволяет найти для каждого листа, обозначенного овалом, соответствующее правило «Если – то». Например, правило с положительным исходом для самого нижнего листа дерева имеет вид: «Если (Положение соперника в турнирной таблице = Выше) и (Место игры = Дома) и (Участие лидеров соперника = Играют) и (Дождь = Нет), то (Победа = Да)».
Дерево решений последовательно разбивает исходное множество объектов на подмножества. Для ускорения поиска нужного решения при построении деревьев используются оптимизирующие процедуры, основанные на выборе наиболее информативных признаков и исключении незначащих, не предоставляющих существенной информации для разделения объектов на классы.
В общем виде алгоритм построения дерева решений следующий:
− выбирается признак X
разделимости классов, который вычисляется на основе комбинаторных методов или с помощью энтропии;
− в узле X
− для каждой ветви построить подмножества объектов, удовлетворяю-
щие заданному значению признака X
− если подмножество содержит объекты одного класса, то сформировать
лист дерева;
− повторить шаги для остальных подмножеств объектов, исключив
признак X
из рассмотрения.
j
, соответствующий максимуму критерия
j
создать ветвь для каждого значения признака;
j
;
j
49
Построим оптимизированное дерево на основе данного алгоритма. Для
Ниже
Положение соперника
Да Нет Да
Выше
Нет Да Да Нет
Место игры
Дома
В гостях
1. Нет
2. Да
3. Да
4. Да
6. Да
5. Нет
7. Нет
Участие лидеров
Играют
Пропускают
Да Да Нет Да
Нет Да Нет
Дождь
Нет
Да
Да Да Да Нет
Нет Да Нет
определения первого признака, проверяемого в корне дерева, выполним разбиение исходного множества объектов по каждому признаку (рис. 4.21).
Рис. 4.21. Разбиение исходного множества объектов по каждому признаку
Чтобы не вычислять для каждого признака величину критерия разделимости классов, проведем анализ сформированных подмножеств объектов.
Единственный признак, который выделяет объекты одного класса – «Место игры». Запишем в каждом подмножестве номера объектов. При значении признака «В гостях» выделяются 5 и 7 объекты с исходом «Победа = = Нет». Этот признак формирует корень дерева.
Для подмножества объектов «Место игры = Дома» исключим признак Место игры» из рассмотрения (табл. 4.3).
50
Таблица 4.3. Подмножество объектов «Место игры = Дома»
Номер
Положение
таблице
Участие
Дождь
Победа
1
Выше
Играют
Да
Нет 2 >>
>>
Нет
Да 3 >>
Пропускают
>>
>>
4
Ниже
>>
>>
>> 5 >>
>>
Да
>>
Ниже
Положение соперника
Да Да
Выше
Дождь
Нет
Да
Да Да Да
Нет Да Да
Участие лидеров
Играют
Пропускают
3. Да
4. Да
6. Да
1. Нет
2. Да
Нет Да
Номер
Положение
таблице
Дождь
Победа
1
Выше
Да
Нет
2
>>
Нет
Да
объекта
соперника
в турнирной
лидеров
Разбиение подмножества объектов «Место игры = дома» по признакам «Положение соперника», «Участие лидеров», «Дождь» представлено на рис.
4.22.
Рис. 4.22. Разбиение подмножества объектов «Место игры = дома»
Признаки, которые выделяют объекты одного класса – «Участие лидеров» и «Дождь». Их разделяющая сила одинакова. При значении признака «Участие лидеров = Пропускают» выделяются 3-, 4- и 6-й объекты с исходом «Победа = Да». Сформируем из этих объектов лист дерева.
Выберем признак «Участие лидеров» на втором уровне дерева. Для подмножества объектов «Место игры = Дома; Участие лидеров = играют» исключим признак «Участие лидеров» из рассмотрения (табл. 4.4).
Таблица 4.4. Подмножество объектов «Место игры = Дома;
Участие лидеров = играют»
объекта
соперника в
турнирной
Разбиение подмножества объектов «Место игры = Дома; Участие лиде­ров = играют» по признакам «Положение соперника», «Дождь» представлено на рис. 4.23.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]