Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Методы бизнес-аналитики. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
51
Ниже
Положение соперника
Выше
Дождь
Нет
Да
Нет Да
–
2. Да
1. Нет
Место игры
Участие лидеров
Нет
{
ω
5
,
ω
7
}
Дождь
Да
{
ω
2
}
Нет
{
ω
1
}
Дома
В гостях
Пропускают
Играют
Да
{
ω
3
,
ω
4
,
ω
6
}
Да
Нет
Рис. 4.23. Разбиение подмножества объектов «Место игры = Дома;
Участие лидеров = играют»
Признак, который выделяет объекты одного класса – «Дождь». При отсутствии дождя выделяется объект 2 с исходом «Победа = Да», если же дождь идет, то выделяется объект 1 с исходом «Победа = Нет». Сформируем из этих объектов два листа дерева.
Оптимизированное дерево решений для признаков, упорядоченных по способности разделять объекты по признаку «Победа», представлено на рис.
4.24. Из первоначального дерева решений исключен дублирующий по разделяющей способности признак «Положение соперника в турнирной таблице».
Рис. 4.24. Оптимизированное дерево решений «Победа в пляжный волейбол»
Совокупность правил, которые можно записать с помощью построенного дерева для каждого листа, имеет вид:
«если (Место игры = В гостях), то (Победа = Нет)»;
«если (Место игры = Дома) и (Участие лидеров соперника = Пропускают), то (Победа = Да)»;
«если (Место игры = Дома) и (Участие лидеров соперника = Играют) и (Дождь = Нет), то (Победа = Да)»;
52
«если (Место игры = Дома) и (Участие лидеров соперника = Играют) и
Номер
объекта
Облачность
Температура
Влажность
Ветер
Игра
1
Солнце
Жарко
Высокая
Нет
Нет
2
>>
>>
>>
Есть
>>
3
Облачно
>>
>>
Нет
Да 4 Дождь
Норма
>>
>>
>>
5
>>
Холодно
Норма
>>
>>
6
>>
>>
>>
Есть
Нет
7
Облачно
>>
>>
>>
Да
8
Солнце
Норма
Высокая
Нет
Нет 9 >>
Холодно
Норма
>>
Да
10
Дождь
Норма
>>
>>
>>
11
Солнце
>>
>>
Есть
>>
12
Облачно
>>
Высокая
>>
>>
13
>>
Жарко
Норма
Нет
>>
14
Дождь
Норма
Высокая
Есть
Нет
(Дождь = Да), то (Победа = Нет)».
Задание для самостоятельной работы
Используя приведенный алгоритм, постройте продукционные правила при принятии решения «Играть ли в гольф?» [6]. Исходные данные приведены в табл. 4.5.
Таблица 4.5. Исходные данные «Играть ли в гольф?»
Последовательно выберите самые информативные признаки. Оценку качества разделения классов по признаку выполните с помощью разбиения объектов на подмножества. Постройте дерево решения для приведенного примера. Попробуйте использовать различный порядок опроса пользователя и сравните полученные деревья. Из построенного оптимизированного дерева решений выведите правила «Если – то».
4.4.2. Особенности построения дерева решений для числовых
признаков
Дерево решений относится к модели классификации объектов. Для ее построения выходной признак должен быть классификационного (номинального типа). Для преобразования непрерывных данных в дискретные используется процедура квантования. Входные признаки преобразуются в дискретные автоматически в процессе построения решающего дерева в
Deductor.
Квантование выходного признака может выполняться на интервалы
одинаковой длины или квантили – интервалы разной длины, когда в каждый интервал попадает одинаковое количество записей. В качестве значений результирующего набора данных аналитик может указать номер интервала,
53
нижнюю или верхнюю границу интервала, середину интервала либо метку (имя) интервала.
Используем мастер квантования для разбиения данных о возрасте кредиторов на 5 интервалов: до 30 лет, от 30 до 40, от 40 до 50, от 50 до 60, старше 60 лет, поскольку минимальное значение возраста кредитора 19, а максимальное – 69 лет. Это позволит аналитику оценить кредиторскую активность разных возрастных групп с целью принять решение о стимулировании кредиторов в группах с низкой активностью, например, уменьшение стоимости кредита для этих групп и увеличение прибыли в возрастных группах кредиторов путем предложения дополнительных платных услуг.
Воспользуемся данными файла Credit.txt. Зададим настройки мастера интервалов, представленные на рис. 4.25.
Рис. 4.25. Настройка интервалов квантования
На следующем шаге зададются метки интервалов соответственно возраста кредиторов: до 30 лет, от 30 до 40 лет и т. д.

4.4.3. Построение дерева решений в автоматическом режиме

Импортируем файл CreditSample.txt и запустим обработчик «Дерево
решений». Почти все признаки имеют назначение «Входные». Значение
признака «Давать кредит», принимающего два значения «Да» (Истина) или «Нет» (Ложь), установлено как «Выходное». Укажем признаки «Код» и «№ паспорта» как «Неиспользуемые», так как их значения уникальны.
54
Настройки разбиения исходного множества объектов на подмножества и параметры обучения дерева решений оставим без изменений. Уровень доверия, используемый при отсечении узлов дерева, по умолчанию равен 20 %. Чем больше его значение, тем больше в итоге будет дерево решений.
Автоматическое построение дерева решений выполняется с помощью кнопки «Пуск» (рис. 4.26). Количество узлов созданного дерева равно 21, количество правил, полученных в конечных узлах – 11. График отображает количество распознанных и нераспознанных объектов.
Рис. 4.26. Характеристики дерева решений на примере кредитоспособности
клиентов банка
Для отображения данных выберем визуализаторы «Дерево решений», «Правила», «Значимость атрибутов», «Что-если», «Таблица сопряженности».
Результирующее дерево решений представлено на рис. 4.27. Конечные узлы дерева – листья показаны одним цветом. Красным, если выходной признак «Давать кредит» принимает значение «Истина», и зеленым, если признак «Давать кредит» принимает значение «Ложь».
55
Рис. 4.27. Результирующее дерево решений
Для каждого узла с помощью инструмента данных» выводится таблица со значениями признаков отобранного подмножества объектов. Для листа, на который указывает правило «Среднемесячный расход, руб. > = 5250», фрагмент с характеристики 5 клиентов, которым можно выдавать кредит, представлен на рис. 4.28.
Рис. 4.28. Характеристики клиентов, которым можно выдавать кредит
со среднемесячным расходом ≥ 5250 руб.
Инструмент продукционное правило, которое было сформировано в процессе разбиения исходного множества в ходе проверки значений признаков в просмотренных узлах (рис. 4.29). Также указывается значение поддержки и процент объектов, относящихся к тому или иному классу, в рассматриваемом примере – обладающих значениями признака «Давать кредит»: «Истина» или «Ложь».
«Показать информацию по узлу» демонстрирует
«Показать источник
56
Рис. 4.29. Характеристика конечного узла
Список из 11 правил для всех листьев конечного дерева выводится с помощью визуализатора «Правила» (рис. 4.30).
Рис. 4.30. Перечень правил конечного дерева решений (фрагмент)
Значимость признаков для построения конечного дерева выводится с помощью визуализатора «Значимость атрибутов» (рис. 4.31).
57
Рис. 4.31. Значимость признаков
Можно сделать вывод, что наиболее значимым является показатель «Срок проживания в данной местности» (значимость 21,7 %). Его использова­ние позволяет сформировать правило для выделения объектов одного класса уже во втором листе: «Если срок проживания в данной местности меньше 6,5 лет, то кредит не давать». Примерно равнозначными являются признаки «Наличие автотранспорта», «Наличие недвижимости», «Обеспеченность займа», «Срок работы на данном предприятии», «Среднемесячный расход». Их значимость лежит в диапазоне (12,5 – 14,6) %.
Визуализатор «Что-если» (рис. 4.32) позволяет сформировать комбинацию значений входных признаков клиента банка и получить значение выходного признака «Давать кредит».
58
Рис. 4.32. Визуализатор «Что-если»
В рассматриваемом случае, когда размер ссуды – 16 500 руб., срок ссуды – 12 месяцев, цель ссуды – покупка и ремонт недвижимости (значения остальных признаков представлены на рис. 4.32), кредит можно давать. Решение принимается на основе второго правила, его поддержка – 42 %, достоверность – 100 %, т. е. правило позволяет правильно классифицировать
42 % объектов, из них все принадлежат классу {
ω
Давать кредит = Да}.
i
Качество классификации данных можно оценить с помощью визуализатора «Таблица сопряженности» (рис. 4.33). Таблица сопряженности показывает результаты сравнения номинальных значений выходной переменной для исходной выборки (по умолчанию задано обучающее и тестовое множества) и номинальных значений выходной переменной, рассчитанных с помощью модели решающего дерева [6].
Рис. 4.33. Таблица сопряженности
59
В таблице сопряженности ячейки с числом правильно распознанных объектов отображаются в синих (113) и зеленых ячейках (26), а неправильно распознанных – в красных (9 и 1). Общее количество объектов – 149. Видно, что большее число ошибок классификации допущено для значения выходной переменной Давать кредит = Нет.
Инструмент Суммарная информация выводит диаграмму качества классификации (рис. 4.34).
Рис. 4.34. Диаграмма качества классификации
Таким образом, при уровне доверия 20 % модель решающего дерева совершает ошибку в 6,71 % случаев. Это меньше 10 %, модель приемлема.
4.4.4. Построение оптимизированного дерева решений в интерактивном
режиме
Рассмотрим пример интерактивного построения дерева для прогнозирования результатов игры в пляжный волейбол, рассмотренный в
подразд. 4.4.1.
Скопируем таблицу Word в таблицу Exсel, сохраним в формате txt с разделителями, импортируем данные в Deductor и применим обработчик Дерево решений, указав ввиду ограниченности выборки обучающее множество 100 %. Номер объекта укажем как информационное поле, «Победа» – выходное. Выберем режим «Интерактивное построение».
В корневом узле поддержка равна 7 (количество всех объектов), достоверность – 4 (количество объектов, для которых Победа = Да).
Используем инструмент Разбить текущий узел на подузлы выбора признака с наибольшей разделяющей силой. Наибольший вклад в
для
60
повышение степени разделение исходного множества на подмножества вносит признак «Место игры». Его показатель Gain Ratio равен 0,54 (рис. 4.35).
Рис. 4.35. Значимость признаков по показателю Gain Ratio
Распределение классов по подузлам показывает процент распределения объектов в каждом классе (рис. 4.36).
Рис. 4.36. Распределение классов по подузлам
Поддержка указывает на число объектов в подузлах. Узел «Место игры = = в гостях» содержит 29% объектов и узел «Место игры = дома» – 71 % объектов.
В первом узле все объекты относятся к классу «Победа = нет», достоверность 100 %. Это конечный узел, лист дерева.
Во втором узле 80 % объектов относятся к классу «Победа = да» и 20 % – «Победа = нет». Список объектов для каждого указанного на графике подмножества можно вывести с помощью инструмента Демонстрировать
источник данных
(рис. 4.37).
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]