Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Модификации метода логического анализа данных для задач классификации. Монография.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
б) разбивает выборку на m подмножеств T1, T2, ..., Tm в соответствии со
значениями атрибута для каждого подмножества
в) создает
A
, рекурсивно вызывает процедуру построения дерева
i
T
с уменьшенным множеством атрибутов;
j
m ребер из r в корни деревьев T
, T2, ..., Tm, построенных
1
в результате рекурсивных вызовов;
г) возвращает построенное дерево.
На втором этапе алгоритма при выборе атрибута
A
для разбиения
i
единственной доступной информацией является распределение классов во множестве информация используется при выборе атрибута
Пусть через Pr( выбранное наблюдение имеет метку класса
T и его подмножествах, получаемых при разбиении. Данная
A
.
i
С = с
) обозначается вероятность того, что случайно
i
c
:
i
T
T
i
,
Pr
cC

i
где |Ti| – мощность множества наблюдений обучающей выборки, относящихся к классу
ci.
В соответствии с определением энтропия выборки T относительно C имеет вид
k
 
i
1
i
PrlogPr)(
2
cCcCTH
.
i
Определяется энтропия выборки T после разбиения, использующего атрибут
A
:
i
m
T
j
)(
TH
A
i
1
j
T

TH
j
.
Прирост информации (информационный выигрыш) – разница между
THTHATGain
энтропией до и после разбиения: )()(),(
Критерий
Gain рассчитывается для всех независимых атрибутов,
после чего выбирается атрибут с максимальным значением
.
Ai
i
Gain [14].
При классификации нового наблюдения обход построенного дерева начинается с корня. На каждом внутреннем узле проверяется значение наблюдения по атрибуту, который соответствует проверке в данном узле. В зависимости от полученного ответа находят соответствующее ветвление и переходят к узлу, находящему на уровень ниже, и т. д. Обход дерева за­канчивается при встрече
узла решения, который и определяет класс для
нового наблюдения.
– 141 –
Алгоритм C4.5 по сравнению со своим предшественником алгорит­мом ID3 обладает следующими дополнительными возможностями:
1)
отсечение ветвей;
2)
работа с количественными атрибутами;
3)
построение дерева из обучающей выборки, в которой отсутствуют
значения некоторых атрибутов.
Алгоритм Random Forest (случайный лес). Алгоритм, предложен-
ный Лео Брейманом и Адель Катлер, в основе которого лежит использова­ние комитета (ансамбля) деревьев принятия решений [130].
Суть алгоритма заключается в том, что на каждой итерации выбира­ют случайный набор переменных, после чего на этом новом наборе запус­кают построение дерева принятия решений. При этом используется бэг­гинг –
выборка случайных двух третей наблюдений выборки данных для обучения, а оставшаяся треть используется для оценки результата. Как правило, подобную операцию проделывают сотни или тысячи раз. Опти­мальное число деревьев подбирается таким образом, чтобы минимизиро­вать ошибку классификатора на тестовой выборке. В случае отсутствия тестовой выборки минимизируется оценка ошибки out-of-bag: доля наблю­дений
обучающей выборки, некорректно классифицируемых комитетом без учета голосов деревьев на наблюдениях, входящих в их собственную обучающую подвыборку [130].
Классификация новых наблюдений проводится путем голосования: каждое дерево комитета относит классифицируемое наблюдение к одному из классов, и выигрывает класс, за который проголосовало наибольшее число полученных при моделировании деревьев.
Преимущества алгоритма Random Forest:
1)
высокое качество результата, особенно для данных с большим ко-
личеством переменных и малым количеством наблюдений;
2)
способность эффективно обрабатывать данные с большим числом
признаков и классов.
Недостатки алгоритма Random Forest:
1)
каждое из деревьев огромное, в результате модель получается
огромная;
2)
долгое построение модели для достижения хороших результатов;
3)
сложная интерпретация модели, поскольку сотни или тысячи
больших деревьев сложны для интерпретации.
Алгоритм Adaboost (сокр. от Adaptive Boosting). Алгоритм усиле-
ния классификаторов путем объединения их в комитет, предложенный Й. Фройндом (Y. Freund) и Р. Шапайром (R. Schapire) [158, 159]. Этот алго­ритм может использоваться в сочетании с несколькими алгоритмами класси­фикации для улучшения их эффективности. AdaBoost является адаптивным в
– 142 –
том смысле, что каждый следующий комитет классификаторов строится по наблюдениям, некорректно классифицированным предыдущими комитетами.
Алгоритм вызывает слабые классификаторы в цикле. После каждого вызова обновляется распределение весов, что устанавливает важность каж­дого из наблюдений обучающего множества для классификации. На каждой итерации веса каждого некорректно классифицированного наблюдения воз­растают, таким образом новый комитет
классификаторов строится именно
по этим наблюдениям [29].
Достоинства алгоритма AdaBoost:
1)
хорошая обобщающая способность;
2)
простота реализации;
3)
возможность определить наблюдения, являющиеся выбросами.
Недостатки алгоритма AdaBoost:
1)
склонен к переобучению при наличии значительного уровня шума
в данных;
2)
требует достаточно длинных обучающих выборок;
3)
может приводить к построению громоздких композиций, состоя-
щих из сотен алгоритмов.
В табл. 6.19 приведен сравнительный анализ работы описанных выше алгоритмов при решении практических задач классификации.
Таблица 6.19
Задача
Алгоритм Показатель
Результаты классификации
1-R RIPPER CART C4.5
Random
Forest
Adaboost LAD
Выявление
Радарное
сканирование
ФП
ФЖ
РС
ОЛ
ЛИ
Количество верно классифи­цированных наблюдений, %
спама
Количество верно классифи­цированных наблюдений, %
ионосферы
Количество верно классифи­цированных наблюдений, %
Количество верно классифи­цированных наблюдений, %
Количество верно классифи­цированных наблюдений, %
Количество верно классифи­цированных наблюдений, %
Количество верно классифи­цированных наблюдений, %
82,6 91,3 90,2 90,2 89,1 91,3 92,4
78,6 82,8 82,8 81,4 84,2 88,5 90
58 66 62 70 70 74 76
87,3 86,7 63,3 83,3 68,3 90 90
85,7 78,6 85,7 85,7 71,4 89,3 96,4
69,2 69,2 71,8 76,9 66,7 69,7 79,5
64 74 74 66 76 74 86
– 143 –
Результаты работы алгоритмов построения 1-правил (1-R), RIPPER, CART, C4.5, Random Forest, Adaboost получены в системе анализа данных WEKA [221], а метода логического анализа данных (LAD) – с помощью
программной системы, разработанной авторами [66]. Для тестирования ис­пользовались все практические задачи, рассмотренные в данной работе. Выборки были разделены случайным образом на обучающую (80 %) и те­стовую (20 %) для задач выявления спама и классификации результатов радарного
сканирования ионосферы. Проведено по 20 экспериментов, ре­зультаты усреднены. Для задачи прогнозирования осложнений ИМ объем выборки, используемый для тестирования по каждому осложнению, опре­делялся согласно табл. 6.3.
Каждый из исследуемых алгоритмов показал достаточно высокие ре­зультаты по точности в процессе исследования, однако наиболее приемле­мыми для решения данных задач, согласно табл. 6.19, являются
такие: LAD, Adaboost, RIPPER. Метод LAD в целом показал наилучший резуль­тат классификации; кроме того, он позволяет лучше учитывать специфику конкретной задачи классификации и требования заказчика (исследователя) при ее решении, обладает возможностью соблюдения баланса между раз­личными критериями сравнения алгоритмов классификации.
Создана программная система, реализующая разработанные алго­ритмы с использованием подходов объектно-ориентированного програм­мирования. Данная программная система используется в качестве системы поддержки принятия решений для задач классификации.
С использованием метода логического анализа данных решены сле­дующие задачи классификации:
1)
выявление спама; классификация результатов радарного сканирования ионосферы;
2)
3)
прогнозирование осложнений инфаркта миокарда (фибрилляция
предсердий, фибрилляция желудочков, разрыв сердца, отек легких, ле­тальный исход).
Разработанные модификации для метода логического анализа дан­ных доказали свою эффективность при решении практических задач. Во-первых, при использовании данных модификаций повышается интер­претируемость классификатора, так как сокращается количество законо­мерностей в нем. Во-вторых, растет
качество классификации новых
наблюдений, т. е. улучшаются обобщающие способности классификатора.
Применение оптимизационной модели, которая позволяет, чтобы правила покрывали некоторое ограниченное число наблюдений другого класса, приводит к поиску закономерностей с наиболее высоким покры­тием, из числа которых строится более точный классификатор. Примене­ние такого подхода дает наилучший результат при решении задач
с нали-
– 144 –
чием выбросов и шумов и с большим количеством пропусков в выборке данных.
Установлено, что в результате применения алгоритмической проце­дуры наращивания закономерностей получаются закономерности с макси­мальным покрытием и с более высокой степенью, что повышает надеж­ность принимаемых классификатором решений.
Метод логического анализа данных является достаточно гибким инструментом, позволяющим учитывать специфику
конкретной задачи классификации и требования заказчика (исследователя) путем целенаправ­ленной настройки параметров метода.
Проведено сравнение по точности различных алгоритмов классифи­кации с методом логического анализа данных. В результате данный метод показал наилучшие результаты по точности классификации; кроме того, он обладает возможностью соблюдения баланса между различными крите­риями сравнения алгоритмов классификации.
– 145 –

ЗАКЛЮЧЕНИЕ

Проведен анализ существующих логических алгоритмов классифи­кации, алгоритмов поиска информативных закономерностей для них и ос­новных программных систем, решающих практические задачи классифи­кации. Отмечено, что для классификации наиболее приемлем алгоритм, основанный на голосовании правил.
Разработана алгоритмическая процедура выбора базовых наблюде­ний для формирования закономерностей, отличающаяся от известных целенаправленным выбором применения алгоритма выборки.
Разработана алгоритмическая процедура наращивания закономерно­стей, полученных на базе оптимизационной модели (с максимальным покрытием наблюдений обучающей выборки).
Для формирования закономерностей создана модель оптимизации, отличающаяся от известных наличием в целевой функции весового коэф­фициента покрываемого наблюдения, а также возможностью захвата наблюдений другого класса.
Разработана алгоритмическая как композиции информативных закономерностей, отличающаяся от из­вестных совместным использованием критерия бустинга для оценки ин­формативности закономерностей и новой итеративной процедуры выбора порога информативности.
Модифицирован метод логического анализа данных на основе разрабо­танных алгоритмических процедур, при использовании которых повышаются интерпретируемость классификатора и качество классификации новых наблюдений, т. е
В результате решения практических задач эмпирически проверены пригодность оптимизационных моделей для формирования информатив­ных закономерностей и эффективность разработанных алгоритмических процедур для метода логического анализа данных.
Проведено сравнение по точности метода логического анализа дан­ных с другими алгоритмами классификации на практических задачах. В результате метод показал лучшие предложенных задач.
Таким образом, разработаны, исследованы и проверены на практиче­ские задачи модификации для метода логического анализа данных, осно-
. улучшаются обобщающие способности классификатора.
базовых наблюдений, получаемых путем
k-средних к множеству наблюдений обучающей
процедура построения классификатора
результаты по точности решения
– 146 –
ванные на создании оптимизационных моделей для формирования инфор­мативных закономерностей и алгоритмических процедур сокращения ко­личества правил в классификаторе (при сохранении высокой точности).
Полученные результаты развивают направление логических алго­ритмов классификации и могут стать основой создания более совершен­ных систем поддержки принятия решений при распознавании и прогнози­ровании. Наиболее важным преимуществом
таких систем будет являться способность интерпретировать получаемые решения и обосновывать дава­емые рекомендации.
Полученные результаты способны качественно повысить уровень решения задач распознавания и прогнозирования в различных областях де­ятельности (особенно там, где решение, принимаемое по результатам ра­боты экспертной системы, должно быть обоснованным, а цена ошибки может быть велика).
В
дальнейшем планируется разработка систем поддержки принятия решений при распознавании и прогнозировании, которые будут основаны на совместном использовании различных инструментов, обеспечивающих доказуемость и интерпретируемость решений, таких как логические зако­номерности, деревья решений, опорные векторы и статистические класси­фикаторы. Их совместное использование позволит провести всесторонний анализ возможных решений.
– 147 –

СПИСОК ЛИТЕРАТУРЫ

1. Айзерман, М. А. Метод потенциальных функций в теории обуче-
ния машин / М. А. Айзерман, Э. М. Браверман, Л. И. Розоноэр. – М.: Наука, 1970. – 383 c.
2.
Антамошкин, А. А. Идентификация свойств псевдобулевых функ-
ций / А. Н. Антамошкин, И. С. Масич // Исследовано в России. – 2004. – № 130. С. 1391–1396.
3.
Антамошкин, А. Н. Гриди алгоритмы и локальный поиск для
условной псевдобулевой оптимизации / А. Н. Антамошкин, И. С. Масич // Исследовано в России. – 2003. – № 177. – С. 2143–2149.
4.
Антамошкин, А. Н. Исследование свойств задачи оптимизации
при поиске логических закономерностей в данных / А. Н. Антамошкин, И. С. Масич // Системы управления и информационные технологии. –
2011. – № 4.1(46). – С. 111–115.
5.
Антамошкин, А. Н. Комбинаторная оптимизация при логической
классификации: монография / А. Н. Антамошкин, И. С. Масич, Р. И. Кузь­мич. – Красноярск: Красноярский государственный аграрный университет,
2015. – 130 с.
6.
Антамошкин, А. Н. Не улучшаемый алгоритм условной оптими-
зации монотонных псевдобулевых функций / А. Н. Антамошкин, И. С. Ма­сич // Исследовано в России. – 2004. – № 64. – С. 703–708.
7.
Антамошкин, А. Н. Оптимизация полимодальных псевдобулевых
функций / А. Н. Антамошкин, В. С. Рассохин. – ОФАП Минвуза РСФСР. Инв. № 85119. – М., 1985. – 43 с.
8.
Антамошкин, А. Н. Оптимизация функционалов с булевыми пе-
ременными. – Томск: Изд-во Томского ун-та, 1987. – 218 с.
9.
Антамошкин, А. Н. Регулярная оптимизация псевдобулевых
функций. – Красноярск: Изд-во Красноярского ун-та, 1989. – 284 с.
10.
Антамошкин, А. Н. Регулярные алгоритмы для задач условной
псевдобулевой оптимизации / А. Н. Антамошкин, И. С. Масич // САКС-2001: Материалы Международной научно-практической конференции. Ч. 2. Красноярск, 2001. – С. 328–330.
11.
Антамошкин, А. Н. Регулярный алгоритм оптимизации загрузки
оборудования / А. Н. Антамошкин, Д. А. Дегтерев, И. С. Масич // Информа­ционные недра Кузбасса: сб. тр. – Кемерово: КемГУ, 2003. – С. 59–61.
12.
Архангельский, А. Я. Программирование в Delphi 7 / А. Я. Ар-
хангельский. – M.: ООО «Бином-пресс», 2003. – 1152 с.
– 148 –
13. Барабаш, Ю. Л. Автоматическое распознавание образов / Ю. Л. Ба-
рабаш, Б. В. Варский, В. Т. Зиновьев и др. – Киев: КВАИУ, 1963. – 168 с.
14.
Барсегян, А. А. Метод и модели анализа данных: OLAP и Data
Mining / А. А. Барсегян, М. С. Куприянов, В. В. Степаненко, И. И. Холод. – СПб.: БХВ-Петербург, 2004. – 336 с.
15.
Береснев, В. Л. Алгоритмы минимизации для некоторых классов
полиномов от булевых переменных / В. Л. Береснев, А. А. Агеев // Модели и методы оптимизации: сб. науч. тр. Т. 10. – Новосибирск: Наука, 1988. – С. 5–17.
16.
Вайнцвайг, М. Н. Алгоритм обучения распознаванию образов
«кора» / М. Н. Вайнцвайг // Алгоритмы обучения распознаванию образов. – М.: Советское радио, 1973. – С. 110–116.
17.
Воронцов, К. В. Лекции по логическим алгоритмам классифика-
ции. http://www.ccas.ru/voron/download/LogicAlgs.pdf.
18.
Генс, Г. В. Дискретные оптимизационные задачи и эффективные
приближенные алгоритмы (обзор) / Г. В. Генс, Е. В. Левнер // Известия АН СССР. Техническая кибернетика. – 1976. – № 6. – С. 84–92.
19.
Гладков, Л. А. Генетические алгоритмы./ Л. А. Гладков, В. В. Ку-
рейчик, В. М. Курейчик. – М.: Физматлит, 2006. – 320 с.
20.
Головенкин, С. Е. Осложнения инфаркта миокарда: база дан-
ных для апробации систем распознавания и прогноза / С. Е. Головенкин, А. Н. Горбань, В. А. Шульман. – Красноярск: Вычислительный центр СО РАН: Препринт. – № 6. – 1997.
21.
Горбань, А. Н. Нейронные сети на персональном компьютере /
А. Н. Горбань, Д. А. Россиев. – Новосибирск: Наука, 1996. – 276 с.
22.
Гринченко, С. Н. Иерархическая оптимизация в природных и со-
циальных системах: селекция вариантов приспособительного поведения и эволюции систем «достаточно высокой сложности» на основе адаптивных алгоритмов случайного поиска / С. Н. Гринченко // Исследовано в России. –
2000. – № 108. – С. 1421–1440.
23.
Гринченко, С. Н. Метод «проб и ошибок» и поисковая оптимиза-
ция: анализ, классификация, трактовка понятия «естественный отбор» / С. Н. Гринченко // Исследовано в России. – 2003. – № 104. – С. 1228–1271.
24.
Гринченко, С. Н. Случайный поиск, адаптация и эволюция: от мо-
делей биосистем – к языку представления о мире (части 1 и 2) / С. Н. Грин­ченко // Исследовано в России. – 1999. – № 10. – С. 1–11; № 11. – С. 1–13.
25.
Гришухин, В. П. Полиномиальность в простейшей задаче разме-
щения: препринт ЦЭМИ АН СССР / В. П. Гришухин. – М., 1987. – 64 с.
26.
Гулакова, Т. К. Поиск закономерностей в задаче классификации /
Т. К. Гулакова, Р. И. Кузьмич // Актуальные проблемы авиации и космо­навтики: материалы VI всероссийской научно-практической конференции
– 149 –
студентов, аспирантов и молодых специалистов: в 2 т. Т. 1. Технические науки. – Красноярск: Сиб. гос. аэрокосмич. ун-т, 2010. – С. 317–318.
27.
Дегтерев, Д. А. Оптимизация загрузки технологического обору-
дования предприятия / Д. А. Дегтерев, И. С. Масич, Г. А. Нейман // Вест­ник ассоциации выпускников КГТУ. – Красноярск: ИПЦ КГТУ, 2002. – № 8. – С. 166–170.
28.
Донской, В. И. Дискретные модели принятия решений при не-
полной информации / В. И. Донской, А. И. Башта. – Симферополь: Таврия,
1992. – 166 с.
29.
Дьяконов, А. Г. Анализ данных, обучение по прецедентам, логи-
ческие игры, системы WEKA, RapidMiner и MatLab (Практикум на ЭВМ кафедры математических методов прогнозирования): учеб. пособие / А. Г. Дьяконов. – М.: Издательский отдел факультета ВМК МГУ имени М.В. Ломоносова, 2010. – 278 с.
30.
Дюличева, Ю. Ю. Стратегии редукции решающих деревьев (об-
зор) / Ю. Ю. Дюличева // Таврический вестник информатики и математи­ки. – 2002. – № 1. – С. 10–17.
31.
Емельянов, В. В. Теория и практика эволюционного моделирова-
ния / В. В. Емельянов, В. В. Курейчик, В. М. Курейчик. – М.: Физматлит,
2003. – 432 с.
32.
Журавлев, Ю. И. Распознавание. Математические методы. Про-
граммная система. Практические применения / Ю. И. Журавлев, В. В. Ря­занов, О. В.
33.
Сенько. – М.: ФАЗИС, 2006. – 159 с.
Загоруйко, Н. Г. Методы распознавания, основанные на алгорит-
ме AdDel / Н. Г. Загоруйко, О. А. Кутненко // Сиб. журн. индустр. матем. –
2004. – № 7. – С. 39–47.
34.
Загоруйко, Н. Г. Прикладные методы анализа данных и знаний /
Н. Г. Загоруйко. – Новосибирск: Изд-во ин-та математики, 1999. – 270 с.
35.
Имануилов, П. А. Решение задачи формирования кредитного
портфеля банка методом МИВЕР / П. А. Имануилов, В. А. Пуртиков // Вестник НИИ Систем управления, волновых процессов и технологий. –
2000. – № 5. – С. 209–213.
36.
Казаковцев, Л. А. Подходы к автоматизации задач планирования
ассортимента на торговых предприятиях / Л. А. Казаковцев // Вестник НИИ Систем управления, волновых процессов и технологий. – 2000. – № 5. – С. 158–164.
37.
Ковалев, М. М. Дискретная оптимизация (целочисленное про-
граммирование) / М. М. Ковалев. – Минск: Изд-во БГУ, 1977. – 191 с.
38.
Корбут, А. А. Дискретное программирование / А. А Корбут,
Ю. Ю. Финкельштейн. – М.: Наука, 1969. – 389 с.
– 150 –
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]