Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Модификации метода логического анализа данных для задач классификации. Монография.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Первая задача имеет неравноценное разделение на классы – количе­ство больных пациентов превышает количество здоровых в 3 раза. Здоро­вые пациенты характеризуются как отрицательные наблюдения, больные – как положительные. Однако ввиду отсутствия пропущенных значений ал­горитм J48 без процедуры редукции неверно классифицирует количество наблюдений в размере 13–15 % тестового множества при построении «глубокого» дерева. Для дерева
меньшей размерности алгоритм показал более высокую точность. Количество наблюдений в листе, равное 48, го­ворит о том, что алгоритму необходимо найти одно правило, которое клас­сифицирует наблюдение с точностью 100 %. Но поскольку такого правила не существует, ошибочно классифицированными в этом случае оказыва­ются все отрицательные наблюдения из тестового множества.
Вторая задача, в отличие
от первой, состоит из приблизительно рав­ного количества наблюдений в обоих классах: отрицательных – 178, поло­жительных – 121. Отрицательным наблюдениям соответствуют лошади, выжившие после перенесенной болезни, положительным – погибшие ло­шади. Однако выборка имеет очень большое количество пропусков в дан­ных. В итоге тот же самый алгоритм J48 без редукции дает большее коли­чество ошибок.
Из результатов исследования видно, что не следует уста-
навливать требования к большему количеству наблюдений в листе.
В табл. 2.3–2.6 приведены исследования алгоритма J48 с использова­нием редукции. В данном случае настраивался не только параметр minNumObject, но и confidenceFactor.
Алгоритм J48 с редукцией для задачи 1
MinNumObject / confidenceFactor
Точность классификации
2/0,25 4/0,25 10/0,25 25/0,25 40/0,25
Таблица 2.3
Множество отрицательных наблюдений, %
Множество положительных наблюдений, %
Количество ошибок, шт. 4 4 9 1 1
71 71 29 86 86
94 94 88 100 100
В табл. 2.3 использовалась редукция с параметром confidencеFactor 0,25 для некоторых параметров minNumObject, из предыдущего исследо-
вания. Из результатов видно, что точность классификации возрастает для алгоритма, строящего дерево с большим количеством наблюдений в листе. Для деревьев с количеством наблюдений на л. 25 и 40 редукция не привела к улучшению точности.
– 51 –
Таблица 2.4
Confidence
Factor
0,5
0,05
0,01
Алгоритм J48 с редукцией при различных параметрах для задачи 1
MinNumObject
Точность классификации
Множество отрицательных / положительных наблюдений, %
Множество отрицательных / положительных наблюдений, %
Множество отрицательных / положительных наблюдений, %
2 4 10 25 40
71/94 71/94 29/94 86/100 86/100
71/94 71/94 29/88 86/100 86/100
29/97 29/97 29/97 86/100 86/100
Количество ошибок, шт. 4; 4; 6 4; 4; 6 7; 9; 6 1; 1; 1 1; 1; 1
Изменение параметра редукции не привело к повышению точности классификации при решении данной задачи. В некоторых случаях повы­шение количества отсекаемых ветвей привело к ухудшению точности. Тем не менее алгоритм J48 с редукцией работает несколько лучше, чем без нее. Возросло количество верно классифицированных положительных наблю­дений на 1 в случае «глубоких» деревьев.
Таблица 2.5
Точность классификации
Алгоритм J48 с редукцией для задачи 2
MinNumObject/confidenceFactor
2/0,25 4/0,25 10/0,25 25/0,25 40/0,25
Множество отрицательных наблюдений, % 68 71 71 53 53 Множество положительных наблюдений, % 73 73 73 62 62 Количество ошибок, шт. 18 17 17 26 26
Из табл. 2.5 видно, что использование процедуры редукции в алго­ритме дало точность несколько выше, чем в предыдущем исследовании, но по-прежнему с большим числом ошибок. Исследуем алгоритм при других параметрах редукции.
Confidence
Алгоритм J48 с редукцией при различных параметрах для задачи 2
Factor
0,5
0,05
0,01
Точность классификации
Множество отрицательных / положительных наблюдений, %
Множество отрицательных / положительных наблюдений, %
Множество отрицательных / положительных наблюдений, %
Количество ошибок, шт.
Таблица 2.6
MinNumObject
2 4 10 25 40
68/73 71/73 73/65 79/31 53/62
77/62 77/62 53/62 53/62 53/62
53/62 53/62 53/62 53/62 53/62
18; 18;
26
17; 18;
26
18; 26;
26
25; 26;
26
26; 26;
26
– 52 –
Ввиду большого количества попущенных данных для задачи 2 не удалось настроить параметры алгоритма J48. Количество неверно клас­сифицируемых наблюдений составляет около 30 % экзаменующей выборки.
Алгоритм RandomTree. Данный алгоритм также относится к катего-
рии Trees. В числе настраиваемых параметров такие: KValues – количество случайно выбранных признаков, которые помещаются в узлы дерева; maxDepth – максимальная «глубина» дерева. По умолчанию значение па­раметра KValues равно 0. В таком случае количество случайных признаков вычисляется как log
(N), где N – количество признаков в задаче. Отсут-
2
ствие ограничений на количество обрабатываемых признаков и «глубину» дерева приведет к полному перебору всех возможных конъюнкций.
В табл. 2.7 и 2.8 приведено исследование работы данного алгоритма на практических задачах.
Таблица 2.7
KValues maxDepth
Результаты решения задачи 1 с помощью RandomTree
Точность классификации, %
Отрицательные наблю-
дения
2 29 97 6
Положительные
наблюдения
Количество
ошибок, шт.
4
1
16
23
4 71 94 3
10 57 91 6
∞ 57 91 6
2 57 94 5 4 57 84 8
10 86 84 6
∞ 86 81 7
2 57 100 3 4 86 97 2
10 86 97 2
∞ 86 97 2
2 43 100 4 4 86 97 2
10 71 97 3
∞ 71 97 3
Из табл. 2.7 видно, что при «глубине» дерева, равной четырем, точ­ность классификации выше, чем при осуществлении полного перебора, кото­рый доступен в WEKA (ввиду относительно небольшой размерности задачи). Выбор из большего числа признаков влечет меньшее количество ошибок.
– 53 –
KValues maxDepth
4
1
16
1 2 3 4 5
23
Результаты решения задачи 2 с помощью RandomTree
2 71 58 21 4 85 54 17
10 82 58 17
∞ 77 50 21
2 74 50 22 4 74 54 21
10 82 65 15
∞ 82 54 18
2 71 65 19 4 77 50 21
10 71 50 23
∞ 74 65 17
2 68 62 21 4 77 54 20
10 74 65 18
∞ 74 65 18
Точность классификации, %
Отрицательные
наблюдения
Положительные
наблюдения
Таблица 2.8
Количество
ошибок, шт.
Для задачи 2 алгоритм RandomTree показал результаты, аналогичные J48. Из табл. 2.8 видно, что величина неверно классифицированных наблюдений по-прежнему составляет 30 % и выше. Деревья большой раз­мерности не позволяют значительно увеличить точность классификации. Однако все же найдено наилучшее решение задачи с величиной ошибки 25 % при параметрах алгоритма KValues = 1 и maxDepth = 10.
Алгоритм DecisionTable. Данный метод относится к категории Rules
(«Правила»). Основным параметром является способ построения наиболее
информативных закономерностей. Каждый из этих способов, в свою оче­редь, имеет собственные настраиваемые параметры. Результаты приведены в табл. 2.9 и 2.10.
Градиентный алгоритм синтеза конъюнкций при методе построения решающей таблицы характеризуется параметром direction (направление поиска), который может принимать три
значения: forward (прямое),
backward (обратное), bi-directional (в двух направлениях).
«Жадный» алгоритм имеет параметр search (поиск), который так же,
как и при градиентном методе, может принимать значения forward и back- ward. Также в данном алгоритме присутствует параметр ConservativeFor­ward, который при осуществлении прямого поиска продолжает добавлять
– 54 –
признаки в лучшее подмножество до тех пор, пока значение информатив­ности не начнет падать.
Генетические алгоритмы синтеза конъюнкций характеризуются тремя основными настраиваемыми параметрами: CrossoverProb, MutationProb, PopulationSize. Первый параметр устанавливает вероятность скрещивания, т. е. вероятность того, что два члена популяции обменяются генетическим материалом. Второй – значение вероятности возникновения мутации. Тре­тий определяет величину
популяции, т. е. количество индивидов (множе-
ства атрибутов).
При решении задачи диагностики заболевания Паркинсона с помо­щью таблицы решений была получена достаточно высокая точность. Луч­шую точность показал «жадный» алгоритм синтеза конъюнкций (неверно классифицированным оказалось только одно наблюдение). Полный пере­бор тем не менее показал наихудшую точность. Такой результат возможен при излишнем обучении алгоритма (переобучении).
Метод синтеза
Градиентный direction
«Жадный»
правил
Таблица 2.9
Результаты решения задачи 1 с помощью DecisionTable
Параметры
Точность классификации, %
Отрицательные
наблюдения
Положительные
наблюдения
Количество
ошибок, шт.
forward 86 94 3 backward 57 88 7 bi-directional 86 94 3
search
forward 86 100 1 backward 86 94 3
conservativeForward selection 86 88 5
Генетические алгоритмы
Полный перебор
CrossoverProb = 0,3 MutationProb = 0,03
CrossoverProb = 0,3 PopulationSize = 20
MutationProb = 0,03 PopulationSize = 20
10 71 94 4
20 86 94 3
30 86 91 4
PopulationSize
0,01 57 91 6
0,025 57 91 6
0,04 57 88 7
MutationProb
0,1 43 97 5
0,5 71 97 3
0,7 71 81 8
CrossoverProb
43 94 8
– 55 –
Метод
синтеза
правил
«Жадный»
Таблица 2.10
Результаты решения задачи 2 с помощью DecisionTable
Параметры
search
Точность классификации, %
Отрицательные
наблюдения
Положительные
наблюдения
forward 88 42 19
Количество
ошибок, шт.
backward 82 35 23
conservativeForwardselection 82 35 23
10 62 58 24
CrossoverProb = 0,3 MutationProb = 0,033
20 79 42 22
30 85 46 19
PopulationSize
0,01 77 35 25
Генетические алгоритмы
CrossoverProb = 0,3 PopulationSize = 20
0,025 74 58 20
0,04 68 62 21
MutationProb
0,1 82 50 19
MutationProb = 0,033 PopulationSize = 30
0,5 84 42 20
0,7 82 42 21
CrossoverProb
forward 82 35 23
Градиентный direction
backward 97 0 27 bi-directional 68 62 21
Алгоритм OneR.
Он, как и DecisionTable, относится к категории
Rules. Настраиваемым параметром в данном алгоритме является количе-
ство порогов бинаризации. Рассмотрим работу данного метода на практи­ческих задачах (табл. 2.11 и 2.12).
Результаты решения задачи 1 с помощью OneR
Количество
порогов бинаризации
Точность классификации, %
Отрицательные
наблюдения
Положительные
наблюдения
4 57 100 3
Таблица 2.11
Количество
ошибок, шт.
6 57 100 3 8 71 100 2
– 56 –
Классификация строится по параметру PPE, который есть не что иное, как нелинейное измерение основного изменения частоты.
Количество
порогов бинаризации
Результаты решения задачи 2 с помощью OneR
Точность классификации, %
Отрицательные
наблюдения
4 74 54 21 6 79 46 21 8 79 46 21
Положительные
наблюдения
Таблица 2.12
Количество
ошибок, шт.
Приведены примеры практического применения логических алго­ритмов классификации в различных предметных областях. Значительная часть данных была взята из открытых источников (публикации, Интернет) или предоставлена авторам коллегами.
Следует отметить очевидную истину: точность распознавания и про­гноза, выявленные закономерности непосредственно зависят от практиче­ской постановки задачи, качества и количества имеющихся данных. Если в
действительности не существует детерминированной или статистической связи между имеющейся системой признаков и распознаваемым свойством (параметром, характеристикой, объектом, ситуацией и т. п.), то наивно рассчитывать найти то, чего нет. Если обучающие данные непредстави­тельны (т. е. к распознаванию могут предъявляться в значительном коли­честве наблюдения, существенно отличающиеся от наблюдаемых ранее), то
более правильным ответом в данных случаях будут отказы от распозна­вания в виде «распознаваемое наблюдение является незнакомым», чем необоснованная их классификация.
С использованием логических алгоритмов классификации (J48, RandomTree, DeсisionTable, OneR), реализованных в программе WEKA, решены задачи диагностики болезни Паркинсона и колик у лошадей. Результаты получены при различных настройках параметров данных ал­горитмов. Возможность настройки
параметров предоставляется пользо­вателю программой WEKA при каждом запуске процесса обучения кон­кретного алгоритма, что позволяет учесть специфику каждой решаемой задачи.
– 57 –

3. МЕТОД ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И ЕГО МОДИФИКАЦИИ

3.1. ОПИСАНИЕ ПОДХОДА

В работе рассматривается задача классификации следующего вида
[87]. Имеется выборка данных, которая состоит из двух непересекающихся
множеств Ω ложительному или отрицательному классу. Компоненты вектора, называе­мые также признаками, могут быть как численными или номинальными, так и бинарными. Задача состоит в том, чтобы для некоторого нового наблюдения, являющегося также вектором n переменных, определить, к какому классу он принадлежит.
В основе предлагаемого подхода к классификации тод, происходящий из теории комбинаторной оптимизации и называемый логическим анализом данных (Logical Analysis of Data – LAD) [174]. Этот метод успешно использовался для решения ряда задач из различных обла­стей [50, 140, 205, 168, 169]. Его основная идея заключается в совместном использовании действий по дифференцированию и интегрированию, про­изводимых на области пространства исходных признаков, содержащей заданные положительные и ренцирования определяется семейство малых подмножеств, обладающих характерными положительными и отрицательными чертами. На шаге инте­грирования формируемые определенным образом объединения этих под­множеств рассматриваются как аппроксимации областей пространства признаков, содержащих положительные и, соответственно, отрицательные наблюдения [44].
Последовательные элементы метода [99, 168]:
1.
данных во множестве переменных определяют некоторое подмножество S, используя которое можно отличать положительные наблюдения от отри­цательных. Далее для работы метода используют проекции Ω жеств Ω
2.
уменьшенного пространства, каждое из которых имеет значительное пере­сечение с Ω сечение с Ω
+
и Ω− n-мерных векторов, принадлежащих соответственно по-
данных лежит ме-
отрицательные наблюдения. На шаге диффе-
Для исключения избыточных переменных в исходной выборке
+
и Ω− на S.
Множество Ω
+
, но не пересекается с Ω
s
−
для большего увеличения пересечения с Ω
s
+
s
+
покрывают семейством однотипных подмножеств
s
−
, либо допускается небольшое пере-
s
+
. Такие подмно-
s
и Ω
−
мно-
s
– 58 –
жества называют положительными закономерностями. Аналогично мно- жество Ω
объединение которых покрывает все наблюдения Ω
−
покрывается отрицательными закономерностями.
s
3.
Определяют подмножество положительных закономерностей,
+
, и подмножество от-
s
рицательных закономерностей, объединение которых покрывает все наблюдения Ω
4.
Положительный или отрицательный характер некоторого наблю-
−
.
s
дения, покрываемого объединением двух подмножеств, определяют с по­мощью классификатора, основанного на этих подмножествах.

3.2. БИНАРИЗАЦИЯ ПРИЗНАКОВ

Рассматриваемый метод предназначен для работы с выборками дан­ных, в которых признаки принимают бинарные значения. Так как исходная выборка может состоять из разнотипных признаков, необходимо восполь­зоваться способами бинаризации.
Суть одного из простейших способов бинаризации заключается в том, что каждой метрической переменной ставится в соответствие несколько бинарных переменных. Бинарная переменная равна
1, если зна­чение соответствующей метрической переменной находится выше опреде­ленного порога, в противном случае бинарная переменная равна 0. Такой способ в [94] называется единичным. Его недостатком является то, что су­ществует большое число комбинаций бинарных переменных, которым не соответствуют точки в исходном пространстве (2
n
–n–1). Этот недостаток затрудняет использование такого способа для кодирования переменных критериальной функции при решении задач оптимизации, так как большое число решений будут недопустимыми. Но в данном случае для классифи­кации это не имеет значения, так как бинарные переменные получаются путем кодирования заданных метрических переменных. Основным же преимуществом такого способа является
соответствие расстояний в исход­ном и бинарном пространствах. Это значит, что точки, близкие в исходном пространстве, являются близкими и в бинаризованном. А это, в свою оче­редь, позволяет еще в процессе бинаризации минимизировать число поро­гов, ставя в соответствие близким значениям исходной переменной одно и то же значение в бинарном пространстве
(при условии, что положитель­ные и отрицательные множества наблюдений останутся непересекающи­мися) [72].
Существует другой способ бинаризации, приведенный в [17, 53].
– 59 –
Произвольный признак f: X→Df создает термы, проверяющие попа-



X
дание значения f(x) в определённые подмножества множества D приводятся типичные конструкции такого вида.
1. Если f номинальный признак:

,

,
2. Если f порядковый или количественный признак:

,


В случае количественных признаков f: X→R необходимо брать толь­ко такие значения порогов d, которые по-разному разделяют выборку Если исключить тривиальные разбиения, обращающие β(x) в 0 или 1 на всей выборке, то таких значений окажется не более но взять пороги вида

d
i
где
 
1
ff
– последовательность значений признака f на наблюде-
,,,
1
ifif
2

Dddxfx
;
f
DDDxfx
.
f
Dddxfx
;
f
ddDdddxfdx
f
1
ii
.
1
. Например, мож-
, (3.1)
1,,1,,
iff
. В [17]
f
.
ниях выборки
 
xfxf ,,
1
, упорядоченная по возрастанию (рис. 3.1).
Рис. 3.1. Вариационный ряд значений признака f(x) и пороги d
i
Если полученные термы в дальнейшем будут использоваться для синтеза конъюнкций, то для сокращения перебора необходимо сразу вы­брать из них самые информативные. Когда признаки порядковые и количе­ственные, такая задача решается посредством оптимального разбиения диапазона значений признака на зоны. Ниже приводится процесс такого разбиения.
– 60 –
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]