Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Модификации метода логического анализа данных для задач классификации. Монография.pdf
X
- •ОГЛАВЛЕНИЕ
- •ПРЕДИСЛОВИЕ
- •ВВЕДЕНИЕ
- •1. АНАЛИЗ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ
- •1.2. АЛГОРИТМЫ ПОИСКА ЗАКОНОМЕРНОСТЕЙ В ФОРМЕ КОНЪЮНКЦИЙ
- •1.3. АНАЛИЗ ОСНОВНЫХ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ И СПОСОБОВ ИХ ПОСТРОЕНИЯ
- •1.3.1. Решающие списки
- •1.3.2. Решающие деревья
- •1.3.4. Алгоритмы вычисления оценок
- •1.3.3. Алгоритмы простого и взвешенного голосования правил
- •2.1. ПРИЛОЖЕНИЯ В ОБЛАСТИ БИЗНЕСА, ЭКОНОМИКИ И ФИНАНСОВ
- •2.2. ПРИЛОЖЕНИЯ В ОБЛАСТИ МЕДИЦИНЫ И ЗДРАВООХРАНЕНИЯ
- •2.3. ПРИЛОЖЕНИЯ В ОБЛАСТИ ТЕХНИКИ
- •2.4. ПРИЛОЖЕНИЯ В ОБЛАСТИ ФИЗИКИ, ХИМИИ, БИОЛОГИИ
- •2.5. ПРИЛОЖЕНИЯ В ОБЛАСТИ ОБРАБОТКИ И РАСПОЗНАВАНИЯ ИЗОБРАЖЕНИЙ
- •3. МЕТОД ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И ЕГО МОДИФИКАЦИИ
- •3.1. ОПИСАНИЕ ПОДХОДА
- •3.2. БИНАРИЗАЦИЯ ПРИЗНАКОВ
- •3.3. ПОСТРОЕНИЕ ОПОРНОГО МНОЖЕСТВА
- •3.4. ФОРМИРОВАНИЕ ЗАКОНОМЕРНОСТЕЙ
- •3.5. ПОСТРОЕНИЕ КЛАССИФИКАТОРА
- •4.1. СОСТОЯНИЕ ПРОБЛЕМЫ
- •4.2. СВОЙСТВА ПСЕВДОБУЛЕВЫХ ФУНКЦИЙ
- •5. АНАЛИЗ ИСХОДНОЙ ВЫБОРКИ ДАННЫХ
- •5.1. НЕДОСТАТКИ В ИСХОДНОЙ ВЫБОРКЕ ДАННЫХ
- •5.3. ВЫБОР ПУЛА ПРИЗНАКОВ
- •5.4. АЛГОРИТМИЧЕСКАЯ ПРОЦЕДУРА ПОЛУЧЕНИЯ УСЕЧЕННОГО НАБОРА ПРИЗНАКОВ
- •ЗАКЛЮЧЕНИЕ
- •СПИСОК ЛИТЕРАТУРЫ
- •ПРИЛОЖЕНИЕ 1
- •ПРИЛОЖЕНИЕ 2

Первая задача имеет неравноценное разделение на классы – количество больных пациентов превышает количество здоровых в 3 раза. Здоровые пациенты характеризуются как отрицательные наблюдения, больные –
как положительные. Однако ввиду отсутствия пропущенных значений алгоритм J48 без процедуры редукции неверно классифицирует количество
наблюдений в размере 13–15 % тестового множества при построении
«глубокого» дерева. Для дерева
меньшей размерности алгоритм показал
более высокую точность. Количество наблюдений в листе, равное 48, говорит о том, что алгоритму необходимо найти одно правило, которое классифицирует наблюдение с точностью 100 %. Но поскольку такого правила
не существует, ошибочно классифицированными в этом случае оказываются все отрицательные наблюдения из тестового множества.
Вторая задача, в отличие
от первой, состоит из приблизительно равного количества наблюдений в обоих классах: отрицательных – 178, положительных – 121. Отрицательным наблюдениям соответствуют лошади,
выжившие после перенесенной болезни, положительным – погибшие лошади. Однако выборка имеет очень большое количество пропусков в данных. В итоге тот же самый алгоритм J48 без редукции дает большее количество ошибок.
Из результатов исследования видно, что не следует уста-
навливать требования к большему количеству наблюдений в листе.
В табл. 2.3–2.6 приведены исследования алгоритма J48 с использованием редукции. В данном случае настраивался не только параметр
minNumObject, но и confidenceFactor.
Алгоритм J48 с редукцией для задачи 1
MinNumObject / confidenceFactor
Точность классификации
2/0,25 4/0,25 10/0,25 25/0,25 40/0,25
Таблица 2.3
Множество отрицательных
наблюдений, %
Множество положительных
наблюдений, %
Количество ошибок, шт. 4 4 9 1 1
71 71 29 86 86
94 94 88 100 100
В табл. 2.3 использовалась редукция с параметром confidencеFactor
0,25 для некоторых параметров minNumObject, из предыдущего исследо-
вания. Из результатов видно, что точность классификации возрастает для
алгоритма, строящего дерево с большим количеством наблюдений в листе.
Для деревьев с количеством наблюдений на л. 25 и 40 редукция не привела
к улучшению точности.
– 51 –

Таблица 2.4
Confidence
Factor
0,5
0,05
0,01
Алгоритм J48 с редукцией при различных параметрах для задачи 1
MinNumObject
Точность классификации
Множество отрицательных /
положительных наблюдений, %
Множество отрицательных /
положительных наблюдений, %
Множество отрицательных /
положительных наблюдений, %
2 4 10 25 40
71/94 71/94 29/94 86/100 86/100
71/94 71/94 29/88 86/100 86/100
29/97 29/97 29/97 86/100 86/100
Количество ошибок, шт. 4; 4; 6 4; 4; 6 7; 9; 6 1; 1; 1 1; 1; 1
Изменение параметра редукции не привело к повышению точности
классификации при решении данной задачи. В некоторых случаях повышение количества отсекаемых ветвей привело к ухудшению точности. Тем
не менее алгоритм J48 с редукцией работает несколько лучше, чем без нее.
Возросло количество верно классифицированных положительных наблюдений на 1 в случае «глубоких» деревьев.
Таблица 2.5
Точность классификации
Алгоритм J48 с редукцией для задачи 2
MinNumObject/confidenceFactor
2/0,25 4/0,25 10/0,25 25/0,25 40/0,25
Множество отрицательных наблюдений, % 68 71 71 53 53
Множество положительных наблюдений, % 73 73 73 62 62
Количество ошибок, шт. 18 17 17 26 26
Из табл. 2.5 видно, что использование процедуры редукции в алгоритме дало точность несколько выше, чем в предыдущем исследовании, но
по-прежнему с большим числом ошибок. Исследуем алгоритм при других
параметрах редукции.
Confidence
Алгоритм J48 с редукцией при различных параметрах для задачи 2
Factor
0,5
0,05
0,01
Точность классификации
Множество отрицательных /
положительных наблюдений, %
Множество отрицательных /
положительных наблюдений, %
Множество отрицательных /
положительных наблюдений, %
Количество ошибок, шт.
Таблица 2.6
MinNumObject
2 4 10 25 40
68/73 71/73 73/65 79/31 53/62
77/62 77/62 53/62 53/62 53/62
53/62 53/62 53/62 53/62 53/62
18; 18;
26
17; 18;
26
18; 26;
26
25; 26;
26
26; 26;
26
– 52 –

Ввиду большого количества попущенных данных для задачи 2
не удалось настроить параметры алгоритма J48. Количество неверно классифицируемых наблюдений составляет около 30 % экзаменующей выборки.
Алгоритм RandomTree. Данный алгоритм также относится к катего-
рии Trees. В числе настраиваемых параметров такие: KValues – количество
случайно выбранных признаков, которые помещаются в узлы дерева;
maxDepth – максимальная «глубина» дерева. По умолчанию значение параметра KValues равно 0. В таком случае количество случайных признаков
вычисляется как log
(N), где N – количество признаков в задаче. Отсут-
2
ствие ограничений на количество обрабатываемых признаков и «глубину»
дерева приведет к полному перебору всех возможных конъюнкций.
В табл. 2.7 и 2.8 приведено исследование работы данного алгоритма
на практических задачах.
Таблица 2.7
KValues maxDepth
Результаты решения задачи 1 с помощью RandomTree
Точность классификации, %
Отрицательные наблю-
дения
2 29 97 6
Положительные
наблюдения
Количество
ошибок, шт.
4
1
16
23
4 71 94 3
10 57 91 6
∞ 57 91 6
2 57 94 5
4 57 84 8
10 86 84 6
∞ 86 81 7
2 57 100 3
4 86 97 2
10 86 97 2
∞ 86 97 2
2 43 100 4
4 86 97 2
10 71 97 3
∞ 71 97 3
Из табл. 2.7 видно, что при «глубине» дерева, равной четырем, точность классификации выше, чем при осуществлении полного перебора, который доступен в WEKA (ввиду относительно небольшой размерности задачи).
Выбор из большего числа признаков влечет меньшее количество ошибок.
– 53 –

KValues maxDepth
4
1
16
1 2 3 4 5
23
Результаты решения задачи 2 с помощью RandomTree
2 71 58 21
4 85 54 17
10 82 58 17
∞ 77 50 21
2 74 50 22
4 74 54 21
10 82 65 15
∞ 82 54 18
2 71 65 19
4 77 50 21
10 71 50 23
∞ 74 65 17
2 68 62 21
4 77 54 20
10 74 65 18
∞ 74 65 18
Точность классификации, %
Отрицательные
наблюдения
Положительные
наблюдения
Таблица 2.8
Количество
ошибок, шт.
Для задачи 2 алгоритм RandomTree показал результаты, аналогичные
J48. Из табл. 2.8 видно, что величина неверно классифицированных
наблюдений по-прежнему составляет 30 % и выше. Деревья большой размерности не позволяют значительно увеличить точность классификации.
Однако все же найдено наилучшее решение задачи с величиной ошибки 25 %
при параметрах алгоритма KValues = 1 и maxDepth = 10.
Алгоритм DecisionTable. Данный метод относится к категории Rules
(«Правила»). Основным параметром является способ построения наиболее
информативных закономерностей. Каждый из этих способов, в свою очередь, имеет собственные настраиваемые параметры. Результаты приведены
в табл. 2.9 и 2.10.
Градиентный алгоритм синтеза конъюнкций при методе построения
решающей таблицы характеризуется параметром direction (направление
поиска), который может принимать три
значения: forward (прямое),
backward (обратное), bi-directional (в двух направлениях).
«Жадный» алгоритм имеет параметр search (поиск), который так же,
как и при градиентном методе, может принимать значения forward и back-
ward. Также в данном алгоритме присутствует параметр ConservativeForward, который при осуществлении прямого поиска продолжает добавлять
– 54 –

признаки в лучшее подмножество до тех пор, пока значение информативности не начнет падать.
Генетические алгоритмы синтеза конъюнкций характеризуются тремя
основными настраиваемыми параметрами: CrossoverProb, MutationProb,
PopulationSize. Первый параметр устанавливает вероятность скрещивания,
т. е. вероятность того, что два члена популяции обменяются генетическим
материалом. Второй – значение вероятности возникновения мутации. Третий определяет величину
популяции, т. е. количество индивидов (множе-
ства атрибутов).
При решении задачи диагностики заболевания Паркинсона с помощью таблицы решений была получена достаточно высокая точность. Лучшую точность показал «жадный» алгоритм синтеза конъюнкций (неверно
классифицированным оказалось только одно наблюдение). Полный перебор тем не менее показал наихудшую точность. Такой результат возможен
при излишнем обучении алгоритма (переобучении).
Метод синтеза
Градиентный direction
«Жадный»
правил
Таблица 2.9
Результаты решения задачи 1 с помощью DecisionTable
Параметры
Точность классификации, %
Отрицательные
наблюдения
Положительные
наблюдения
Количество
ошибок, шт.
forward 86 94 3
backward 57 88 7
bi-directional 86 94 3
search
forward 86 100 1
backward 86 94 3
conservativeForward selection 86 88 5
Генетические
алгоритмы
Полный
перебор
CrossoverProb = 0,3
MutationProb = 0,03
CrossoverProb = 0,3
PopulationSize = 20
MutationProb = 0,03
PopulationSize = 20
10 71 94 4
20 86 94 3
30 86 91 4
PopulationSize
0,01 57 91 6
0,025 57 91 6
0,04 57 88 7
MutationProb
0,1 43 97 5
0,5 71 97 3
0,7 71 81 8
CrossoverProb
43 94 8
– 55 –

Метод
синтеза
правил
«Жадный»
Таблица 2.10
Результаты решения задачи 2 с помощью DecisionTable
Параметры
search
Точность классификации, %
Отрицательные
наблюдения
Положительные
наблюдения
forward 88 42 19
Количество
ошибок, шт.
backward 82 35 23
conservativeForwardselection 82 35 23
10 62 58 24
CrossoverProb = 0,3
MutationProb = 0,033
20 79 42 22
30 85 46 19
PopulationSize
0,01 77 35 25
Генетические
алгоритмы
CrossoverProb = 0,3
PopulationSize = 20
0,025 74 58 20
0,04 68 62 21
MutationProb
0,1 82 50 19
MutationProb = 0,033
PopulationSize = 30
0,5 84 42 20
0,7 82 42 21
CrossoverProb
forward 82 35 23
Градиентный direction
backward 97 0 27
bi-directional 68 62 21
Алгоритм OneR.
Он, как и DecisionTable, относится к категории
Rules. Настраиваемым параметром в данном алгоритме является количе-
ство порогов бинаризации. Рассмотрим работу данного метода на практических задачах (табл. 2.11 и 2.12).
Результаты решения задачи 1 с помощью OneR
Количество
порогов бинаризации
Точность классификации, %
Отрицательные
наблюдения
Положительные
наблюдения
4 57 100 3
Таблица 2.11
Количество
ошибок, шт.
6 57 100 3
8 71 100 2
– 56 –

Классификация строится по параметру PPE, который есть не что
иное, как нелинейное измерение основного изменения частоты.
Количество
порогов бинаризации
Результаты решения задачи 2 с помощью OneR
Точность классификации, %
Отрицательные
наблюдения
4 74 54 21
6 79 46 21
8 79 46 21
Положительные
наблюдения
Таблица 2.12
Количество
ошибок, шт.
Приведены примеры практического применения логических алгоритмов классификации в различных предметных областях. Значительная
часть данных была взята из открытых источников (публикации, Интернет)
или предоставлена авторам коллегами.
Следует отметить очевидную истину: точность распознавания и прогноза, выявленные закономерности непосредственно зависят от практической постановки задачи, качества и количества имеющихся данных. Если
в
действительности не существует детерминированной или статистической
связи между имеющейся системой признаков и распознаваемым свойством
(параметром, характеристикой, объектом, ситуацией и т. п.), то наивно
рассчитывать найти то, чего нет. Если обучающие данные непредставительны (т. е. к распознаванию могут предъявляться в значительном количестве наблюдения, существенно отличающиеся от наблюдаемых ранее),
то
более правильным ответом в данных случаях будут отказы от распознавания в виде «распознаваемое наблюдение является незнакомым», чем
необоснованная их классификация.
С использованием логических алгоритмов классификации (J48,
RandomTree, DeсisionTable, OneR), реализованных в программе WEKA,
решены задачи диагностики болезни Паркинсона и колик у лошадей.
Результаты получены при различных настройках параметров данных алгоритмов. Возможность настройки
параметров предоставляется пользователю программой WEKA при каждом запуске процесса обучения конкретного алгоритма, что позволяет учесть специфику каждой решаемой
задачи.
– 57 –

3. МЕТОД ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И ЕГО МОДИФИКАЦИИ
3.1. ОПИСАНИЕ ПОДХОДА
В работе рассматривается задача классификации следующего вида
[87]. Имеется выборка данных, которая состоит из двух непересекающихся
множеств Ω
ложительному или отрицательному классу. Компоненты вектора, называемые также признаками, могут быть как численными или номинальными,
так и бинарными. Задача состоит в том, чтобы для некоторого нового
наблюдения, являющегося также вектором n переменных, определить,
к какому классу он принадлежит.
В основе предлагаемого подхода к классификации
тод, происходящий из теории комбинаторной оптимизации и называемый
логическим анализом данных (Logical Analysis of Data – LAD) [174]. Этот
метод успешно использовался для решения ряда задач из различных областей [50, 140, 205, 168, 169]. Его основная идея заключается в совместном
использовании действий по дифференцированию и интегрированию, производимых на области пространства исходных признаков, содержащей
заданные положительные и
ренцирования определяется семейство малых подмножеств, обладающих
характерными положительными и отрицательными чертами. На шаге интегрирования формируемые определенным образом объединения этих подмножеств рассматриваются как аппроксимации областей пространства
признаков, содержащих положительные и, соответственно, отрицательные
наблюдения [44].
Последовательные элементы метода [99, 168]:
1.
данных во множестве переменных определяют некоторое подмножество S,
используя которое можно отличать положительные наблюдения от отрицательных. Далее для работы метода используют проекции Ω
жеств Ω
2.
уменьшенного пространства, каждое из которых имеет значительное пересечение с Ω
сечение с Ω
+
и Ω− n-мерных векторов, принадлежащих соответственно по-
данных лежит ме-
отрицательные наблюдения. На шаге диффе-
Для исключения избыточных переменных в исходной выборке
+
и Ω− на S.
Множество Ω
+
, но не пересекается с Ω
s
−
для большего увеличения пересечения с Ω
s
+
s
+
покрывают семейством однотипных подмножеств
s
−
, либо допускается небольшое пере-
s
+
. Такие подмно-
s
и Ω
−
мно-
s
– 58 –

жества называют положительными закономерностями. Аналогично мно-
жество Ω
объединение которых покрывает все наблюдения Ω
−
покрывается отрицательными закономерностями.
s
3.
Определяют подмножество положительных закономерностей,
+
, и подмножество от-
s
рицательных закономерностей, объединение которых покрывает все
наблюдения Ω
4.
Положительный или отрицательный характер некоторого наблю-
−
.
s
дения, покрываемого объединением двух подмножеств, определяют с помощью классификатора, основанного на этих подмножествах.
3.2. БИНАРИЗАЦИЯ ПРИЗНАКОВ
Рассматриваемый метод предназначен для работы с выборками данных, в которых признаки принимают бинарные значения. Так как исходная
выборка может состоять из разнотипных признаков, необходимо воспользоваться способами бинаризации.
Суть одного из простейших способов бинаризации заключается
в том, что каждой метрической переменной ставится в соответствие
несколько бинарных переменных. Бинарная переменная равна
1, если значение соответствующей метрической переменной находится выше определенного порога, в противном случае бинарная переменная равна 0. Такой
способ в [94] называется единичным. Его недостатком является то, что существует большое число комбинаций бинарных переменных, которым не
соответствуют точки в исходном пространстве (2
n
–n–1). Этот недостаток
затрудняет использование такого способа для кодирования переменных
критериальной функции при решении задач оптимизации, так как большое
число решений будут недопустимыми. Но в данном случае для классификации это не имеет значения, так как бинарные переменные получаются
путем кодирования заданных метрических переменных. Основным же
преимуществом такого способа является
соответствие расстояний в исходном и бинарном пространствах. Это значит, что точки, близкие в исходном
пространстве, являются близкими и в бинаризованном. А это, в свою очередь, позволяет еще в процессе бинаризации минимизировать число порогов, ставя в соответствие близким значениям исходной переменной одно
и то же значение в бинарном пространстве
(при условии, что положительные и отрицательные множества наблюдений останутся непересекающимися) [72].
Существует другой способ бинаризации, приведенный в [17, 53].
– 59 –

Произвольный признак f: X→Df создает термы, проверяющие попа-
X
дание значения f(x) в определённые подмножества множества D
приводятся типичные конструкции такого вида.
1. Если f номинальный признак:
,
,
2. Если f порядковый или количественный признак:
,
В случае количественных признаков f: X→R необходимо брать только такие значения порогов d, которые по-разному разделяют выборку
Если исключить тривиальные разбиения, обращающие β(x) в 0 или 1 на
всей выборке, то таких значений окажется не более
но взять пороги вида
d
i
где
1
ff
– последовательность значений признака f на наблюде-
,,,
1
ifif
2
Dddxfx
;
f
DDDxfx
.
f
Dddxfx
;
f
ddDdddxfdx
f
1
ii
.
1
. Например, мож-
, (3.1)
1,,1,,
iff
. В [17]
f
.
ниях выборки
xfxf ,,
1
, упорядоченная по возрастанию (рис. 3.1).
Рис. 3.1. Вариационный ряд значений признака f(x) и пороги d
i
Если полученные термы в дальнейшем будут использоваться для
синтеза конъюнкций, то для сокращения перебора необходимо сразу выбрать из них самые информативные. Когда признаки порядковые и количественные, такая задача решается посредством оптимального разбиения
диапазона значений признака на зоны. Ниже приводится процесс такого
разбиения.
– 60 –
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
