Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Модификации метода логического анализа данных для задач классификации. Монография.pdf
X
- •ОГЛАВЛЕНИЕ
- •ПРЕДИСЛОВИЕ
- •ВВЕДЕНИЕ
- •1. АНАЛИЗ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ
- •1.2. АЛГОРИТМЫ ПОИСКА ЗАКОНОМЕРНОСТЕЙ В ФОРМЕ КОНЪЮНКЦИЙ
- •1.3. АНАЛИЗ ОСНОВНЫХ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ И СПОСОБОВ ИХ ПОСТРОЕНИЯ
- •1.3.1. Решающие списки
- •1.3.2. Решающие деревья
- •1.3.4. Алгоритмы вычисления оценок
- •1.3.3. Алгоритмы простого и взвешенного голосования правил
- •2.1. ПРИЛОЖЕНИЯ В ОБЛАСТИ БИЗНЕСА, ЭКОНОМИКИ И ФИНАНСОВ
- •2.2. ПРИЛОЖЕНИЯ В ОБЛАСТИ МЕДИЦИНЫ И ЗДРАВООХРАНЕНИЯ
- •2.3. ПРИЛОЖЕНИЯ В ОБЛАСТИ ТЕХНИКИ
- •2.4. ПРИЛОЖЕНИЯ В ОБЛАСТИ ФИЗИКИ, ХИМИИ, БИОЛОГИИ
- •2.5. ПРИЛОЖЕНИЯ В ОБЛАСТИ ОБРАБОТКИ И РАСПОЗНАВАНИЯ ИЗОБРАЖЕНИЙ
- •3. МЕТОД ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И ЕГО МОДИФИКАЦИИ
- •3.1. ОПИСАНИЕ ПОДХОДА
- •3.2. БИНАРИЗАЦИЯ ПРИЗНАКОВ
- •3.3. ПОСТРОЕНИЕ ОПОРНОГО МНОЖЕСТВА
- •3.4. ФОРМИРОВАНИЕ ЗАКОНОМЕРНОСТЕЙ
- •3.5. ПОСТРОЕНИЕ КЛАССИФИКАТОРА
- •4.1. СОСТОЯНИЕ ПРОБЛЕМЫ
- •4.2. СВОЙСТВА ПСЕВДОБУЛЕВЫХ ФУНКЦИЙ
- •5. АНАЛИЗ ИСХОДНОЙ ВЫБОРКИ ДАННЫХ
- •5.1. НЕДОСТАТКИ В ИСХОДНОЙ ВЫБОРКЕ ДАННЫХ
- •5.3. ВЫБОР ПУЛА ПРИЗНАКОВ
- •5.4. АЛГОРИТМИЧЕСКАЯ ПРОЦЕДУРА ПОЛУЧЕНИЯ УСЕЧЕННОГО НАБОРА ПРИЗНАКОВ
- •ЗАКЛЮЧЕНИЕ
- •СПИСОК ЛИТЕРАТУРЫ
- •ПРИЛОЖЕНИЕ 1
- •ПРИЛОЖЕНИЕ 2

личеству наборами центроидов, чтобы определить зависимость точности
классификации от количества центроидов для каждого класса.
Процедура выбора базовых наблюдений для формирования законо-
мерностей реализуется до момента построения классификатора; тем самым
сокращается трудоемкость его построения, так как значительно уменьшается количество формируемых закономерностей, однако точность классификации, как правило, немного снижается. Для устранения
работе предлагается другой подход с целью сокращения количества закономерностей в исходном классификаторе. Необходимо построить классификатор, количество закономерностей которого равно мощности обучающей выборки данных, и сократить данное количество закономерностей при сохранении высокой точности классификации. Для реализации этого подхода предлагается процедура построения классификатора как
тивных закономерностей, базирующаяся на понятии их информативности.
В литературе для измерения информативности закономерности су-
ществует несколько критериев [161]. В данной работе предлагается использовать критерий бустинга, так как он адекватно оценивает информативность закономерности и прост в вычислении:
этого недостатка в
композиции информа-
где p – количество наблюдений своего класса, которые захватывает построенная закономерность; n – количество наблюдений другого класса, которые захватывает построенная закономерность.
Изначально, классификатор содержал все закономерности, которые
строились относительно каждого наблюдения обучающей выборки. В результате, если объем обучающей выборки увеличивается, то и размер
набора правил
мерности характеризуются разной информативностью. Закономерности,
покрывающие мало наблюдений, статистически не надежны: среди них
слишком много таких, которые допускают на независимых контрольных
данных больше ошибок, чем на обучающей выборке. Поэтому предлагается формировать классификатор только из информативных закономерностей, информативность которых выше некоторого порога информативности (H
щению числа закономерностей в классификаторе без потери точности
классификации или при незначительном ее изменении в положительную
или отрицательную сторону.
формативности. Для ее решения разработана следующая итеративная процедура. На первом шаге порог информативности
), задаваемого исследователем. В результате это приведет к сокра-
0
При решении данной задачи возникает проблема выбора порога ин-
классификатора возрастает. Причем построенные законо-
npnpH ,, (3.6)
выбирают равным нулю
– 71 –

для положительного и для отрицательного набора закономерностей, тем
самым получается исходный классификатор, состоящий из максимального
числа закономерностей. На следующем шаге процедуры предлагается выбрать порог информативности для отрицательных (положительных) закономерностей, равный значению средней информативности (H
) по всем
ср
отрицательным (положительным) закономерностям:
q
1
ср
HH
q
i
,
i
1
где q – количество отрицательных (положительных) закономерностей
в классификаторе, H
– информативность отрицательной (положительной)
i
i-й закономерности, рассчитанная по формуле (3.6).
Для получения нового классификатора, состоящего из более инфор-
мативных закономерностей, из исходного классификатора удаляем все отрицательные (положительные) закономерности, значения информативности которых ниже найденного значения порога информативности для них.
Рассчитав значения средней информативности для отрицательных и положительных закономерностей текущего
классификатора, используем их для
построения последующего классификатора, состоящего из закономерностей, информативность которых превышает значения средней информативности текущего классификатора. Таким образом, строим каждый последующий классификатор, используя значения средней информативности
текущего. При этом количество закономерностей сокращается, а значения
средней информативности возрастают для каждого последующего классификатора. Условием остановки следует считать
момент увеличения количества неклассифицированных (непокрытых) наблюдений при классификации, т. е. закономерности, входящие в текущий классификатор, не покрывают некоторые наблюдения экзаменующей выборки. Поэтому необходимо вернуться либо к предыдущему классификатору, поменяв значение
двух порогов информативности на предыдущие их значения, либо поменять значение только одного порога информативности по
отрицательным
(положительным) закономерностям и посмотреть, каким образом это
изменение отразится на количестве неклассифицированных наблюдений и
на результатах классификации в целом.
На основе разработанных алгоритмических процедур предлагаются
модификации для метода логического анализа данных с целью усиления
обобщающих способностей классификатора и повышения его интерпретируемости за счет сокращения числа правил, используемых в
применение целевой функции (3.5) и ограничения (3.4) для фор-
1)
нем:
мирования закономерностей и построение классификатора только из тех
правил, значение целевой функции для которых больше нуля;
– 72 –

2) использование алгоритмической процедуры выбора базовых
наблюдений для формирования закономерностей и применение к полученным правилам процедуры наращивания;
применение алгоритмической процедуры построения классифика-
3)
тора как композиции информативных закономерностей на базе оптимизационной модели (3.2), (3.4) с процедурой наращивания.
Предлагаемые модификации для метода логического анализа данных
позволяют повысить качество классификации новых наблюдений.
3.7. РЕШЕНИЕ ЗАДАЧ
ПСЕВДОБУЛЕВОЙ ОПТИМИЗАЦИИ
В процессе работы описанного метода необходимо многократное
решение задач условной псевдобулевой оптимизации следующего вида:
XC
;max)(
n
BX
2
jj
,,1,)(
mjHXA
где
B
2
1,0
обладающие свойствами унимодальности и монотонности [115].
Как показано выше, функции эти в общем случае задаются алгоритмически, т. е. вычисляются через определенную последовательность операций. Поэтому наиболее приемлемыми для решения этой задачи являются
так называемые поисковые алгоритмы оптимизации, которые не требуют
задания функций в явном виде с помощью алгебраических
а используют вычисления функций в точках.
Для решения этой задачи разработан регулярный алгоритм псевдобулевой оптимизации [6], который находит точное оптимальное решение
задачи за ограниченное время. Причем показано, что этот алгоритм реализует информационную сложность данного класса задач и в этом смысле
является неулучшаемым.
В то же время для многократного
переменных 100 и выше наиболее целесообразным является использование
приближенных алгоритмов [3, 80, 114], разработанных специально для
этого класса задач и основанных на поведении монотонных функций С(Х)
(X) в пространстве булевых переменных
и A
j
n
,
; С(Х) и Aj(X) – псевдобулевые функции,
BBBB
2222
выражений,
решения данной задачи с числом
n
B
. Эти алгоритмы с успехом
2
– 73 –

применяются для решения прикладных задач в различных областях [27, 73].
X
X
X
X
S
Y
S
Далее следует рассмотреть обоснование и описание некоторых приближенных алгоритмов условной псевдобулевой оптимизации.
Ниже в формализованном виде приведены некоторые понятия
и определения, необходимые для описания работы алгоритмов [2, 3]:
1. Псевдобулевой функцией называют вещественную функцию на мно-
жестве булевых переменных
2. Точки
12
,
XB
n
2
n
: RBf
2
1
, где
B ,
2
1,0
называются k-соседними, если они отличаются
n
BBBB
2222
.
значением k-координат,
nk ,1
. Так, 1-соседние точки называют просто
соседними.
n
3. Множество
k
,
)(XO
называют k-м уровнем точки
4. Множество точек
между точками X
5. Множество
то существует путь
6. Точку
0
и X1, если
BA
0
*
n
, для которой
BX
2
n
называют связным множеством, если ,,
2
, всех точек
nk ,0
.
точка
li ,,1
l
.
AXXW
),(
*
B
, k-соседних к точке Х,
2
100
i
},,,{),(
является соседней к
nll
называют путем
BXXXXXW
2
XOXXfXf
1
0
l
*
, называют
)(),()(
1
i
.
AXX
локальным минимумом псевдобулевой функции f.
7. Псевдобулевую функцию, имеющую только один локальный ми-
n
нимум, называют унимодальной на
8. Унимодальную функцию f называют монотонной на
k
*
k
nkXOX
,1),(
:
B
функцией.
2
11 k
kkk
k
*
1
n
, если
B
2
)()(),()(
XOXOXXfXf
1
.
Таким образом, имеется задача следующего вида:
XC
max)(
где С(Х) – монотонно возрастающая от X0 псевдобулевая функция;
, (3.7)
n
BSX
2
n
BS
–
2
некоторая подобласть пространства булевых переменных, определяемая
заданной системой ограничений:
Далее вводится ряд понятий для подмножества точек пространства
булевых переменных:
является граничной точкой множества S, если суще-
, для которой
ствует
1. Точка
(Y)OX
1
X
.
– 74 –
. (3.8)
mjHXA
jj
,1,)(

2. Точку
S
S
X
зовой точкой
X
0
0
i
, если
называют крайней точкой множества S с ба-
S)(XOY
i
0
выполняется
XOYOX
11
X .
3. Ограничение, определяющее подобласть пространства булевых
переменных, называют активным, если оптимальное решение задачи
условной оптимизации не совпадает с оптимальным решением соответствующей задачи оптимизации без учета ограничения.
Следует определить некоторые свойства множества допустимых
решений [140]:
1. Если целевая функция является монотонной унимодальной функцией, а ограничение активно, то оптимальным решением задачи (3.7) будет
точка, принадлежащая подмножеству крайних точек множества допусти-
мых решений
S с базовой точкой
0
, в которой целевая функция принима-
ет наименьшее значение:
0
n
BX
2
)(min)(
XCXC
.
2. Приводится задача (3.7) с одним ограничением (3.8). Если функ-
ция ограничения (3.8) является унимодальной, то множество допустимых
решений
S задачи (3.7) представляет собой связное множество.
С учетом указанных свойств множеств – допустимых решений – рассматриваются приближенные алгоритмы поиска граничных точек [62].
Для любой эвристики поиска граничных точек предлагается пара алгоритмов – прямой и двойственный. Прямой алгоритм начинает поиск из допустимой области и движется по пути возрастания целевой функции, пока
не найдет
крайнюю точку допустимой области. Напротив, двойственный
алгоритм ведет поиск в недопустимой области по пути убывания целевой
функции, пока не найдет некоторого допустимого решения (некоторую
граничную точку, которая может и не являться крайней).
Общая схема прямого алгоритма поиска:
1. Установить
В соответствии с правилом выбрать
2.
1
0
XX
Если таких точек нет, то перейти к шагу 3; иначе
3.
XX
.
1iopt
1
i
,
.
1
1
ii
0
, а шаг повторяется.
)()(
iii
1
.
SXOXOX
ли
Общая схема двойственного алгоритма поиска:
1. Установить )(
В соответствии с правилом выбрать
2.
, то перейти к шагу 3; иначе
SX
i1
3.
XX
,
1
.
1iopt
0
XOX
n
i
– 75 –
1
.
1 iini
1
ii
и повторить шаг.
0
1
. Ес-
)()(
XOXOX

Существует несколько алгоритмов поиска граничных точек, которые
j
X
X
X
X
X
отличаются друг от друга лишь правилом выбора следующей точки на шаге 2 общих схем. Далее приводится два алгоритма, показавшие наиболее
высокую эффективность при решении задач данного вида.
Правило 1. Гриди алгоритм. Точка
()max()
где
j
XOX OX S для прямого алгоритма и
0
() ()
ii
1
1
i
j
выбирается из условия
X
1i
,
X
j
XOX OX
0
() ()
ni i
1
для двойственного.
Функция
выбирается исходя из специфики задачи, например:
)(
а) целевая функция
б) удельная ценность
() ()
CX
() () ()XCXAX
,
(для одного ограничения)
и т. д.
Правило 2. Модифицированный случайный поиск граничных точек.
Точка
где
стью из точек
выбирается исходя из условия
X
1i
r
()max()
r
– точки, выбранные случайным образом и с равной вероятно-
0
)()(
XOXO
для двойственного);
)()(
10iin
1
i
ii
1
r
SXOXO
для прямого алгоритма (из точек
,
X
Rr ,1
; R – задаваемый параметр
алгоритма.
Описаны основные этапы метода логического анализа данных, созданы оптимизационные модели для формирования закономерностей
и разработаны алгоритмические процедуры, позволяющие улучшить интерпретируемость классификатора, сокращая количество правил в нем.
Формирование закономерностей и опорного множества представляет
собой задачу условной псевдобулевой оптимизации, для решения которой
используются алгоритмы оптимизации, основанные на
поиске граничных
точек допустимой области. Эти алгоритмы были разработаны специально
для данного класса задач и основаны на поведении монотонных функций
модели оптимизации в пространстве булевых переменных. Алгоритмы поиска граничных точек являются поисковыми, т. е. не требуют задания
функций в явном виде с помощью алгебраических выражений, а используют вычисление функций
в точках.
Разработана алгоритмическая процедура наращивания закономерно-
стей, полученных на базе оптимизационной модели с максимальным по-
– 76 –

крытием наблюдений обучающей выборки, которая позволяет повысить
информативность закономерностей, тем самым способствуя увеличению
точности принимаемых классификатором решений.
Создана модель оптимизации для формирования закономерностей
с покрытием существенно различных подмножеств наблюдений обучающей выборки, которая позволяет повысить обобщающие способности
классификатора, получаемого на базе данных правил.
Разработана алгоритмическая процедура выбора базовых наблюдений для
формирования закономерностей (с целью сокращения количества
правил в классификаторе и снижения трудоемкости его построения при
сохранении высокой точности).
Разработана алгоритмическая процедура построения классификатора
как композиции информативных закономерностей с целью сокращения количества правил в классификаторе при сохранении высокой точности.
На основе разработанных алгоритмических процедур предложены
модификации для метода логического анализа
данных, позволяющие повысить интерпретируемость классификатора за счет сокращения числа
правил в нем и сохранения при этом высокой точности классификации при
решении практических задач.
Следует отметить, что особенностью метода является то, что вместо
того чтобы просто ответить на вопрос, к какому из классов принадлежит
новое наблюдение, он строит аппроксимацию областей пространства
признаков, содержащую наблюдения соответствующих классов. Наиболее
важные преимущества такого подхода – это возможность объяснить любое
решение, полученное данным методом, выявить новые классы наблюдений, проанализировать роли и природу признаков.
– 77 –

4. ПОИСКОВЫЕ АЛГОРИТМЫ
УСЛОВНОЙ ПСЕВДОБУЛЕВОЙ ОПТИМИЗАЦИИ
4.1. СОСТОЯНИЕ ПРОБЛЕМЫ
Вещественные функции, определенные на множестве булевых пере-
менных, по аналогии с булевыми функциями принято называть
левыми
ций называются
а также управлении сложными техническими объектами можно решать
с помощью задач условной оптимизации с булевыми переменными. В работе [36] рассматривается проблема автоматизации планирования товарного ассортимента торговых предприятий, которая сводится к решению многокритериальной задачи псевдобулевой оптимизации с ограничениями.
Задача нахождения набора кредитных
портфеля банка) решается как поток задач условной оптимизации псевдобулевых функций [35]. Большое внимание в последнее время уделяется задаче оптимального проектирования структуры отказоустойчивых систем
управления с использованием подхода мультиверсионного программирования, формулируемой в виде задачи условной псевдобулевой оптимизации [118, 119]. Для ее решения построен ряд оптимизационных моделей,
в которых
ограничения. Структура определяется набором булевых переменных, по
которым и происходит максимизация критерия. В основном для решения
таких задач нашли применение алгоритмы случайного поиска, например
алгоритмы схемы метода изменяющихся вероятностей [8]. В некоторых
работах [69, 197] были предприняты попытки построения регулярных
алгоритмов.
делях в различных областях, таких как проектирование [98, 109, 112, 215],
теория надежности [77], теория вычислительных систем [181], статистика
(классификация) [76, 209, 210], экономика [65, 165], финансы [178, 183, 184],
менеджмент [64, 67, 220], исследование операций [71], дискретная математика (оптимизация на графах [150, 171]), промышленность (календарное
планирование и составление расписания [10, 59, 144]).
[143]. Соответственно, задачи оптимизации псевдобулевых функ-
задачами псевдобулевой оптимизации.
Многие проблемы в экономике, банковском деле, промышленности,
заявок (формирования кредитного
максимизируется критерий надежности с учетом стоимостного
Псевдобулевые функции играют важную роль в
оптимизационных мо-
псевдобу-
– 78 –

Помимо задач оптимизации псевдобулевые функции также появились во многих других моделях, представляющих интерес в настоящее
время. Они составляют, к примеру, основной объект исследования в теории кооперативных игр, где рассматриваются как характеристические
функции игр с побочными платежами [121, 166]. Псевдобулевые функции
встречаются в комбинаторной теории как функции ранга матроидов
[142, 222] или как
функции, связанные с определенными параметрами графа,
такими как число стабильности, хроматическое число и т. д. [157, 175, 201].
Оптимизация псевдобулевых функций используется в распознавании
образов, как при отборе информативных признаков [68, 74, 75], так и при
построении классификаторов [61, 62].
Впервые задачи псевдобулевой оптимизации подробно исследовались в монографии [167]. В этой работе также были разработаны методы
решения аналитически заданных
задач псевдобулевой оптимизации.
В работе [127] псевдобулевые функции рассматриваются как функции множеств, т. е. функции, отображающие семейство подмножеств
конечного исходного множества во множество действительных чисел.
Функции множеств – часто с заданным алгоритмом, способным выдавать их значения для любого подмножества заданного конечного исходного
множества. В некоторых задачах функция множества может быть
определена
аналитическим выражением, что является весьма благоприятным случаем.
Явное задание функций множеств делает возможным применение
большого числа методов для их анализа и оптимизации. Считается, что
любая функция множеств, определенная на конечном исходном множестве, допускает аналитический способ задания. Однако в некоторых случаях определение аналитического выражения может быть значительно более
трудоемкой
процедурой, чем решение исходной задачи.
Эта работа сосредоточена на тех функциях множеств, которые определены на конечном исходном множестве, представляющем собой множество булевых переменных, и не имеют известного аналитического задания.
Особое внимание уделено специальным классам – монотонным и унимодальным псевдобулевым функциям.
Известно несколько эффективных схем для решения задач, в
которых целевая функция и ограничения заданы аналитическими выражениями. Это алгебраические методы [15, 25, 37, 38, 110, 120, 140, 145, 160, 170,
199, 176, 194, 202, 203, 219] (наиболее известный – базовый алгоритм
Хаммера [167, 127]), в том числе методы линеаризации [124, 163, 177, 218],
квадратичной оптимизации [124‒126, 128, 172, 173], различные методы
с применением релаксации [204].
В практических задачах очень часто целевая функция, а иногда
и ограничения, заданы алгоритмом или наблюдаются на выходе реальной
– 79 –

системы [79]. Это обстоятельство исключает возможность практического
N
f
применения стандартных процедур математического программирования,
опирающихся на известную структуру и вид целевой функции и ограничений. Именно для таких случаев разрабатываются поисковые методы.
Обратим внимание на общую структуру поискового метода [23, 93].
Алгоритм решения задачи оптимизации представляет собой последова-
тельную процедуру, имеющую рекуррентный характер. Это означает, что
процесс поиска состоит из повторяющихся этапов, каждый из которых
определяет переход от одного решения к другому, лучшему, что и образует
процедуру последовательного улучшения решения:
XXXX
......
110
NN
В этом ряду каждое последующее решение в определенном смысле
лучше, предпочтительнее предыдущего, т. е.
XX , ,...2,1
1NN
Алгоритм поиска оптимального решения, таким образом, связывает
следующие друг за другом решения. В простейшем случае
XFX ,
)(
1NN
где F – алгоритм поиска, указывающий, какие операции следует сделать
в одной точке
X , чтобы получить следующую NX , более предпочти-
1N
тельную.
Рассмотрим специфику поискового алгоритма F. Вполне очевидно,
что информации в точке
в другую, лучшую, точку
нии оптимизируемой функции )(X
X совершенно недостаточно для перехода
1N
X . Необходимо иметь информацию о поведе-
N
и ограничения S в области точки
X . Без этого нельзя составить разумный алгоритм F, обеспечивающий
1N
условие улучшения.
Поисковый алгоритм для решения оптимизационной задачи состоит
обычно из двух этапов: сбор информации о поведении целевой функции
и ограничений, часто посредством пробных шагов, и осуществление рабочего шага. Возможны и отклонения от этой схемы, когда оба этапа совмещены и
неразделимы, но при этом обязательно сохраняются.
В оптимизации для функций, заданных алгоритмически, широкое
распространение получили адаптивные поисковые процедуры [22, 24, 164,
213] – эволюционные и генетические алгоритмы, алгоритм имитации
– 80 –
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
