Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Модификации метода логического анализа данных для задач классификации. Монография.pdf
X
- •ОГЛАВЛЕНИЕ
- •ПРЕДИСЛОВИЕ
- •ВВЕДЕНИЕ
- •1. АНАЛИЗ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ
- •1.2. АЛГОРИТМЫ ПОИСКА ЗАКОНОМЕРНОСТЕЙ В ФОРМЕ КОНЪЮНКЦИЙ
- •1.3. АНАЛИЗ ОСНОВНЫХ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ И СПОСОБОВ ИХ ПОСТРОЕНИЯ
- •1.3.1. Решающие списки
- •1.3.2. Решающие деревья
- •1.3.4. Алгоритмы вычисления оценок
- •1.3.3. Алгоритмы простого и взвешенного голосования правил
- •2.1. ПРИЛОЖЕНИЯ В ОБЛАСТИ БИЗНЕСА, ЭКОНОМИКИ И ФИНАНСОВ
- •2.2. ПРИЛОЖЕНИЯ В ОБЛАСТИ МЕДИЦИНЫ И ЗДРАВООХРАНЕНИЯ
- •2.3. ПРИЛОЖЕНИЯ В ОБЛАСТИ ТЕХНИКИ
- •2.4. ПРИЛОЖЕНИЯ В ОБЛАСТИ ФИЗИКИ, ХИМИИ, БИОЛОГИИ
- •2.5. ПРИЛОЖЕНИЯ В ОБЛАСТИ ОБРАБОТКИ И РАСПОЗНАВАНИЯ ИЗОБРАЖЕНИЙ
- •3. МЕТОД ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И ЕГО МОДИФИКАЦИИ
- •3.1. ОПИСАНИЕ ПОДХОДА
- •3.2. БИНАРИЗАЦИЯ ПРИЗНАКОВ
- •3.3. ПОСТРОЕНИЕ ОПОРНОГО МНОЖЕСТВА
- •3.4. ФОРМИРОВАНИЕ ЗАКОНОМЕРНОСТЕЙ
- •3.5. ПОСТРОЕНИЕ КЛАССИФИКАТОРА
- •4.1. СОСТОЯНИЕ ПРОБЛЕМЫ
- •4.2. СВОЙСТВА ПСЕВДОБУЛЕВЫХ ФУНКЦИЙ
- •5. АНАЛИЗ ИСХОДНОЙ ВЫБОРКИ ДАННЫХ
- •5.1. НЕДОСТАТКИ В ИСХОДНОЙ ВЫБОРКЕ ДАННЫХ
- •5.3. ВЫБОР ПУЛА ПРИЗНАКОВ
- •5.4. АЛГОРИТМИЧЕСКАЯ ПРОЦЕДУРА ПОЛУЧЕНИЯ УСЕЧЕННОГО НАБОРА ПРИЗНАКОВ
- •ЗАКЛЮЧЕНИЕ
- •СПИСОК ЛИТЕРАТУРЫ
- •ПРИЛОЖЕНИЕ 1
- •ПРИЛОЖЕНИЕ 2

1. Мера разделения. Обозначим x
+
(x-) – среднее значение признака
x, полученное по множеству всех положительных (отрицательных)
наблюдений в выборке. Допустим, что x
аналогично), тогда обозначим x* – среднее из x
жительных (отрицательных) наблюдений с x ≥ x* (x < x*) – n
+
≥ x- (при x+ < x- обрабатывается
+
и x-. Пусть число поло-
+
-
(n
x
). Заме-
x
ним численные переменные x на бинарные переменные ξ, которые равны
«1» для x ≥ x* и «0» в противном случае. Количество пар, состоящих
из положительных и отрицательных наблюдений, которые могут быть
+
разделены в соответствии со значениями ξ, превысит n
+
мера разделения σ
x
= n
-
n
, тем больше положительных/отрицательных
x
x
-
n
. Чем больше
x
x
пар из наблюдений могут быть разделены по значениям, принимаемым
признаком x.
2. Огибающий эксцентриситет. Обозначим l
+
x
и u
+
-
(l
x
x
и u
-
) мини-
x
мальное и максимальное значение признака x среди положительных (отри-
+
цательных) наблюдений в выборке. Пересечение интервалов [l
-
и [l
-
, u
] при обозначении границ положительных и отрицательных клас-
x
x
x
, u
+
]
x
сов основывается на значениях единственного признака x. Будем обозначать частичное перекрытие по x индексом
x
lluu
,max,min
xxxx
.
lluu
,min,max
xxxx
Ясно, что ω
имеет значение между «0» и «1» и чем меньше его зна-
x
чение, тем более значим признак x при разделении положительных и отрицательных наблюдений.
3. Системная энтропия. Информационная теория обеспечивает чис-
ленную оценку, выражающую неразделимость положительных и отрицательных наблюдений в выборке, основанной на значениях одного из признаков. Пусть m – количество наблюдений в выборке, t – целочисленная
аппроксимация
. Упорядочим наблюдения в выборке в соответствии со
m
значениями переменной x и разделим их на (t + 1) приблизительно равных
подвыборок последовательных наблюдений S
, S1, …, St. Допуская, что p
0
и qj – количество положительных и отрицательных наблюдений соответ-
p
ственно в S
, частота положительных наблюдений в Sj будет равна
j
а энтропия {S
, S1, …, St} равна
0
i
qp
ii
t
1
x
t
1
i
0
p
i
qp
ii
p
i
qp
ii
q
i
qp
lnln
ii
q
i
.
qp
ii
j
,
– 111 –

Это число называется энтропией признака x и принимает значения
между «0» и «ln2». Ясно, что переменные, которые хорошо «разделяют» по-
ложительные и отрицательные наблюдения, будут иметь низкую энтропию.
4. Корреляция Пирсона. Коэффициент корреляции Пирсона π
x
между вектором значений признака x и выходным вектором о (компоненты
которого равны «1» для положительных наблюдений и «0» для отрицательных) указывает на важность этого признака: чем выше абсолютное
значение этого коэффициента, тем более важен признак.
5. Корреляция сигнал-шум. Общая корреляция «сигнал-шум» τ
x
обеспечивает дополнительное измерение разбиения и определяется следующим способом. Пусть x
и пусть σ
+
и σ- соответствуют стандартным отклонениям значений по x
+
и x- определены по критерию «мера разделения»
на положительном и отрицательном наборе данных. Отношение
x
xx
называется корреляцией «сигнал-шум» признака
x с выходом.
Основанное на наборе правил ранжирование признаков по их значимости служит в качестве основного принципа для итеративной последовательности шагов предлагаемого алгоритма. Начиная с исходного пула мы
определяем каждый шаг процедуры формирования нового пула, состоящего приблизительно из половины признаков, имеющих наибольший ранг,
в соответствии с ранжированием, базирующимся
на наборе правил.
Точность построенного на новом пуле классификатора оценивается
на тестовом множестве:
1.
Если находится допустимое качество, т. е. если точность прибли-
зительно равна родительской точности, новый пул заменяет предыдущий
пул – и процесс продолжается.
2.
Если точность снижается относительно точности родительского
пула, новый пул не является непригодным автоматически. Необходимо
проверить его на модифицированном наборе правил. Модификация набора
правил с целью его наилучшего представления может быть достигнута
варьированием (обычно увеличением) параметров покрытия и степени
паттерна.
3.
Если набор правил, классификационная мощность которого име-
ет допустимую точность, найден, тогда новый пул принят и процесс
продолжается.
4.
Если не определено наилучшее представление набора правил, то-
гда новый пул улучшается включением 75 % признаков из родительского
пула (87,5 или 93,75 %).
– 112 –

5. Если этот процесс не создает пул, который определяет набор пра-
вил с допустимым качеством, тогда процесс останавливается на родительском пуле, как окончательном.
В некоторых случаях требуется, чтобы обеспечивалась робастность,
т. е. количество признаков в конечном пуле не должно быть ниже установленного порога. В этих случаях процесс останавливается, прежде чем
ко-
личество признаков получится слишком маленьким.
5.4. АЛГОРИТМИЧЕСКАЯ ПРОЦЕДУРА ПОЛУЧЕНИЯ УСЕЧЕННОГО НАБОРА ПРИЗНАКОВ
Одним из подходов для отбора признаков является разработанная алгоритмическая процедура получения усеченного набора, которая основана
на оценке важности признаков [41, 45].
Оценка важности признака – это оценка частоты его включения в закономерности, задействованные в классификаторе [187]. Таким образом,
чем чаще признак встречается в получаемых закономерностях, тем он более важен. А те
признаки, которые не встречаются или почти не участвуют
в построении закономерностей, важными не являются.
Алгоритмическая процедура получения усеченного набора признаков состоит из четырех этапов.
Первым этапом процедуры получения усеченного набора признаков
является проведение классификации на полном наборе признаков с целью
определения важности каждого.
Второй этап – установление исследователем порога важности,
отно-
сительно которого можно судить о важности конкретного признака.
Третий этап – ранжирование признаков по важности и выделение
тех, значение важности которых оказалось ниже установленного порога.
Четвертый этап состоит в исключении выделенных на третьем этапе
признаков из рассмотрения. Оставшиеся составляют усеченный набор. Таким образом, исследователь, варьируя порог важности, получает различные
усеченные наборы признаков, которые в дальнейшем используются на
этапе формирования закономерностей.
Помимо важности, определяемой для каждого признака и показывающей его роль в конкретной задаче, исследуют стимулирующую и блокирующую природу некоторых признаков для классификации. Если
существует признак, значение которого равно только 1 для положительных закономерностей, включающих этот признак, и 0
для всех отрица-
– 113 –

тельных закономерностей, включающих этот признак, то данный признак
называется стимулятором. Признак-блокатор возникает в противном случае. Действительно, каждая положительная закономерность, которая
включает данный признак, требует, чтобы блокатор был равен 0, в то
время как отрицательная закономерность требует, чтобы блокатор равнялся 1.
Рассмотрены основные недостатки в исходной выборке данных
и приведены методы
, позволяющие избежать проблем обработки данных
при наличии этих недостатков. Предложена алгоритмическая процедура
получения усеченного набора признаков для формирования опорного
множества, основанная на исключении неважных признаков методом логического анализа данных, что позволяет сократить количество признаков,
участвующих при формировании закономерностей, тем самым снижает
сложность задачи.
– 114 –

6. ПРОГРАММНАЯ РЕАЛИЗАЦИЯ МЕТОДА
И ЭКСПЕРИМЕНТАЛЬНЫЕ ИССЛЕДОВАНИЯ
НА ПРАКТИЧЕСКИХ ЗАДАЧАХ
6.1. ПРОГРАММНАЯ РЕАЛИЗАЦИЯ
МЕТОДА ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ
И ОСОБЕННОСТИ ИСПОЛЬЗОВАНИЯ ПРОГРАММНОЙ СИСТЕМЫ
Метод логического анализа данных реализован в виде программной
системы [46, 52, 66]. Эта программная система написана на языке программирования Delphi с использованием среды быстрого программирования
приложений Delphi 2009 [12, 88, 92, 103], что позволило наиболее полно использовать возможности, предоставляемые объектно-ориентированным подходом в программировании, а также наиболее качественно разработать
графический интерфейс пользователя, стандартный для приложений, работающих под
Структурная схема программной системы приведена на рис. 6.1.
управлением операционной системы Windows.
Интерфейс
Классификация
Рис. 6.1. Структурная схема программной системы
Алгоритмы
оптимизации
Целевые функции
и ограничения
Разработанное программное обеспечение состоит из трех модулей,
реализующих метод логического анализа данных, и модуля «Интерфейс»,
который позволяет осуществить взаимодействие пользователя со средой.
Краткое описание модулей:
1.
Модуль «Интерфейс» позволяет исследователю выбирать загружа-
емые данные, устанавливать самостоятельно или выбирать параметры,
необходимые для работы метода, сохранять и просматривать результаты
работы метода для конкретной задачи.
– 115 –

2. Модуль «Классификация» включает в себя алгоритмы реализации
всех этапов метода логического анализа данных: загрузка данных, выбор
признаков, настройка теста, бинаризация признаков, нахождение опорного
множества признаков, формирование закономерностей, построение классификатора, тестирование и сохранение полученных результатов.
3.
Модуль «Целевые функции и ограничения» содержит целевые
функции и ограничения оптимизационных моделей для нахождения опорного множества и закономерностей.
4.
Модуль «Алгоритмы оптимизации» включает в себя алгоритмы
оптимизации, служащие для нахождения оптимальных решений при поиске опорного множества и закономерностей.
Стартовое окно программной системы выглядит следующим образом
(рис. 6.2).
Рис. 6.2. Стартовое окно программной системы
– 116 –

В данной программной системе – восемь вкладок, которые последовательно реализуют метод логического анализа данных. Название вкладок
сообщает исследователю о той операции, которая выполняется на данной
вкладке.
Для того чтобы реализовать процедуру классификации, необходимо
выполнить ряд шагов в программной системе, последовательно переходя
от одной вкладки к другой [100]:
1)
загрузить данные, в итоге программа будет работать с таблицами
формата *.dbf (вкладка «Выборка»);
2)
выбрать признаки, которые будут участвовать в процедуре клас-
сификации, и классификационный признак (вкладка «Признаки»);
3)
выбрать способ тестирования (вкладка «Настройка теста»);
4)
бинаризовать признаки – преобразовать количественные и номи-
нальные переменные в бинарные переменные, так как метод логического
анализа данных работает только с бинарными переменными (вкладка
«Бинаризация»);
5)
построить опорное множество признаков, по которому можно раз-
личить наблюдения двух классов (вкладка «Опорное множество»);
6)
построить логические закономерности для каждого класса (вклад-
ка «Закономерности»);
7)
построить классификатор, на основе которого будет приниматься ре-
шение о принадлежности к конкретному классу (вкладка «Классификатор»);
8)
проверить полученный классификатор на тестовой выборке,
т. е. получить и проанализировать результаты классификации (вкладка
«Тестирование»).
Следует отметить, что в данной программной системе возможны три
способа тестирования (вкладка «Настройка теста»):
Первый способ. Использование обучающей выборки, т. е. все ис-
ходные данные применяют как для обучения, так и для тестирования.
Второй способ. Процентное разделение, т. е. исходная выборка раз-
деляется на две части: обучающую и тестовую. Процент обучающей выборки задается в интервале от 1 до 100. Процент тестовой выборки вычисляется программой как разность между 100 и процентом обучающей выборки.
Третий способ. Кросс-проверка в том случае, если множество ис-
ходных данных представляет относительно небольшую выборку наблюдений. Наиболее часто использующийся метод кросс-проверки –
k-областной
метод статистики. Этот метод заключается в случайном делении выборки
на
k приблизительно одинаковых подмножеств. Одно из этих подмножеств
помечается как тестовое множество, модель строится на (
ствах, а затем тестируется на
k-м. Этот процесс повторяется k раз, каждый
k–1) подмноже-
– 117 –

раз выбирается новое тестовое множество, затем средняя точность выводится как мера качества используемого метода. Случай
k-областей называ-
ется методом перочинного ножа (или поочередного пропуска), если число
k берется равным количеству наблюдений в выборке, т. е. тестовое множе-
ство состоит всегда только из одного наблюдения. Точность классификации определяется простым отношением верно классифицированных
наблюдений при тесте [47, 100].
В результате выполнения процедуры бинаризации исследователь видит общее число исходных переменных и полученное общее число бинарных переменных. Также при выделении
конкретного признака в листе признаков определяются его тип переменной, количество бинарных переменных для данного признака и конкретные значения порогов. Перед началом
процедуры бинаризации исследователь может задавать самостоятельно
число порогов для количественных переменных, регулируя общее число
бинарных переменных.
Осуществляя поиск опорного множества, исследователь устанавли-
вает минимальное число различий между наблюдениями
двух классов,
т. е. количество признаков, по которым они должны отличаться, и ищет
опорное множество для заданного числа различий. В результате в листе
признаков можно посмотреть все признаки, которые будут участвовать
в классификации. Также указывается общая мощность множества признаков, т. е. количество переменных, участвующих в классификации. Варьируя число
различий между наблюдениями двух классов, получают разные
наборы признаков, участвующие в классификации.
При поиске закономерностей исследователем проводится следующее: выбирается максимальное число положительных и отрицательных
закономерностей, которые необходимо построить; устанавливается количество термов в закономерности, по которым должны отличаться положительные наблюдения от отрицательных; устанавливается допуск, показывающий число наблюдений другого
класса, которые захватывает закономерность; указывается максимальное количество правил, которыми может
покрываться любое наблюдение обучающей выборки. В результате работы
метода для каждой найденной закономерности указываются количество
наблюдений своего и другого классов, которые она захватывает, степень
данной закономерности.
При построении классификатора выбирается необходимое количество закономерностей, указываются пороги информативности для каждого класса. По желанию исследователя приводятся все закономерности,
имеется возможность сохранить полученную модель в текстовый редактор (рис. 6.3).
– 118 –

Рис. 6.3. Вкладка «Классификатор» программной системы
Помимо самой процедуры классификации определяется важность
каждого признака. Эта информация может быть использована исследователем для уменьшения количества переменных в задаче путем удаления
признаков, не участвующих при построении закономерностей.
При выполнении тестирования определяются результаты классификации с учетом построенного классификатора. Сначала выбираются веса
для классов положительных и отрицательных наблюдений. Сумма весов
равна 1; поэтому достаточно задать вес для класса отрицательных наблюдений из интервала от 0 до 1 – программная система автоматически вычислит вес для другого класса. Результаты классификации для каждого из
классов указываются в полях «Точность». Также результаты классификации приводятся в итоговой таблице: первый столбец – номер наблюдения
в экзаменующей выборке; второй столбец –
отрицательного класса, покрывающих наблюдение; третий столбец – число
закономерностей положительного класса, покрывающих наблюдение; четвертый столбец – класс, который определил метод логического анализа
данных; пятый столбец – реальный класс (рис. 6.4). Итоговую таблицу
можно сохранить в целях анализа полученных результатов.
количество закономерностей
– 119 –

Рис. 6.4. Результаты классификации
Данная программная система решает задачи классификации с высокой точностью. Задача может иметь произвольную входную размерность,
но количество выходов должно быть равно 1. Если в задаче больше выходов, необходимо декомпозировать данную задачу на несколько задач.
6.2. РЕЗУЛЬТАТЫ ЭКСПЕРИМЕНТАЛЬНЫХ ИССЛЕДОВАНИЙ
МЕТОДА ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И РАЗРАБОТАННЫХ ДЛЯ НЕГО
МОДИФИКАЦИЙ НА ПРАКТИЧЕСКИХ ЗАДАЧАХ КЛАССИФИКАЦИИ
В монографии рассматриваются две задачи классификации, взятые
из репозитория машинного обучения UCI, и задача прогнозирования
осложнений инфаркта миокарда (фибрилляция желудочков, фибрилляция
предсердий, отек легких, разрыв сердца и летальный исход).
Приводится описание задачи классификации результатов радарного
сканирования ионосферы [217]. Система радаров, с помощью которой
собраны данные, состоит из фазированной антенной решетки, включающей 16 высокочастотных
антенн с общей передаваемой мощностью поряд-
– 120 –
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
