Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Модификации метода логического анализа данных для задач классификации. Монография.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
1. Мера разделения. Обозначим x


+
(x-) – среднее значение признака
x, полученное по множеству всех положительных (отрицательных) наблюдений в выборке. Допустим, что x аналогично), тогда обозначим x* – среднее из x жительных (отрицательных) наблюдений с x ≥ x* (x < x*) – n
+
≥ x- (при x+ < x- обрабатывается
+
и x-. Пусть число поло-
+
-
(n
x
). Заме-
x
ним численные переменные x на бинарные переменные ξ, которые равны «1» для x ≥ x* и «0» в противном случае. Количество пар, состоящих из положительных и отрицательных наблюдений, которые могут быть
+
разделены в соответствии со значениями ξ, превысит n
+
мера разделения σ
x
= n
-
n
, тем больше положительных/отрицательных
x
x
-
n
. Чем больше
x
x
пар из наблюдений могут быть разделены по значениям, принимаемым признаком x.
2. Огибающий эксцентриситет. Обозначим l
+
x
и u
+
-
(l
x
x
и u
-
) мини-
x
мальное и максимальное значение признака x среди положительных (отри-
+
цательных) наблюдений в выборке. Пересечение интервалов [l
-
и [l
-
, u
] при обозначении границ положительных и отрицательных клас-
x
x
x
, u
+
]
x
сов основывается на значениях единственного признака x. Будем обозна­чать частичное перекрытие по x индексом
x

lluu
,max,min
xxxx
.
lluu
,min,max
xxxx
Ясно, что ω
имеет значение между «0» и «1» и чем меньше его зна-
x
чение, тем более значим признак x при разделении положительных и отри­цательных наблюдений.
3. Системная энтропия. Информационная теория обеспечивает чис-
ленную оценку, выражающую неразделимость положительных и отрица­тельных наблюдений в выборке, основанной на значениях одного из при­знаков. Пусть m – количество наблюдений в выборке, t – целочисленная
аппроксимация
. Упорядочим наблюдения в выборке в соответствии со
m
значениями переменной x и разделим их на (t + 1) приблизительно равных подвыборок последовательных наблюдений S
, S1, …, St. Допуская, что p
0
и qj – количество положительных и отрицательных наблюдений соответ-
p
ственно в S
, частота положительных наблюдений в Sj будет равна
j
а энтропия {S
, S1, …, St} равна
0
i
qp
ii
t
1
x
t
1
i
0
p
i
 
qp
 
ii
p
i
 
qp
 
ii
q
i
 
qp
 
lnln
ii
q
 
i
.
qp
ii
j
,
– 111 –
Это число называется энтропией признака x и принимает значения

между «0» и «ln2». Ясно, что переменные, которые хорошо «разделяют» по- ложительные и отрицательные наблюдения, будут иметь низкую энтропию.
4. Корреляция Пирсона. Коэффициент корреляции Пирсона π
x
между вектором значений признака x и выходным вектором о (компоненты которого равны «1» для положительных наблюдений и «0» для отрица­тельных) указывает на важность этого признака: чем выше абсолютное значение этого коэффициента, тем более важен признак.
5. Корреляция сигнал-шум. Общая корреляция «сигнал-шум» τ
x
обеспечивает дополнительное измерение разбиения и определяется следу­ющим способом. Пусть x и пусть σ
+
и σ- соответствуют стандартным отклонениям значений по x
+
и x- определены по критерию «мера разделения»
на положительном и отрицательном наборе данных. Отношение
x
xx
называется корреляцией «сигнал-шум» признака
x с выходом.
Основанное на наборе правил ранжирование признаков по их значи­мости служит в качестве основного принципа для итеративной последова­тельности шагов предлагаемого алгоритма. Начиная с исходного пула мы определяем каждый шаг процедуры формирования нового пула, состояще­го приблизительно из половины признаков, имеющих наибольший ранг, в соответствии с ранжированием, базирующимся
на наборе правил.
Точность построенного на новом пуле классификатора оценивается на тестовом множестве:
1.
Если находится допустимое качество, т. е. если точность прибли-
зительно равна родительской точности, новый пул заменяет предыдущий пул – и процесс продолжается.
2.
Если точность снижается относительно точности родительского
пула, новый пул не является непригодным автоматически. Необходимо проверить его на модифицированном наборе правил. Модификация набора правил с целью его наилучшего представления может быть достигнута варьированием (обычно увеличением) параметров покрытия и степени паттерна.
3.
Если набор правил, классификационная мощность которого име-
ет допустимую точность, найден, тогда новый пул принят и процесс продолжается.
4.
Если не определено наилучшее представление набора правил, то-
гда новый пул улучшается включением 75 % признаков из родительского пула (87,5 или 93,75 %).
– 112 –
5. Если этот процесс не создает пул, который определяет набор пра-
вил с допустимым качеством, тогда процесс останавливается на родитель­ском пуле, как окончательном.
В некоторых случаях требуется, чтобы обеспечивалась робастность, т. е. количество признаков в конечном пуле не должно быть ниже установ­ленного порога. В этих случаях процесс останавливается, прежде чем
ко-
личество признаков получится слишком маленьким.

5.4. АЛГОРИТМИЧЕСКАЯ ПРОЦЕДУРА ПОЛУЧЕНИЯ УСЕЧЕННОГО НАБОРА ПРИЗНАКОВ

Одним из подходов для отбора признаков является разработанная ал­горитмическая процедура получения усеченного набора, которая основана на оценке важности признаков [41, 45].
Оценка важности признака – это оценка частоты его включения в за­кономерности, задействованные в классификаторе [187]. Таким образом, чем чаще признак встречается в получаемых закономерностях, тем он бо­лее важен. А те
признаки, которые не встречаются или почти не участвуют
в построении закономерностей, важными не являются.
Алгоритмическая процедура получения усеченного набора призна­ков состоит из четырех этапов.
Первым этапом процедуры получения усеченного набора признаков является проведение классификации на полном наборе признаков с целью определения важности каждого.
Второй этап – установление исследователем порога важности,
отно-
сительно которого можно судить о важности конкретного признака.
Третий этап – ранжирование признаков по важности и выделение тех, значение важности которых оказалось ниже установленного порога.
Четвертый этап состоит в исключении выделенных на третьем этапе признаков из рассмотрения. Оставшиеся составляют усеченный набор. Та­ким образом, исследователь, варьируя порог важности, получает различ­ные
усеченные наборы признаков, которые в дальнейшем используются на
этапе формирования закономерностей.
Помимо важности, определяемой для каждого признака и показы­вающей его роль в конкретной задаче, исследуют стимулирующую и бло­кирующую природу некоторых признаков для классификации. Если существует признак, значение которого равно только 1 для положитель­ных закономерностей, включающих этот признак, и 0
для всех отрица-
– 113 –
тельных закономерностей, включающих этот признак, то данный признак называется стимулятором. Признак-блокатор возникает в противном слу­чае. Действительно, каждая положительная закономерность, которая включает данный признак, требует, чтобы блокатор был равен 0, в то время как отрицательная закономерность требует, чтобы блокатор рав­нялся 1.
Рассмотрены основные недостатки в исходной выборке данных и приведены методы
, позволяющие избежать проблем обработки данных при наличии этих недостатков. Предложена алгоритмическая процедура получения усеченного набора признаков для формирования опорного множества, основанная на исключении неважных признаков методом ло­гического анализа данных, что позволяет сократить количество признаков, участвующих при формировании закономерностей, тем самым снижает сложность задачи.
– 114 –
6. ПРОГРАММНАЯ РЕАЛИЗАЦИЯ МЕТОДА
И ЭКСПЕРИМЕНТАЛЬНЫЕ ИССЛЕДОВАНИЯ
НА ПРАКТИЧЕСКИХ ЗАДАЧАХ
6.1. ПРОГРАММНАЯ РЕАЛИЗАЦИЯ
МЕТОДА ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ
И ОСОБЕННОСТИ ИСПОЛЬЗОВАНИЯ ПРОГРАММНОЙ СИСТЕМЫ
Метод логического анализа данных реализован в виде программной системы [46, 52, 66]. Эта программная система написана на языке про­граммирования Delphi с использованием среды быстрого программирования приложений Delphi 2009 [12, 88, 92, 103], что позволило наиболее полно ис­пользовать возможности, предоставляемые объектно-ориентированным под­ходом в программировании, а также наиболее качественно разработать графический интерфейс пользователя, стандартный для приложений, рабо­тающих под
Структурная схема программной системы приведена на рис. 6.1.
управлением операционной системы Windows.
Интерфейс
Классификация
Рис. 6.1. Структурная схема программной системы
Алгоритмы
оптимизации
Целевые функции
и ограничения
Разработанное программное обеспечение состоит из трех модулей, реализующих метод логического анализа данных, и модуля «Интерфейс», который позволяет осуществить взаимодействие пользователя со средой.
Краткое описание модулей:
1.
Модуль «Интерфейс» позволяет исследователю выбирать загружа-
емые данные, устанавливать самостоятельно или выбирать параметры, необходимые для работы метода, сохранять и просматривать результаты работы метода для конкретной задачи.
– 115 –
2. Модуль «Классификация» включает в себя алгоритмы реализации
всех этапов метода логического анализа данных: загрузка данных, выбор признаков, настройка теста, бинаризация признаков, нахождение опорного множества признаков, формирование закономерностей, построение клас­сификатора, тестирование и сохранение полученных результатов.
3.
Модуль «Целевые функции и ограничения» содержит целевые
функции и ограничения оптимизационных моделей для нахождения опор­ного множества и закономерностей.
4.
Модуль «Алгоритмы оптимизации» включает в себя алгоритмы
оптимизации, служащие для нахождения оптимальных решений при поис­ке опорного множества и закономерностей.
Стартовое окно программной системы выглядит следующим образом (рис. 6.2).
Рис. 6.2. Стартовое окно программной системы
– 116 –
В данной программной системе – восемь вкладок, которые последо­вательно реализуют метод логического анализа данных. Название вкладок сообщает исследователю о той операции, которая выполняется на данной вкладке.
Для того чтобы реализовать процедуру классификации, необходимо выполнить ряд шагов в программной системе, последовательно переходя от одной вкладки к другой [100]:
1)
загрузить данные, в итоге программа будет работать с таблицами
формата *.dbf (вкладка «Выборка»);
2)
выбрать признаки, которые будут участвовать в процедуре клас-
сификации, и классификационный признак (вкладка «Признаки»);
3)
выбрать способ тестирования (вкладка «Настройка теста»);
4)
бинаризовать признаки – преобразовать количественные и номи-
нальные переменные в бинарные переменные, так как метод логического анализа данных работает только с бинарными переменными (вкладка
«Бинаризация»);
5)
построить опорное множество признаков, по которому можно раз-
личить наблюдения двух классов (вкладка «Опорное множество»);
6)
построить логические закономерности для каждого класса (вклад-
ка «Закономерности»);
7)
построить классификатор, на основе которого будет приниматься ре-
шение о принадлежности к конкретному классу (вкладка «Классификатор»);
8)
проверить полученный классификатор на тестовой выборке,
т. е. получить и проанализировать результаты классификации (вкладка «Тестирование»).
Следует отметить, что в данной программной системе возможны три способа тестирования (вкладка «Настройка теста»):
Первый способ. Использование обучающей выборки, т. е. все ис-
ходные данные применяют как для обучения, так и для тестирования.
Второй способ. Процентное разделение, т. е. исходная выборка раз-
деляется на две части: обучающую и тестовую. Процент обучающей вы­борки задается в интервале от 1 до 100. Процент тестовой выборки вычис­ляется программой как разность между 100 и процентом обучающей вы­борки.
Третий способ. Кросс-проверка в том случае, если множество ис-
ходных данных представляет относительно небольшую выборку наблюде­ний. Наиболее часто использующийся метод кросс-проверки –
k-областной
метод статистики. Этот метод заключается в случайном делении выборки на
k приблизительно одинаковых подмножеств. Одно из этих подмножеств
помечается как тестовое множество, модель строится на ( ствах, а затем тестируется на
k-м. Этот процесс повторяется k раз, каждый
k–1) подмноже-
– 117 –
раз выбирается новое тестовое множество, затем средняя точность выво­дится как мера качества используемого метода. Случай
k-областей называ-
ется методом перочинного ножа (или поочередного пропуска), если число
k берется равным количеству наблюдений в выборке, т. е. тестовое множе-
ство состоит всегда только из одного наблюдения. Точность классифика­ции определяется простым отношением верно классифицированных наблюдений при тесте [47, 100].
В результате выполнения процедуры бинаризации исследователь ви­дит общее число исходных переменных и полученное общее число бинар­ных переменных. Также при выделении
конкретного признака в листе при­знаков определяются его тип переменной, количество бинарных перемен­ных для данного признака и конкретные значения порогов. Перед началом процедуры бинаризации исследователь может задавать самостоятельно число порогов для количественных переменных, регулируя общее число бинарных переменных.
Осуществляя поиск опорного множества, исследователь устанавли-
вает минимальное число различий между наблюдениями
двух классов, т. е. количество признаков, по которым они должны отличаться, и ищет опорное множество для заданного числа различий. В результате в листе признаков можно посмотреть все признаки, которые будут участвовать в классификации. Также указывается общая мощность множества призна­ков, т. е. количество переменных, участвующих в классификации. Варьи­руя число
различий между наблюдениями двух классов, получают разные
наборы признаков, участвующие в классификации.
При поиске закономерностей исследователем проводится следую­щее: выбирается максимальное число положительных и отрицательных закономерностей, которые необходимо построить; устанавливается коли­чество термов в закономерности, по которым должны отличаться положи­тельные наблюдения от отрицательных; устанавливается допуск, показы­вающий число наблюдений другого
класса, которые захватывает законо­мерность; указывается максимальное количество правил, которыми может покрываться любое наблюдение обучающей выборки. В результате работы метода для каждой найденной закономерности указываются количество наблюдений своего и другого классов, которые она захватывает, степень данной закономерности.
При построении классификатора выбирается необходимое количе­ство закономерностей, указываются пороги информативности для каждо­го класса. По желанию исследователя приводятся все закономерности, имеется возможность сохранить полученную модель в текстовый редак­тор (рис. 6.3).
– 118 –
Рис. 6.3. Вкладка «Классификатор» программной системы
Помимо самой процедуры классификации определяется важность каждого признака. Эта информация может быть использована исследова­телем для уменьшения количества переменных в задаче путем удаления признаков, не участвующих при построении закономерностей.
При выполнении тестирования определяются результаты классифи­кации с учетом построенного классификатора. Сначала выбираются веса для классов положительных и отрицательных наблюдений. Сумма весов равна 1; поэтому достаточно задать вес для класса отрицательных наблю­дений из интервала от 0 до 1 – программная система автоматически вы­числит вес для другого класса. Результаты классификации для каждого из классов указываются в полях «Точность». Также результаты классифика­ции приводятся в итоговой таблице: первый столбец – номер наблюдения в экзаменующей выборке; второй столбец – отрицательного класса, покрывающих наблюдение; третий столбец – число закономерностей положительного класса, покрывающих наблюдение; чет­вертый столбец – класс, который определил метод логического анализа данных; пятый столбец – реальный класс (рис. 6.4). Итоговую таблицу можно сохранить в целях анализа полученных результатов.
количество закономерностей
– 119 –
Рис. 6.4. Результаты классификации
Данная программная система решает задачи классификации с высо­кой точностью. Задача может иметь произвольную входную размерность, но количество выходов должно быть равно 1. Если в задаче больше выхо­дов, необходимо декомпозировать данную задачу на несколько задач.
6.2. РЕЗУЛЬТАТЫ ЭКСПЕРИМЕНТАЛЬНЫХ ИССЛЕДОВАНИЙ
МЕТОДА ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И РАЗРАБОТАННЫХ ДЛЯ НЕГО
МОДИФИКАЦИЙ НА ПРАКТИЧЕСКИХ ЗАДАЧАХ КЛАССИФИКАЦИИ
В монографии рассматриваются две задачи классификации, взятые из репозитория машинного обучения UCI, и задача прогнозирования осложнений инфаркта миокарда (фибрилляция желудочков, фибрилляция предсердий, отек легких, разрыв сердца и летальный исход).
Приводится описание задачи классификации результатов радарного сканирования ионосферы [217]. Система радаров, с помощью которой собраны данные, состоит из фазированной антенной решетки, включаю­щей 16 высокочастотных
антенн с общей передаваемой мощностью поряд-
– 120 –
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]