Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Модификации метода логического анализа данных для задач классификации. Монография.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Это есть мера информационного выигрыша – количество информа-



ции об исходном делении выборки на классы k и не k, которое содержится в закономерности φ.
Закономерность φ является закономерностью по энтропийному кри-
XIGain
терию информативности, если
большом G
.
0
, > G0 при заданном достаточно
k
Особенностью энтропийного критерия является завышение информа­тивности малых закономерностей; статистический критерий в данном случае работает лучше. На практике, как правило, используют энтропийный крите­рий информативности, так как он проще с точки зрения его вычисления.

1.2. АЛГОРИТМЫ ПОИСКА ЗАКОНОМЕРНОСТЕЙ В ФОРМЕ КОНЪЮНКЦИЙ

Информативные закономерности служат исходными данными для построения логических алгоритмов классификации. Множество предика­тов, в котором следует искать информативные закономерности, называют пространством поиска.
Пространство поиска описывается закономерностями в виде различ­ных эталонных форм.
Параметрическое семейство шаров:
, (1.3)
, rxxx
00
где ρ(x, x0) – метрика в пространстве наблюдений X.
Параметрами являются центр шара x
, его радиус r0, и, вообще гово-
0
ря, сама функция расстояния ρ. В качестве центров берут либо обучающие наблюдения, либо центры кластеров, найденные, скажем, EM-алгоритмом. Наиболее информативны шары, внутрь которых попадают наблюдения пре­имущественно одного класса. Радиусы шаров можно подбирать аналогично выделению зон: формируется множество (ℓ − 1) пороговых значений, по- разному разделяющих выборку, и
из них выбирается такое значение радиу-
са, при котором достигается максимум информативности предиката (1.3).
Функция расстояния ρ часто задаётся как линейная комбинация эле­ментарных метрик по некоторому набору признаков },...,1{ n
:

wj
,
xfxfxx,
jjw
где набор ω и коэффициенты αj предполагается оптимизировать по выборке.
– 11 –
Преимущество шарообразных закономерностей в том, что они особен-

x
но хорошо интерпретируются, если число признаков в наборе ω невелико. Действительно, если наблюдение x покрывается такой закономерностью, то мы можем говорить о том, что наблюдение x относится к классу c потому, что оно близко к эталонному наблюдению x купности признаков ω. Такого рода объяснения хорошо воспринимаются экспертами в тех предметных областях, где распространён прецедентный стиль мышления: в медицине, геологии, социологии, юриспруденции и др.
На закономерностях данного типа основаны алгоритмы вычисления оценок, подробно рассматриваемые в п. 1.3.4 данной работы.
Параметрическое семейство полуплоскостей:
, лежащему в классе c, по сово-
0
xx , (1.4)
где
и смещение ω ω и ω преимущественно одного класса.
случаях, когда среди компонент вектора ω мало ненулевых, т. е. когда раз­деляющие гиперплоскости проводятся в подпространствах небольшой размерности. Поиск информативных наборов признаков },...,1{ n , ана-
логичных конъюнкциям и шарам, сводится вариантов. Линейные комбинации большого числа признаков, как правило, трудно интерпретировать.
,x – скалярное произведение в пространстве наблюдений X.
Параметрами являются направляющий вектор гиперплоскости ω
. Максимизация информативности сводится к подбору таких
0
, при которых по одну сторону гиперплоскости лежат наблюдения
0
Закономерности вида (1.4) поддаются интерпретации только в тех
Параметрическое семейство областей, описываемых ядром:
φ ,

,
Kxx K
0
к комбинаторному перебору
00
,
где K: X × X → R – функция ядра (kernel function), x метры предиката.
Легко видеть, что шары и полуплоскости являются частными приме­рами ядер. Функция K может свободно выбираться, исходя из любых априорных соображений. Если таковых в конкретной прикладной задаче не имеется, единственное, что остаётся, – организовать банк ядер, содер­жащий некоторое конечное множество метрик, скалярных произведений и других «потенциально информативных закономерностей должна включать в себя цикл перебора по банку ядер.
полезных» функций. Тогда процедура поиска
– 12 –
0
X и K
R – пара-
0
Ядра, зависящие только от небольшого числа признаков, проще под-
x


даются содержательной интерпретации, но для их поиска приходится организовывать эффективный перебор подмножеств признаков.
Параметрическое семейство гиперпараллелепипедов:
β

Если все исходные признаки являются бинарными, то пространство поиска образуется самими признаками и всевозможными булевыми функ­циями, которые из этих признаков можно построить. Такие булевые функ­ции будут иметь форму гиперпараллелепипедов, для построения которых достаточно построить лишь дизъюнктивные нормальные формы (ДНФ), поскольку любую булеву функцию можно записать в виде ДНФ го, в качестве закономерностей можно брать только конъюнкции призна­ков и их отрицаний, а дизъюнкцию реализовать как корректирующую опе­рацию, например как голосование по большинству или старшинству.
Логические закономерности часто ищут в виде конъюнкций неболь­шого числа элементарных высказываний. Именно в такой форме люди привыкли выражать свой житейский
На практике чаще встречаются случаи, когда наблюдения описыва­ются разнотипными признаками: номинальными, порядковыми, количе­ственными. Тогда пространством поиска становятся всевозможные бинар­ные функции от исходных признаков. Процесс построения таких функций называют бинаризацией исходной информации. Способы бинаризации по­дробно рассмотрены в п. 3.2 данной работы.
После бинаризации признаков в качестве брать только конъюнкции этих признаков или их отрицаний. Пусть B – ко­нечное множество предикатов (термов), которые называются элементар­ными. Рассмотрим множество конъюнкций с ограниченным числом термов из B:

Количество термов k в конъюнкции называется её рангом (степе­нью). Конъюнкции небольшой степени обладают полезным преимуще­ством, так как они имеют вид привычных для человека логических выска­зываний и легко поддаются интерпретации.
Процедура поиска наиболее информативных конъюнкций в общем случае требует полного перебора. Число допустимых конъюнкций может оказаться настолько большим неосуществимым. На практике используют различные эвристики для со-
 
,,,|
dfxd
 
и профессиональный опыт.
, что полный перебор станет практически
11
.
. Более то-
закономерностей можно
.

kkK
KkBxBxBxBxBxBK
– 13 –
кращённого целенаправленного поиска конъюнкций, близких к оптималь­ным. Идея всех этих методов заключается в том, чтобы не перебирать огромное количество заведомо неинформативных термов.
Далее приведем обзор наиболее известных алгоритмов синтеза конъюнкций [17].
Наиболее простой из них – градиентный алгоритм синтеза конъюнк­ций. Суть алгоритма заключается в том, что каждой конъюнкции φ ставит­ся в соответствие её окрестность – множество конъюнкций V(φ), получае­мых из φ путём элементарных модификаций: добавлением, удалением или модификацией одного из термов конъюнкции.
Начиная с заданной конъюнкции φ следовательность конъюнкций φ щая конъюнкция φ
выбирается из окрестности предыдущей Vt = V(φ
t
, φ1, …, φt, …, в которой каждая следую-
0
(например, пустой) строится по-
0
t−1
)
по критерию максимума информативности (1.2).
Конъюнкции с высокой информативностью могут допускать много ошибок, хотя они считаются наиболее перспективными с точки зрения дальнейших модификаций. Поэтому на каждом шаге t выделяется наилуч-
*
шая конъюнкция, удовлетворяющая дополнительному условию E и в общем случае не совпадающая с наиболее перспективной φ
.
t
k(φt
) < ε
Итерационный процесс сходится за конечное число шагов к некото­рой локально неулучшаемой конъюнкции, так как множество конъюнкций, различно классифицирующих выборку, конечно.
Ясно, что ни о каком градиенте в прямом смысле слова речь не идёт. Данный алгоритм, по аналогии с градиентным спуском, выбирает на каж­дой итерации наилучшую из ближайших точек
пространства поиска.
Критерий информативности и функция окрестности являются пара­метрами алгоритма. При формировании окрестности можно применять различные эвристики [17]:
1) ограничивать максимальный ранг конъюнкций;
2) разрешать только добавления термов;
3) чередовать серии добавлений термов с сериями удалений;
4) разрешать модификацию нескольких термов одновременно.
Изменяя параметры градиентного алгоритма синтеза конъюнкций, можно получать различные процедуры поиска
или улучшения инфор­мативных конъюнкций. Ниже приведены несколько вариантов этого алгоритма.
«Жадный» алгоритм синтеза конъюнкции использует только опе­рацию добавления термов. Начальным приближением является конъ­юнкция, не содержащая термов. Недостаток «жадной» стратегии в том, что она может уводить в сторону от глобального максимума информа­тивности, поскольку терм, найденный на i
-м шаге, перестаёт быть опти-
– 14 –
мальным после добавления последующих термов. Тем не менее на неко­торых практических задачах данная эвристика способна находить хоро­шие закономерности.
Случайный локальный поиск [180, 219] начинает с пустой конъюнк­ции, но применяет весь набор возможных модификаций. Это преимуще­ство по сравнению с «жадным» алгоритмом, так как появляется возмож­ность удалять и заменять неоптимальные
термы. Недостатком является наличие, как правило, очень большой мощности окрестности |V(φ)|, что за­труднит перебор всех допустимых модификаций. Для устранения недо­статка в случайном локальном поиске строится не вся окрестность, а толь­ко некоторое её случайное подмножество. Максимальная допустимая мощность этого подмножества задаётся как дополнительный параметр алгоритма.
С целью
улучшения конъюнкции, построенной «жадным» наращи­ванием или случайным локальным поиском, к ней применяют процедуры стабилизации и редукции.
Основной идеей процедуры стабилизации является попытка улучше­ния конъюнкции путем удаления или замены по одному терму. В отличие от случайного локального поиска перебираются все возможные удаления и за­мены. Модификации производятся все время, пока
идет возрастание инфор­мативности конъюнкции. В результате стабилизации найденные конъюнкции часто сходятся к одним и тем же локальным максимумам информативности, что положительно сказывается на интерпретируемости правил. Также проце­дура стабилизации рекомендуется для настройки порогов в термах.
Целью процедуры редукции является повышение обобщающей спо-
собности правила. Ее отличие от стабилизации заключается
в том, что
термы только удаляются, а информативность вычисляется по независимой
k
контрольной выборке X
, составленной из наблюдений, не участвовавших
в построении конъюнкции. Контрольную выборку формируют до начала обучения, выделяя случайным образом из массива исходных данных при­мерно 25 % наблюдений. При этом наблюдения разных классов распреде­ляются в той же пропорции, что и во всей выборке. Смысл редукции в том, чтобы проверить, не является ли найденная
конъюнкция избыточно слож­ной, и либо упростить её, либо вовсе признать неудачной и удалить из классификатора. Упрощение повышает общность закономерности, по­скольку множество покрываемых ей наблюдений расширяется. Недостаток редукции заключается в том, что она оставляет значительную долю дан­ных для контроля, уменьшив представительность обучающей выборки. Однако при приемлемом выборе соотношения ℓ следующей редукцией по X
ℓ
по X
U Xk без редукции.
k
может давать лучшие результаты, чем поиск
/k поиск правил по Xℓ c по-
– 15 –
Дальнейшим усовершенствованием случайного локального поиска на основе идей дарвиновской эволюции является генетический алгоритм синтеза конъюнкций. Основное отличие генетического алгоритма от слу­чайного локального поиска в том, что на каждом шаге отбирается не одна, наилучшая конъюнкция, а целое множество лучших конъюнкций, называ­емое популяцией. Из них порождается большое количество конъюнкций­потомков
с помощью двух генетических операций – скрещивания и мута­ции. Скрещивание – образование новой конъюнкции путём обмена терма­ми между двумя членами популяции. В роли мутаций выступают операции добавления, замещения и удаления термов.
Следует отметить, что генетические алгоритмы отличаются большим разнообразием всевозможных эвристик, заимствованных непосредственно из живой природы. Например, в генетический алгоритм легко
встроить процедуру селекции или искусственного отбора, породив потомков только от наилучших конъюнкций или задав распределение вероятностей на по­пуляции так, чтобы вероятность стать родителем увеличилась с ростом информативности. Эти и другие эвристики описаны в литературе по гене­тическим алгоритмам [19, 31, 95, 148].
Для поиска конъюнктивных закономерностей можно также приспо-
собить методы отбора признаков,
описанные в [34]: метод последователь­ного сокращения признаков (алгоритм Del [200]), метод последовательного добавления признаков (алгоритм Add [13]), алгоритм Add–Del [33], метод случайного поиска с адаптацией (алгоритм СПА [56]). Для этого достаточ­но заменить в них функционал качества: вместо минимизации средней ошибки искать максимум информативности.

1.3. АНАЛИЗ ОСНОВНЫХ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ И СПОСОБОВ ИХ ПОСТРОЕНИЯ

1.3.1. Решающие списки

Решающий список [193] – логический алгоритм классификации a: X → Y, который задается набором закономерностей φ классам k
, …, kT соответственно, и вычисляется согласно алгоритму 1 [17]:
1
(x),...,φT(x), приписанных к
1
Алгоритм 1. Классификация наблюдения решающим списком
t = 1.
1.
Если φ
2.
(x) = 1, то вернуть kt;
t
иначе t = t + 1.
Если t ≤ T, то на 2;
3.
иначе вернуть k
.
0
– 16 –
Согласно алгоритму 1 при классификации наблюдения x закономер-




ности проверяются последовательно для всех t = 1,…,T, пока для некоторо­го t не выполнится условие φ
t
(x) = 1. Ответ k0 означает отказ алгоритма от
k
классификации наблюдения x. Часто такие наблюдения приписывают классу, имеющему минимальную цену ошибки.
Для формирования решающего списка используется алгоритм 2 [17].
Алгоритм 2. «Жадный» алгоритм построения решающего списка:
1.
2.
3.
4.
ошибок:
U = X Для всех t = 1, …, T k = k Найти наиболее информативное правило при ограничении на долю
ℓ
.
.
max
– выбрать класс, для которого будет строиться правило.
t
maxarg
t
Ik(φ, U), где

,: EUE
k
max
.
Если I
5.
Исключить из выборки наблюдения, выделенные правилом φ
6.
(φt, U) < I
k
, то выход.
min
:
t
xUxU
t
.
0:
7. Если |U| ≤ ℓ0, то выход из алгоритма, в котором Xℓ – обучающая
выборка, Ф – семейство предикатов, из которого выбираются закономер-
T
ности, нимальная допустимая информативность правил в списке, мальная допустимая доля ошибок на обучающей выборке,
– максимальное допустимое число правил в списке, I
max
ℓ
E
max
– максималь-
0
ное допустимое число отказов.
На каждой итерации алгоритм 2 строит ровно одно правило φ крывающее максимальное число наблюдений некоторого класса нимальное число наблюдений других классов. Для этого производится по­иск наиболее информативного правила на шаге 4 алгоритма, допускающе­го относительно мало ошибок на обучающей выборке. После построения правила φ реходит к поиску следующего правила φ В итоге выборка оказывается покрытой множествами вида {
покрытые им наблюдения удаляются из выборки и алгоритм пе-
t
по оставшимся наблюдениям.
t+1
x: φ
По этой причине решающий список называют также покрывающим набо­ром закономерностей, или машиной покрывающих множеств [212].
В алгоритме 2 одновременно работают три критерия останова:
построение заданного числа правил T
покрытие всей выборки, за исключением не более ℓ
невозможность найти правило с информативностью выше I
max
;
наблюдений;
0
остатку выборки.
Для нахождения баланса между точностью классификации обучаю­щей выборки и длиной списка в алгоритме используется параметр
– ми-
min
– макси-
, по-
t
k
и ми-
t
(x) = 1}.
t
по
min
E
max
.
– 17 –
Уменьшение E
приводит к снижению числа ошибок на обучении, но
max
усложняет отбор правил, способствует уменьшению числа наблюдений, покрываемых отдельными правилами, и увеличению длины списка. Пра­вила, покрывающие слишком мало наблюдений, статистически не надёж­ны, в них может быть много ошибок на независимых контрольных данных. Таким образом, увеличение длины списка при одновременном малом
по-
крытии правил может приводить к эффекту переобучения. Следовательно,
E
значение
должно быть примерно равно доле ошибок, которую мы
max
ожидаем получить как на обучающей выборке, так и контрольной.
E
На практике параметр
подбирается экспериментально.
max
Важным моментом алгоритма 2 является выбор класса на шаге 3. Для реализации этого предлагается два альтернативных варианта.
Первый вариант состоит в поочередном построении набора правил для каждого класса. Классы берутся в порядке убывания важности или це­ны ошибки. Преимущество данного варианта в том, что правила оказыва­ются независимыми – в пределах
своего класса их можно переставлять
местами. Это улучшает их интерпретируемость.
Второй вариант заключается в совмещении шагов 3 и 4 алгоритма и выборе пары (φ
, kt), для которой информативность Ikt(φt, U) максималь-
t
на. Тогда правила различных классов могут следовать неупорядоченно. Доказано, что списки такого типа реализуют более широкое множество функций [193]. При этом улучшается разделяющая способность списка, но ухудшается его интерпретируемость. На практике первый вариант часто оказывается более удобным.
Особенностью решающих списков является решение проблемы про­пущенных данных. Если для вычисления правила то считается, что φ
(x) = 0, и обработку наблюдения x берут на себя следу-
t
φt не хватает данных,
ющие правила в списке. Это относится и к стадии обучения, и к стадии классификации.
К преимуществам решающих списков можно отнести:
интерпретируемость правил;
возможность обработки данных с пропусками.
Недостатки решающих списков следующие:
список может не построиться, если множество предикатов выбрано
неудачно. При этом возможен высокий процент отказов от классификации;
список плохо интерпретируется, если он длинный и правила раз-
личных классов следуют неупорядоченно;
каждое наблюдение классифицируется только одним правилом,
что не позволяет правилам компенсировать ошибки друг друга. Данный недостаток устраняется путём голосования правил.
– 18 –

1.3.2. Решающие деревья

Решающее дерево – это логический алгоритм классификации, отли­чающийся от решающего списка тем, что при синтезе все конъюнкции строятся одновременно.
Деревом ленной вершиной
называется конечный связный ациклический граф с выде-
v
V, называемой корневой вершиной (корнем) дерева
0
[28]. Вершина, не имеющая выходящих рёбер, называется терминальной,
или листом. Остальные вершины называются внутренними. Дерево назы­вается бинарным, если из любой его внутренней вершины выходят два ре­бра. Выходящие рёбра связывают каждую внутреннюю вершину с левой
L
дочерней вершиной
и с правой дочерней вершиной Rv.
v
Бинарное решающее дерево – это алгоритм классификации, задаю­щийся бинарным деревом, в котором каждой внутренней вершине приписан предикат βv: X → {0, 1}, каждой терминальной вершине v
k
приписано имя класса
. При классификации наблюдения xX он прохо-
v
vV
V
дит по дереву путь от корня до некоторого листа в соответствии с алго­ритмом 3 [17]:
Алгоритм 3. Классификация наблюдения решающим деревом
v := v
1.
Пока вершина v внутренняя:
2.
если β
иначе
Вернуть k
3.
.
0
(x) = 1, то v := Rv (переход вправо);
v
v := L
(переход влево).
v
.
v
Основными элементами алгоритмов синтеза решающих деревьев яв­ляются также: выбор критерия ветвления для поиска атрибута во внутрен­нюю вершину решающего дерева, выбор критерия остановки для прекра­щения ветвления с целью получения терминальных вершин, определение имени класса, приписываемого листу.
Признак обладает свойством полной отделимости, если логическое правило, построенное на базе этого ство наблюдений на два подмножества: подмножество жит наблюдения только одного класса; подмножество наблюдения только одного класса, и классы наблюдений из Признак обладает свойством частичной отделимости, если подмножество или подмножество
B содержит наблюдения только одного класса [28].
признака, разделяет исходное множе-
A, которое содер-
B, которое содержит
A и B различны.
A
Большая часть эвристических алгоритмов синтеза решающих дере­вьев предпочитают признаки со свойством полной или частичной отдели­мости. Считается, что такие признаки формируют решающее правило, ко­торое допускает минимальное число ошибок на наблюдениях экзаменую­щей выборки [132, 136].
– 19 –
В зависимости от выбора алгоритма разбиения по данным наблюде-
ниям обучающей выборки может быть построено несколько решающих деревьев, позволяющих верно классифицировать эти наблюдения. В этом случае необходимо выбрать решающее дерево, которое лучше остальных позволит правильно классифицировать наблюдения, не участвовавшие в обучении. Как правило, таким деревом считают наиболее простое реша­ющее дерево
, точное на всех обучающих наблюдениях.
На практике применяют различные эвристики, нацеленные на по­строение как можно более простого дерева, обладающего как можно луч­шим качеством классификации. Придумано огромное количество различ­ных алгоритмов синтеза бинарных решающих деревьев по обучающей выборке.
Сначала следует рассмотреть простой «жадный» алгоритм ID3, осно­ванный на принципе «разделяй
и властвуй» [208].
Идея алгоритма заключается в последовательном разбиении выборки на две части до тех пор, пока в каждой части не окажутся наблюдения только одного класса. Проще всего записать этот алгоритм в виде рекур­сивной процедуры LearnID3, которая строит дерево по заданной подвы­борке
U [17]:
Алгоритм 4. Алгоритм синтеза бинарного ID3:
Процедура LearnID3 (U).
1.
Если все наблюдения из U лежат в одном классе k, то:
2.
создать новый лист
k
= k;
v
вернуть (
v).
v;
Найти предикат с максимальной информативностью:
3.
4.
Разбить выборку на две части U = U
= {xU : β(x) = 0};
U
0
= {xU : β(x) = 1}.
U
1
Если U
5.
= Ø или U1 = Ø, то:
0
U1 по предикату β:
0
создать новый лист v;
= класс, в котором находится большинство наблюдений
k
v
из U.
Иначе:
6.
создать новую внутреннюю вершину v;
:= β;
β
v
:= LearnID3 (U0), т. е. построим левое поддерево;
L
v
:= LearnID3 (U1), т. е. построим правое поддерево.
R
v
Вернуть (v).
7.
– 20 –
β arg max β,IU
.
β

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]