Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Модификации метода логического анализа данных для задач классификации. Монография.pdf
X
- •ОГЛАВЛЕНИЕ
- •ПРЕДИСЛОВИЕ
- •ВВЕДЕНИЕ
- •1. АНАЛИЗ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ
- •1.2. АЛГОРИТМЫ ПОИСКА ЗАКОНОМЕРНОСТЕЙ В ФОРМЕ КОНЪЮНКЦИЙ
- •1.3. АНАЛИЗ ОСНОВНЫХ ЛОГИЧЕСКИХ АЛГОРИТМОВ КЛАССИФИКАЦИИ И СПОСОБОВ ИХ ПОСТРОЕНИЯ
- •1.3.1. Решающие списки
- •1.3.2. Решающие деревья
- •1.3.4. Алгоритмы вычисления оценок
- •1.3.3. Алгоритмы простого и взвешенного голосования правил
- •2.1. ПРИЛОЖЕНИЯ В ОБЛАСТИ БИЗНЕСА, ЭКОНОМИКИ И ФИНАНСОВ
- •2.2. ПРИЛОЖЕНИЯ В ОБЛАСТИ МЕДИЦИНЫ И ЗДРАВООХРАНЕНИЯ
- •2.3. ПРИЛОЖЕНИЯ В ОБЛАСТИ ТЕХНИКИ
- •2.4. ПРИЛОЖЕНИЯ В ОБЛАСТИ ФИЗИКИ, ХИМИИ, БИОЛОГИИ
- •2.5. ПРИЛОЖЕНИЯ В ОБЛАСТИ ОБРАБОТКИ И РАСПОЗНАВАНИЯ ИЗОБРАЖЕНИЙ
- •3. МЕТОД ЛОГИЧЕСКОГО АНАЛИЗА ДАННЫХ И ЕГО МОДИФИКАЦИИ
- •3.1. ОПИСАНИЕ ПОДХОДА
- •3.2. БИНАРИЗАЦИЯ ПРИЗНАКОВ
- •3.3. ПОСТРОЕНИЕ ОПОРНОГО МНОЖЕСТВА
- •3.4. ФОРМИРОВАНИЕ ЗАКОНОМЕРНОСТЕЙ
- •3.5. ПОСТРОЕНИЕ КЛАССИФИКАТОРА
- •4.1. СОСТОЯНИЕ ПРОБЛЕМЫ
- •4.2. СВОЙСТВА ПСЕВДОБУЛЕВЫХ ФУНКЦИЙ
- •5. АНАЛИЗ ИСХОДНОЙ ВЫБОРКИ ДАННЫХ
- •5.1. НЕДОСТАТКИ В ИСХОДНОЙ ВЫБОРКЕ ДАННЫХ
- •5.3. ВЫБОР ПУЛА ПРИЗНАКОВ
- •5.4. АЛГОРИТМИЧЕСКАЯ ПРОЦЕДУРА ПОЛУЧЕНИЯ УСЕЧЕННОГО НАБОРА ПРИЗНАКОВ
- •ЗАКЛЮЧЕНИЕ
- •СПИСОК ЛИТЕРАТУРЫ
- •ПРИЛОЖЕНИЕ 1
- •ПРИЛОЖЕНИЕ 2

решение в этом случае, как показано выше, принадлежит подмножеству
крайних точек множества допустимых решений.
Простейший алгоритм случайного поиска крайних точек состоит
0
в следующем [84]. Поиск начинается из
X . На каждом шаге алгоритм выбирает соседнюю точку на следующем уровне, двигаясь, таким образом,
по пути возрастания целевой функции до границы допустимой области.
При необходимости процедура повторяется несколько раз – и из найденных крайних точек выбирается лучшая.
Рассмотренные выше два алгоритма на каждом шаге случайно выби-
рают допустимую точку на
следующем уровне (если такая существует).
Таким образом, при поиске граничных точек эти алгоритмы не учитывают
значения целевой функции С(Х) и функции А(Х), кроме как для определения, удовлетворяет ли точка ограничению, и используют значения целевой
функции лишь при сравнении найденных граничных точек (последний
пункт алгоритма).
Альтернативой случайному поиску
граничных точек является регу-
лярный алгоритм, использующий «жадную» эвристику [3].
«Жадные» алгоритмы являются интуитивными эвристиками, в которых на каждом шаге принимается решение, являющееся наиболее выгодным в данный момент, без учета того, что происходит на последующих
шагах поиска [153].
Описанные выше и исследуемые далее схемы приближенных алгоритмов поиска граничных точек
можно агрегировать в общую схему [196].
Для любой эвристики поиска граничных точек будем рассматривать пару
алгоритмов – прямой и двойственный. Прямой алгоритм начинает поиск из
допустимой области и движется по пути возрастания целевой функции,
пока не найдет крайнюю точку допустимой области. Напротив, двойственный алгоритм ведет поиск в недопустимой области по пути убывания
целевой функции, пока не найдет некоторого допустимого решения.
Общая схема прямого алгоритма поиска:
Полагаем Х
1.
2.
В соответствии с правилом выбираем SXOXOX
= Х0, i = 1.
1
1
0
1
)()(
iii
.
Если таких точек нет, то переходим к п. 3; в противном случае i = i + 1 и по-
вторяем шаг 2.
Принимаем Х
3.
opt
= Х
i +1
.
Общая схема двойственного алгоритма поиска:
0
XOX
n
i +1
.
i .
1 iini
0
XOXOX
1
.
Если
Полагаем )(
1.
В соответствии с правилом выбираем )()(
2.
SX
i
1
Принимаем Х
3.
, то переходим к п. 3; иначе i = i + 1 и повторяем шаг 2.
, 1
1
= Х
opt
– 101 –

Как видно из приведенных схем, прямой алгоритм находит крайнюю
X
XCX
точку допустимой области, в то время как двойственный алгоритм находит
граничную точку, которая может и не являться крайней. Поэтому для задач
со связной областью допустимых решений прямой алгоритм в среднем
находит лучшее решение, чем двойственный. Если же мы применим прямой алгоритм
для задачи с несвязной допустимой областью, то полученное
в результате решение может быть далеким от оптимального, так как на пути возрастания целевой функции допустимые и недопустимые решения
будут чередоваться. Для таких случаев более пригоден двойственный алгоритм, для которого это чередование не играет никакой роли. Для улучшения решения,
полученного двойственным алгоритмом, рекомендуется
применять соответствующий прямой алгоритм. Такое улучшение на практике оказывается весьма значительным [198].
Рассматриваемые здесь алгоритмы поиска граничных точек отличаются друг от друга лишь правилом выбора следующей точки на шаге 2
общих схем.
Правило 1. Случайный поиск граничных точек (СПГ). Точка
X
1i
выбирается случайным образом. Каждая точка на следующем шаге может
быть выбрана с равной вероятностью. При решении практических задач
эти вероятности могут быть неравными, а вычисляться на основании специфики задачи до начала поиска.
Правило 2. «Жадный» алгоритм. Точка
X выбирается из условия
1i
j
)(max)(
XX
1
i
j
,
где SXOXOX
j
для двойственного.
Функция )(
целевая функция )()(
удельная ценность
Правило 3. Адаптивный случайный поиск граничных точек (АСПГ).
Точка
X выбирается случайным образом в соответствии с вектором
вероятностей
0
1
)()(
ii
– для прямого алгоритма,
j
выбирается исходя из специфики задачи, например:
,
(для одного ограничения) и т. д.
1i
)()()( XAXCX
iii
21
i
,
),...,,(
pppP
J
где J – количество точек, из которых производится выбор.
–
)()(
XOXOX
10iin
– 102 –

j
X
)(
,
l
X
)(
1
Jj ,1 ,
j
XOXOX
–
10iin
где SXOXOX
i
p
j
J
l
j
0
)()(
ii
1
– для прямого алгоритма, )()(
для двойственного.
Правило 4. Модифицированный случайный поиск граничных точек
(МСПГ). Точка
X выбирается из условия
1i
1
i
r
r
,
)(max)(
XX
где rX – точки, выбранные по правилу 1, Rr ,1 ; R – задаваемый пара-
метр алгоритма.
Приведенные выше регулярные и стохастические алгоритмы переводят исходную задачу условной псевдобулевой оптимизации, являющуюся
NP-трудной, в задачу
*
Xf
XfXf
)()(
*
)(
,
принадлежащую классу P (полиномиально разрешимые), где *X – оптимальное решение, X – приближенное решение.
Разработанные приближенные алгоритмы (гриди алгоритмы и алгоритмы случайного поиска граничных точек) имеют полиномиальные оценки трудоемкости и поэтому предназначены прежде всего для решения задач большой размерности. Наиболее эффективной представляется следующая схема: на первом этапе задача решается гриди алгоритмом, а затем
находятся несколько решений с помощью адаптивного случайного поиска;
лучшее из найденных принимается за решение задачи.
В процессе управления сложными техническими и организационными системами часто возникает необходимость в оптимизации по определенным критериям посредством выбора наилучших значений управляемых
переменных из области допустимых значений, определяемой рядом ограничений на переменные. Причем эти
критерии и ограничения во многих
встречающихся на практике случаях не удается записать в виде явных алгебраических выражений, т. е. они заданы алгоритмически, а упрощения
моделей, такие как линеаризация, оказываются неприемлемыми для оптимизации при управлении сложными техническими системами. Это делает
невозможным применение хорошо изученных методов математического
программирования и соответствующих
программных приложений.
– 103 –

Следует отметить, что известные поисковые методы не учитывают
особенности ограничений, да и целевых функций, наблюдаемых, как правило, в реальных задачах. Адаптивные поисковые алгоритмы типа генетических к тому же требуют подбора некоторого числа параметров, что возможно только при предварительном решении ряда однотипных задач
и неприемлемо при единичном решении задачи
, и не дают никакой гаран-
тии об исключении полного перебора.
Значительную часть в задачах дискретной оптимизации занимают
задачи оптимизации с булевыми переменными. Строгая булевость – свойство, которое часто встречается в практических задачах оптимизации.
Задачам оптимизации с булевыми переменными, как с алгоритмическим,
так и с алгебраическим заданием функций, многие исследователи уделяют
особое внимание. В принципе любая задача дискретной оптимизации сводится к псевдобулевой.
Проблема повышения эффективности решения задач условной псевдобулевой оптимизации с алгоритмически заданными функциями является
весьма актуальной. Наибольшая эффективность может быть достигнута
путем выявления топологических свойств пространства булевых переменных и свойств псевдобулевых функций и их утилизации при построении
математического
аппарата решения выделенных классов задач.
Разработанные алгоритмы оптимизации применимы для любых задач условной псевдобулевой оптимизации, возникающих в процессе
управления сложными техническими объектами, а также в областях экономики. Наиболее интересными для практического использования являются точные поисковые алгоритмы, реализующие свойства классов задач,
и приближенные алгоритмы, особенно алгоритм адаптивного случайного
поиска граничных точек, а также процедура идентификации свойств псевдобулевых функций.
Описанные алгоритмы использованы в решении задачи оптимизации
загрузки технологического оборудования предприятия, представляющей
собой задачу условной псевдобулевой оптимизации с несвязным множеством допустимых решений [195].
Интересны результаты применения разработанных алгоритмов оптимизации в методах распознавания, в частности в логических алгоритмах
классификации [6]. Применение
эффективных алгоритмов комбинаторной
оптимизации позволяет находить информативные закономерности в данных, что ведет к получению эффективных решающих правил.
– 104 –

5. АНАЛИЗ ИСХОДНОЙ ВЫБОРКИ ДАННЫХ
5.1. НЕДОСТАТКИ В ИСХОДНОЙ ВЫБОРКЕ ДАННЫХ
Рассмотрим три основных недостатка, которые могут присутствовать
в исходной выборке данных, состоящей из наблюдений положительного
и отрицательного классов:
1)
ошибки классификации;
пропущенные значения признаков;
2)
3)
погрешности при измерении значений числовых признаков.
Перейдем к рассмотрению первого недостатка в исходной выборке
данных – ошибки классификации.
Рассмотрим случай наблюдения отрицательного класса, ошибочно
классифицированного как наблюдение положительного класса. При условии, что подавляющее большинство наблюдений классифицировано верно,
такой случай будет означать, что данное ложноположительное наблюдение
не покрывается ни одним положительным паттерном
Если количество таких наблюдений в данной ситуации значительно, то генерируются более «длинные» паттерны, чтобы покрыть их. Если количество таких наблюдений мало, их классификация может быть рассмотрена
как ошибочная и эти наблюдения могут быть исключены из дальнейшей
классификации.
Теперь рассмотрим случай, когда наблюдение положительного класса ошибочно
классифицировано как наблюдение отрицательного класса.
Данная ситуация будет проявляться в процессе генерации правил, когда
некоторые потенциальные термы, покрывающие большое количество
наблюдений положительного класса, покрывают изолированные наблюдения отрицательного класса. Теперь данные наблюдения отрицательного
класса также являются неправильно классифицированными и будут проигнорированы при оценке потенциальных термов. Способ осуществления
данной идеи – рассматривать
потенциальные термы как положительные
закономерности, если отношение отрицательных и положительных точек,
S
покрываемых ими, не превышает
, где |S+| и |S-| – количество наблю-
S
небольшой степени.
дений положительного и отрицательного класса; τ – параметр, зависящий
от задачи.
– 105 –

Второй недостаток в исходной выборке данных – пропущенные зна-
чения признаков.
Незаполненная ячейка таблицы данных – это не такой уж редкий
случай, особенно если эксперимент проводится не в лабораторных,
а в естественных условиях. Исключить из таблицы строку и столбец, на
пересечении которых находится пустая ячейка, – выход далеко не всегда
приемлемый. Можно, используя избыточность
таблицы, некоторым образом «восстановить» пропущенные значения, а затем обрабатывать таблицу
так, будто их и не было. Однако критерий «восстановления» и цель обработки должны быть согласованы, поэтому не может быть универсального
способа «восстановления» пропусков [89].
В отношении пропущенных данных можно рассмотреть булевые
признаки как фактически принимающие три значения 1, 0 и *, где *
обо-
значает отсутствие информации о значениях признака.
Пропущенные значения влияют на различные стадии алгоритма. Для
начала, если значение исходного признака пропущено, все значения всех
бинарных переменных рассматриваются как пропущенные. На стадии построения опорного множества недоступность значений переменной
предотвращает использование данной переменной для отличия соответствующего наблюдения от других. Следовательно, в
задаче о множественном покрытии ограничение, соответствующее паре, состоящей из наблюдений положительного и отрицательного класса, должно приводить только
к тем переменным, чьи значения известны для обоих наблюдений в паре
(т. е. коэффициенты для наблюдений с пропущенными значениями должны быть равны нулю).
Наличие пропусков значений признаков делает необходимой моди
-
фикацию принципа покрытия наблюдения термом. Мы будем говорить,
что терм покрывает наблюдение слабо, если существует хоть одна возможность установить 0-1 значения для * в данном наблюдении, такие, что
итоговое 0-1 наблюдение покрывается термом. Аналогично мы будем говорить, что терм покрывает наблюдение сильно, тогда и только тогда, когда возможно установить 0-1 значения
для всех * в данном наблюдении,
чтобы итоговое 0-1 наблюдение было покрыто термом [113].
Данные модификации в понятие покрытия вводятся для того, чтобы
сделать возможным переопределение понятия закономерностей для случая
пропущенных значений. Цель данного переопределения – гарантировать
устойчивость закономерностей, сгенерированных данной процедурой. Робастность интерпретируется как свойство термов быть закономерностями
в действительном смысле для всех
0-1 замен * во множествах данных. Мы
будем называть термы робастными положительными (отрицательными)
закономерностями, если данный терм покрывает сильно по крайней мере
– 106 –

одно наблюдение положительного (отрицательного) класса и не покрывает
слабо ни одно наблюдение отрицательного (положительного) класса [113].
Ясно, что если множество данных не имеет ни одного пропущенного значения признака, определение робастности снижается до исходного определения закономерности.
Процедура генерации закономерностей может быть легко модифи-
цирована в генерацию робастных закономерностей для случая пропущен
-
ных значений признаков. Рассмотрим погрешности при измерении значений числовых признаков.
Точность измерений – свойство, отражающее близость результатов
измерений к истинным значениям измеренных величин. Она может быть
большей или меньшей в зависимости от выделенных ресурсов (затрат на
средства измерений, проведение измерений, стабилизацию внешних условий и т. д.). Очевидно, что она
должна быть оптимальной: достаточной для
выполнения поставленной задачи, но не более, ибо дальнейшее повышение
точности приведет к неоправданным финансовым затратам.
По источнику возникновения погрешности измерений делят на сле-
дующие:
1)
инструментальная погрешность измерения – составляющая по-
грешности измерения, обусловленная несовершенством применяемого
средства измерения: отличием реальной функции преобразования прибора
от его калибровочной зависимости, неустранимыми шумами в измерительной цепи, внутренним сопротивлением средства измерения;
2)
методическая – составляющая погрешности измерений, обуслов-
ленная несовершенством метода измерений. К ней относят погрешности,
обусловленные отличием принятой модели объекта измерения от реального объекта, несовершенством способа воплощения принципа измерений, неточностью формул, применяемых при нахождении результата измерений, и другими факторами, не связанными со свойствами средств
измерения;
3)
субъективная (личная) – составляющая погрешности измерения,
обусловленная индивидуальными особенностями оператора, т. е. погрешность отсчета оператором показаний по шкалам средства измерения. Она
вызывается состоянием оператора, несовершенством органов чувств, эргономическими свойствами средства измерения.
Числовые множества данных имеют погрешности в значениях числовых признаков из-за неточных инструментов, методов измерений или
человеческих ошибок
. Пока данные факторы сами по себе приводят к погрешностям, их влияние может увеличиться в процессе бинаризации. Если
числовое значение признака находится на грани секущей точки, то значение бинаризированной переменной может сильно зависеть от незначитель-
– 107 –

ных погрешностей. Очевидно, такая ситуация может привести к серьезным
искажениям. Во избежание искаженной бинаризации значение бинарной
переменной безопаснее рассмотреть как пропущенное (и, как было показано выше, пометить *), если числовое значение признака сильно близко
к секущей точке. Формально для каждого признака х и секущей точки t
мы будем вводить уровневую переменную
b(x,t), такую, что
txif
;1
x
),(
txb
txif
;0
x
txtif
,*
xx
где σ
– измерение точности признака.
x
Аналогичная модификация может быть сделана также для интер-
вальных переменных.
Очевидно, данная модификация процедуры бинаризации может породить проблемы с пропущенными значениями признака, даже когда нет
пропущенных данных в исходной формулировке задачи. Итоговая проблема с (возможно) пропущенными значениями признака решается описанным ранее методом.
5.2. ВЫБОР ПОДМНОЖЕСТВА ПРИЗНАКОВ
ДЛЯ КЛАССИФИКАЦИИ С ВЫСОКОЙ ТОЧНОСТЬЮ
Представление большого числа лишних признаков в выборке может
создавать огромную вычислительную сложность. Например, в геномике
и протеомике, двух наиболее развивающихся областях биоинформатики,
где выражение уровней яркости тысяч или десятков тысяч генов (или белков) включено в набор данных, несмотря на тот факт, что очень маленького
подмножества этих признаков достаточно для
превосходного разделения
положительных и отрицательных наблюдений. Из более чем 15 000 пептидов, появившихся при недавнем изучении рака яичников в наборе данных,
мы определили 7 пептидов, которые со 100%-ной точностью могут выделить случаи рака в тестовом наборе данных [188]. Подобным образом в
наборе данных рака молочной железы, описываемом выражением интенсивности слоев, из
более чем 25 000 генов для каждого случая мы определили подмножество из 16 генов, которые с 93%-ной точностью разделяют
плохие и хорошие прогнозные случаи [138].
– 108 –

Представление слишком большого числа признаков в наборе данных, так же как и представление не влияющих на распознавание признаков, таких как экспериментальный шум, может привести (в отсутствие
адекватного способа отбора маленького, значимого подмножества) к ошибке любой попытки извлечения знаний из данных.
Важность отбора признаков общеизвестна в статистике, и долгое
время она признавалась главным элементом исследований в машинном
обучении, выявлении экспертных знаний, добыче данных и других связанных областях. Всесторонний обзор многих существующих методов начиная с 1970 г. представлен в 1997 г. в работах [147, 190, 191]. Некоторые из
классических техник статистики (анализ главных компонент) являются
весьма подходящими к области отбора признаков. Среди методов,
специально созданных для этой цели, следует отметить и полный перебор эвристик (последовательный прямой/ обратный выбор, метод ветвей и границ
[147]), использование искусственных нейронных сетей [184, 214], метод
опорных векторов [129, 133], генетические алгоритмы [134].
Одним из усложняющих факторов в извлечении значимого подмножества признаков является то, что существует явное различие между значимостью индивидуальных
признаков и значимостью набора признаков.
Приведем типичный пример: высокозначимый набор из 7 пептидов, идентифицирующих рак яичников, включает только 4 пептида, уровень которых сильно коррелирует с присутствием рака яичника [188].
Для идентификации подмножества признаков существует необходимость в методе, который может отделить с высокой точностью положительные наблюдения от отрицательных. Основной принцип, исполь
-
зуемый в таком методе, – построение коллективных биомаркеров или
закономерностей, определение которых дано в методе логического анализа данных.
Специфические черты подхода логического анализа данных
включают всестороннее исследование полного набора признаков (в том
числе те, которые имеют слабую корреляцию с выходом и маленькое
значение), сфокусированного на классификационной мощности комбинации признаков (
не ограничивая внимания только индивидуальными
признаками), и возможности извлечения новой информации о роли
признаков и комбинации признаков через анализ их всесторонних перечислений.
Метод отбора признаков, основанный на покрытии набора, оказался
очень полезным при анализе набора данных из разных областей (экономика, сейсмография, изучение нефти, создание искусственных тканей). Это
можно проследить
на примере геномики и протеомики, где его приложе-
ние оказалось наглядным и необходимым.
– 109 –

Во-первых, количество генов или белков в типичном геномном или
белковом наборе составляет тысячи и десятки тысяч. В то время как количество бинарных переменных, заменяющих численные переменные (соответствующие генам или белкам), может быть в сотни раз больше.
Это означает, что данные проблемы приводят к моделям задач о покрытии
множества
с миллионом бинарных переменных. Ограничения в задачах,
связанных с покрытием множества, соответствуют парам, формируемым
отрицательными и положительными наблюдениями в наборе. Поэтому
задача о покрытии множества может, вероятно, иметь десятки тысяч ограничений и миллионы переменных. Хотя существуют превосходные эвристики для решения задач о покрытиях множества, размер задач, фигурирующих
в области исследования, выше их возможностей.
Во-вторых, в отличие от обычных задач о покрытиях множества в бинаризированных формах задач анализа данных возникает новый тип требований. В обычных моделях задач о покрытии множества основной задачей
является минимизация числа переменных, которые дают значение «1», т. е.
выбраны в оптимальном решении. В
геномике и протеомике следует минимизировать количество переменных исходя не из общего числа бинарных переменных, связанных с каждым геном или белком, а из числа выбранных генов или белков. Комбинаторная оптимизационная модель, соответствующая
данной задаче, является более сложной, чем для простой задачи о покрытии,
и пока нет эвристических методов
для ее решения, описанных в литературе.
Из сказанного следует необходимость обхода шага бинаризации,
а также формулирования и решения задач о покрытии, а также извлечения
из полного набора данных небольшого набора признаков, который позволяет точно разделить положительные и отрицательные наблюдения.
5.3. ВЫБОР ПУЛА ПРИЗНАКОВ
На этапе отбора признаков применяется несколько критериев для
оценки каждого из них в наборе с целью создания пула выбранных признаков, используемых для дальнейшего анализа. По каждому рассматриваемому критерию с целью дальнейшего рассмотрения выбираем k первых
по рангу признаков. Пул состоит из набора этих признаков, которые ранжируются в
числе первых k признаков согласно примененным критериям.
Приведем описание пяти критериев, применяемых для определения
значимости признака при разделении положительных и отрицательных
наблюдений [205].
– 110 –
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
