Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Модификации метода логического анализа данных для задач классификации. Монография.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
решение в этом случае, как показано выше, принадлежит подмножеству
крайних точек множества допустимых решений.
Простейший алгоритм случайного поиска крайних точек состоит
0
в следующем [84]. Поиск начинается из
X . На каждом шаге алгоритм вы­бирает соседнюю точку на следующем уровне, двигаясь, таким образом, по пути возрастания целевой функции до границы допустимой области. При необходимости процедура повторяется несколько раз – и из найден­ных крайних точек выбирается лучшая.
Рассмотренные выше два алгоритма на каждом шаге случайно выби-
рают допустимую точку на
следующем уровне (если такая существует). Таким образом, при поиске граничных точек эти алгоритмы не учитывают значения целевой функции С(Х) и функции А(Х), кроме как для определе­ния, удовлетворяет ли точка ограничению, и используют значения целевой функции лишь при сравнении найденных граничных точек (последний пункт алгоритма).
Альтернативой случайному поиску
граничных точек является регу-
лярный алгоритм, использующий «жадную» эвристику [3].
«Жадные» алгоритмы являются интуитивными эвристиками, в кото­рых на каждом шаге принимается решение, являющееся наиболее выгод­ным в данный момент, без учета того, что происходит на последующих шагах поиска [153].
Описанные выше и исследуемые далее схемы приближенных алго­ритмов поиска граничных точек
можно агрегировать в общую схему [196]. Для любой эвристики поиска граничных точек будем рассматривать пару алгоритмов – прямой и двойственный. Прямой алгоритм начинает поиск из допустимой области и движется по пути возрастания целевой функции, пока не найдет крайнюю точку допустимой области. Напротив, двойствен­ный алгоритм ведет поиск в недопустимой области по пути убывания целевой функции, пока не найдет некоторого допустимого решения.
Общая схема прямого алгоритма поиска:
Полагаем Х
1.
2.
В соответствии с правилом выбираем SXOXOX
= Х0, i = 1.
1
1
0
1
)()(
iii
.
Если таких точек нет, то переходим к п. 3; в противном случае i = i + 1 и по- вторяем шаг 2.
Принимаем Х
3.
opt
= Х
i +1
.
Общая схема двойственного алгоритма поиска:
0
XOX
n
i +1
.
i .
1 iini
0
XOXOX
1
.
Если
Полагаем )(
1.
В соответствии с правилом выбираем )()(
2.
SX
i
1
Принимаем Х
3.
, то переходим к п. 3; иначе i = i + 1 и повторяем шаг 2.
, 1
1
= Х
opt
– 101 –
Как видно из приведенных схем, прямой алгоритм находит крайнюю
X
XCX
точку допустимой области, в то время как двойственный алгоритм находит граничную точку, которая может и не являться крайней. Поэтому для задач со связной областью допустимых решений прямой алгоритм в среднем находит лучшее решение, чем двойственный. Если же мы применим пря­мой алгоритм
для задачи с несвязной допустимой областью, то полученное в результате решение может быть далеким от оптимального, так как на пу­ти возрастания целевой функции допустимые и недопустимые решения будут чередоваться. Для таких случаев более пригоден двойственный ал­горитм, для которого это чередование не играет никакой роли. Для улуч­шения решения,
полученного двойственным алгоритмом, рекомендуется применять соответствующий прямой алгоритм. Такое улучшение на прак­тике оказывается весьма значительным [198].
Рассматриваемые здесь алгоритмы поиска граничных точек отлича­ются друг от друга лишь правилом выбора следующей точки на шаге 2 общих схем.
Правило 1. Случайный поиск граничных точек (СПГ). Точка
X
1i
выбирается случайным образом. Каждая точка на следующем шаге может быть выбрана с равной вероятностью. При решении практических задач эти вероятности могут быть неравными, а вычисляться на основании спе­цифики задачи до начала поиска.
Правило 2. «Жадный» алгоритм. Точка
X выбирается из условия
1i
j
)(max)(
XX
1
i
j
,
где SXOXOX
j
для двойственного.
Функция )(
целевая функция )()(
удельная ценность
Правило 3. Адаптивный случайный поиск граничных точек (АСПГ).
Точка
X выбирается случайным образом в соответствии с вектором
вероятностей
0
1
)()(
ii
– для прямого алгоритма,
j
выбирается исходя из специфики задачи, например:
,
(для одного ограничения) и т. д.
1i
)()()( XAXCX
iii
21
i
,
),...,,(
pppP
J
где J – количество точек, из которых производится выбор.
–
)()(
XOXOX
10iin
– 102 –
j
X
)(
,
l
X
)(
1
Jj ,1 ,
j
XOXOX
–
10iin
где SXOXOX
i
p
j
J
l
j
0
)()(
ii
1
– для прямого алгоритма, )()(
для двойственного.
Правило 4. Модифицированный случайный поиск граничных точек
(МСПГ). Точка
X выбирается из условия
1i
1
i
r
r
,
)(max)(
XX
где rX – точки, выбранные по правилу 1, Rr ,1 ; R – задаваемый пара- метр алгоритма.
Приведенные выше регулярные и стохастические алгоритмы перево­дят исходную задачу условной псевдобулевой оптимизации, являющуюся
NP-трудной, в задачу
*
Xf
XfXf
)()(
*
)(
,
принадлежащую классу P (полиномиально разрешимые), где *X – опти­мальное решение, X – приближенное решение.
Разработанные приближенные алгоритмы (гриди алгоритмы и алго­ритмы случайного поиска граничных точек) имеют полиномиальные оцен­ки трудоемкости и поэтому предназначены прежде всего для решения за­дач большой размерности. Наиболее эффективной представляется следу­ющая схема: на первом этапе задача решается гриди алгоритмом, а затем находятся несколько решений с помощью адаптивного случайного поиска; лучшее из найденных принимается за решение задачи.
В процессе управления сложными техническими и организационны­ми системами часто возникает необходимость в оптимизации по опреде­ленным критериям посредством выбора наилучших значений управляемых переменных из области допустимых значений, определяемой рядом огра­ничений на переменные. Причем эти
критерии и ограничения во многих встречающихся на практике случаях не удается записать в виде явных ал­гебраических выражений, т. е. они заданы алгоритмически, а упрощения моделей, такие как линеаризация, оказываются неприемлемыми для опти­мизации при управлении сложными техническими системами. Это делает невозможным применение хорошо изученных методов математического программирования и соответствующих
программных приложений.
– 103 –
Следует отметить, что известные поисковые методы не учитывают особенности ограничений, да и целевых функций, наблюдаемых, как пра­вило, в реальных задачах. Адаптивные поисковые алгоритмы типа генети­ческих к тому же требуют подбора некоторого числа параметров, что воз­можно только при предварительном решении ряда однотипных задач и неприемлемо при единичном решении задачи
, и не дают никакой гаран-
тии об исключении полного перебора.
Значительную часть в задачах дискретной оптимизации занимают задачи оптимизации с булевыми переменными. Строгая булевость – свой­ство, которое часто встречается в практических задачах оптимизации. Задачам оптимизации с булевыми переменными, как с алгоритмическим, так и с алгебраическим заданием функций, многие исследователи уделяют особое внимание. В принципе любая задача дискретной оптимизации сво­дится к псевдобулевой.
Проблема повышения эффективности решения задач условной псев­добулевой оптимизации с алгоритмически заданными функциями является весьма актуальной. Наибольшая эффективность может быть достигнута путем выявления топологических свойств пространства булевых перемен­ных и свойств псевдобулевых функций и их утилизации при построении математического
аппарата решения выделенных классов задач.
Разработанные алгоритмы оптимизации применимы для любых за­дач условной псевдобулевой оптимизации, возникающих в процессе управления сложными техническими объектами, а также в областях эко­номики. Наиболее интересными для практического использования являют­ся точные поисковые алгоритмы, реализующие свойства классов задач, и приближенные алгоритмы, особенно алгоритм адаптивного случайного поиска граничных точек, а также процедура идентификации свойств псев­добулевых функций.
Описанные алгоритмы использованы в решении задачи оптимизации загрузки технологического оборудования предприятия, представляющей собой задачу условной псевдобулевой оптимизации с несвязным множе­ством допустимых решений [195].
Интересны результаты применения разработанных алгоритмов оп­тимизации в методах распознавания, в частности в логических алгоритмах классификации [6]. Применение
эффективных алгоритмов комбинаторной оптимизации позволяет находить информативные закономерности в дан­ных, что ведет к получению эффективных решающих правил.
– 104 –

5. АНАЛИЗ ИСХОДНОЙ ВЫБОРКИ ДАННЫХ

5.1. НЕДОСТАТКИ В ИСХОДНОЙ ВЫБОРКЕ ДАННЫХ

Рассмотрим три основных недостатка, которые могут присутствовать в исходной выборке данных, состоящей из наблюдений положительного и отрицательного классов:
1)
ошибки классификации; пропущенные значения признаков;
2)
3)
погрешности при измерении значений числовых признаков.
Перейдем к рассмотрению первого недостатка в исходной выборке данных – ошибки классификации.
Рассмотрим случай наблюдения отрицательного класса, ошибочно классифицированного как наблюдение положительного класса. При усло­вии, что подавляющее большинство наблюдений классифицировано верно, такой случай будет означать, что данное ложноположительное наблюдение не покрывается ни одним положительным паттерном Если количество таких наблюдений в данной ситуации значительно, то ге­нерируются более «длинные» паттерны, чтобы покрыть их. Если количе­ство таких наблюдений мало, их классификация может быть рассмотрена как ошибочная и эти наблюдения могут быть исключены из дальнейшей классификации.
Теперь рассмотрим случай, когда наблюдение положительного клас­са ошибочно
классифицировано как наблюдение отрицательного класса. Данная ситуация будет проявляться в процессе генерации правил, когда некоторые потенциальные термы, покрывающие большое количество наблюдений положительного класса, покрывают изолированные наблюде­ния отрицательного класса. Теперь данные наблюдения отрицательного класса также являются неправильно классифицированными и будут про­игнорированы при оценке потенциальных термов. Способ осуществления данной идеи – рассматривать
потенциальные термы как положительные
закономерности, если отношение отрицательных и положительных точек,
S
покрываемых ими, не превышает
, где |S+| и |S-| – количество наблю-
S
небольшой степени.
дений положительного и отрицательного класса; τ – параметр, зависящий от задачи.
– 105 –
Второй недостаток в исходной выборке данных – пропущенные зна-
чения признаков.
Незаполненная ячейка таблицы данных – это не такой уж редкий случай, особенно если эксперимент проводится не в лабораторных, а в естественных условиях. Исключить из таблицы строку и столбец, на пересечении которых находится пустая ячейка, – выход далеко не всегда приемлемый. Можно, используя избыточность
таблицы, некоторым обра­зом «восстановить» пропущенные значения, а затем обрабатывать таблицу так, будто их и не было. Однако критерий «восстановления» и цель обра­ботки должны быть согласованы, поэтому не может быть универсального способа «восстановления» пропусков [89].
В отношении пропущенных данных можно рассмотреть булевые
признаки как фактически принимающие три значения 1, 0 и *, где *
обо-
значает отсутствие информации о значениях признака.
Пропущенные значения влияют на различные стадии алгоритма. Для начала, если значение исходного признака пропущено, все значения всех бинарных переменных рассматриваются как пропущенные. На стадии по­строения опорного множества недоступность значений переменной предотвращает использование данной переменной для отличия соответ­ствующего наблюдения от других. Следовательно, в
задаче о множествен­ном покрытии ограничение, соответствующее паре, состоящей из наблю­дений положительного и отрицательного класса, должно приводить только к тем переменным, чьи значения известны для обоих наблюдений в паре (т. е. коэффициенты для наблюдений с пропущенными значениями долж­ны быть равны нулю).
Наличие пропусков значений признаков делает необходимой моди
-
фикацию принципа покрытия наблюдения термом. Мы будем говорить, что терм покрывает наблюдение слабо, если существует хоть одна воз­можность установить 0-1 значения для * в данном наблюдении, такие, что итоговое 0-1 наблюдение покрывается термом. Аналогично мы будем го­ворить, что терм покрывает наблюдение сильно, тогда и только тогда, ко­гда возможно установить 0-1 значения
для всех * в данном наблюдении,
чтобы итоговое 0-1 наблюдение было покрыто термом [113].
Данные модификации в понятие покрытия вводятся для того, чтобы сделать возможным переопределение понятия закономерностей для случая пропущенных значений. Цель данного переопределения – гарантировать устойчивость закономерностей, сгенерированных данной процедурой. Ро­бастность интерпретируется как свойство термов быть закономерностями в действительном смысле для всех
0-1 замен * во множествах данных. Мы будем называть термы робастными положительными (отрицательными) закономерностями, если данный терм покрывает сильно по крайней мере
– 106 –
одно наблюдение положительного (отрицательного) класса и не покрывает слабо ни одно наблюдение отрицательного (положительного) класса [113]. Ясно, что если множество данных не имеет ни одного пропущенного зна­чения признака, определение робастности снижается до исходного опреде­ления закономерности.
Процедура генерации закономерностей может быть легко модифи-
цирована в генерацию робастных закономерностей для случая пропущен
-
ных значений признаков. Рассмотрим погрешности при измерении значе­ний числовых признаков.
Точность измерений – свойство, отражающее близость результатов измерений к истинным значениям измеренных величин. Она может быть большей или меньшей в зависимости от выделенных ресурсов (затрат на средства измерений, проведение измерений, стабилизацию внешних усло­вий и т. д.). Очевидно, что она
должна быть оптимальной: достаточной для выполнения поставленной задачи, но не более, ибо дальнейшее повышение точности приведет к неоправданным финансовым затратам.
По источнику возникновения погрешности измерений делят на сле-
дующие:
1)
инструментальная погрешность измерения – составляющая по-
грешности измерения, обусловленная несовершенством применяемого средства измерения: отличием реальной функции преобразования прибора от его калибровочной зависимости, неустранимыми шумами в измери­тельной цепи, внутренним сопротивлением средства измерения;
2)
методическая – составляющая погрешности измерений, обуслов-
ленная несовершенством метода измерений. К ней относят погрешности, обусловленные отличием принятой модели объекта измерения от реаль­ного объекта, несовершенством способа воплощения принципа измере­ний, неточностью формул, применяемых при нахождении результата из­мерений, и другими факторами, не связанными со свойствами средств измерения;
3)
субъективная (личная) – составляющая погрешности измерения,
обусловленная индивидуальными особенностями оператора, т. е. погреш­ность отсчета оператором показаний по шкалам средства измерения. Она вызывается состоянием оператора, несовершенством органов чувств, эрго­номическими свойствами средства измерения.
Числовые множества данных имеют погрешности в значениях чис­ловых признаков из-за неточных инструментов, методов измерений или человеческих ошибок
. Пока данные факторы сами по себе приводят к по­грешностям, их влияние может увеличиться в процессе бинаризации. Если числовое значение признака находится на грани секущей точки, то значе­ние бинаризированной переменной может сильно зависеть от незначитель-
– 107 –
ных погрешностей. Очевидно, такая ситуация может привести к серьезным искажениям. Во избежание искаженной бинаризации значение бинарной переменной безопаснее рассмотреть как пропущенное (и, как было показа­но выше, пометить *), если числовое значение признака сильно близко к секущей точке. Формально для каждого признака х и секущей точки t мы будем вводить уровневую переменную
b(x,t), такую, что
txif
;1
x
),(
txb
 
txif
;0
x
txtif
,*
xx
где σ
– измерение точности признака.
x
Аналогичная модификация может быть сделана также для интер-
вальных переменных.
Очевидно, данная модификация процедуры бинаризации может по­родить проблемы с пропущенными значениями признака, даже когда нет пропущенных данных в исходной формулировке задачи. Итоговая пробле­ма с (возможно) пропущенными значениями признака решается описан­ным ранее методом.
5.2. ВЫБОР ПОДМНОЖЕСТВА ПРИЗНАКОВ
ДЛЯ КЛАССИФИКАЦИИ С ВЫСОКОЙ ТОЧНОСТЬЮ
Представление большого числа лишних признаков в выборке может создавать огромную вычислительную сложность. Например, в геномике и протеомике, двух наиболее развивающихся областях биоинформатики, где выражение уровней яркости тысяч или десятков тысяч генов (или бел­ков) включено в набор данных, несмотря на тот факт, что очень маленького подмножества этих признаков достаточно для
превосходного разделения положительных и отрицательных наблюдений. Из более чем 15 000 пепти­дов, появившихся при недавнем изучении рака яичников в наборе данных, мы определили 7 пептидов, которые со 100%-ной точностью могут выде­лить случаи рака в тестовом наборе данных [188]. Подобным образом в наборе данных рака молочной железы, описываемом выражением интен­сивности слоев, из
более чем 25 000 генов для каждого случая мы опреде­лили подмножество из 16 генов, которые с 93%-ной точностью разделяют плохие и хорошие прогнозные случаи [138].
– 108 –
Представление слишком большого числа признаков в наборе дан­ных, так же как и представление не влияющих на распознавание призна­ков, таких как экспериментальный шум, может привести (в отсутствие адекватного способа отбора маленького, значимого подмножества) к ошиб­ке любой попытки извлечения знаний из данных.
Важность отбора признаков общеизвестна в статистике, и долгое время она признавалась главным элементом исследований в машинном обучении, выявлении экспертных знаний, добыче данных и других связан­ных областях. Всесторонний обзор многих существующих методов начи­ная с 1970 г. представлен в 1997 г. в работах [147, 190, 191]. Некоторые из классических техник статистики (анализ главных компонент) являются весьма подходящими к области отбора признаков. Среди методов,
специ­ально созданных для этой цели, следует отметить и полный перебор эври­стик (последовательный прямой/ обратный выбор, метод ветвей и границ [147]), использование искусственных нейронных сетей [184, 214], метод опорных векторов [129, 133], генетические алгоритмы [134].
Одним из усложняющих факторов в извлечении значимого подмно­жества признаков является то, что существует явное различие между зна­чимостью индивидуальных
признаков и значимостью набора признаков. Приведем типичный пример: высокозначимый набор из 7 пептидов, иден­тифицирующих рак яичников, включает только 4 пептида, уровень кото­рых сильно коррелирует с присутствием рака яичника [188].
Для идентификации подмножества признаков существует необхо­димость в методе, который может отделить с высокой точностью поло­жительные наблюдения от отрицательных. Основной принцип, исполь
-
зуемый в таком методе, – построение коллективных биомаркеров или закономерностей, определение которых дано в методе логического ана­лиза данных.
Специфические черты подхода логического анализа данных включают всестороннее исследование полного набора признаков (в том числе те, которые имеют слабую корреляцию с выходом и маленькое значение), сфокусированного на классификационной мощности комби­нации признаков (
не ограничивая внимания только индивидуальными признаками), и возможности извлечения новой информации о роли признаков и комбинации признаков через анализ их всесторонних пе­речислений.
Метод отбора признаков, основанный на покрытии набора, оказался очень полезным при анализе набора данных из разных областей (экономи­ка, сейсмография, изучение нефти, создание искусственных тканей). Это можно проследить
на примере геномики и протеомики, где его приложе-
ние оказалось наглядным и необходимым.
– 109 –
Во-первых, количество генов или белков в типичном геномном или белковом наборе составляет тысячи и десятки тысяч. В то время как коли­чество бинарных переменных, заменяющих численные переменные (соот­ветствующие генам или белкам), может быть в сотни раз больше. Это означает, что данные проблемы приводят к моделям задач о покрытии множества
с миллионом бинарных переменных. Ограничения в задачах, связанных с покрытием множества, соответствуют парам, формируемым отрицательными и положительными наблюдениями в наборе. Поэтому задача о покрытии множества может, вероятно, иметь десятки тысяч огра­ничений и миллионы переменных. Хотя существуют превосходные эври­стики для решения задач о покрытиях множества, размер задач, фигури­рующих
в области исследования, выше их возможностей.
Во-вторых, в отличие от обычных задач о покрытиях множества в би­наризированных формах задач анализа данных возникает новый тип требо­ваний. В обычных моделях задач о покрытии множества основной задачей является минимизация числа переменных, которые дают значение «1», т. е. выбраны в оптимальном решении. В
геномике и протеомике следует мини­мизировать количество переменных исходя не из общего числа бинарных пе­ременных, связанных с каждым геном или белком, а из числа выбранных ге­нов или белков. Комбинаторная оптимизационная модель, соответствующая данной задаче, является более сложной, чем для простой задачи о покрытии, и пока нет эвристических методов
для ее решения, описанных в литературе.
Из сказанного следует необходимость обхода шага бинаризации, а также формулирования и решения задач о покрытии, а также извлечения из полного набора данных небольшого набора признаков, который позво­ляет точно разделить положительные и отрицательные наблюдения.

5.3. ВЫБОР ПУЛА ПРИЗНАКОВ

На этапе отбора признаков применяется несколько критериев для оценки каждого из них в наборе с целью создания пула выбранных при­знаков, используемых для дальнейшего анализа. По каждому рассматрива­емому критерию с целью дальнейшего рассмотрения выбираем k первых по рангу признаков. Пул состоит из набора этих признаков, которые ран­жируются в
числе первых k признаков согласно примененным критериям.
Приведем описание пяти критериев, применяемых для определения значимости признака при разделении положительных и отрицательных наблюдений [205].
– 110 –
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]