Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистический анализ больших данных подход на основе машин опорных векторов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
852 Кб
Скачать

мелкое разбиение. Сократить количество вычислительных операций позволяет, например, поиск на квадродереве (quadtree) [14] или на латинском гиперкубе.

В [15] рассмотрено асимптотическое поведение leave-one-out- ошибки для стандартного SV-классификатора с гауссовым ядром. Показано, что область подходящих значений гиперпараметров (С ипараметрагауссоваядраσ)имеетопределенныеочертания(рис.11:

– наилучшее значение параметра регуляризации для линейно-

C

го SV-классификатора). Значение Clim зависит от соотношения в тренировочной последовательности образцов разных классов.

Перечислим ряд подходов для настройки SVM на основе различных методов оптимизации.

Припримененииметодаимитацииотжига(simulatedannealing) [16] нахождения глобального экстремума целевой функции не гарантируется, но при корректной генерации случайных точек во время поиска, как правило, происходит улучшение ее значения.

Используя стохастический метод поиска с чередующимися окрестностями (variable neighborhood search, VNS) [17], можно бы-

строиэффективноопределитьзначениягиперпараметров,улучшающих способность SV-классификатора к обобщению.

logσ2 = logC – logC

logσ2

Область

недообучения

модели Область подходящих значений

Область недообучения

Область переобучения

модели

модели

logClim

logC

Рис. 11. Разбиение пространства поиска гиперпараметров при настройке машины

41

МетаалгоритмSPO(sequentialparameteroptimization)[18]–по-

следовательная оптимизация параметров.

Поиск по образцу (pattern search, метод Хука–Дживса) [19] и

методглобальнойоптимизации(efficientparameterselectionviaglobal optimization,EPSGO)[20]применяюткакдляклассификации,так

идля задач регрессии.

Спомощью методов настройки, основанных на генетических алгоритмах[21,22],моделируютэволюционныйпроцесс:насуществующуюпопуляцию(наборзначенийгиперпараметров),которая размножается, воздействуют мутации, затем на основе функции валидации происходит «естественный отбор».

Подход к настройке машины опорных векторов, при котором используется градиент функции валидации по гиперпараметрам, рассмотренв[23].Дляиспользованияградиентногометодаобычно приходится сглаживать функцию валидации. Удобно применять сигмоидальноесглаживаниефункций,однакоприэтомвозникает необходимость оценивания дополнительных параметров.

9.ОСНОВНЫЕ ПОДХОДЫ К ПОСТРОЕНИЮ SV-МАШИН

НА ПРАКТИКЕ

9.1. Решение двойственной задачи SVM-обучения

Стандартнаяпостановказадачибинарнойклассификациипозволяет свести исходную задачу минимизации верхней границы ожидаемого риска к задаче квадратичного программирования с известными ограничениями относительно двойственных переменных, полностью определяющих искомое решающее правило.

ВспомнимформулировкудвойственнойзадачиSVM-обучения для бинарной классификации (15) и перепишем ее в следующем виде: найти

minW (α)= − l α

+ 1

l

α

α

y y

j

k(x

,x

j

)

(27)

α

i

 

i

 

j i

i

 

 

 

i=1

2 i,j=1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

l

 

 

 

 

 

 

 

 

 

 

 

при ограничениях αi yi = 0 и 0

≤ αi C.

 

 

 

 

 

 

i=1

42

Здесь(x1,y1),…,(xl,yl) Rn×{–1;+1}−тренировочнаяпоследо- вательностьобъемаl; αi≥0−множителиЛагранжа;C >0−параметр регуляризации, контролирующий ширину полосы;k(x,x′)− поло- жительно-определенное ядро.

Оптимальная решающая функция представляет собой линейную комбинацию значений ядра на тренировочных векторах:

l

f(x)= αi yik(xi,x)+b.

i=1

Условия ККТ для оптимальных множителей Лагранжа можно записать в лаконичной форме:

если αi = 0, то yi f(xi) ≥ 1;

если 0 < αi < C, то yi f(xi) = 1;

если αi = C, то yi f(xi) ≤ 1.

Обычнонепосредственноерешениезадачиквадратичногопрограммирования (27) невозможно из-за ее огромной размерности. Основныеподходыкпостроениюнепрямогорешенияэтойзадачи опираются на свойство разреженности, присущее SV-машинам.

ПустьQ –симметричнаяположительно-полуопределеннаяl×l матрица с элементами Qij = yiyjk(xi, xj). Если исключить строки и столбцы матрицы Q, соответствующие нулевым множителям Лагранжа, значение квадратичной формы в целевой функции задачи (27)неизменится.Следовательно,исходнуюзадачуможноразбить насериюподзадачтакогожевида,ногораздоменьшейразмерности.

Накаждомшагепроцессаобученияоптимизируетсятолькочасть множителейЛагранжа(рабочеемножество,workingset)прификсированных значениях остальных. Элементами рабочего множества являютсяαi,соответствующие«наихудшим»образцам,нарушающим условияККТ,дляихвыбораприменяютсяразличныеэвристические процедуры. Когда не остается двойственных переменных, подходящих для рабочего множества, исходная задача (27) оказывается решенной. На рис. 12 представлено развитие этой идеи.

Рассмотримтришагапроцессаобучения.Горизонтальнаялиния представляет собой ТП на каждом шаге, темные прямоугольники (квадратики)–рабочеемножество,т.е.подлежащиеоптимизации на этом шаге множители Лагранжа.

43

Chunking

Osuna

SMO

Рис. 12. Три процедуры решения задачи квадратичного программирования

Процедура chunking (предложена Вапником) на каждом шаге решает задачу квадратичного программирования, рабочее множество которой содержит все ненулевые значения αi предыдущего шагаификсированноечислоновыхзначенийαj,соответствующих «наихудшим»образцам-нарушителям.Такимобразом,количество образцов,принимающихучастиевобучениинакаждомшаге,может расти.Размерностьзадачименяетсяотшагакшагуиокончательно становится равной количеству ненулевых оптимальных значений αi. Этот подход полностью не решает проблемы большой размерности задачи и требует на каждом шаге оптимизатора (модуля, реализующегорешениезадачиквадратичногопрограммирования).

Процедура декомпозиции (предложена Осуной, 1997) на каждом шаге решает задачу квадратичного программирования фиксированнойразмерности.Приэтомиз/врабочеемножествоудаляется/ добавляется по крайней мере один множитель Лагранжа. Этот подходдопускаетработусТПпроизвольногообъема.Ноздесьвсе еще нужен оптимизатор.

Процедура SMO (sequential minimal optimization; предложена в[26])представляетсобойкрайнююформудекомпозиции.Накаждом шагеаналитическирешаетсязадачаквадратичногопрограммированияразмерности2.Таккаквектордвойственныхпеременныхα

44

подчиняется известному линейному ограничению типа равенств, этонаименьшаявозможнаяразмерность.Основнойзадачейстановитсявыборрабочегомножества{αi, αj}накаждомшагепроцедуры.

Заметим, что для задачи восстановления регрессии этот подход применяют только для ε-нечувствительной функции потерь, так как для других выпуклых функций потерь не существует аналитического решения задачи квадратичного программирования размерности 2.

9.2. Декомпозиция двойственной задачи

Еслирабочеемножествоудовлетворяетминимальнымтребованиям,сходимостьпроцессадекомпозициигарантирована.Разделим переменныеαi исходнойдвойственнойзадачи(27)надвекатегории: свободныепеременные,индексыкоторыхсоставляютмножествоВ, ификсированныепеременные,индексыкоторыхсоставляютмножество N (N = {1, 2, …, l}\B). Проведем декомпозицию задачи (27) посредством разделения α (вектора двойственных переменных), y (вектора откликов ТП) и матрицы Q на части, соответствующие множествам индексов B и N:

α =

 

αB

 

; y

 

yB

 

; Q

 

QBB QBN

 

.

 

 

 

 

 

 

 

αN

 

 

=

 

 

=

 

 

 

 

 

 

yN

 

 

 

QNB QNN

 

 

Учитывая симметричность матрицы Q и исключая из целевой функции исходной задачи (27) постоянные слагаемые, получаем задачу квадратичного программирования размерности |B|:

minW

(

α

B )

= −αT

1−Q

 

α

N )

+

1

αT Q

 

α

 

(28)

αB

 

B

(

BN

 

 

2

B

BB

 

B

при ограничениях αTByB TN yN = 0 и 0 ≤αB

C 1.

 

 

 

9.3. Базовые идеи SV-алгоритмов

Для задачи бинарной классификации эффективный алгоритм, реализующий процедуру декомпозиции, – SVM_Light [24], для задачивосстановлениярегрессии(сε-нечувствительнойфункцией потерь) – SVM_Torch [25].

45

Алгоритм SMO, впервые предложенный для задач классификации в [26, 27], реализует крайнюю форму декомпозиции задачи (27) при наименьшем возможном объеме рабочего множества, которое равно 2. Важнейшее преимущество SMO перед другими SVM-алгоритмамисостоитвтом,чторешениезадачи(28)длядвух переменныхнаходятаналитически.Эффективностьиспользования декомпозиции связана с процедурой выбора рабочего множества. Влияние методов выбора рабочего множества на эффективность алгоритма SMO-классификации рассмотрено в [28]. Сходимость SMO-алгоритма для задач классификации доказана в [29].

ЕслидобавитькцелевойфункциипрямойзадачиSVM-обуче- ния переменную b2/2 и минимизировать полученную функцию по w, ξ и b, то двойственная задача минимизации лагранжиана не будет иметь ограничения типа равенств и ее можно свести к задаче решения системы линейных алгебраических уравнений. ДанныйподходкпостроениюSV-машинреализуеталгоритмSOR (successive over relaxation) [31], решая СЛАУ методом последова-

тельной релаксации.

Алгоритм IU (incremental updating) [33, 34] предполагает online

режим поступления образцов. За конечное число шагов алгоритм приводит к выполнению условий ККТ как для всех предшествующих данных, так и для вновь поступившего образца. Это достигаетсявпроцессеизмененияключевыхпеременныхсистемызасчет наибольшеговозможногоприращениядвойственнойпеременной, соответствующей новому образцу.

Всоответствии с алгоритмами SMO, SOR и IU строят SV-ма- шиныдлязадачибинарнойклассификацииидопускаетсяобобще- ниедлязадачивосстановлениярегрессииприε-нечувствительной функции потерь [30, 32, 35].

Вобщем случае SV-решение для задачи восстановления регрессии с квадратичной функцией потерь абсолютно плотно. Для полученияегоразреженнойаппроксимацииприменяюталгоритмы, основанные на идее последовательного наращивания множества опорныхвекторов.ВсоответствиисалгоритмомGSLS(greedysparse least squares) [36] строят разреженную аппроксимацию полного

46

SV-разложения, включая в него на каждом шаге тренировочный образец, минимизирующий регуляризованный эмпирический риск.

СпомощьюоnlineалгоритмаKRLS(kernelrecursiveleastsquares)

[37]померепоступленияновыхчленовтренировочнойпоследова- тельностистроятразреженноерешение.ВSV-разложениевключа- ются векторы, входящие в составленный согласно определенному критерию словарь. Вновь поступивший вектор добавляется в словарь в том случае, если он не является приближенной линейной аппроксимацией векторов, входящих в словарь в момент его поступления.

СпомощьюоnlineалгоритмапостроенияSV-машиныNORMA (naive online risk minimization algorithm) [38, 39] непосредственно минимизируется регуляризованный риск, при этом используется стохастический градиентный спуск в гильбертовом пространстве аппроксимирующихфункций.Простойиэффективныйалгоритм NORMA разработан для решения широкого круга проблем, таких как классификация, восстановление регрессии и классификация при отсутствии меток (novelty detection).

9.4.Преимущества SVM-подхода

Ифункция,оценивающаякривуюрегрессии,ирешающееправило задачи бинарной классификации всегда имеют вид f(x) =

=l βik(xi,x)+b, гдеk(x,x′)–ядернаяфункция,соответствующая

i=1

скалярномупроизведениювпространствепризнаков;β–l-мерный вектор весов признаков (l – объем ТП); b – сдвиг.

Переход из исходного пространства объектов в пространство признаковпосредствомнекоторогоотображенияΦцелесообразен по следующим причинам:

в качестве скалярного произведения используется ядерная функция k(x, x′) = (Φ(x), Φ(x′));

явныйвидотображенияΦможетбытьнеизвестен,достаточно знать и использовать ядро k;

47

в пространстве признаков нелинейную задачу обучения решают подобно линейной задаче;

поскольку используются подходящие ядерные функции в качестве количественной меры подобия двух объектов, SVM-методы применяют при анализе данных, не имеющих ясного векторного представления.

Заданноемножествоаппроксимирующихфункцийпредставляет собой достаточно большой класс нелинейных (в зависимости от вида ядра) функций. При этом они линейны по параметрам.

Благодаря свойству разреженности, присущему SV-машинам, число опорных векторов значительно меньше объема тренировочной последовательности. Количество свободных параметров равно количествуопорныхвекторовинезависитотразмерностивходных векторов.Такимобразом,методопорныхвекторовдлязадачбинарнойклассификацииивосстановлениярегрессииможноприменять прилюбомчислеконтролируемыхфакторов,посколькуонпреодолевает проклятие размерности.

ЭффективныеSVM-алгоритмырешениязадачибинарнойклас- сификации:

sequential minimal optimization (SMO) [26, 27];

successive over relaxation (SOR) [31];

incremental updating (IU) [33, 34];

naive online risk minimization algorithm (NORMА) [38];

SVM_Light [24].

ЭффективныеSVM-алгоритмырешениязадачивосстановления регрессии для ε-нечувствительной функции потерь:

SMO [30];

SOR [32];

IU [35];

NORMА [38];

SVM_Torch [25].

ЭффективныеSVM-алгоритмырешениязадачивосстановления регрессии на основе квадратичной функции потерь:

greedy sparse least squares (GSLS-алгоритм) [36];

kernel recursive least squares (KRLS-алгоритм) [37].

48

10. SV-АЛГОРИТМ РЕШЕНИЯ ЗАДАЧИ КЛАСТЕРИЗАЦИИ

Задачаавтоматическойклассификацииобъектов,иликластеризации,заключаетсявтом,чтобывсюанализируемуюсовокупность объектов разбить на небольшое число однородных, в определенном смысле, групп, или кластеров. Несмотря на существующее разнообразиепроцедуркластер-анализа,досихпорнеразработан универсальныйэффективныйалгоритмкластеризациидляданных различной природы.

Бен-Гурсколлегами[40]предложилипроцедурукластеризации нового типа, основанную на SVM-подходе. Отметим, что SV-ал- горитм кластеризации не определяет кластеры посредством ряда прототипов,нетребуетзаданиячислакластеровистроиткластеры произвольнойформы.SV-кластеризацияявляетсяоднимизнемно- гих методов, которые позволяют работать с выбросами.

10.1. SV-кластеризация

СогласноалгоритмуSV-кластеризации(supportvectorclustering, SVC)исходныевекторы,которыенеобходиморазбитьнакластеры с помощью гауссова ядра k(xi, xj) = exp(−q||xi xj||2) с параметром q > 0, отображаются в пространство признаков большей размерности, где отыскивается радиус наименьшей гиперсферы, охватывающей множество исходных векторов. При обратном отображении(висходноепространство)этасфераможетразделяться нанесколькоконтуров,каждыйизкоторыхвключаетвсебячасть исходных векторов. Полученные контуры интерпретируются как границы кластеров.

Дляследующейзаэтимпроцедурымаркировкикластеров(cluster labeling)могутприменятьсяразличныеметодики.Простая(сточки зренияпонимания)методикамаркировкиосновананапостроении матрицысмежности.Далеекластерыопределяютсякаксвязанные компоненты графа, индуцированного этой матрицей.

Гиперпараметры SVC-алгоритма – параметр гауссова ядра q, которыйуправляетмасштабомисследуемыхданных;параметррегуляризации,илиштрафнойпараметрС,которыйконтролируетдолю

49

точек,лежащихвнесферы,ипомогаетрешатьпроблемуперекрывающихся кластеров и выбросов. Структура данных исследуется в процессе варьирования этих двух параметров при сохранении минимального количества опорных векторов, обеспечивающего гладкость границ кластеров.

10.2. Определение границ кластеров

Пусть Х Rd – исходное пространство объектов, {x i} Х,

i = 1, …, n, – множество точек этого пространства. Используя

 

 

нелинейное преобразование Φ из исходного пространства Х в некоторое гилбертово пространство признаков большей размерности, будем искать гиперсферу с центром в точке a наименьшего радиуса R, охватывающую в пространстве признаков все исходные точки:

R

 

 

2 → min : ||Φ(xi) a||2 ≤ R2, i {1, …, n},

(29)

 

||

|| –

a

a

 

сферы.

 

где

евклидова норма;

– центр

 

 

 

 

 

 

Введемнеотрицательныепеременныеξi,ослабляющиежесткие ограничения. Точки xi, которым соответствуют ξi > 0, находятся в пространстве признаков на большем, чем радиус R, расстоянии от центра a, т. е. лежат вне гиперсферы (и должны быть оштрафованы!).Добавимвцелевуюфункцию(29)суммуξi >0,контролируемую штрафным параметром С > 0, и представим окончательную формулировку оптимизационной задачи:

 

 

 

 

 

min2

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

R2

+C∑ξi

 

(30)

 

 

 

 

 

R ,ξ,a

 

i=1

 

 

 

с ограничениями

 

Φ

(

x

i )

a

 

 

 

2

R2

i

≥0, i 1, …,n .

 

 

 

 

 

 

 

 

 

 

 

 

i

 

{

}

СоставимлагранжианLp,соответствующийэтойзадачеивключающий в себя переменные R2, ξ, a и множители µ и β, контроли-

рующиеоба ограничения: Lp(R2, ξ, a, µ, β) = R2 + CΣiξi Σi µi(R2 +

+ ξi − ||Φ(xi) a||2) Σiβiξi, βi 0, µi 0,

 

i {1, …, n}.

 

 

задачи в терминах лагран-

Приведем формулировку прямой

 

 

2

 

жиана: найти минимум функции Lpпо переменным R

, ξ и a при

50

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]