Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистический анализ больших данных подход на основе машин опорных векторов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
852 Кб
Скачать

заменить среднее по мере P(x, y) средним по тренировочным дан-

ным: Remp [f ]= 1l l L(f (xi ),y), т.е.минимизироватьэмпирический

i=1

риск (ошибку обучения, training error). Однако при конечных выборкахэтотпринципможетприводитькпереобучению(overfitting). ЕсликачестворешающейфункциивнеТПнавновьпоступающих образцах намного ниже качества, достигнутого на ТП, говорят об эффекте переобучения.

2. СТРУКТУРНАЯ МИНИМИЗАЦИЯ РИСКА

Одинизспособовпреодоленияэффектапереобучения–суже- ниеклассааппроксимирующихфункцийдоклассасосложностью, подходящей для имеющейся тренировочной последовательности. (Мера сложности функций выступает как мера способности их к обобщению.)

Как найти оптимальную сложность класса функций для имеющегося объема ТП?

Статистическаятеорияобученияутверждаетновыйиндукцион- ныйпринципобученияпоконечнымвыборкам–структурнуюми- нимизациюриска(structuralriskminimization).Этотпринципдает способ, позволяющий контролировать сложность класса гипотез.

Показано, что если эмпирический риск с ростом объема ТП повероятностиравномернопоαстремитсякожидаемомуриску,

 

 

 

 

Remp [f ]R[f ]

 

 

= 0,

то верхняя гра-

 

 

 

 

т. е. при ε > 0 limP sup

 

 

> ε

l→∞

 

α

 

 

 

 

 

 

 

 

 

 

ница ожидаемого риска, основанная на некоторой мере сложности функций h, имеет вид

R[f ]R

[f ]+Ω

h

,ln

η

(1)

emp

 

 

 

 

 

 

 

l

 

l

 

игарантированасвероятностью(1–η)длялюбогоη (0,1)илюбойфункции f иззаданногоклассааппроксимирующихфункций {f(x,α)}смеройсложностиhприl > h.Второеслагаемоев(1)контролирует сложность класса аппроксимирующих функций и не зависит от ТП.

11

В соответствии с принципом структурной минимизации риска существует способ, позволяющий контролировать сложность класса функций, из которого выбирается решение. На заданном множестве гипотез {f(x, α)} согласно некоторой мере сложности подклассов h вводится вложенная структура. Вначале на каждом элементе структуры выбирается функция, минимизирующая эм- пирическийриск,затемизотобранных–функция,доставляющая минимум верхней границе ожидаемого риска (1).

Cущность нового индукционного принципа – минимизация верхней границы ожидаемого риска. Это обеспечивает согласованность между ошибкой обучения и сложностью класса аппроксимирующихфункций.Принципструктурнойминимизациириска обеспечивает SV-машины способностью к обобщению, которая и является целью статистического обучения.

Определиммерусложностифункций–размерностьВапника– Червоненкиса (VC-dimension).

Рассмотрим последовательность l точек из Rn. Она может быть разделенанадвакласса2l способами.Пустьдлялюбогоразбиения можетбытьнайденэлементмножествафункций{f(x,α)},который правильно относит точки к соответствующему классу. Тогда говорят,чтоданноемножествоточекразделяетсязаданныммножеством функций.

Мера сложности функций, называемая размерностью Вапни- ка–Червоненкиса, для множества функций {f(x, α)} определяется как максимальное число точек ТП, которое может быть разделено с помощью этого множества функций.

Рассмотримзадачубинарнойклассификациисфункциейпотерь θ(−yf(x)),гдеθ()–функцияХевисайда.Пустьклассфункций{f(x,α)} имеет размерность Вапника–Червоненкиса, равную h. Тогда верхняя граница ожидаемого риска для любой функцииf из заданного

 

 

 

 

2l

 

 

η

 

 

h ln

h

+1

ln

4

 

класса будет иметь вид R[f ]Remp [f ]+

 

 

 

 

 

 

 

 

 

 

l

 

 

 

 

 

 

 

 

 

 

 

 

и гарантирована с вероятностью (1 – η)для любого η (0, 1) иl > h.

12

3. ЛИНЕЙНЫЙ SVM-КЛАССИФИКАТОР

3.1. Линейно разделимые данные

Рассмотримнапримерезадачибинарнойклассификациилинейно разделимых данных основные идеи и преимущества SVM-об- учения.

Пусть(x1,y1),…,(xl,yl) Rn×R −тренировочнаяпоследовательность. В этом случае:

эмпирический риск должен быть равным нулю;

выходyможетприниматьтолькодвазначения:−1и+1(метка класса);

заданный класс аппроксимирующих функций – множество гиперплоскостей f(x) = 0, где f(x) = (w, x) + b ((w, x) – скалярное произведение x и w Rn; b R);

в качестве функции потерь естественно взять θ(–yf(x)), где θ( ) – функция Хевисайда.

Для параметров разделяющей гиперплоскости (ГП) выберем масштаб так, чтобы для векторов ТП выполнялось условие

min (w,xi )+b =1. Тогда расстояние между двумя ближайшими к

1≤il

этой канонической для данной ТП разделяющей ГП векторами из разных классов (так называемая margin – ширина полосы) будетравно2/||w||,где|| ||–евклидованорма.Гиперплоскостивида (w, x) + b = ±1 называются поддерживающими (рис. 1).

Посколькуцельюобученияявляетсяпостроениемашины,обладающейнаскольковозможнолучшейспособностьюкобобщению, оптимальнымрешениемзадачиклассификациидолжнабытьканоническаядляданнойТПразделяющаяГП,имеющаямаксимальную ширину полосы. На рис. 2 представлены две возможные разделяющие гиперплоскости с разной шириной полосы. Поскольку решение,показанноенарис.2,б,обладаетбольшейспособностью к обобщению, оно предпочтительнее.

На множестве канонических разделяющих ГП введем вложенную структуру с использованием такой меры сложности классов гиперплоскостей, как размерность Вапника–Червоненкиса h,

13

{х | <w, x> + b = +1}

{х | <w, x>+ b = –1}

 

x1 yi = +1

 

x2

yi = –1

w

 

{х | <w, x> + b = 0}

Рис. 1. Каноническая разделяющая гиперплоскость и соответствующие ей поддерживающие гиперплоскости

a)

Узкая

б)

x2

x2

полоса

Широкая полоса

 

 

 

 

x

1

x1

Рис. 2. Разделяющие гиперплоскости с разной шириной полосы:

кружки – класс 1, у = +1; квадратики – класс 2, у = –1

азатемвпроцессеобучениявыберемподкласссh,подходящейдля даннойтренировочнойпоследовательности,прикоторойверхняя граница ожидаемого риска (1) будет минимальной.

Вапник показал, что для класса гиперплоскостей h ограничена сверху величиной, связанной с шириной полосы: если ограничить

14

снизуширинуполосывеличиной2/A,то||w||≤A и hA2R2+1,гдеR – радиуснаименьшейгиперсферы,охватывающеймножествовекторов ТП. Поэтому малое значение ||w|| приводит к малому значениюh, и минимизация||w||представляетсобойреализациюпринципаструктурнойминимизациириска.Разделяющиегиперплоскостиостаютсяза пределамигиперсферрадиуса1/А,охватывающихточкиТП(рис.3).

Такимобразом,минимумнормывеса||w||каноническойразделяющейГПодновременномаксимизируетвеличинуmarginиминими-

зирует Ω(h). Найдем min

1

 

 

 

w

 

 

 

2 при ограничениях y ((w,x ) + b)≥ 1,

 

 

 

 

w

2

 

 

 

 

 

 

 

i

i

 

 

 

 

 

 

 

 

 

i=1,...,l,которыеявляютсяусловиямиклассификациибезошибок. Составим функцию Лагранжа, соответствующую этой задаче:

Lp (w,b)= 12 w 2 i=l1αi yi ((w,xi )

+b)+αi, гдеαi≥0−множите-

i=1l

ли Лагранжа.

Сформулируемпрямуюзадачуоптимизациивтерминахцелевой функции Lp:найтиминимумцелевойфункцииLp поw иb,требуя,

x1

1

A

R

Точка ТП

x2

Рис. 3. Наименьшая гиперсфера, охватывающая множество векторов ТП, при ||w|| ≤ A

15

чтобы градиент лагранжиана по всем {αi} был равен нулю и αi ≥ 0. Это задача выпуклого квадратичного программирования. Вместо нее можно решать эквивалентную ей двойственную задачу: найти максимум целевой функции Lp по {αi}, требуя, чтобы градиент лагранжиана по w и b был равен нулю и αi ≥ 0.

Вычислив градиент лагранжиана Lp по w и b и приравняв его нулю, получим

l

 

w = αi yixi;

(2)

i=1

 

l

 

αi yi = 0.

(3)

i =1

Подставив ограничения типа равенств (2) и (3) в лагранжиан, найдемокончательнуюформулировкудвойственнойзадачи:найти maxα LD , где

l

 

l

 

LD = αi

1 αiαj yi yj (xi,x j )

(4)

i=1

 

2 i,j=1

 

l

 

 

 

при ограниченияхαi yi

= 0 и αi ≥ 0.

 

i=1

Таким образом, решение задачи SVM-обучения эквивалентно решению задачи квадратичного программирования (4), удовлетворяющего условиям Каруша–Куна–Таккера (ККТ)

L

l

 

 

= wk αi yi xik = 0, k =1, …,n;

 

wk

 

i=1

 

 

L

l

 

 

= −αi yi = 0;

 

 

b

i=1

 

yi ((w,xi )+b)−1≥ 0, i =1, …,l;

(5)

 

αi ≥ 0, i =1, …,l;

 

(yi ((w,xi )+b)−1)= 0, i =1, …,l.

 

16

ДляэтойзадачиусловияККТнеобходимыидостаточны.Используя условия(5),получаютрядочевидныхпреимуществдляоптимальных

{αi}:

w находят, согласно (2), применяя только ТП. Такой вид вектора весов называют SV-разложением;

при αi > 0 из соотношения (5) легко найти b;

правильноклассифицированнымвекторамТП,лежащимвне полосы, соответствуют αi = 0;

правильно классифицированным векторам ТП, лежащим на оптимальных поддерживающих гиперплоскостях, соответствуют

αi > 0. Эти векторы и будут опорными, определяющими решение задачи.

Опорные векторы представляют собой наиболее информативныеточкитренировочнойпоследовательности:еслиубратьизнее всеостальныеточкииповторитьпроцессобучения,решениеостанется тем же.

Окончательное решение задачи бинарной классификации линейно разделимых данных (hard margin SVM) представляет собой

l

оптимальную гиперплоскость, имеющую вид αi yi (xi,x)+b= 0.

i=1

Линейной машиной опорных векторов является функция

l

 

f (x)= αi yi (xi,x)+b.

(6)

i=1

Заметим, что количество свободных параметров определяется количествомопорныхвекторов(числокоторыхзначительноменьше объема l ТП) и не зависит от размерностиn входных векторов. Для

 

l

 

тестирования новых векторов используют sign

αi yi (xi,x)+b .

i=1

 

3.2. Линейно неразделимые данные

Для линейно неразделимых данных выберем каноническую гиперплоскость, которая разделяет тренировочные точки настолько правильно, насколько это возможно, следуя идее максимальной ширины полосы, т. е. построим soft margin SVM.

17

Дляослабленияжесткихограниченийвводятнеотрицательные переменныеξi, i =1,…,l.Теперьвпроцессеобучения,нарядус||w||, минимизируют и верхнюю границу эмпирического риска. Такая целевая функция представляет собой верхнюю границу ожидаемого риска

 

1

 

 

 

 

 

 

 

2

l

min

 

 

 

w

 

 

 

+Cξi

 

 

 

 

w

2

 

 

 

 

 

 

 

 

i=1

приограничениях yi ((w,xi )+b)≥1−ξi, ξi ≥ 0, i =1,…,l, гдепараметр регуляризации C > 0 контролирует ширину полосы, значение параметра задается заранее. Чем больше C, тем уже ширина полосы. С − штрафной параметр, его большее значение соответствует назначениюбольшегоштрафаошибкамклассификациитренировочных образцов.

Соответствующий лагранжиан имеет вид

 

1

 

 

 

 

 

 

 

 

l

l

l

Lp (w,b)=

 

 

 

w

 

 

 

2

αi {yi ((w,xi )+b)−1+ξi}+C ξi µiξi,

 

 

 

 

 

2

 

 

 

 

 

 

 

 

i=1

i=1

i=1

где µi ≥ 0 – множители Лагранжа для ограничений на переменные ξi, i = 1, …, l. Вычислив градиент лагранжиана Lp по w, b и ξ, приравнявегонулюиподставивполученныеограничениятипаравенств влагранжианLp,найдемокончательнуюформулировкудвойствен-

ной дачи для линейно неразделимого случая: найти maxLD , где

α

l

1

l

 

LD = αi

αiαj yi yj (xi,x j )

(7)

i=1

2 i,j=1

 

l

при ограничениях αi yi = 0 и 0≤ αi C.

i=1

Запишем условия оптимальности (условия ККТ) для этой задачи:

L

l

 

 

= wk αi yi xik = 0, k =1, …,n;

(8)

wk

i=1

 

 

L

l

 

 

= −αi yi = 0;

(9)

 

b

i=1

 

18

 

L

=C −αi −µi, i =1, …,l;

(10)

 

 

 

∂ξi

 

yi ((w,xi )+b)−1+ξi ≥ 0, i =1, …,l;

(11)

ξi ≥ 0; αi ≥ 0; µi ≥ 0, i =1, …,l;

(12)

αi (yi ((w,xi )+b)−1+ξi )= 0, i =1, …,l;

(13)

 

 

µiξi ≥ 0, i =1, …,l.

(14)

Из соотношений (13) и (14) определяем сдвиг b, заметив, что

ξi = 0, если 0 < αi < C (это следует из (10) и (14)).

ДляоптимальныхмножителейЛагранжаусловия(8)–(14)можно записать в более удобной форме:

– если αi = 0, то yi f(xi) ≥ 1 и ξi = 0 (вектор xi лежит вне полосы);

x1

0 < α < C, ξ = 0

x2

α = C,

α = C,

ξ > 1

0 < ξ < 1

Рис. 4. Оптимальные множители Лагранжа и соответствующие им тренировочные векторы

19

если 0 < αi < C, то yi f(xi) = 1 и ξ i = 0 (xi – опорный вектор, margin SV);

если αi = C, то yi f(xi) ≤ 1 и ξi 0 (xi – связанный опорный вектор, bounded SV).

ИзусловийККТследует,чтодлялинейнонеразделимыхданных машинаопорныхвекторовимееттотжевид,чтоивлинейноразде-

l

лимом случае (6): f (x)= αi yi (xi,x)+b и по-прежнему является

i=1

разреженнойпоα.Нарис.4представленпримерусловийоптимальности задачи (7).

4. НЕЛИНЕЙНОЕ SVM-ОБУЧЕНИЕ

Двойственная формулировка задачи оптимизации для линейного случая обеспечивает обобщение процедуры SVM-обучения на нелинейный случай.

Используятакназываемыйядерныйприем(kerneltrick),можно строить гиперплоскости с максимальной шириной полосы в пространстве признаков, куда отображаются исходные образы. При этомалгоритмрешениязадачиформальноостаетсяподобнымалгоритмудлялинейногослучая,заисключениемтого,чтокаждоескалярное произведение заменяется нелинейной ядерной функцией.

Отобразим исходное пространство входных объектов Х (input space) в пространство признаков F (feature space) сколь угодно большой размерности:

 

Ф : Х F;

х

→ Ф(х).

ВпространствеF дляданнойзадачиобученияиспользуетсяпрежнийалгоритм,нотеперьвместоисходнойТП(x1,y1),…,(xl,yl) Rn×R работают с последовательностью (Ф(x1), y1), …, (Φ(xl), yl) F×R.

На рис. 5 представлен пример отображения Φ исходных входныхвекторовизпространстваR2впространствопризнаковR3,где построенлинейныйклассификатор.Висходномпространствеему соответствуетнелинейнаярешающаяграница(эллипс).Вкачестве признаков использованы одночлены второй степени. В данном

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]