Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистический анализ больших данных подход на основе машин опорных векторов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
852 Кб
Скачать

x1

z1

x2

z3

z2

Рис. 5. Отображение входных векторов из исходного пространства в пространство признаков

случае роль скалярного произведения в пространстве признаков играет ядерная функция k(x, x′) = (x, x′)2:

Φ:R2 R3;

(x1,x2 ) (z1,z2,z3 ):=(x12,2x1x2,x22 );

(Ф(x)(x))=(x12,2x1x2,x22 )(x12,2x1x2′,x22 )Τ =(x,x ')2 := k (x,x).

Используя теорему Мерсера, можно ответить на вопрос, какие функции k ( , ) соответствуют скалярному произведению в определенных пространствах признаков, т. е. являются допустимыми SV-ядрами.

Пустьфункцияk : X×X R непрерывна,симметричнапосвоим аргументам и для f L2(X) удовлетворяет условию Мерсера

k(x,x) f (x) f (x)dxdx′≥ 0. Тогда существует пространство F

X×X

иотображениеΦ :X Fтакое,что k(x,x′)=(Ф(x),Φ(x′)).Тоесть

k(x, x′) служит скалярным произведением в некотором пространстве признаков F.

21

Переход в пространство признаков целесообразен по следующим причинам:

в качестве меры подобия двух объектов можно использовать скалярноепроизведениевпространствепризнаков:k(x,x′)=(Φ(x), Φ(x′));

явныйвидотображенияΦможетбытьнеизвестен,достаточно знатьииспользоватьядернуюфункциюk(∙,∙),следовательно,можно строитьразличныеобучающиеалгоритмы,втомчисленелинейные;

впространствепризнаковF нелинейнуюзадачуобученияможно решать подобно линейной задаче.

Различныеклассыфункциймогутбытьобученысиспользованием разных ядер. Например, линейное ядро (скалярное произведениевпространстве Rn)соответствуетобучениюлинейныхфункций.

Проблема выбора ядра для конкретной практической задачи имеет большое значение. Ряд теорем устанавливает правила кон- струированиядопустимыхSV-ядернаосновеимеющихся.Исполь- зованиеподходящихядерныхфункцийвкачествеколичественной мерыподобиядвухобъектовсоздаетосновупримененияSVM-ме- тодов при анализе данных, не имеющих явного векторного представления. Обзор ядерных функций, подходящих для различного типа данных, дан в [3].

Допустимые SV-ядра, обычно используемые на практике для данных, допускающих векторное представление:

k(x,x')= exx2 /2σ2 , σ > 0, – гауссово ядро;

k(x, x′) = (γ(x, x′) + θ)p, γ > 0, θ R, − полиномиальное ядро порядка p;

k(x, x′) = th(λ(x, x′) – δ), λ > 0, δ R, − сигмоидальное ядро.

Длянелинейнойзадачипроцессобученияаналогиченпроцессу решения соответствующей линейной задачи, но скалярные произведения (x, x′) заменяются значениями ядра k(x, x′), а вектор w принадлежит пространству признаков.

Итак,ищемрешениенелинейнойзадачиклассификацииввиде

l

f(x) = (w, Ф(x)) + b, где w = αi yixi, w F; b R.

i=1

22

a)

б)

Рис. 6. Нелинейно разделимые данные: полиномиальное ядро порядка 2: a – С = 25; б – С = 50

Для нелинейного случая двойственная задача (7) принимает

следующий вид: найти maxLD , где

α

l

l

 

LD = αi

1 αiαj yi yjk(xi,x j ),

(15)

i=1

2 i,j=1

 

l

 

 

при ограничениях αi yi = 0 и 0≤ αi C.

 

i=1

 

l

Машинаопорныхвекторовбудетиметьвидf (x)= αi yik(xi,x)+b.

 

 

i=1

На рис. 6 представлены нелинейные машины, полученные при различных значениях параметра регуляризации C. Опорные векторы выделеныжирнымикружками,связанныеопорные векторы обведены бледными кружками.

5. ЯДЕРНЫЕ МЕТОДЫ

Ядерные функции могут использоваться для обобщений алгоритмов, которые формулируются в терминах скалярных произведений. В настоящее время наблюдается большое количество «ядролизаций»алгоритмовдляразличныхзадач(срединихмашина опорных векторов, метод главных компонент, линейный дискриминантныйанализ).Ядернымметодамвмашинномобучениипосвящены [5, 6].

23

5.1. Представление данных

Пусть S = (x1, …, xl) X – подмножество входных объектов. Как представить данные для дальнейшей обработки? Можно, используя некоторое отображение Φ в некоторое пространство признаков F, работать с образами исходных объектов в этом пространстве: Φ(S) = (Φ(x1), …, Φ(xl)), Φ(xi) F. Однако при применении ядерных методов данные никогда не представляются индивидуально, а только через множество попарных сравнений. То есть вместо отображения из исходного пространства объектов в пространство признаков используется вещественная функция сравнений (ядерная функция).

Множество S из l объектов, подлежащих анализу, представляется матрицей попарных сравнений K = {k(xi, xj)}, i, j = 1, ..., l, k : X×X R. Все ядерные методы предназначены для обработки такой ядерной матрицы.

5.2. Положительно-определенные ядра

Функция k: X×X R представляет собой положительно-опреде- ленное ядро тогда и только тогда, когда она симметрична по своим аргументамидлялюбогонатурального l,любогонабораx1,…,xl X

 

l

и любого набора c1, …, cl R

ci cj k(xi,x j )≥ 0.

 

i,j=1

Если k(x,x′)–положительно-определенноеядро,толюбаямат- рица попарных сравнений, построенная с его использованием (матрица Грама), симметрична и неотрицательно определена.

5.3. Ядро как скалярное произведение

Показано[6],чтоклассядервида k(x,x′)=(Φ(x),Φ(x′))совпада- етсклассомположительно-определенныхядер.Любоеположитель- но-определенное ядро k можно интерпретировать как скалярное произведение в некотором пространстве (пространстве признаков). При этом представление любого объекта x, Φ(x), не нужно вычислять явно.

24

Поскольку cicj Ф(xi ), Ф(x j )

ciФ(xi ), c=jФ(x j ) ≥ 0,

i,j

i

j

ядра вида k(x, x′) = (Φ(x), Φ(x′)) положительно определены при любом выборе отображения Φ.

5.4. Ядро как мера подобия объектов

Интерпретация ядра как меры подобия объектов полезна при конструировании ядер для различных типов данных (например, строк,графов,деревьевипр.).Использованиеподходящихядерных функций создает основу применения SVM-методов при анализе данных,неимеющихясноговекторногопредставления.Например, гауссовоядро–убывающаяфункцияевклидоварасстояниямежду

двумявекторами k(x,x')= exx2 /2σ2 , σ>0, имеетподходящуюин-

терпретациюкакмераподобия:чембольшеk(x,x′),темближеx иx′ в пространстве X.

5.5. Ядро как мера гладкости функций

Понятие«гладкостьфункций»двойственнопонятию«подобие объектов». Функция «гладкая», если она мало изменяется между «подобными» точками.

Пусть H = {f } – класс функцийf :X R, образующий гильбертовопространство,k:X×XR –ядро.Функцияk(x,x′)называется репродуктивным ядром для H, если:

1)x X k(x, ∙) H;

2)f, k(x, ∙) H = f(x), x X, f H; , H – скалярное про-

изведение в пространстве H (т. е. k обладает репродуктивным

свойством).

Пусть k :X×XR –положительно-определенноеядро.Функ- цияΦ(x) = k(x,∙)ставитвсоответствиеэлементу xX значение k(x, x′).

Построим пространство со скалярным произведением, содержащее образы исходных объектов при отображении Φ. Для этого

25

 

n

 

рассмотрим пространство с элементами вида f ( )= αi k (xi, );

n

i=1

 

g ( )= βj k (xj , ), αi, βj R. Определим структуру:

 

j =1

n

 

n

 

f ,g := ∑∑αiβj k (xi,xj ).

(16)

i=1 j=1

 

Покажем, что (16) – скалярное произведение.

 

n

n

 

Заметим,что f ,g = βj f

(xj ); f ,g = αi g (xi ). Тогда

f ,g =

j=1

i=1

 

= g, f .Поскольку k – положительно-определенное ядро, то для

n

 

 

 

любогоэлемента f f , f := αi αj k (xi,x j )≥ 0. Дляпроизвольных

i,j=1

p

p

p

наборов f1, …, fp и γ1, …, γp R

γi γj

fi, f j = γi fi,γj f j ≥ 0.

 

i,j=1

i=1

j=1

Следовательно,структура , –положительно-определенноеядро. Заметим, что из (16) следует

f ,k (x, ) = f (x), x X , f ,

в частности,

k (x,x)= k (x, ), k (x′, ).

СогласнонеравенствуКоши–Шварца f : f (x) = f ( ),k (x, )

1

k (x,x) f , f 2 .Отсюда,если f, f = 0, H = {f}–классфункций

n

f:X R таких, что f ( )= αi k (xi, ), то f – нулевой элемент про-

i=1

странства H.

Таким образом, показано, что (16) – скалярное произведение в пространстве H, а k : X×X R – репродуктивное ядро для H.

Согласно скалярному произведению (16) норма в Н f 2H =

=αi αj k (xi,x j ). i,j=1n

26

Такимобразом,H –этогильбертовопространствосрепродук-

тивным ядром (reproducing kernel hilbert space, RKHS) [5–7].

Согласно теореме Мура–Аронсзайна [4] существует взаимно однозначное соответствие между множеством положительноопределенных ядер и множеством RKH-пространств.

Норма в пространстве H является мерой гладкости, или мерой сложности функций. Многие ядерные методы (SVM в том числе) можно понимать как алгоритмы, которые для данного множества объектоввосстанавливаютфункциюизпространстваН,миними-

зирующую регуляризованный риск Rreg [f ]= Remp [f ] f 2H .

Норма || f ||H обеспечивает подходящую гладкость решения. Параметр регуляризации λ > 0. Параметр регуляризации C для стандартного SVM-обучения связан с λ соотношением C = 1/(2lλ), где l – объем ТП.

Показано (теорема репрезентативности; различные формулировки теоремы предложены в [5–7]), что функция, минимизирующая регуляризованный риск, единственна и представляет собой

 

l

ядерную машину, т. е. имеет вид f (x)= βik (xi,x), где вектор

весов β Rl.

i=1

 

Итак,ядерныйприемсостоитвтом,чтолюбойлинейныйалгоритм,использующийтолькоскалярныепроизведения,можетбыть неявновыполненвпространствепризнаков,надолишькаждоескалярноепроизведениезаменитьнелинейнымядром.Такимобразом, нелинейностьнетребуетдополнительныхвычислительныхзатрат.

6. SVM-ПОДХОД К РЕШЕНИЮ ЗАДАЧИ ВОССТАНОВЛЕНИЯ РЕГРЕССИИ

6.1. Постановка задачи

Пусть вектор контролируемых факторов х Rn распределен согласновероятностноймереP(x).Отклик(зависимаяпеременная) у R распределен согласно P(y|x). Существует функция регрессии

у* (x)= ∫ yP(y|x)dy.

27

По случайной независимой выборке l пар (x1, y1), …, (xl, yl), таких что yi = y*(xi) + ξi, где ξi, i = 1, …, l, – случайные ошибки (шум), требуется восстановить регрессию, т. е. в заданном классе функций {f(x, α} отыскать функцию f(x, α*), наиболее близкую к регрессии y*(x).

6.2. Функции потерь

Выбор функции потерь, определяющей, каким образом штрафуютсяошибкиобучения,долженбытьсодержательнообоснован для каждой конкретной задачи прогнозирования. Поскольку различнымфункциямпотерьсоответствуютразныеметодыобучения, целесообразноизбегатьсложныхфункций,которыемогутпривести к трудной оптимизационной задаче. Обычно используют симметричные функции потерь, такие как ε-нечувствительная, юберовская, абсолютная и квадратичная (рис. 7).

Вид функции потерь связан с априорными предположениями о распределении шума в регрессионной модели [7, 8], а именно оптимальная согласно принципу максимального правдоподобия функция потерь L(f(x), y) = –ln p(y f(x)), где p(y f(x)) ≡ p(ξ) –

плотность распределения шума.

ε-Нечувствительная функция потерь. Пусть (x1, y1), …, (xl, yl)

Rn×R − тренировочная последовательность. Требуется найти наиболее гладкую функцию f(x), отклонение значений которой от наблюдаемого y по всей тренировочной последовательности не превышает заданное число ε.

а)

б)

в)

L

L

L

 

 

ε

y – f(x, w)

y – f(x, w)

y – f(x, w)

Рис. 7. Функции потерь: а – квадратичная, юберовская (штриховая линия); б – абсолютная ошибка; в – ε-нечувствительная

28

Будем искать линейную оценку функции регрессии в виде f(x) = (w, x) + b, w Rn, b R. Мерой гладкости класса линейных

функций может служить евклидова норма ||w||.

Для ослабления жестких ограничений введем переменные ξi, ξi*≥0.Тогда,согласнопринципуструктурнойминимизациириска, задача восстановления регрессии сводится к задаче оптимизации: найти

 

 

1

 

 

 

 

 

l

 

 

min*

 

w

 

 

 

2 +C(ξi i* )

(17)

 

 

 

 

 

2

 

 

 

 

w,ξ,ξ

 

 

 

 

 

i=1

 

 

yi

(w,xi )b≤ ε+ξi,

 

при ограничениях

 

 

 

 

 

 

 

 

 

(w,xi )+byi ≤ ε+ξi*,

 

 

 

 

*

 

 

 

 

 

 

ξi, ξi ≥ 0....................

 

Параметр регуляризации С > 0 устанавливает баланс между допустимой ошибкой обучения и сложностью класса функций, из котороговыбираетсярешениеf(x).Формулировка(17)соответствует использованию так называемой ε-нечувствительной функции потерь (ε-insensitive loss function)

 

 

 

 

 

 

f(xi )− yi

 

≤ε,

 

 

 

 

 

 

Lε ( f(xi ),yi )=

 

 

0,если

 

f(xi )− yi

 

=

 

 

 

 

 

 

 

ε

 

f(xi )− yi

 

−ε иначе.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Для задачи выпуклого программирования (17) лагранжиан имеет вид

 

(

 

)

 

1

 

 

 

 

 

 

 

 

l

l

 

L

w,b(*)(*)(*)

=

 

 

 

w

 

 

 

2

+ C(ξi *i

)αi (ε+ξi yi +

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

i=1

i=1

 

 

 

l

 

 

 

 

 

 

 

 

 

 

 

 

l

),

+ (w,xi )+b)αi*

(ε+ξi* + yi (w,xi )b)(ηiξi *i ξ*i

 

 

i=1

 

 

 

 

 

 

 

 

 

 

 

 

i=1

 

αi(*)≥0,ηi(*)≥0,ξi(*)≥0,гдеξ(*) обозначаетпеременнуюкакξ,такиξ*. Вычисляя частные производные лагранжиана по w, b, ξi(*)

и приравнивая их нулю, получим

L

l

 

= i −αi* )= 0;

(18)

b

i=1

 

29

L

 

 

l

 

 

= wj i −αi* )xij = 0, j =1, …,n;

(19)

wj

 

 

 

i=1

 

 

 

L

= C −αi* −ηi* = 0, i =1, …,l.

(20)

 

∂ξ(*)

 

 

 

 

 

i

 

 

Подставляя (18)–(20) в лагранжиан, получим двойственную задачу:

 

1

l

 

l

l

max−

i −αi* )(αj −α*j )(xi,x j )−εi i* )+yii −αi* )(21)

α(*)

2 i,j=1

 

i=1

i=1

 

 

 

l

 

 

 

 

i −αi* )= 0,

 

при ограничениях i=1

 

 

 

 

 

*

[0,C].

 

 

 

 

αii

 

В этом случае условия оптимальности Каруша–Куна–Таккера будут необходимыми и достаточными.

Наряду с соотношениями (18)–(20), условия ККТ включают в себя условия комплиментарностиαi (ε+ξi yi +(w,xi )+b)= 0;

α*i (ε+ξ*i yi +(w,xi )+b)= 0; (C −αi )ξi = 0; (C *iα) *i ξ 0=.

Понятно, что αiαi* = 0 для всех значений i. Из условий ККТ следует:

только образцы, для которых αi(*) = C, лежат вне ε-области вокруг f(x);

для αi(*) (0, C) соответствующие ξi(*) = 0, при этом можно легко вычислить сдвиг b;

длявсехобразцов,лежащихвнутриε-области(ε-tube),αi(*)=0, что свидетельствует о разреженности SV-решения.

Таким образом, в SV-разложение войдет только часть векторов тренировочной последовательности. Они и являются опорными векторами.

УсловияККТпозволяютнайтивекторw сиспользованиемтоль-

l

ко тренировочной последовательности w = i −α*i )xi и, следо-

i=1

вательно, решение задачи восстановления линейной регрессии,

30

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]