Статистический анализ больших данных подход на основе машин опорных векторов. Учебное пособие
.pdf
x1 |
z1 |
x2
z3
z2
Рис. 5. Отображение входных векторов из исходного пространства в пространство признаков
случае роль скалярного произведения в пространстве признаков играет ядерная функция k(x, x′) = (x, x′)2:
Φ:R2 → R3;
(x1,x2 ) (z1,z2,z3 ):=(x12,
2x1x2,x22 );
(Ф(x),Ф(x′))=(x12,
2x1x2,x22 )(x1′2,
2x1′x2′,x2′2 )Τ =(x,x ')2 := k (x,x′).
Используя теорему Мерсера, можно ответить на вопрос, какие функции k ( , ) соответствуют скалярному произведению в определенных пространствах признаков, т. е. являются допустимыми SV-ядрами.
Пустьфункцияk : X×X →R непрерывна,симметричнапосвоим аргументам и для f L2(X) удовлетворяет условию Мерсера
∫ k(x,x′) f (x) f (x′)dxdx′≥ 0. Тогда существует пространство F
X×X
иотображениеΦ :X → Fтакое,что k(x,x′)=(Ф(x),Φ(x′)).Тоесть
k(x, x′) служит скалярным произведением в некотором пространстве признаков F.
21
Переход в пространство признаков целесообразен по следующим причинам:
–в качестве меры подобия двух объектов можно использовать скалярноепроизведениевпространствепризнаков:k(x,x′)=(Φ(x), Φ(x′));
–явныйвидотображенияΦможетбытьнеизвестен,достаточно знатьииспользоватьядернуюфункциюk(∙,∙),следовательно,можно строитьразличныеобучающиеалгоритмы,втомчисленелинейные;
–впространствепризнаковF нелинейнуюзадачуобученияможно решать подобно линейной задаче.
Различныеклассыфункциймогутбытьобученысиспользованием разных ядер. Например, линейное ядро (скалярное произведениевпространстве Rn)соответствуетобучениюлинейныхфункций.
Проблема выбора ядра для конкретной практической задачи имеет большое значение. Ряд теорем устанавливает правила кон- струированиядопустимыхSV-ядернаосновеимеющихся.Исполь- зованиеподходящихядерныхфункцийвкачествеколичественной мерыподобиядвухобъектовсоздаетосновупримененияSVM-ме- тодов при анализе данных, не имеющих явного векторного представления. Обзор ядерных функций, подходящих для различного типа данных, дан в [3].
Допустимые SV-ядра, обычно используемые на практике для данных, допускающих векторное представление:
k(x,x')= e−
x−x′
2 /2σ2 , σ > 0, – гауссово ядро;
k(x, x′) = (γ(x, x′) + θ)p, γ > 0, θ R, − полиномиальное ядро порядка p;
k(x, x′) = th(λ(x, x′) – δ), λ > 0, δ R, − сигмоидальное ядро.
Длянелинейнойзадачипроцессобученияаналогиченпроцессу решения соответствующей линейной задачи, но скалярные произведения (x, x′) заменяются значениями ядра k(x, x′), а вектор w принадлежит пространству признаков.
Итак,ищемрешениенелинейнойзадачиклассификацииввиде
l
f(x) = (w, Ф(x)) + b, где w = ∑αi yixi, w F; b R.
i=1
22
a) |
б) |
Рис. 6. Нелинейно разделимые данные: полиномиальное ядро порядка 2: a – С = 25; б – С = 50
Для нелинейного случая двойственная задача (7) принимает
следующий вид: найти maxLD , где
α
l |
l |
|
LD = ∑αi − |
1 ∑αiαj yi yjk(xi,x j ), |
(15) |
i=1 |
2 i,j=1 |
|
l |
|
|
при ограничениях ∑αi yi = 0 и 0≤ αi ≤C. |
|
|
i=1 |
|
l |
Машинаопорныхвекторовбудетиметьвидf (x)= ∑αi yik(xi,x)+b. |
||
|
|
i=1 |
На рис. 6 представлены нелинейные машины, полученные при различных значениях параметра регуляризации C. Опорные векторы выделеныжирнымикружками,связанныеопорные векторы обведены бледными кружками.
5. ЯДЕРНЫЕ МЕТОДЫ
Ядерные функции могут использоваться для обобщений алгоритмов, которые формулируются в терминах скалярных произведений. В настоящее время наблюдается большое количество «ядролизаций»алгоритмовдляразличныхзадач(срединихмашина опорных векторов, метод главных компонент, линейный дискриминантныйанализ).Ядернымметодамвмашинномобучениипосвящены [5, 6].
23
5.1. Представление данных
Пусть S = (x1, …, xl) X – подмножество входных объектов. Как представить данные для дальнейшей обработки? Можно, используя некоторое отображение Φ в некоторое пространство признаков F, работать с образами исходных объектов в этом пространстве: Φ(S) = (Φ(x1), …, Φ(xl)), Φ(xi) F. Однако при применении ядерных методов данные никогда не представляются индивидуально, а только через множество попарных сравнений. То есть вместо отображения из исходного пространства объектов в пространство признаков используется вещественная функция сравнений (ядерная функция).
Множество S из l объектов, подлежащих анализу, представляется матрицей попарных сравнений K = {k(xi, xj)}, i, j = 1, ..., l, k : X×X → R. Все ядерные методы предназначены для обработки такой ядерной матрицы.
5.2. Положительно-определенные ядра
Функция k: X×X →R представляет собой положительно-опреде- ленное ядро тогда и только тогда, когда она симметрична по своим аргументамидлялюбогонатурального l,любогонабораx1,…,xl X
|
l |
и любого набора c1, …, cl R |
∑ci cj k(xi,x j )≥ 0. |
|
i,j=1 |
Если k(x,x′)–положительно-определенноеядро,толюбаямат- рица попарных сравнений, построенная с его использованием (матрица Грама), симметрична и неотрицательно определена.
5.3. Ядро как скалярное произведение
Показано[6],чтоклассядервида k(x,x′)=(Φ(x),Φ(x′))совпада- етсклассомположительно-определенныхядер.Любоеположитель- но-определенное ядро k можно интерпретировать как скалярное произведение в некотором пространстве (пространстве признаков). При этом представление любого объекта x, Φ(x), не нужно вычислять явно.
24
Поскольку ∑cicj Ф(xi ), Ф(x j ) |
∑ciФ(xi ), ∑c=jФ(x j ) ≥ 0, |
|
i,j |
i |
j |
ядра вида k(x, x′) = (Φ(x), Φ(x′)) положительно определены при любом выборе отображения Φ.
5.4. Ядро как мера подобия объектов
Интерпретация ядра как меры подобия объектов полезна при конструировании ядер для различных типов данных (например, строк,графов,деревьевипр.).Использованиеподходящихядерных функций создает основу применения SVM-методов при анализе данных,неимеющихясноговекторногопредставления.Например, гауссовоядро–убывающаяфункцияевклидоварасстояниямежду
двумявекторами k(x,x')= e−
x−x′
2 /2σ2 , σ>0, имеетподходящуюин-
терпретациюкакмераподобия:чембольшеk(x,x′),темближеx иx′ в пространстве X.
5.5. Ядро как мера гладкости функций
Понятие«гладкостьфункций»двойственнопонятию«подобие объектов». Функция «гладкая», если она мало изменяется между «подобными» точками.
Пусть H = {f } – класс функцийf :X → R, образующий гильбертовопространство,k:X×X→R –ядро.Функцияk(x,x′)называется репродуктивным ядром для H, если:
1)x X k(x, ∙) H;
2)f, k(x, ∙) H = f(x), x X, f H; , H – скалярное про-
изведение в пространстве H (т. е. k обладает репродуктивным
свойством).
Пусть k :X×X→R –положительно-определенноеядро.Функ- цияΦ(x) = k(x,∙)ставитвсоответствиеэлементу x′ X значение k(x, x′).
Построим пространство со скалярным произведением, содержащее образы исходных объектов при отображении Φ. Для этого
25
|
n |
|
рассмотрим пространство с элементами вида f ( )= ∑αi k (xi, ); |
||
n′ |
i=1 |
|
g ( )= ∑βj k (x′j , ), αi, βj R. Определим структуру: |
|
|
j =1 |
n′ |
|
n |
|
|
f ,g := ∑∑αiβj k (xi,x′j ). |
(16) |
|
i=1 j=1 |
|
|
Покажем, что (16) – скалярное произведение. |
|
|
n′ |
n |
|
Заметим,что f ,g = ∑βj f |
(x′j ); f ,g = ∑αi g (xi ). Тогда |
f ,g = |
j=1 |
i=1 |
|
=
g, f
.Поскольку k – положительно-определенное ядро, то для
n |
|
|
|
любогоэлемента f f , f := ∑αi αj k (xi,x j )≥ 0. Дляпроизвольных |
|||
i,j=1 |
p |
p |
p |
наборов f1, …, fp и γ1, …, γp R |
∑γi γj |
fi, f j = ∑γi fi,∑γj f j ≥ 0. |
|
|
i,j=1 |
i=1 |
j=1 |
Следовательно,структура , –положительно-определенноеядро. Заметим, что из (16) следует
f ,k (x, )
= f (x), x X , f ,
в частности,
k (x,x′)= k (x, ), k (x′, ).
СогласнонеравенствуКоши–Шварца f : f (x) = f ( ),k (x, ) ≤
1
≤ 
k (x,x) f , f 2 .Отсюда,если f, f = 0, H = {f}–классфункций
n
f:X → R таких, что f ( )= ∑αi k (xi, ), то f – нулевой элемент про-
i=1
странства H.
Таким образом, показано, что (16) – скалярное произведение в пространстве H, а k : X×X → R – репродуктивное ядро для H.
Согласно скалярному произведению (16) норма в Н 
f 
2H =
=∑αi αj k (xi,x j ). i,j=1n
26
Такимобразом,H –этогильбертовопространствосрепродук-
тивным ядром (reproducing kernel hilbert space, RKHS) [5–7].
Согласно теореме Мура–Аронсзайна [4] существует взаимно однозначное соответствие между множеством положительноопределенных ядер и множеством RKH-пространств.
Норма в пространстве H является мерой гладкости, или мерой сложности функций. Многие ядерные методы (SVM в том числе) можно понимать как алгоритмы, которые для данного множества объектоввосстанавливаютфункциюизпространстваН,миними-
зирующую регуляризованный риск Rreg [f ]= Remp [f ]+λ
f 
2H .
Норма || f ||H обеспечивает подходящую гладкость решения. Параметр регуляризации λ > 0. Параметр регуляризации C для стандартного SVM-обучения связан с λ соотношением C = 1/(2lλ), где l – объем ТП.
Показано (теорема репрезентативности; различные формулировки теоремы предложены в [5–7]), что функция, минимизирующая регуляризованный риск, единственна и представляет собой
|
l |
ядерную машину, т. е. имеет вид f (x)= ∑βik (xi,x), где вектор |
|
весов β Rl. |
i=1 |
|
|
Итак,ядерныйприемсостоитвтом,чтолюбойлинейныйалгоритм,использующийтолькоскалярныепроизведения,можетбыть неявновыполненвпространствепризнаков,надолишькаждоескалярноепроизведениезаменитьнелинейнымядром.Такимобразом, нелинейностьнетребуетдополнительныхвычислительныхзатрат.
6. SVM-ПОДХОД К РЕШЕНИЮ ЗАДАЧИ ВОССТАНОВЛЕНИЯ РЕГРЕССИИ
6.1. Постановка задачи
Пусть вектор контролируемых факторов х Rn распределен согласновероятностноймереP(x).Отклик(зависимаяпеременная) у R распределен согласно P(y|x). Существует функция регрессии
у* (x)= ∫ yP(y|x)dy.
27
По случайной независимой выборке l пар (x1, y1), …, (xl, yl), таких что yi = y*(xi) + ξi, где ξi, i = 1, …, l, – случайные ошибки (шум), требуется восстановить регрессию, т. е. в заданном классе функций {f(x, α} отыскать функцию f(x, α*), наиболее близкую к регрессии y*(x).
6.2. Функции потерь
Выбор функции потерь, определяющей, каким образом штрафуютсяошибкиобучения,долженбытьсодержательнообоснован для каждой конкретной задачи прогнозирования. Поскольку различнымфункциямпотерьсоответствуютразныеметодыобучения, целесообразноизбегатьсложныхфункций,которыемогутпривести к трудной оптимизационной задаче. Обычно используют симметричные функции потерь, такие как ε-нечувствительная, юберовская, абсолютная и квадратичная (рис. 7).
Вид функции потерь связан с априорными предположениями о распределении шума в регрессионной модели [7, 8], а именно оптимальная согласно принципу максимального правдоподобия функция потерь L(f(x), y) = –ln p(y – f(x)), где p(y – f(x)) ≡ p(ξ) –
плотность распределения шума.
ε-Нечувствительная функция потерь. Пусть (x1, y1), …, (xl, yl)
Rn×R − тренировочная последовательность. Требуется найти наиболее гладкую функцию f(x), отклонение значений которой от наблюдаемого y по всей тренировочной последовательности не превышает заданное число ε.
а) |
б) |
в) |
L |
L |
L |
|
|
ε |
y – f(x, w) |
y – f(x, w) |
y – f(x, w) |
Рис. 7. Функции потерь: а – квадратичная, юберовская (штриховая линия); б – абсолютная ошибка; в – ε-нечувствительная
28
Будем искать линейную оценку функции регрессии в виде f(x) = (w, x) + b, w Rn, b R. Мерой гладкости класса линейных
функций может служить евклидова норма ||w||.
Для ослабления жестких ограничений введем переменные ξi, ξi*≥0.Тогда,согласнопринципуструктурнойминимизациириска, задача восстановления регрессии сводится к задаче оптимизации: найти
|
|
1 |
|
|
|
|
|
l |
|
|
min* |
|
w |
|
|
|
2 +C∑(ξi +ξi* ) |
(17) |
|
|
|
|
|
||||||
|
2 |
|
|
|
|||||
|
w,ξ,ξ |
|
|
|
|
|
i=1 |
|
|
|
yi − |
(w,xi )−b≤ ε+ξi, |
|
||||||
при ограничениях |
|
|
|
|
|
|
|
|
|
(w,xi )+b− yi ≤ ε+ξi*, |
|
||||||||
|
|
|
* |
|
|
|
|
|
|
|
ξi, ξi ≥ 0.................... |
|
|||||||
Параметр регуляризации С > 0 устанавливает баланс между допустимой ошибкой обучения и сложностью класса функций, из котороговыбираетсярешениеf(x).Формулировка(17)соответствует использованию так называемой ε-нечувствительной функции потерь (ε-insensitive loss function)
|
|
|
|
|
|
f(xi )− yi |
|
≤ε, |
||
|
|
|
|
|
|
|||||
Lε ( f(xi ),yi )= |
|
|
0,если |
|
||||||
f(xi )− yi |
|
= |
|
|
|
|
|
|
|
|
ε |
|
f(xi )− yi |
|
−ε иначе. |
||||||
|
|
|||||||||
|
|
|
|
|
||||||
|
|
|
|
|
|
|
|
|
|
|
Для задачи выпуклого программирования (17) лагранжиан имеет вид
|
( |
|
) |
|
1 |
|
|
|
|
|
|
|
|
l |
l |
|
L |
w,b,ξ(*),α(*),η(*) |
= |
|
|
|
w |
|
|
|
2 |
+ C∑(ξi +ξ*i |
)−∑αi (ε+ξi – yi + |
||||
|
|
|
|
|||||||||||||
|
|
|
2 |
|
|
|
|
|
|
|
|
i=1 |
i=1 |
|
||
|
|
l |
|
|
|
|
|
|
|
|
|
|
|
|
l |
), |
+ (w,xi )+b)–∑αi* |
(ε+ξi* + yi −(w,xi )−b)−∑(ηiξi +η*i ξ*i |
|||||||||||||||
|
|
i=1 |
|
|
|
|
|
|
|
|
|
|
|
|
i=1 |
|
αi(*)≥0,ηi(*)≥0,ξi(*)≥0,гдеξ(*) обозначаетпеременнуюкакξ,такиξ*. Вычисляя частные производные лагранжиана по w, b, ξi(*)
и приравнивая их нулю, получим
∂L |
l |
|
= ∑(αi −αi* )= 0; |
(18) |
|
∂b |
i=1 |
|
29
∂L |
|
|
l |
|
|
= wj −∑(αi −αi* )xij = 0, j =1, …,n; |
(19) |
||
∂wj |
|
|||
|
|
i=1 |
|
|
|
|
∂L |
= C −αi* −ηi* = 0, i =1, …,l. |
(20) |
|
∂ξ(*) |
|||
|
|
|
||
|
|
i |
|
|
Подставляя (18)–(20) в лагранжиан, получим двойственную задачу:
|
1 |
l |
|
l |
l |
max− |
∑(αi −αi* )(αj −α*j )(xi,x j )−ε∑(αi +αi* )+∑yi(αi −αi* )(21) |
||||
α(*) |
2 i,j=1 |
|
i=1 |
i=1 |
|
|
|
|
l |
|
|
|
|
∑(αi −αi* )= 0, |
|
||
при ограничениях i=1 |
|
|
|||
|
|
|
* |
[0,C]. |
|
|
|
|
αi,αi |
|
|
В этом случае условия оптимальности Каруша–Куна–Таккера будут необходимыми и достаточными.
Наряду с соотношениями (18)–(20), условия ККТ включают в себя условия комплиментарностиαi (ε+ξi − yi +(w,xi )+b)= 0;
α*i (ε+ξ*i − yi +(w,xi )+b)= 0; (C −αi )ξi = 0; (C −*iα) *i ξ 0=.
Понятно, что αiαi* = 0 для всех значений i. Из условий ККТ следует:
–только образцы, для которых αi(*) = C, лежат вне ε-области вокруг f(x);
–для αi(*) (0, C) соответствующие ξi(*) = 0, при этом можно легко вычислить сдвиг b;
–длявсехобразцов,лежащихвнутриε-области(ε-tube),αi(*)=0, что свидетельствует о разреженности SV-решения.
Таким образом, в SV-разложение войдет только часть векторов тренировочной последовательности. Они и являются опорными векторами.
УсловияККТпозволяютнайтивекторw сиспользованиемтоль-
l
ко тренировочной последовательности w = ∑(αi −α*i )xi и, следо-
i=1
вательно, решение задачи восстановления линейной регрессии,
30
