Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистический анализ больших данных подход на основе машин опорных векторов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
852 Кб
Скачать

т. е. линейная машина опорных векторов имеет вид f (x)=

l

= i −α*i )(xi,x)+b и не зависит от размерности входных векто-

i=1

ров, а зависит только от числа опорных векторов.

Квадратичная функция потерь. Используя квадратичную функ-

цию потерь, получим задачу оптимизации:

minw12 w 2 + γ∑l ξi2

i=1

при ограничениях yi =(w,xi )+bii ~N (0,σ),i =1, …,l.

Это соответствует гребневой регрессии, а минимизация эмпирического риска – методу наименьших квадратов. Параметр регуляризации γ > 0 связан с введенным ранее параметром C соотношением γ = (2С)/l.

Составим функцию Лагранжа:

L

(

w,b,ξ,α

)

= 1

 

 

 

w

 

 

 

2 +

l

ξ2

l α

 

w,х

i )

+b

 

y

,

 

 

 

 

 

i

 

 

2

 

 

 

 

 

 

 

 

γ∑ i

 

i (

 

 

i

 

 

 

 

 

 

 

 

 

 

 

 

 

i=1

 

 

i=1

 

 

 

 

 

 

 

где α Rl – вектор множителей Лагранжа. Запишем условия оптимальности:

wLk = wk i=l1αi xik = 0, k =1, …,n w = i=l1αixi;

L = −l αi = 0; b i=1

L = 0 αi = γξi, i =1, …,l; ∂ξi

L = 0 (w,xi )+bi yi = 0, i =1, …,l. ∂αi

(22)

(23)

(24)

(25)

Послеисключенияизсоотношений(25)переменныхξi, i=1,…,l, и w согласно (24) и (22) соответственно получаем систему линейныхалгебраическихуравнений(СЛАУ)порядка(l+1)свектором неизвестных (α, b):

31

0

eT

b

0

 

,

 

 

 

=

 

e K+ γ−1E

α

y

 

 

 

 

 

 

 

 

где e – единичный вектор-столбец размерности l; E – единичная матрица l×l; K – ядерная матрица l×l (ядро линейное); y – век- тор-столбец наблюдаемых откликов.

Решениезадачивосстановлениялинейнойрегрессии,согласно

l

(22), будет иметь вид f (x)= αi(xi,x)+b.

i=1

SVM-решение,построенноенаосновеквадратичнойфункции потерь,вобщемслучаеабсолютноплотно:αi≠0длявсехзначенийi. Тоестьсвойстворазреженностирешениянеимеетместа.Следовательно,реализацияметодатребуетнастолькобольшихвременных затрат и такого объема памяти, при которых метод становится непригодным для практического использования.

На практике для получения разреженной аппроксимации полного ядерного разложения применяют различные экономичные алгоритмы.

6.3. Нелинейное SVR-обучение

Для нелинейной задачи (как классификации, так и восстановлениярегрессии)процессобученияаналогиченпроцессурешения соответствующей линейной задачи, но при этом скалярные произведения (x, x′) заменяются значениями ядра k(x, x′) и вектор w принадлежит пространству признаков.

На рис. 8 представлены построенные по точным данным машины опорных векторов для различных значений параметра ε: прогноз истинной закономерности (сплошная линия) согласно тренировочной последовательности (мелкие точки) и образцы (жирные точки), определяющие опорные векторы. Заметим, что с уменьшением ε растет число опорных векторов. На рис. 8, а ε = 0,5, б – ε = 0,2, в – ε = 0,1 и на рис. 8, г ε = 0,02.

Нарис.9показано,какувеличениеε-областисглаживаетвлия- ниешума(данныесильнозашумлены)намодель(прогнозистинной

32

а)

у

б)

у

 

 

х

х

в)

у

г)

у

х

х

Рис. 8. Машины опорных векторов, построенные по точным данным

а)

 

 

 

б)

 

 

 

 

у 4

 

 

 

у

4

 

 

 

 

3

 

 

 

 

3

 

 

 

 

2

 

 

 

 

2

 

 

 

 

1

 

 

 

 

1

 

 

 

 

0

 

 

 

 

0

 

 

 

 

–1

 

 

 

–1

 

 

 

 

–2

 

 

 

–2

 

 

 

 

–4

–2

0

2

4

–4

–2

0

2

4

 

 

 

 

х

 

 

 

 

х

 

 

 

 

 

 

 

 

 

Рис. 9. Истинная зависимость (бледная прерывистая линия),

ее прогноз (сплошная жирная кривая) и ε-зона: + – тренировочная последовательность; + – опорные векторы

закономерности, в нашем случае синусоиды). При увеличении ε требования к точности аппроксимации на ТП ослабляются. Это ведет также к сокращению числа опорных векторов. На рис. 9, а

33

ε=0,1,выбраны15опорныхвекторов,нарис.9,бε=0,5,выбраны 6 опорных векторов, которые обеспечивают лучший прогноз.

7. КАЧЕСТВО АЛГОРИТМОВ ОБУЧЕНИЯ

При обучении машин существенным моментом является оценивание характеристики обобщения (generalization performance) различных алгоритмов обучения. При заданной тренировочной последовательности важно определить, насколько хорошо конкретный алгоритм обучения будет работать на новых данных, т. е. какова его способность к обобщению. Располагая подобной информацией, можно решать вопрос о выборе алгоритма, модели, значений параметров обучения.

На практике при оценивании характеристики (или ошибки) обобщенияиспользуютразличныестратегииперевыбора,приэтом обычноприменяетсяпроцедураk-кратнойперекрестнойпроверки (k-fold cross-validation, CV), и как самостоятельная стратегия, и в составе более сложных стратегий. Наиболее популярной разно- видностьюCV-ошибкиявляетсятакназываемаяleave-one-out(loo) ошибка(скользящийконтроль),получаемаяпослеиспользования l-кратной перекрестной проверки, где l – объем тренировочной последовательности.

Loo-ошибка как оценка ошибки обобщения (generalization error) – важная статистическая оценка качества алгоритмов обучения. В [9–11] обосновано использование loo-ошибки при построении машин.

Введем обозначения:

X – пространство входных объектов x с фиксированным неизвестным распределением вероятностей P(x);

Y пространство выходных объектов y с фиксированным неизвестным распределением вероятностей P(y/x);

D – тренировочная последовательность объема l, т. е. выборка независимых,одинаковораспределенныхсогласнозакону P(x,y) =

=P(xP(y/x) наблюдений (x1, y1), …, (xl, yl);

34

Di – тренировочная последовательность объема (l – 1), полученная из D при удалении i-го образца (xi, yi);

D' – тренировочная последовательность объема (l – 1), полученная из D при удалении одного произвольного образца;

fD : X Y – решение, полученное с использованием данного алгоритма обучения на основе выборки D. Алгоритм обучения называется симметричным, если fD не зависит от перестановки элементов ТП.

Пусть функция потерьL : R×Y R, L(f(x), y) ≡L(f, (x,y)) ≡L(f, z)

штрафует отклонение оценок f(x) от наблюдаемых значений y; z = (x, y).

В качестве ошибки обобщения данного алгоритма обучения относительнофункциипотерьL(∙)рассматриваютожидаемыйриск

R[fD ]= L( fD(x,y))dP(x,y), или Rgen ( f ) EzL( f,z).=

X×Y

Вкачестве эмпирической ошибки (т. е. статистической оценки ошибки обобщения) данного алгоритма обучения относительно функции потерь L можно использовать как эмпирический риск

R

[f

D

]= 1

l L( f

D

(x

,y

)),

 

emp

 

 

l

i

i

 

 

 

 

 

 

i=1

 

 

 

 

 

так и leave-one-out-ошибку

 

 

 

 

 

 

 

 

Rloo [fD ]=

1

l L(fDi

(xi ,yi )).

(26)

 

 

 

 

l

i=1

 

 

 

 

 

Заметим, что в (26) образец (xi, yi) в процессе обучения не используется, на нем тестируется решение, полученное на основе выборки Di объема (l – 1).

Вотличиеотэмпирическогорискаloo-ошибкапочтинесмеще- на: ED Rloo ( fD ) =EDRgen ( fD) .Тоестьloo-ошибка,основанная навыборкахобъемаl,даетнесмещеннуюоценкуошибкиобобщения после обучения по (l – 1) образцу (теорема Лунца–Браилов- ского)[9]).Процессвычисленияloo-ошибкитребуетбольшихвре- менныхзатрат,поэтомумногиеисследователипыталисьполучить верхние границы для этой ошибки.

35

Верхниеграницыдляloo-ошибки,предполагающиепостроение толькоодноймашиныопорныхвекторовнаосновеисходнойтренировочной последовательности объема l, рассмотрены в [9, 11].

Длязадачибинарнойклассификациисиспользованиемфункции потерь θ(–yf(x)), где θ( ) – функция Хевисайда, loo-оценка ядерной машины fD, которая минимизирует регуляризованный рискнаосноветренировочнойпоследовательностиD,ограничена сверху [9]:

Rloo [fD ]1l i=l1θ(yi fD(xi ))1l i=l1θ(αi k(xi,xi )yi fD(xi )).

В[11]предложенаверхняяграницаleave-one-out-оценкиошибки обобщениядлястандартногоSV-классификатора(оценкаЙохимса):

Jerrl = dl ,

где d = {i:(iγ +ξi )≥1}.

Здесьαi−множительЛагранжа;ξi−ослабляющаяпеременная, соответствующая i-му образцу; γ – верхняя граница разности k(x, x) – k(x, x′) для всех допустимых входных векторов x, x′, где k – ядерная функция (для линейного и гауссова ядра γ = 1). Доказано,чтовсреднемэтаоценкапревышаетистиннуюдолюошибок классификации.

Алгоритмы, минимизирующие, как и SVM, регуляризованную целевую функцию (алгоритмы регуляризации), имеют следующее важное свойство: они позволяют получать верхние границы ожидаемого риска, явно не зависящие от меры сложности класса функций, из которого выбирается решение. Эти верхние границы ожидаемогорисказависятявноотпараметрарегуляризации.Сле- довательно,приSVM-подходевыбормоделиможнорассматривать как процесс выбора подходящего уровня сложности для оценивающей функции.

Качество SV-классификатора можно исследовать с примене-

нием ROC-анализа (receiver operator characteristic). Это графиче-

ский метод представления результатов бинарной классификации

36

при машинном обучении, отражающий качество одного классификатора или сравнительную эффективность нескольких классификаторов.

ROC-кривые полезно применять для асимметричного распределения входных векторов и неодинаковой цены ошибок классификации. Эти показатели становятся особенно важными при несбалансированных классах.

Чтобы определить качество классификации отдельно для каждого класса (один класс – с положительными образцами, дру- гой–сотрицательными),используютпоказателичувствительности и специфичности.

Чувствительность отражает эффективность работы бинарного классификатора и определяет долю истинно положительных наблюдений относительно количества фактически положительных. Классификатор, обладающий высокой чувствительностью, обеспечивает большую вероятность правильного распознавания положительных образцов.

Специфичность отражает точность работы бинарного классификатора и определяется как отношение истинно отрицательных наблюденийкчислуфактическиотрицательных.Модель,обладающаявысокойспецифичностью,обеспечиваетбольшуювероятность правильного распознавания отрицательных образцов.

Практическое руководство по корректному использованию ROC-кривых и основных показателей качества классификации можно найти в [12].

8. ОСНОВНЫЕ ЭТАПЫ ПОСТРОЕНИЯ МАШИН ОПОРНЫХ ВЕКТОРОВ

Основные этапы построения машин опорных векторов:

предобработка исходных данных;

выбор ядра;

определение стратегии формирования выборок;

настройка машины;

обучение настроенной машины;

тестирование построенной машины.

37

Определяющиеэтапыэтогопроцесса–настройкамашины(вы- бормодели)иопределениеоптимальныхпараметровнастроенной машины (обучение машины).

Вэтапнастройкимашинывходитпоисктакихзначенийгиперпараметров, параметров регуляризации и ядра, которые приводят к наиболее высокому качеству машины.

Необходимооцениватькачествомашин,получаемыхвпроцессе настройки, а также качество обученной машины. Для этого надо определить показатели (характеристики) качества обучения. Корректнооценитькачествомоделипозволяеттехнологияперевыбора.

ПрипостроенииSVMвпредобработкуисходныхданныхвпервую очередь входит отбор и выделение (конструирование новых признаков из исходных) признаков.

Передприменениемметодовотбораи/иливыделенияпризнаков целесообразноиспользоватьпроцедуруочищенияотшума,т.е.от бесполезных признаков, не влияющих на отклик.

Передначаломанализавседанныенеобходимомасштабировать или стандартизировать, что способствует вычислительной устойчивости используемых алгоритмов.

8.1.Характеристики качества обучения

Впроцессенастройкимашиныкачествоочередноймоделиоценивают на основе характеристик, отражающих качество обуче-

ния (performance measure, validation function). Эти характеристики неявно зависят от гиперпараметров, поэтому их часто называют функциями валидации.

Длясравнениякачестваобученияразличныхмоделей,полученных при разных значениях гиперпараметров, нужно определить критерий (или критерии) поиска.

8.2.Стратегии формирования выборок при настройке машины опорных векторов

Корректно оценить качество очередной модели в процессе настройки машины позволяет правильно подобранная стратегия пе-

ревыбора (resampling technique).

38

Самаяпростаяпроцедура(hold-out)–разделитьисходныедан- ные на два непересекающихся множества, произвести обучение машины по одному из них, а на другом тестировать построенную машину. Однако при этом возникают следующие проблемы:

1)дляполучениястатистическиобоснованныхрезультатовтребуется большой объем исходной выборки;

2)невозможно определить дисперсию и устойчивость характеристикмоделивсвязисизменениямивтренировочноммножестве.

Справиться с проблемами позволяют различные методы перевыбора:

k-кратная перекрестная проверка;

– бутстреп (bootstrap), использующий случайный выбор с возвращением;

–subsampling,использующийслучайныйвыборбезвозвращения. Методы перевыбора позволяют последовательно генерировать выборки из исходного набора данных и снова обучать машину на каждойвыборке,получаятакимобразомдополнительнуюинфор-

мацию об обучаемой модели.

Длятогочтобыизбежатьявленияпереобученияприпостроении машинопорныхвекторов,рекомендуетсяприменятьстратегиювложенного перевыбора (рис. 10) [13]: в то время как качество модели оценивается во внешнем цикле, для настройки гиперпараметров каждаятренировочнаяпоследовательностьсноваподвергаетсяперевыбору во внутреннем цикле.

Дляуспешногопостроениямашиныопорныхвекторовиполучения корректной оценки ее качества следует:

1)разбить исходные данные на три непересекающихся множества: тренировочное для обучения машины; валидационное для настройки гиперпараметров; тестовое, предназначенное исключительно для оценивания качества уже настроенной модели;

2)выбрать ядро и зафиксировать значения гиперпараметров;

3)обучить модель на тренировочном множестве;

4)определить качество модели на валидационном множестве;

5)повторить шаги 2–4, используя различные значения гиперпараметров (и/или ядра);

39

 

 

Использо-

 

Выбор модели

вание

Оценивание

найденных

выбранной модели

Внутренний цикл

параметров

 

перевыбора

 

Внешний цикл

последовательности

перевыбора

Выбор подходящих параметров

 

последовательности

 

 

Оценка качества

 

Использо-

классификатора

 

вание

для полученных

 

найденных

значений параметров

 

параметров

Тренировочная

Тренировочная

Тестовая

Тестовая

последовательность

последовательность

последовательность

последовательность

длявнешнегоцикла

длявнутреннего

длявнешнегоцикла

длявнутреннегоцикла

 

цикла

 

 

Рис. 10. Схема вложенного перевыбора при настройке SVM

6)выбрать лучшую модель и обучить ее на данных из тренировочного и валидационного множеств;

7)оценить качество построенной машины на данных из тестового множества.

Прииспользованииk-кратнойперекрестнойпроверкиилибут- стрепашаги3и4нужноповторитьдлякаждоговариантаперевыбора.

8.3. Настройка машины опорных векторов

Настройка машины может проводиться на основе различных методов оптимизации, как методов поиска в пространстве гиперпараметров, так и методов, базирующихся на использовании градиента функции валидации.

Методы поиска в пространстве гиперпараметров включают всебя:методыпоисканарешетке,методыслучайногопоискаиэволюционные методы на основе генетических алгоритмов.

Наиболеераспространенныйметоднастройкипараметров–по- иск на решетке (grid search). Вначале используют грубую решетку, затем для полученной области пространства гиперпараметров, соответствующейприемлемомукачествумашины,выбираютболее

40

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]