Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистический анализ больших данных подход на основе машин опорных векторов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
852 Кб
Скачать

Министерство науки и высшего образования Российской Федерации

САНКТ-ПЕТЕРБУРГСКИЙ ПОЛИТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ ПЕТРА ВЕЛИКОГО

Физико-механический институт

Высшаяшколаприкладнойматематикиивычислительнойфизики

Н. О. Кадырова Л. В. Павлова

СТАТИСТИЧЕСКИЙ АНАЛИЗ БОЛЬШИХ ДАННЫХ:

ПОДХОД НА ОСНОВЕ МАШИН ОПОРНЫХ ВЕКТОРОВ

Учебное пособие

ПОЛИТЕХ-ПРЕСС

Санкт-Петербургский политехнический университет Петра Великого

Санкт-Петербург

2022

ББК 22.172я73 К13

Р е ц е н з е н т ы:

Кандидат физико-математических наук, старший научный сотрудник лаборатории лазерной диагностики плазмы и взаимодействия плазмы с поверхностью ФТИ им. А. Ф. Иоффе РАН А. Н. Баженов Кандидат физико-математических наук, доцент ВШ ПМиВФ СПбПУ

О. И. Заяц

Кадырова Н. О.Статистический анализ больших данных: подход на основе ма-

шин опорных векторов : учеб. пособие / Н. О. Кадырова, Л. В. Павлова. – СПб. : ПОЛИТЕХ-ПРЕСС,2022. – 60 с.

Соответствует содержанию федеральной дисциплины «Машины опорных векторов» государственного образовательного стандарта по направлению подготовки бакалавров 01.03.02 «Прикладная математика и информатика», специальность 01.03.02_02 «Системное программирование».

Рассмотрены основные принципы и идеи современного подхода к решению задачи восстановления зависимостей по эмпирическим данным. При- веденыосновныебазовыеидеиреализацииSVM-методов.Сделанобзорнаи- более эффективных алгоритмов построения машин опорных векторов для задачбинарнойклассификации,кластеризацииивосстановлениярегрессии.

Предназначено для студентов, обучающихся по бакалаврским и магистерским программам, а также для аспирантов, изучающих методы и алгоритмы машинного обучения.

Ил. 16. Библиогр.: 43 назв.

Печатается по решению Совета по издательской деятельности Ученого совета

Санкт-Петербургского политехнического университета Петра Великого.

ISBN 978-5-7422-7813-9

© Кадырова Н. О., Павлова Л. В., 2022

© Санкт-Петербургский политехнический

doi:10.18720/SPBPU/2/id22-81

университет Петра Великого, 2022

Ministry of Science and Higher Education of the Russian Federation

PETER THE GREAT ST. PETERSBURG

POLYTECHNIC UNIVERSITY

InstituteofPhysicsandMechanics

GraduateSchoolofAppliedMathematicsandComputationalPhysics

N. O. Kadyrova L. V. Pavlova

STATISTICAL ANALYSIS

OF BIG DATA:

AN APPROACH BASED ON SUPPORT VECTOR MACHINES

Training manual

POLYTECH-PRESS

Peter the Great

St.Petersburg Polytechnic

University

Saint Petersburg

2022

R e v i e w e r s:

Candidate (PhD) of Physics and Mathematics, senior researcher at the laboratory of laser diagnostics of plasma and plasma-surface interaction

of Ioffe Physical-Technical Institute of the Russian Academy of Sciences

A. N. Bazhenov

Candidate (PhD) of Physics and Mathematics, associate professor at the Graduate School of Applied Mathematics and Computational Physics of SPbPU

O. I. Zayats

Kadyrova N. O. Statistical analysis of big data: an approach based on support vec- tor machines : training manual / N. O. Kadyrova, L. V. Pavlova. – St. Petersburg: POLYTECH-PRESS, 2022. – 60 p.

The training manual corresponds to the content of the federal discipline “Support Vector Machines” of the state educational standard for the bachelor’s degree major 01.03.02 “Applied Mathematics and Computer Science”, stream 01.03.02_02 “System Programming”.

The manual considers the basic principles and ideas of the modern approach to solving the problem of reconstructing dependencies from empirical data. The main basic ideas of implementing SVM methods are presented. The authors made a review of the most effective algorithms for constructing support vector machines for the tasks of binary classification, clustering, and regression recovery.

The manual is intended for students enrolled in bachelor’s and master’s degree programs, as well as for graduate students studying methods and algorithms of machine learning.

Figures: 16. References.: 43 titles.

Printed by decision

of the Council on Publishing Activities of the Academic Board of Peter the Great St. Petersburg Polytechnic University.

 

© Kadyrova N. O., Pavlova L. V., 2022

ISBN 978-5-7422-7813-9

© Peter the Great St. Petersburg Polytechnic

doi:10.18720/SPBPU/2/id22-81

University, 2022

ОГЛАВЛЕНИЕ

 

Введение.....................................................................................................

6

1. Общая постановка задачи обучения с учителем......................................

10

2. Структурная минимизация риска............................................................

11

3. Линейный SVM-классификатор............................................................

13

3.1. Линейно разделимые данные..........................................................

13

3.2. Линейно неразделимые данные......................................................

17

4. Нелинейное SVM-обучение...................................................................

20

5. Ядерные методы....................................................................................

23

5.1. Представление данных...................................................................

24

5.2. Положительно-определенные ядра...............................................

24

5.3. Ядро как скалярное произведение ................................................

24

5.4. Ядро как мера подобия объектов...................................................

25

5.5. Ядро как мера гладкости функций................................................

25

6. SVM-подход к решению задачи восстановления регрессии ................

27

6.1. Постановка задачи .........................................................................

27

6.2. Функции потерь.............................................................................

28

6.3. Нелинейное SVR-обучение............................................................

32

7. Качество алгоритмов обучения...............................................................

34

8. Основные этапы построения машин опорных векторов..........................

37

8.1. Характеристики качества обучения...............................................

38

8.2. Стратегии формирования выборок при настройке машины

 

опорных векторов.................................................................................

38

8.3. Настройка машины опорных векторов.........................................

40

9. Основные подходы к построению SV-машин на практике.....................

42

9.1. Решение двойственной задачи SVM-обучения.............................

42

9.2. Декомпозиция двойственной задачи ............................................

45

9.3. Базовые идеи SV-алгоритмов.........................................................

45

9.4. Преимущества SVM-подхода..........................................................

47

10. SV-алгоритм решения задачи кластеризации.......................................

49

10.1. SV-кластеризация..........................................................................

49

10.2. Определение границ кластеров....................................................

50

10.3. Маркировка кластеров.................................................................

53

10.4. Подбор значений гиперпараметров SVC-алгоритма...................

54

БИБЛИОГРАФИЧЕСКИЙ СПИСОК..................................................

57

ВВЕДЕНИЕ

Необходимость создания и использования современных эффективныхметодовстатистическогоанализаобусловленабыстрым ростомобъемовкорпоративныхинаучныххранилищданных,размерность которых не ограничена. Общепринятые методы ретроспективнойобработкиинформации,напримерметодыописательнойстатистики,позволяютлишьответитьнавопрос,чтобыло.Для ответа на вопрос, что надо делать, нужны механизмы построения моделей,способныенаходитьскрытыезакономерностивбольших объемах данных большой размерности, так называемых больших данных (big data).

Каждыйотдельныйэлементинформации,включаемыйвпред- ставлениеобобъекте,–этопризнак.Наборпризнаковдляодного объекта назовем примером. Если каждый пример можно описать вектором,причемдляданнойсовокупностиобъектоввсевекторы имеют одинаковую размерность, то для описания такого набора данныхможноиспользоватьматрицуплана.Встрокахэтойматрицы расположены примеры, а в столбцах – признаки.

Приобучениисучителемпримерсодержитнетольконаборпризнаков,ноиметку(отклик).Конечно,невсегдаметкапредставляет собой единственное число. Так, если необходимо научить систему распознаванияречитранскрибироватьцелыепредложения,тометкой для каждого примера будет последовательность слов.

Требования к качеству данных для различных методов и алгоритмов их анализа могут быть разными.

В настоящее время искусственный интеллект – бурно развивающаяся дисциплина, имеющая многочисленные приложения. Ее задача состоит в создании интеллектуальных программ (алгоритмов), которые могли бы автоматизировать рутинный труд,

6

понимали речь, интерпретировали изображения, ставили медицинскиедиагнозыиподдерживалинаучныеисследования.Система сискусственныминтеллектомдолжнауметьсамостоятельнонакапливать знания, отыскивая закономерности в исходных данных. Это умение называется машинным обучением.

Выделяютследующиестандартныетипызакономерностей,выявляемые методами машинного обучения:

классификация – отнесение вновь поступивших объектов

кодному из известных классов;

регрессия(прогнозирование)–предсказаниеоткликадляно- вого объекта;

ранжирование–упорядочениеобъектовсогласнонекоторому критерию;

кластеризация– разбиение объектов на однородные группы. Машинноеобучение–методика,позволяющаякомпьютерной

системесовершенствоватьсяпомеренакопленияопытаиданных. Это междисциплинарная область исследований (использующая методыматематическойстатистики,оптимизацииипр.),имеющая специфику, связанную с проблемами вычислительной эффективности применяемых алгоритмов и переобучения.

Основная практическая цель машинного обучения – выработатьпредсказаниядлявновьпоступающихобъектов,построивдля этого эффективные и устойчивые алгоритмы на основе больших данных.

Основные проблемы, которые необходимо преодолеть в ходе машинного обучения, – так называемое проклятие размерностииявление переобучения(overfitting).Проклятиеразмерности означает,чтоточностьоцениванияистиннойзависимостисростом размерности входных данных катастрофически снижается. Если качество решающей функции на вновь поступающих примерах намногонижекачества,достигнутогонаисходныхданных,говорят об эффекте переобучения.

Алгоритм машинного обучения должен эффективно работать

сновой информацией, которую он раньше не видел, а не только

сиспользуемойдляобучениямодели.Этаспособностьправильной

7

работы на ранее не предъявлявшихся данных называется способностью к обобщению.

Мера«неправильности»работыалгоритма,вычисленнаянаоб- учающемнаборепримеров,–ошибкаобучения.Минимизацияэтой ошибки представляет собой задачу оптимизации. При машинном обучении, в отличие от оптимизации, наряду с ошибкой обучения минимизируетсяиошибкаобобщения(еетакженазываютошибкой тестирования), т. е. математическое ожидание ошибки на новой входной информации.

Какправило,дляоценкиошибкиобобщениямоделиопределяют ее качество на тестовом наборе данных, отдельном от обучающего набора.

Итак,качествоработыалгоритмамашинногообучениясвязано

сдвумя ключевыми моментами:

1)с минимизацией ошибки обучения;

2)сокращением разрыва между ошибками обучения и обобщения.

Они соответствуют двум центральным проблемам машинного обучения: недообучению и переобучению. Недообучение имеет место,когдамодельнепозволяетполучатьдостаточномалуюошибку на обучающем наборе, а переобучение – когда разрыв между ошибкамиобученияиобобщения(тестирования)слишкомвелик.

Управлять склонностью модели к переобучению или недообучению позволяет ее сложность, или емкость (capacity). Иными словами, емкость модели описывает ее способность к аппроксимации широкого спектра функций. Модели малой емкости испытываютсложностиаппроксимацииобучающегонабора(проблема недообучения). Поскольку модели большой емкости запоминают свойстваобучающегонабора,неприсущиетестовомунабору,они склонны к переобучению.

Одинизспособовконтролясложностиклассафункцийсостоит в сужении пространства допустимых решающих функций до пространства гипотез, т. е. до множества функций, которые алгоритм обученияможетрассматриватьвкачествепотенциальногорешения. Например,пространствомгипотезалгоритмалинейнойрегрессии

8

является множество всех линейных функций. Можно обобщить линейную регрессию, включив в пространство гипотез многочлены более высокой степени. При этом емкость модели увеличится.

Вобщем случае, когда емкость модели соответствует истинной сложности задачи и объему обучающих данных, алгоритмы машинного обучения работают оптимально. Модель недостаточной емкостинеспособнарешатьсложныезадачи.Модельизбыточной емкости может решать сложные задачи, но если для конкретной задачиемкостьслишкомбольшая,товозникаетрискпереобучения.

Современные идеи, относящиеся к способности моделей машинного обучения к обобщению, берут свое начало в античной философии.Стехвременизвестенпринципэкономии,внашидни называемый бритвой Оккама. Этот принцип гласит, что из всех гипотез, одинаково хорошо объясняющих наблюдения, следует выбирать простейшую. Такую идею в XX веке сформулировали

иразвилиоснователистатистическойтеорииобученияВ.Н.Вапник и А. Я. Червоненкис [1].

Всередине1990-хгодовбылпредложенновыйтипметодовста- тистическогооцениванияфункций(илиновыйвидмашинобучения),получившийназвание«машиныопорныхвекторов»(support vectormachines,SVM)иимеющийотношение,преждевсего,кобучению с учителем. Основы этого подхода заложены в работах, посвященныхстатистическойтеорииобучения[1,2].SVM-методы приобрели широкую популярность благодаря своим полезным свойствам.Ониимеютперспективныепрактическиеприложения:

–мониторингразличныхобъектовипроцессов(ядерныереак- торы,экологияокружающейсреды,мониторингпациента,социологический мониторинг);

– прогнозирование временных рядов (например, в сфере финансов, биохимии и фармакологии);

–определениеструктурысложнейшихсистем,вчастностибио- логических.

При использовании подходящих ядерных функций в качестве количественноймерыподобиядвухобъектовможностроитьнели- нейныерешающиеправиланаосновелинейныхSVM-алгоритмов,

9

атакжеприменятьSVM-методыприанализеданных,неимеющих ясного векторного представления.

SVM-подход и связанные с ним ядерные методы способны эффективно обрабатывать большие данные, преодолевая проклятие размерности и контролируя эффекты переобучения.

В данном пособии рассмотрен SVM-подход к решению задач классификации, восстановления регрессии и кластеризации.

1.ОБЩАЯ ПОСТАНОВКА ЗАДАЧИ ОБУЧЕНИЯ

СУЧИТЕЛЕМ

Модель обучения с учителем по эмпирическим данным предполагает наличие:

генератораслучайныхвходныхобъектовx –элементовнеко- торого пространства X, появляющихся независимо согласно фиксированному,нонеизвестномураспределениювероятностейP(x);

учителя,определяющеговыходy,–элементанекоторогопро- странстваY длялюбоговходящегоx согласноусловномураспределению P(y/x), фиксированному и неизвестному;

классафункций{f(x,α)},гдепараметрαможетприниматьзначенияизнекоторогодопустимогомножествапроизвольнойприроды.

Задача обучения состоит в выборе из заданного множества функций одной функции, которая предсказывает ответ учителя наилучшим образом.

Этотвыбордолженбытьоснованнатренировочнойпоследовательности(ТП)конечногообъемаl,т.е.нанезависимых,одинаково распределенныхсогласнозакону P(x,y) = P(xP(y/x)наблюдениях

(x1, y1), …, (xl, yl).

Наилучшаяфункцияf(x),которуюможновыбрать,–функция, минимизирующая ожидаемый риск (ошибку обобщения, general-

izationerror): R[f ]= L(f (x),y)dP(x,y), гдеL(∙)−содержатель-

X ×Y

но обоснованная функция потерь.

ПосколькураспределениеP(x,y)неизвестно,можно,учитывая индукционный принцип минимизации эмпирического риска,

10

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]