Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Технологии искусственного интеллекта в банковской сфере. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
08.09.2026
Размер:
2 Мб
Скачать
Глава 3
x
j
s
A
требует меньший объем данных и быстрее обучается, напри­мер, в сравнении с другими байесовскими алгоритмами. Однако есть и отрицательные стороны, например, самый главный — это само упрощающее предположение о независимости.
Байесовские методы могут применяться для выдачи реше­ния на основе признаков, описываемых пользователем. В дру­гих областях они применяются для фильтрации спама комендательных системах.
Метод независимых компонент.
Один из неконтролируемых методов машинного обучения [22]. Предназначен для решения такой задачи, как слепое раз-
деление источников, суть которой заключается в выделении независимых друг от друга сигналов из смешанных данных. Данный метод может использоваться для распознавания речи группы людей, когда все говорят различные нужно выделить и распознать каждую. Помимо распознавания речи, метод независимых компонент применяется в распозна­вании изображений, медицине, диагностике электронных схем.
Краткая математическая постановка выглядит следующим образом: поступающую смесь данных подставляют в виде ли­нейной комбинации
фразы и системе
и в ре-
as a s a s i n 
11 2 2
ii i imm
где
aj m
,
ij
элементы вектора независимых компонент. При определенном наборе данных значения последних могут быть представлены также и в виде матрицы. Пусть в дальнейшем это будет так. Выражение (4) записывается в матричном виде:
где симых компонент;
ний матрицы
— матрица входных сигналов; S — матрицы незави-
X
Так вот, данный алгоритм при наличии известных значе-
называют коэффициенты смещения;
1..
матрица коэффициентов смещения.
позволяет найти значения матрицы S, пред-
X
... , 1.. ,
(5)
,XAS
(4)
31
Технологии искусственного интеллекта в банковской сфере
A
ставляющей собой набор независимых компонент, которые и описывают независимые сигналы, а также такие значения мат­рицы странствами
принципах, выполнение которых обязательно:
ми, то есть значение одной компоненты не влияет на значение другой;
вым распределением.
производящую некоторые логические схемы, которые исполь­зуются для получения окончательной классификации того или иного объекта [21]. Фактически они представляют собой хически организованную систему вопросов, причем вопросы на последующих уровнях зависят от ответов, полученных на предыдущих. Сами деревья могут быть и бинарными, когда ответы на вопросы только «да» или «нет». Вообще, решающие деревья широко известны, они могут применяться для постро­ения оптимальной стратегии в простейших играх, использу­ются для составления тестов действия пользователя с интерфейсом системы, простейших чат-ботов, вариативного сюжета видеоигр и вариативных диа­логов.
ки о структурах данных, представляет собой ациклический ориентированный граф, где корневая вершина принимает дан­ные и соответствует инициализирующему вопросу, остальные вершины (узлы) соответствуют другим условиям сколько ответов / результатов, которым соответствуют ребра. Листья дерева — ответы (классы, окончательный результат).
, с помощью которых возможен переход между про-
и X.
S
Окончательная постановка задачи имеет вид:
1
SAX
Стоит отметить, что данный алгоритм работает при двух
значения
независимые компоненты должны обладать негауссо-
Решающие деревья.
Решающие деревья представляют собой структуру, вос-
Самое обычное дерево, известное из разделов информати-
должны быть статистически независимы-
S
, проектирования путей взаимо-
. (6)
иерар-
и имеют не-
32
Глава 3
x
Отметим, что существуют некоторые обобщения деревьев, например случайный лес — коллекция решающих деревьев. Здесь каждое дерево пытается классифицировать данные / дать им определенную оценку, которая называется голосом. По сути, идет рассмотрение каждого голоса от каждого дерева и выбира­ется классификация с наибольшим количеством голосов.
В машинном обучении очень часто используют бинарные деревья. Формальный вид: пусть некоторое бинарное дерево
вид такого дерева имеет следующий
используется для
T
распознавания объектов, которые описываются набором при­знаков
,1,.
in
i
Каждой вершине дерева v ставится преди-
кат, связанный со значением одного из признаков. В зависи­мости от типа признака будут ставиться предикаты вида
v
x
ii
чение, и вида
для непрерывных, где
xEk
''
ii
vk
,1,2
элемент дихотомического разбиения
n
'
i
Ea

'
ij
принимаемых значений данным признаком.
1
j
v
некоторое пороговое зна-
i
для категориальных, где
12
vv
,
EE
''
ii
множества
E
'vki
Выбор одного из двух исходящих ребер из вершины произво­дится в зависимости от значения предиката. Сам процесс рас­познания заключается в пробеге уже построенного данного дерева и выборе нужных ребер и закончится с достижением одного из листьев.
Для непосредственного построения дерева существует множество алгоритмов, но они
— есть готовая обучающая выборка объектов знаками и известные классы
используют общий принцип:
с n при-
X
k
С
, к которым необходимо
i
i
1
отнести тот или иной объект (то есть здесь прослеживается обучение с учителем);
— выбирается признак, по которому будет происходить разбиение, причем этот признак должен обладать двумя или
более значениями
m
, отличными друг от друга;
O
i
i
1
33
Технологии искусственного интеллекта в банковской сфере
обобщающая выборка разбивается на подмножества
m
X
ние
, где каждое
i
i
1
для выбранного признака, по которому идет разбиение.
О
i
содержит все объекты, имеющие значе-
X
i
Данная процедура будет рекурсивно продолжаться и за­кончится тогда, когда конечное множество будет состоять из объектов, относящихся к одному и тому же классу.
В результате будет получено дерево, бинарный случай ко­торого описан выше. Наиболее популярными алгоритмами, ре­ализующими всю эту процедуру, являются CART (Classification and Regression Tree) (причем данный алгоритм строит именно бинарное дерево) и C4.5 (алгоритм для классификации, не предназначен для работы с непрерывными признаками).
Простые решающие деревья обладают серьезным недо­статком, есть вероятность построить дерево так, что на каж­дый объект будет отдельный лист, то есть вместо получения определенной закономерности оно просто «запомнит» обуча­ющую выборку (
так называемый эффект переобучения). Выше был приведен пример обобщения (случайный лес), при кото­ром усредняется ответ, и это на определенном уровне решает данную проблему. Но есть другой способ, называемый гради­ентным бустингом. Общая идея применительно к решающим деревьям такая же, как и к другим алгоритмам обучения с учи­телем (например, градиентный
спуск для линейного класси­фикатора). Сначала строится первое дерево, которое при рас­познавании даст некоторую ошибку, затем строится второе, нацеленное на снижение полученной на первой итерации ошиб­ки, и т.
д. В конце работы алгоритма ответ от всех постро-
енных деревьев суммируется.
В настоящее время решающие деревья применяются в раз­личных областях, например в финансах (самый распростра­ненный пример: давать кредит клиенту или нет), медицине, промышленности (для контроля качества изделия). Также при­меняется в экспертных системах для прогнозирования.
34
Глава 3
3.2. Ансамблевые методы
Понятие «мудрость толпы» описывает ситуацию, когда коллектив людей со средним уровнем знаний по заданной те­ме при совместных усилиях может ответить на вопросы, на ко­торые большинство из членов коллектива не ответили бы по­одиночке. Это выражение достаточно полно описывает смысл ансамблевых моделей в машинном обучении — комбинация нескольких моделей вместе может создать гораздо более каче­ственную модель [23].
Ансамблевые методы — подход к обучению моделей ма­шинного обучения, при котором множество моделей (называ­емых «слабыми») обучаются решать одну задачу и затем ис­пользуются вместе, чтобы сообща добиться более точных и устойчивых результатов. Модель, построенная на основе ан­самбля слабых моделей
, называется метамоделью. В большин­стве подходов все слабые модели представляют собой один выбранный алгоритм обучения. Каждая модель обучается с небольшими отличиями от других. Главное решение при ан­самблевом подходе состоит в выборе метода, по которому бу­дут комбинироваться решения слабых моделей. В настоящий момент активно применяются два способа построения мета­модели из слабых моделей: бэггинг и бустинг.
Бэггинг.
Бэггинг [24] — метод ансамблирования, при котором все слабые модели обучаются независимо друг от друга. Это поз­воляет применять распараллеливание и обучать слабые моде­ли одновременно, что уменьшает время обучения метамодели. Название метода является сокращением словосочетания «boot- strap aggregating», которое указывает на основную идею ме тода бэггинг — использование техники бутстрэппинга [25].
Бутстрэппинг — это прием из статистики, при котором из оригинальной выборки размера n составляются подвыборки
-
35
Технологии искусственного интеллекта в банковской сфере
размера b путем случайного выбора элементов с возможно­стью повторения элементов (рис. 4). Все подвыборки состав­ляются таким образом, чтобы сохранить достаточную репре­зентативность основного набора данных и в то же время не слишком сильно коррелировать друг с другом.
Рис. 4. Оригинальная выборка (слева), набор подвыборок
размера b
= 5 из элементов оригинальной выборки (справа)
Идея бэггинга проста — обучаются несколько моделей, каждая на своем наборе данных бутстрэппинга. Затем пред­сказания этих моделей усредняются при применении метамо­дели на практике. Из-за того что все слабые модели обучались на подвыборке с хорошей репрезентативностью оригинальной выборки, метамодель будет обладать хорошей обобщающей способностью, а так как каждая модель
обучалась на своем на­боре данных, особенные знания каждой модели дополнят воз­можное отсутствие таковых у остальных.
Предположим, у нас есть набор L бутстрэп подвыборок
размера B:
󰇝
,
,..,
󰇞,󰇝
,
,..,
󰇞
,..,󰇝
,..,
󰇞
.
,
На этих выборках обучается L слабых моделей:
36
󰇛
󰇜
,
󰇛
󰇜
,..,
󰇛
󰇜
.
Глава 3
Затем комбинируем их предсказания. Для задачи регрессии это может быть среднее арифметическое выходов всех моде­лей:

 

.
Для задачи классификации применяются мажоритарный или мягкий способы голосования. Мажоритарное голосование — ко­гда каждая слабая модель прогнозирует свой класс k из K воз­можных и наиболее популярный ответ становится результи­рующим:
󰇡󰇢,1..

  󰇛󰇟
 󰇛󰇜,1..󰇠󰇜.
При мягком голосовании вероятности слабых моделей для каждого класса усредняются и выбирается результирующий класс:
  
󰇡󰇣


󰇟󰇠,1..
󰇤󰇢
.
Подход к ансамблированию методом бэггинга использует­ся в модели машинного обучения, названной «случайный лес» (Random forest). Метамодель случайного леса использует в ка­честве слабых моделей решающие деревья одинаковой глуби­ны. Однако помимо обучения каждого дерева случайного леса на подвыборке бутстрэппинга случайный лес использует еще один прием, позволяющий слабым
моделям быть еще менее похожими друг на друга. Во время обучения каждого дерева используется не только подвыборка оригинального набора данных, но и случайная подвыборка признаков для обучения. Игнорирование некоторых признаков не позволяет деревьям видеть всю информацию, а это уменьшает корреляцию между входными и выходными данными. Главным же преимуще­ством использования
подвыборок признаков является увели­чение устойчивости метамодели в случае отсутствующей ин­формации — при пропуске значений в каких-либо полях у ме­тамодели будут деревья, обученные без использования этих признаков.
37
Технологии искусственного интеллекта в банковской сфере
Бустинг.
Метод бустинга преследует ту же цель, что и бэггинг, — строится семейство слабых моделей одного типа, которые объединяются в сильную метамодель для получения лучшего результата. Однако в отличие от бэггинга, бустинг представ­ляет собой последовательный подход к использованию слабых моделей — входные данные проходят через одну слабую мо­дель за другой, а
не через все одновременно. Идея последова­тельного применения моделей состоит в том, чтобы каждая последующая модель училась в большей степени уделять вни­мание ошибкам предыдущей модели и исправляла их. Эта идея представлена двумя типами реализаций бустинга: адап­тивный бустинг и градиентный бустинг.
Адаптивный бустинг [26] является наиболее известной ре-
ализацией последовательного
ансамблирования слабых моде­лей. Метод основывается на изменении весов конкретных примеров при обучении. Во время обучения на каждом шаге новая слабая модель уделяет больше внимания тем наблюде­ниям, на которых комбинация предыдущих слабых моделей совершила ошибку. Отсюда следуют главные условия выбора архитектуры слабых моделей:
— слабая модель желательно должна быть линейной
моде­лью, так как взвешенная комбинация линейных моделей также является линейной моделью. Это может снизить способность к определению нелинейных зависимостей данных;
— слабый ученик должен быть действительно «слабым». Если слабый ученик выучил все примеры на своем шаге обу­чения, то алгоритм бустинга не сработает — следующей сла­бой модели будет нечему учиться.
Поэтому оптимальный вы-
бор для слабой модели — дерево небольшой глубины.
Рассмотрим шаги алгоритма адаптивного бустинга для за­дачи бинарной классификации. Имеется датасет размером m, где у каждого примера вес инициализирован значением
= 1/m. Пусть метамодель будет содержать T слабых моде-
w
y
лей. Тогда на каждом шаге t будут выполняться следующие действия:
38
Глава 3
— обучаем слабую модель на примерах, учитывая веса. Вес примера можно рассматривать как вероятность его выбора при использовании подмножества изначального датасета;
— выполняем предсказания на обучающем наборе и рас­считываем взвешенную ошибку:
 󰇛
предполагается e
0,5, так как et = 0,5 соответствует случай-
t



∗󰇜,
ному угадыванию; добавляем текущего слабого ученика в ан­самбль с весом α
(рис. 5). Чем выше точность слабой модели,
t
тем больший вклад в ансамбль она будет вносить. Если алго­ритм верно классифицировал все примеры, получится беско­нечный вес и продолжить бустинг будет невозможно. Если же точность модели на уровне случайного угадывания, ее вес ра­вен 0 и такая модель не будет участвовать в классификации:

󰇡
ln
󰇢
;
Рис. 5. График веса α
от ее взвешенной ошибки e
слабой модели в зависимости
t
t
39
Технологии искусственного интеллекта в банковской сфере
— веса неверно классифицированных примеров умножа­ются на exp(α
), веса верно классифицированных примеров де-
t
лятся на это же число. Затем все веса нормализуются, чтобы их сумма равнялась единице.
Градиентный бустинг [27] в отличие от адаптивного не уде­ляет больше внимания данным, на которых предыдущая слабая модель совершила ошибку, а стремится уменьшить значение са­мой ошибки, используя в качестве целевых данных
производ­ную функции потерь предыдущей слабой модели. Рассмотрим шаги градиентного бустинга. Введем обозначения:
— датасет имеет N примеров обучающих данных X
эталонных ответов y
= {y
i
};
= {x
} и
i
— каждая слабая модель имеет параметры θ, принимает на
вход x
и возвращает предсказания 󰇛,󰇜
i
;
— функция потерь принимает на вход эталонные ответы и
предсказания и возвращает число 󰇛
,󰇜.
После этого можно приступать к обучению. В качестве
первого приближения можно выбрать константу С таким обра­зом, чтобы 󰇛,С󰇜 была минимальна. Пусть метамодель бу­дет содержать K слабых моделей. Тогда на каждом шаге k бу­дут выполняться следующие действия:
— получаем предсказания текущих моделей ансамбля с по-
мощью взвешенной суммы

С
∗󰇛,󰇜

;
считаем отрицательную функцию потерь полученного
предсказания

r
дает нам представление о том, как надо изменить предсказа-
i
󰇛,

󰇜
,
ния для уменьшения функции потерь;
обучаем новую слабую модель предсказывать r
Параметры новой слабой модели обозначим θ
40
;
k
для xi.
i
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]