Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Технологии искусственного интеллекта в банковской сфере. Учебное пособие
.pdf
Глава 3
x
j
s
A
требует меньший объем данных и быстрее обучается, например, в сравнении с другими байесовскими алгоритмами. Однако
есть и отрицательные стороны, например, самый главный —
это само упрощающее предположение о независимости.
Байесовские методы могут применяться для выдачи решения на основе признаков, описываемых пользователем. В других областях они применяются для фильтрации спама
комендательных системах.
Метод независимых компонент.
Один из неконтролируемых методов машинного обучения
[22]. Предназначен для решения такой задачи, как слепое раз-
деление источников, суть которой заключается в выделении
независимых друг от друга сигналов из смешанных данных.
Данный метод может использоваться для распознавания речи
группы людей, когда все говорят различные
нужно выделить и распознать каждую. Помимо распознавания
речи, метод независимых компонент применяется в распознавании изображений, медицине, диагностике электронных схем.
Краткая математическая постановка выглядит следующим
образом: поступающую смесь данных подставляют в виде линейной комбинации
фразы и системе
и в ре-
as a s a s i n
11 2 2
ii i imm
где
aj m
,
ij
элементы вектора независимых компонент. При определенном
наборе данных значения последних могут быть представлены
также и в виде матрицы. Пусть в дальнейшем это будет так.
Выражение (4) записывается в матричном виде:
где
симых компонент;
ний матрицы
— матрица входных сигналов; S — матрицы незави-
X
Так вот, данный алгоритм при наличии известных значе-
— называют коэффициенты смещения;
1..
— матрица коэффициентов смещения.
позволяет найти значения матрицы S, пред-
X
... , 1.. ,
(5)
,XAS
(4)
—
31

Технологии искусственного интеллекта в банковской сфере
A
ставляющей собой набор независимых компонент, которые и
описывают независимые сигналы, а также такие значения матрицы
странствами
принципах, выполнение которых обязательно:
ми, то есть значение одной компоненты не влияет на значение
другой;
вым распределением.
производящую некоторые логические схемы, которые используются для получения окончательной классификации того или
иного объекта [21]. Фактически они представляют собой
хически организованную систему вопросов, причем вопросы
на последующих уровнях зависят от ответов, полученных на
предыдущих. Сами деревья могут быть и бинарными, когда
ответы на вопросы только «да» или «нет». Вообще, решающие
деревья широко известны, они могут применяться для построения оптимальной стратегии в простейших играх, используются для составления тестов
действия пользователя с интерфейсом системы, простейших
чат-ботов, вариативного сюжета видеоигр и вариативных диалогов.
ки о структурах данных, представляет собой ациклический
ориентированный граф, где корневая вершина принимает данные и соответствует инициализирующему вопросу, остальные
вершины (узлы) соответствуют другим условиям
сколько ответов / результатов, которым соответствуют ребра.
Листья дерева — ответы (классы, окончательный результат).
, с помощью которых возможен переход между про-
и X.
S
Окончательная постановка задачи имеет вид:
1
SAX
Стоит отметить, что данный алгоритм работает при двух
— значения
— независимые компоненты должны обладать негауссо-
Решающие деревья.
Решающие деревья представляют собой структуру, вос-
Самое обычное дерево, известное из разделов информати-
должны быть статистически независимы-
S
, проектирования путей взаимо-
. (6)
иерар-
и имеют не-
32

Глава 3
x
Отметим, что существуют некоторые обобщения деревьев,
например случайный лес — коллекция решающих деревьев.
Здесь каждое дерево пытается классифицировать данные / дать
им определенную оценку, которая называется голосом. По сути,
идет рассмотрение каждого голоса от каждого дерева и выбирается классификация с наибольшим количеством голосов.
В машинном обучении очень часто используют бинарные
деревья. Формальный
вид: пусть некоторое бинарное дерево
вид такого дерева имеет следующий
используется для
T
распознавания объектов, которые описываются набором признаков
,1,.
in
i
Каждой вершине дерева v ставится преди-
кат, связанный со значением одного из признаков. В зависимости от типа признака будут ставиться предикаты вида
v
x
ii
чение, и вида
для непрерывных, где
xEk
''
ii
vk
,1,2
элемент дихотомического разбиения
n
'
i
Ea
'
ij
принимаемых значений данным признаком.
1
j
v
— некоторое пороговое зна-
i
для категориальных, где
12
vv
,
EE
''
ii
множества
—
E
'vki
Выбор одного из двух исходящих ребер из вершины производится в зависимости от значения предиката. Сам процесс распознания заключается в пробеге уже построенного данного
дерева и выборе нужных ребер и закончится с достижением
одного из листьев.
Для непосредственного построения дерева существует
множество алгоритмов, но они
— есть готовая обучающая выборка объектов
знаками и известные классы
используют общий принцип:
с n при-
X
k
С
, к которым необходимо
i
i
1
отнести тот или иной объект (то есть здесь прослеживается
обучение с учителем);
— выбирается признак, по которому будет происходить
разбиение, причем этот признак должен обладать двумя или
более значениями
m
, отличными друг от друга;
O
i
i
1
33

Технологии искусственного интеллекта в банковской сфере
— обобщающая выборка разбивается на подмножества
m
X
ние
, где каждое
i
i
1
для выбранного признака, по которому идет разбиение.
О
i
содержит все объекты, имеющие значе-
X
i
Данная процедура будет рекурсивно продолжаться и закончится тогда, когда конечное множество будет состоять из
объектов, относящихся к одному и тому же классу.
В результате будет получено дерево, бинарный случай которого описан выше. Наиболее популярными алгоритмами, реализующими всю эту процедуру, являются CART (Classification
and Regression Tree) (причем данный алгоритм строит именно
бинарное дерево) и C4.5 (алгоритм для классификации, не
предназначен для работы с непрерывными признаками).
Простые решающие деревья обладают серьезным недостатком, есть вероятность построить дерево так, что на каждый объект будет отдельный лист, то есть вместо получения
определенной закономерности оно просто «запомнит» обучающую выборку (
так называемый эффект переобучения). Выше
был приведен пример обобщения (случайный лес), при котором усредняется ответ, и это на определенном уровне решает
данную проблему. Но есть другой способ, называемый градиентным бустингом. Общая идея применительно к решающим
деревьям такая же, как и к другим алгоритмам обучения с учителем (например, градиентный
спуск для линейного классификатора). Сначала строится первое дерево, которое при распознавании даст некоторую ошибку, затем строится второе,
нацеленное на снижение полученной на первой итерации ошибки, и т.
д. В конце работы алгоритма ответ от всех постро-
енных деревьев суммируется.
В настоящее время решающие деревья применяются в различных областях, например в финансах (самый распространенный пример: давать кредит клиенту или нет), медицине,
промышленности (для контроля качества изделия). Также применяется в экспертных системах для прогнозирования.
34

Глава 3
3.2. Ансамблевые методы
Понятие «мудрость толпы» описывает ситуацию, когда
коллектив людей со средним уровнем знаний по заданной теме при совместных усилиях может ответить на вопросы, на которые большинство из членов коллектива не ответили бы поодиночке. Это выражение достаточно полно описывает смысл
ансамблевых моделей в машинном обучении — комбинация
нескольких моделей вместе может создать гораздо более качественную модель [23].
Ансамблевые методы — подход к обучению моделей машинного обучения, при котором множество моделей (называемых «слабыми») обучаются решать одну задачу и затем используются вместе, чтобы сообща добиться более точных и
устойчивых результатов. Модель, построенная на основе ансамбля слабых моделей
, называется метамоделью. В большинстве подходов все слабые модели представляют собой один
выбранный алгоритм обучения. Каждая модель обучается с
небольшими отличиями от других. Главное решение при ансамблевом подходе состоит в выборе метода, по которому будут комбинироваться решения слабых моделей. В настоящий
момент активно применяются два способа построения метамодели из слабых моделей: бэггинг и бустинг.
Бэггинг.
Бэггинг [24] — метод ансамблирования, при котором все
слабые модели обучаются независимо друг от друга. Это позволяет применять распараллеливание и обучать слабые модели одновременно, что уменьшает время обучения метамодели.
Название метода является сокращением словосочетания «boot-
strap aggregating», которое указывает на основную идею ме
тода бэггинг — использование техники бутстрэппинга [25].
Бутстрэппинг — это прием из статистики, при котором из
оригинальной выборки размера n составляются подвыборки
-
35

Технологии искусственного интеллекта в банковской сфере
размера b путем случайного выбора элементов с возможностью повторения элементов (рис. 4). Все подвыборки составляются таким образом, чтобы сохранить достаточную репрезентативность основного набора данных и в то же время не
слишком сильно коррелировать друг с другом.
Рис. 4. Оригинальная выборка (слева), набор подвыборок
размера b
= 5 из элементов оригинальной выборки (справа)
Идея бэггинга проста — обучаются несколько моделей,
каждая на своем наборе данных бутстрэппинга. Затем предсказания этих моделей усредняются при применении метамодели на практике. Из-за того что все слабые модели обучались
на подвыборке с хорошей репрезентативностью оригинальной
выборки, метамодель будет обладать хорошей обобщающей
способностью, а так как каждая модель
обучалась на своем наборе данных, особенные знания каждой модели дополнят возможное отсутствие таковых у остальных.
Предположим, у нас есть набор L бутстрэп подвыборок
размера B:
,
,..,
,
,
,..,
,..,
,..,
.
,
На этих выборках обучается L слабых моделей:
36
,
,..,
.

Глава 3
Затем комбинируем их предсказания. Для задачи регрессии
это может быть среднее арифметическое выходов всех моделей:
∑
.
Для задачи классификации применяются мажоритарный или
мягкий способы голосования. Мажоритарное голосование — когда каждая слабая модель прогнозирует свой класс k из K возможных и наиболее популярный ответ становится результирующим:
,1..
,1...
При мягком голосовании вероятности слабых моделей для
каждого класса усредняются и выбирается результирующий
класс:
,1..
.
∑
Подход к ансамблированию методом бэггинга используется в модели машинного обучения, названной «случайный лес»
(Random forest). Метамодель случайного леса использует в качестве слабых моделей решающие деревья одинаковой глубины. Однако помимо обучения каждого дерева случайного леса
на подвыборке бутстрэппинга случайный лес использует еще
один прием, позволяющий слабым
моделям быть еще менее
похожими друг на друга. Во время обучения каждого дерева
используется не только подвыборка оригинального набора
данных, но и случайная подвыборка признаков для обучения.
Игнорирование некоторых признаков не позволяет деревьям
видеть всю информацию, а это уменьшает корреляцию между
входными и выходными данными. Главным же преимуществом использования
подвыборок признаков является увеличение устойчивости метамодели в случае отсутствующей информации — при пропуске значений в каких-либо полях у метамодели будут деревья, обученные без использования этих
признаков.
37

Технологии искусственного интеллекта в банковской сфере
Бустинг.
Метод бустинга преследует ту же цель, что и бэггинг, —
строится семейство слабых моделей одного типа, которые
объединяются в сильную метамодель для получения лучшего
результата. Однако в отличие от бэггинга, бустинг представляет собой последовательный подход к использованию слабых
моделей — входные данные проходят через одну слабую модель за другой, а
не через все одновременно. Идея последовательного применения моделей состоит в том, чтобы каждая
последующая модель училась в большей степени уделять внимание ошибкам предыдущей модели и исправляла их. Эта
идея представлена двумя типами реализаций бустинга: адаптивный бустинг и градиентный бустинг.
Адаптивный бустинг [26] является наиболее известной ре-
ализацией последовательного
ансамблирования слабых моделей. Метод основывается на изменении весов конкретных
примеров при обучении. Во время обучения на каждом шаге
новая слабая модель уделяет больше внимания тем наблюдениям, на которых комбинация предыдущих слабых моделей
совершила ошибку. Отсюда следуют главные условия выбора
архитектуры слабых моделей:
— слабая модель желательно должна быть линейной
моделью, так как взвешенная комбинация линейных моделей также
является линейной моделью. Это может снизить способность к
определению нелинейных зависимостей данных;
— слабый ученик должен быть действительно «слабым».
Если слабый ученик выучил все примеры на своем шаге обучения, то алгоритм бустинга не сработает — следующей слабой модели будет нечему учиться.
Поэтому оптимальный вы-
бор для слабой модели — дерево небольшой глубины.
Рассмотрим шаги алгоритма адаптивного бустинга для задачи бинарной классификации. Имеется датасет размером m,
где у каждого примера вес инициализирован значением
= 1/m. Пусть метамодель будет содержать T слабых моде-
w
y
лей. Тогда на каждом шаге t будут выполняться следующие
действия:
38

Глава 3
— обучаем слабую модель на примерах, учитывая веса.
Вес примера можно рассматривать как вероятность его выбора
при использовании подмножества изначального датасета;
— выполняем предсказания на обучающем наборе и рассчитываем взвешенную ошибку:
предполагается e
≤ 0,5, так как et = 0,5 соответствует случай-
t
∗,
ному угадыванию; добавляем текущего слабого ученика в ансамбль с весом α
(рис. 5). Чем выше точность слабой модели,
t
тем больший вклад в ансамбль она будет вносить. Если алгоритм верно классифицировал все примеры, получится бесконечный вес и продолжить бустинг будет невозможно. Если же
точность модели на уровне случайного угадывания, ее вес равен 0 и такая модель не будет участвовать в классификации:
ln
;
Рис. 5. График веса α
от ее взвешенной ошибки e
слабой модели в зависимости
t
t
39

Технологии искусственного интеллекта в банковской сфере
— веса неверно классифицированных примеров умножаются на exp(α
), веса верно классифицированных примеров де-
t
лятся на это же число. Затем все веса нормализуются, чтобы
их сумма равнялась единице.
Градиентный бустинг [27] в отличие от адаптивного не уделяет больше внимания данным, на которых предыдущая слабая
модель совершила ошибку, а стремится уменьшить значение самой ошибки, используя в качестве целевых данных
производную функции потерь предыдущей слабой модели. Рассмотрим
шаги градиентного бустинга. Введем обозначения:
— датасет имеет N примеров обучающих данных X
эталонных ответов y
= {y
i
};
= {x
} и
i
— каждая слабая модель имеет параметры θ, принимает на
вход x
и возвращает предсказания ,
i
;
— функция потерь принимает на вход эталонные ответы и
предсказания и возвращает число
,.
После этого можно приступать к обучению. В качестве
первого приближения можно выбрать константу С таким образом, чтобы ,С была минимальна. Пусть метамодель будет содержать K слабых моделей. Тогда на каждом шаге k будут выполняться следующие действия:
— получаем предсказания текущих моделей ансамбля с по-
мощью взвешенной суммы
С
∑
∗,
;
— считаем отрицательную функцию потерь полученного
предсказания
r
дает нам представление о том, как надо изменить предсказа-
i
,
,
ния для уменьшения функции потерь;
— обучаем новую слабую модель предсказывать r
Параметры новой слабой модели обозначим θ
40
;
k
для xi.
i
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
