Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Технологии искусственного интеллекта в банковской сфере. Учебное пособие
.pdf
Глава 3
— вес новой слабой модели wk подбирается таким образом,
чтобы минимизировать
∑
,∗,
.
Метод бэггинга представлен моделью случайного леса, метод адаптивного бустинга — моделью Adaboost. Обе модели
являются частью библиотеки алгоритмов машинного обучения
sklearn [28]. Метод градиентного бустинга представлен тремя
реализациями с открытым исходным кодом:
— LightGBM [29] (Light Gradient Boosting Machine) — проект от Microsoft;
— XGBoost [30] — проект энтузиастов;
— CatBoost [31] — проект от Yandex.
3.3. Метрики для оценки моделей машинного обучения
Для оценки качества моделей машинного обучения в задачах классификации используют метрики, основанные на понятиях из математической статистики — ошибки первого и второго рода. Ошибка первого рода состоит в отказе от правильного утверждения, ошибка второго рода означает принятие неправильного утверждения. В
ным утверждением является истинная классификация наблюдения. На основании этих ошибок строится матрица ошибок —
таблица сопряженности с двумя измерениями (табл.).
Истинный класс
Предсказанный
Матрица ошибок для бинарной классификации
TP (True Positive)
1
Истинно положительный
класс
FN (False Negative)
0
Ложно отрицательный
(ошибка первого рода)
случае классификации правиль-
1 0
FP (False Positive)
Ложно положительный
(ошибка второго рода)
TN (True Negative)
Истинно
отрицательный
41

Технологии искусственного интеллекта в банковской сфере
В чистом виде матрица ошибок не используется, однако
значения ячеек позволяют получать показатели различных
метрик.
Accuracy.
Доля правильных ответов (accuracy) — доля верных отве-
тов модели для обоих классов. Является самой распространенной метрикой ввиду своей предельно простой интерпретируемости
.
Однако accuracy практически не используется на практике
из-за некорректного поведения на выборках с несбалансированными классами. Так, при использовании модели, предсказывающей исключительно целевой класс, на выборке с соотношением классов 30/70 метрика accuracy выдаст показатель в
70
%. Это можно принять за неплохой показатель, однако та-
кая модель абсолютно неприменима для использования. Также
метрика accuracy не дает информации о количестве ложноположительных и ложноотрицательных предсказаний модели.
Sensitivity.
Чувствительность (sensitivity, recall, True Positives Rate
(TPR)) — доля правильно поставленного класса среди пред-
ставителей этого класса. Показывает способность модели обнаруживать целевой класс
.
Модель с высокой чувствительностью способна распознать всех представителей целевого класса. Но использование
этой метрики в одиночку также не является надежным методом оценки модели. Sensitivity не способна учитывать ложноположительные результаты, а значит, при использовании модели, предсказывающей исключительно целевой класс, показатель метрики достигнет 100
%, так как модель правильно
классифицирует всех представителей целевого класса.
42

Глава 3
Specificity.
Специфичность (specificity, True Negatives Rate (TNR)) —
доля правильно поставленного класса среди представителей не
целевого класса
.
Specificity обладает тем же недостатком, что и sensitivity —
100%-ный результат при использовании модели, предсказывающей исключительно не целевой класс.
Precision.
Точность (precision) — доля истинных представителей
класса среди представителей, предсказанных моделью
.
Метрика precision избавлена от уязвимости перед моделью, предсказывающей исключительно целевой класс, так как
учитывает количество ложноположительных результатов.
Таким образом, использование метрик sensitivity и preci-
sion вместе может дать исчерпывающее представление о качестве модели. Однако сравнение нескольких моделей по двум
метрикам может быть затруднительным. Поэтому может использоваться метрика F
-score.
F
β
F
-мера — гармоническое среднее между чувствительно-
1
.
1
стью и точностью, позволяет свести два показателя в один, принимая во внимание с одинаковым весом обе метрики. Мера
достигает 1 при максимальных чувствительности и точности и
уменьшается при уменьшении любого из показателей
∙∙
В записи общей формулы F
-score задается положитель-
β
.
ным действительным параметром β, который описывает, во
сколько раз вес recall должен превышать вес precision
∙
1
∗
.
43

Технологии искусственного интеллекта в банковской сфере
ROC-AUC.
Кривая ROC (receiver operating characteristic) представляет
собой график, показывающий эффективность модели классификации при всех пороговых значениях классификации. Для
построения ROC-кривой используются значения двух характеристик:
— доля истинно положительных предсказаний (sensitivity,
recall, True Positives Rate (TPR))
;
— доля ложноположительных предсказаний (False Positives Rate (FPR))
100
.
В ходе построения ROC-кривой порог принятия решения
принимает значения в диапазоне [0, 1] с некоторым шагом.
Для каждого значения порога рассчитываются значения TPR и
FPR. Строится график зависимости этих метрик: на оси Ox откладываются значения FPR, на оси Oy — TPR (рис. 6).
44
Рис. 6. Пример графика ROC-кривой

Глава 3
При использовании идеального классификатора график
пройдет через верхний левый угол, где доля истинно положительных предсказаний максимальна и равна 1, а доля ложноположительных предсказаний минимальна и равна 0. Поэтому
при сравнении нескольких моделей классификации та, у которой график визуально расположен левее и выше, считается
более качественной (рис. 7).
Рис. 7. Сравнение графиков ROC-кривых двух классификаторов
Однако при небольших различиях качества моделей визуальное определение лучшей может быть затруднительным. Поэтому используется показатель AUC (Area Under Curve) — площадь фигуры, ограниченной снизу осью координат, справа —
максимальным значением доли ложноположительных результатов, и слева сверху — точками ROC-кривой (рис. 8).
45

Технологии искусственного интеллекта в банковской сфере
Рис. 8. AUC-площадь под ROC-кривой
Индекс Юдена.
Индекс Юдена позволяет оценить эффективность модели
при ее использовании для бинарной классификации (рис. 9).
Графически индекс Юдена представляет собой высоту над случайной линией
1.
Рис. 9. Индекс Юдена
46

Глава 3
Значение индекса находится в диапазоне [0, 1]. При значении индекса 1 модель идеальна и не совершает ошибок ни первого, ни второго рода, при 0 модель бесполезна для практического применения.
Индекс Юдена может использоваться в сочетании с метрикой ROC-AUC. Он высчитывается для всех точек ROC-кривой, и максимальное значение индекса Юдена может исполь
зоваться в качестве критерия для выбора оптимального порога
принятия решения.
Коэффициент Жаккара.
Коэффициент Жаккара представляет собой меру схожести
двух конечных наборов элементов. Коэффициент высчитывается как отношение пересечения двух наборов к их объединению и принимает значения от 0 до 1:
,
∩
|
∪
|
|
|
∩
|||||
|
∩
.
|
|
Если наборы абсолютно идентичны, коэффициент равен 1,
если в наборах нет ни одного одинакового элемента, коэффициент равен 0. Коэффициент Жаккара под неофициальным
названием IoU (Intersection over Union) широко применяется в
задачах сегментации изображений, которые можно отнести к
бинарной классификации набора всех пикселей изображения.
Визуализация IoU позволяет хорошо понять смысл коэффициента Жаккара (рис. 10).
-
Рис. 10. Схематичное изображение метрики IoU
(зеленый прямоугольник — истинная маска,
красный — предсказанная)
47

Технологии искусственного интеллекта в банковской сфере
В терминах матрицы ошибок (табл.) коэффициент Жаккара
рассчитывается по формуле
.
Коэффициент каппа Коэна.
Коэффициент каппа Коэна измеряет степень согласованности между двумя оценщиками, каждый из которых классифицирует одинаковый набор элементов по фиксированному количеству взаимоисключающих категорий. Коэффициент каппа
Коэна назван в честь Джейкоба Коэна, американского статистика и психолога, написавшего основополагающую статью
по этой теме [32]. Позже сообщество исследователей в
области машинного обучения стало использовать эту метрику для
оценивания качества моделей, приняв истинные значения
классов за показания одного оценщика и ответы модели за показания другого. Коэффициент каппа Коэна принимает значе-
1, 1], где 1 означает полную согласованность оценок, 0 —
ния [–
уровень случайного выставления оценок, –
1 — полную про-
тивоположность в согласованности. Коэффициент каппа Коэна рассчитывается по формуле
∗∗
∗∗∗
.
Коэффициент корреляции Мэтьюса.
Коэффициент корреляции Мэтьюса (Matthews correlation
coefficient — MCC), изобретенный Брайаном Мэтьюсом в 1975 г.
[33], представляет собой инструмент для оценки моделей классификации. Он измеряет разницу между фактическими значениями и прогнозируемыми значениями классов объектов. Коэффициент учитывает истинно отрицательные, истинно положительные, ложноотрицательные и ложноположительные результаты. Эта мера дает высокие
оценки только в том случае,
если прогноз дает хорошие оценки для всех четырех значений
матрицы ошибок (табл.). MCC принимает значения [–
1, 1], где
1 означает полную согласованность оценок, 0 — уровень случайного выставления оценок, –
1 — полную противополож-
ность в согласованности
48

Глава 3
∗∗
.
Выбор метрики.
При выборе метрики для оценивания тестируемых моделей
следует принять во внимание некоторые факторы. Первый
фактор — сбалансированность представителей классов. При
дисбалансе некоторые метрики будут некорректно отображать
свойства модели. К ним относятся accuracy, sensitivity и speci-
ficity. В таких случаях можно использовать коэффициент корреляции Мэтьюса, который устойчив к сильно несбалансированным датасетам [34].
Другим важным фактором является критичность ошибок
первого или второго рода и то, какую из них важнее минимизировать. Модель машинного обучения возвращает вероятность принадлежности примера к целевому классу — значение
в диапазоне [0, 1]. При значениях вероятности 0,995 или 0,013
не составит труда однозначно определить класс примера, однако как быть с вероятностью
в 0,6? Чтобы сопоставить значение вероятности с классом, необходимо определить порог принятия решения. Все значения выше этого порога будут определены как представители целевого класса, а что ниже — как
представители не целевого класса.
Определение порога принятия решения будет прямым образом влиять на значения ячеек матрицы ошибок и большинство вышеперечисленных метрик. При повышении этого порога меньше примеров будут классифицированы как целевые,
что понизит метрику sensitivity, однако уверенность в их классификации будет высокой, что уменьшит количество ложноположительных предсказаний (ошибка второго рода) и повысит метрику specificity. При уменьшении порога эти метрики
поведут себя противоположным образом.
Для более
полной оценки предсказательной способности
модели в таких случаях применяется метрика ROC-AUC. Метрика ROC-AUC позволяет проводить исследования и сравнивать
необходимое количество моделей классификации, чтобы выбрать модель с лучшей способностью к прогнозированию. Также
ROC-AUC устойчива к несбалансированным классам [35].
49

Технологии искусственного интеллекта в банковской сфере
Глава 4
ТЕХНОЛОГИИ РАСПОЗНАВАНИЯ
И КЛАССИФИКАЦИИ ИЗОБРАЖЕНИЙ
Классификация объектов — одна из задач области компьютерного зрения. Более локальная задача — классификация изображений, которая подразумевает под собой маркировку изображений одной из нескольких предопределенных категорий.
Классификация объектов является простой задачей для
людей, но очень большой проблемой для машин. Интерес к алгоритмам классификации
рогих камер, снимающих видео высокого качества, распространения высокопроизводительных компьютеров и потребности в автоматическом анализе видеоматериалов.
Для решения задачи классификации изображений применяются следующие подходы:
1) использование характеристик изображения;
2) использование обучающей выборки;
3) использование предположений о параметрах данных.
Для классификации изображений используются как клас
сические методы машинного обучения, так и нейронные сети,
включая глубокое обучение.
объектов возрос из-за наличия недо-
-
4.1. Нейронные сети
Наиболее перспективным для работы с изображениями является метод искусственных нейронных сетей.
Нейронные сети представляют собой набор алгоритмов,
смоделированных на основе человеческого мозга, которые
предназначены для распознавания паттернов. Они интерпрети-
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
