Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы и модели решения задачи классификации данных. Основные этапы. Учебное пособие
.pdf
Определим априорные вероятности появления классов в выборке:
x
ˆ
(1) ,
PY
4
ˆ
(2)
PY
7
Определим правило классификации. Вычислим значения
3
.
7
ˆ
A и
1
ˆ
A :
2
⎛⎞⎛ ⎞
ˆ
A
ˆ
A
Объект
41
ln ln
1
ln ln
2
⎜⎟⎜ ⎟
⎜⎟⎜ ⎟
72 2 2
31
72 2 2
(, )
⎝⎠⎝ ⎠
⎛⎞⎛ ⎞
⎜⎟⎜ ⎟
⎜⎟⎜ ⎟
⎝⎠⎝ ⎠
xx
12
наибольшее из значений
()( )
xx
11 11 21 21
11 21 11 21
()( )
xx
12 12 22 22
12 22 12 22
относится к классу, которому соответствует
ˆ
ˆ
A и
A . Для определения апостериорной ве-
1
2
22
22
22
22
; (56)
. (57)
роятности класса в долях единицы можно использовать соотношения:
ˆ
exp
A
ˆ
(1| )
PY X x
ˆ
(2| )
PY X x
exp exˆp
exp exˆp
1
AA
12
ˆ
exp
A
2
AA
12
; (58)
ˆ
. (59)
ˆ
В табл. 1 приведены апостериорные вероятности первого и второго
класса для каждого наблюдения. Как видно из табл. 1, все наблюдения
классифицированы верно. С помощью приведенных выше формул (56) –
(59) можно классифицировать новое наблюдение, например, объект
х = (18, 42) с вероятностью 4
к первому классу
и с вероятностью 6
ˆ
(1| )0,4PY X x будет относиться
ˆ
(2| )0,5PY X x – ко второму.
41

1.6. ОЦЕНКА ТОЧНОСТИ МОДЕЛЕЙ КЛАССИФИКАЦИИ
Оценка точности является важным этапом в процессе решения задачи классификации и опирается на расчет набора метрик [18]. Метрики
оценивают, насколько точно модель классификации предсказывает принадлежность объекта определенному классу. Анализ рассчитанных значений метрик точности позволяет сделать вывод о качестве и надежности модели классификации и принять решение о ее дальнейшем
приме-
нении на практике.
Метрики точности рассчитываются на обучающей и тестовой выборке. Для формирования выборок из исходного набора данных используются два подхода.
В первом случае наблюдения обучающей и тестовой выборки формируются случайным образом в заданном соотношении с помощью генератора случайных чисел. Наиболее часто используют соотношения
0,2 или 0,7 и 0,3, т. е. 80 % (70 %) наблюдений из исходных данных
0,8 и
составляют обучающую выборку и 20 % (30 %) наблюдений включают
в тестовую выборку.
Во втором случае для формирования выборок используется алгоритм K-блочной перекрестной проверки (K-fold cross-validation). Алгоритм заключается в разбиении исходной выборки на K блоков (как правило, задают K = 10) примерно
одинаковой длины, случайным образом,
но со стратификацией классов. Каждый из K блоков поочередно объявляется тестовой выборкой, остальные K – 1 блоков объединяются в обу-
чающую выборку. Далее классификатор строится по обучающей выборке, затем классифицирует объекты тестовой выборки. Процедура
обучения повторяется K раз, в результате все объекты используются как
тестовые ровно
по одному разу и как обучающие – по K – 1 разу. Метрики точности рассчитываются K раз на тестовой и обучающей выборке. Для получения итоговых значений метрик выполняется усреднение по результатам K испытаний. Алгоритм K-блочной перекрестной
проверки позволяет получить более надежную оценку точности модели
по сравнению с использованием первого подхода
благодаря различным
многократным разбиениям исходных данных на обучающий и тестовый
наборы. Таким образом, алгоритм K-блочной перекрестной проверки
учитывает вариативность в данных и снижает возможность переобучения или недообучения модели. Кроме того, этот алгоритм позволяет использовать доступные исходные данные максимально эффективно, учитывать все наблюдения при обучении модели.
42

Далее рассмотрим основные метрики точности, которые используют
для оценки качества классификационных решений. Для простоты сначала приведем расчет мер для случая бинарной классификации (два
класса), а потом обобщим алгоритм расчета для случая многоклассовой
классификации (более двух классов).
В результате применения метода классификации строится матрица
ошибок классификации (confusion matrix), которая в случае двух
клас-
сов выглядит следующим образом (рис. 4).
Actually
Positive (1)
Negative (0)
Рис. 4. Матрица ошибок классификации (два класса)
Positive (1) Negative (0)
True Positive (TP) False Negative (FN)
False Positive (FP)
Type I error
Predicted
Type II error
True Negative (TN)
В матрице ошибок классификации один из классов обозначается как
Positive (1) – позитивный или предсказываемый; второй класс обозначается как Negative (0). Интерпретация классов зависит от конкретной задачи. Например, при классификации сообщений на два класса: «Спам» –
Positive (1); «Не спам» – Negative (0). Каждая строка матрицы ошибок
классификации представляет фактическое (Actually) количество объек-
классе, каждый столбец – предсказанное (Predicted) количество
тов в
объектов в классе или, наоборот, – оба варианта встречаются в литературе. В каждой ячейке таблицы записано количество верно (не верно)
классифицированных наблюдений класса:
True Positive (TP) – истинно положительное решение;
False Positive (FP, ошибка I рода) – ложноположительное реше-
ние;
True Negative (TN) – истинно отрицательное решение;
False Negative (FN, ошибка II рода) – ложноотрицательное реше-
ние.
Базовыми метриками при оценке точности моделей классификации
являются меры: Accuracy (точность); Precision (точность); Recall (полнота), которые используются в качестве основы для расчета производных метрик.
43

Мера точности (Accuracy) измеряет долю правильно классифицированных наблюдений (объектов) от общего числа наблюдений (N):
TP TN
Accuracy
. (60)
N
Достоинство меры Accuracy – простота интерпретации. Недостатки
меры – чувствительность к дисбалансу классов и неадекватное отражение точности классификации (миноритарный класс может прогнозироваться с низкой точностью, при этом Accuracy будет иметь большие значения за счет высокой точности прогнозирования мажоритарного
класса).
Мера точности (Precision) – это доля объектов, классифицирован-
ных к классу
класса Positive. В литературе этот показатель еще обозначают как PPV –
Positive Predictive value (положительная прогностическая ценность):
Positive, которые действительно являются объектами
TP FP
TN
TP
. (61)
. (62)
TP
. (63)
TP FN
Мера Precision не чувствительна к дисбалансу классов, но отражает
качество классификации только для класса Positive.
Показатель NPV – Negative Predictive Value (отрицательная прогностическая ценность) – это доля объектов, классифицированных к классу
Negative, которые действительно являются объектами класса Negative:
Precision PPV
NPV
FN TN
Мера полноты (Recall) – это доля объектов, классифицированных
к классу Positive, относительно всех объектов этого класса. Меру Recall
в литературе еще называют чувствительностью (Sensitivity) или истинно
положительным показателем (TPR – True Positive Rate) и интерпретируют как вероятность того, что объект будет классифицирован как Po-
sitive при условии, что он действительно принадлежит классу Positive:
Recall Sensitivity TPR
44

Мера Recall не чувствительна к дисбалансу классов, но не учитывает
y
y
отрицательных классификаций.
Мера специфичности (Specificity), или истинно отрицательный показатель (TNR – True Negative Rate), – это вероятность того, что объект
будет отнесен к классу Negative при условии, что он действительно принадлежит к классу Negative:
Мера Specificity просто вычисляется и интерпретируется, но характеризует способность модели распознавать только класс Negative.
Показатель распространенности (Prevalence) – это доля объектов
класса Positive в исходной выборке:
Specificity TNR
Prevalence
TN
FP TN
TP FN
. (64)
. (65)
N
Показатель скорости обнаружения (Detection Rate) – это доля объектов, верно классифицированных к классу Positive, относительно всех
объектов исходной выборки:
Detection rate DR
TP
. (66)
N
Показатель выявленной распространенности (Detection Prevalence) – это доля предсказанных объектов класса Positive (как истинных,
так и ложных) относительно всех объектов исходной выборки:
Detection Prevalence DP
TP FP
. (67)
N
Мера сбалансированной точности (Balanced Accuracy) вычисляется
по формуле
Balanced Accuracy BA
Sensitivit
Specificit
. (68)
2
Мера BA учитывает несбалансированность классов, что является
важным аспектом при решении задач, в которых присутствует дисбаланс в количестве объектов разных классов в исходной выборке.
45

F-мера является метрикой, которая объединяет точность (Precision)
и полноту (Recall) в одну меру качества в задачах классификации.
Она представляет собой гармоническое среднее между точностью
и полнотой и позволяет оценить баланс между этими двумя метриками.
F-мера обычно используется в задачах, где важно достичь баланса
между точностью и полнотой. Она позволяет
оценить качество классификации, учитывая и ложноположительные, и ложноотрицательные
предсказания:
Precision Recall
2
F
Precision Recall
. (69)
Формула (69) придает одинаковый вес точности и полноте, поэтому
F-мера будет уменьшаться одинаково при снижении как точности, так
и полноты. Можно рассчитать F-меру, придав различный вес точности
и полноте, если наиболее важна одна из метрик при решении задачи
классификации:
01
где
, если отдается приоритет точности; при
дается полноте; при
2
(1)
F
1
формула сводится к (69).
Precision Recall
2
Precision Recall
, (70)
1
приоритет от-
Недостатками F-меры являются чувствительность к дисбалансу
классов и отсутствие симметрии, т. е. она может изменять свое значение
при инверсии положительного и отрицательного класса.
Коэффициент Мэттьюса (MCC – Matthews Correlation Coefficient) яв-
мерой, которая учитывает все четыре значения из матрицы оши-
ляется
бок (confusion matrix), оценивает качество классификации и учитывает
баланс между полнотой (Recall) и точностью (Precision) для каждого
класса. Мера MCC называется коэффициентом корреляции, поскольку
указывает, насколько коррелированы фактические и предсказанные
классы: значение 1 указывает на идеальный классификатор; –1 указывает на классификатор, который предсказывает противоположный
класс
относительно фактического значения, а значение 0 показывает, что
классификатор работает не лучше случайного угадывания:
TP TN FP FN
MCC
()()()( )
TP FP TP FN TN FP TN FN
46
. (71)

Коэффициент MCC не может использоваться, если один из множи-
A
y
телей в знаменателе обращается в нуль.
Мера Каппа Коэна (Cohen’s Kappa) используется при выраженном
дисбалансе классов и основана на нормировке значений меры Accuracy:
точность полученного решения (Accuracy) нормируется с помощью точности, которую можно было получить случайно (Accuracy
):
n
ccuracyAccurac
K
Accuracy
n
()( )()()
TN FP TN FN FN TP FP TP
Accuracy
1
n
; (72)
n
. (73)
NN NN
Первое слагаемое в (73) определяет вероятность угадать класс Negative, а второе слагаемое – класс Positive.
ROC-кривая (Receiver Operator Characteristic) – кривая, которая
наиболее часто используется для представления результатов бинарной
классификации. ROC-кривая показывает зависимость количества верно
классифицированных положительных наблюдений (TPR или Sensitivity)
от количества неверно классифицированных отрицательных наблюдений (1 – TNR или 1 – Specificity). При этом предполагается, что у классификатора имеется некоторый параметр, варьируя который можно получить то
или иное разбиение на два класса. Этот параметр часто называют порогом или точкой отсечения (cut-off value). В зависимости
от него будут получаться различные величины ошибок I и II рода. Предполагается, что классификатор выдает вероятность принадлежности
объекта к классу Positive. Методика оценки качества моделей бинарной
классификации с помощью ROC-кривых известна как
ROC-анализ.
Рассмотрим совместно TPR и TNR классификаторы. Очевидно, что
если все положительные наблюдения классифицированы правильно
(т. е. число ложноотрицательных случаев равно 0), то TPR = 1. Мера TNR
показывает, насколько хорошо модель классифицирует отрицательные
наблюдения. Очевидно, что если все отрицательные наблюдения классифицированы правильно (т. е. число ложноположительных случаев
равно 0), то TNR = 1.
Совместное
использование TPR и TNR помогает создать метрику, поз-
воляющую выбирать значение дискриминационного порога, который
47

оптимально балансирует модель между способностью распознавать
положительные и отрицательные наблюдения. Именно эта задача и решается с помощью ROC-кривой. Действительно, если изменять дискриминационный порог от 0 до 1 и наносить по оси абсцисс точки 1 − TNR,
а по оси ординат TPR, то полученный график и будет ROC-кривой. Величину 1 −
TNR называют долей ложноположительных классификаций
(False Positive Rate):
1FPTNR FPR
FP TN
. (74)
При пороге, равном единице, все примеры будут классифицированы
как отрицательные (FPR = 1, TPR = 1), а при пороге, равном нулю, – как
положительные (FPR = 0, TPR = 0). Поэтому ROC-кривая (рис. 5) всегда
идет от точки (0; 0) до точки (1; 1).
Рис. 5. Варианты ROC-кривой
Несложно увидеть, что для идеальной модели ROC-кривая превращается в ломаную линию, проходящую через точки (0; 0), (0; 1) и (1; 1).
При этом площадь под ROC-кривой (AUC – Area Under Curve) окажется
равной единице. Точка (0; 1) соответствует идеальному состоянию модели, в котором и TPR, и TNR одновременно равны единице. Идеальная
модель является, скорее, гипотетической и на практике, как
правило,
недостижима. Поэтому обычно приходится иметь дело с ROC-кривыми,
48

которые не проходят через точку (0; 1), а приближаются к ней на определенное расстояние. Соответственно и AUC оказывается меньше единице. Таким образом, показатель AUC является удобной мерой качества
классификатора относительно идеального. Принята следующая шкала
оценки качества:
отличное: 0,9…1;
очень хорошее: 0,8…0,9;
хорошее: 0,7…0,8;
удовлетворительное: 0,6…0,7;
плохое: ниже 0,7.
Если AUC = 0,5, то ROC-кривая превращается в линию, проходящую
через точки (0; 0) и (1; 1), которая соответствует бесполезному классификатору, работающему как случайный предсказатель. Если AUC < 0,5,
то получается модель, которая работает хуже случайного предсказателя
и от ее использования следует отказаться.
В случае если классификатор выдает бинарные ответы (номер
класса), а не вероятность
принадлежности объекта классу, можно также
построить ROC-кривую и вычислить AUC. В этом случае ROC-кривая
будет состоять только из трех точек, соединенных линиями: (0; 0),
(FPR; TPR), (1; 1).
В рамках многоклассовой классификации для вычисления метрик
точности используется подход One-vs-All («один против всех»): каждый
класс один раз становится Positive, а
остальные при этом объявляются
как Negative (см. пример вычисления на рис. 6, а).
Существует три варианта получения итогового значения метрики из
матрицы ошибок. Рассмотрим варианты на примере расчета F-меры
(рис. 6, б).
Алгоритм расчета
1. Усреднение элементов матрицы ошибок (TP; FP; TN; FN) между
бинарными классификаторами. Затем расчет Precision, Recall, F-меры
по одной усредненной матрице ошибок. Это называют микроусреднением (Micro-average)
.
2. Расчет Precision, Recall для каждого классификатора отдельно,
а потом усреднение. Это называют макроусреднением (Macro-average).
3. Расчет F-меры для каждого классификатора отдельно, а потом
усреднение. Это называют усреднением (Average).
49

а б
Рис. 6. Вычисление метрик точности при многоклассовой классификации:
а – матрица ошибок классификации; б – схема вычисления F-меры
Различия в микро- и макроусреднениях достаточно просты. Если
классы объектов в обучающей выборке не сбалансированы, то при микроусреднении они будут «теряться», тогда как при макроусреднении
они будут иметь примерно тот же вес, что и мажоритарные классы.
Таким образом, если при оценке модели важны как мажоритарные,
так и миноритарные классы, то
лучше использовать макроусреднение.
Если же главным образом анализируются мажоритарные классы, то используется микроусреднение. Если же выборка сбалансирована, то особых различий между этими подходами нет.
1.7. КОНТРОЛЬНЫЕ ВОПРОСЫ К РАЗДЕЛУ 1
1. Приведите математическую постановку задачи классификации
данных «с учителем». В каких предметных областях решается задача
классификации? Приведите примеры.
К какому типу относятся целевая переменная (признак) и предик-
2.
торные признаки при решении задачи классификации? Какие существуют типы шкал измерения значений признака, в чем их различия?
Что понимается под обучающей и тестовой выборкой при реше-
3.
нии задачи классификации?
Какие основные этапы можно выделить в процессе решения за-
4.
дачи классификации данных? Приведите характеристику каждого из
этапов.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
