Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы и модели решения задачи классификации данных. Основные этапы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
Определим априорные вероятности появления классов в выборке:
x
ˆ
(1) ,
PY
4
ˆ
(2)
PY
7
Определим правило классификации. Вычислим значения
3
.
7
ˆ
A и
1
ˆ
A :
2
⎛⎞⎛ ⎞
ˆ
A
ˆ
A
Объект
41

ln ln
1

ln ln
2
⎜⎟⎜ ⎟ ⎜⎟⎜ ⎟
72 2 2
31
72 2 2
(, )
 
⎝⎠⎝ ⎠
⎛⎞⎛ ⎞ ⎜⎟⎜ ⎟
⎜⎟⎜ ⎟
 
⎝⎠⎝ ⎠
xx
12
наибольшее из значений
()( )
xx
11 11 21 21
11 21 11 21
()( )
xx
12 12 22 22
12 22 12 22
относится к классу, которому соответствует
ˆ
ˆ
A и
A . Для определения апостериорной ве-
1
2
22
 
22
22
 
22
; (56)
. (57)
роятности класса в долях единицы можно использовать соотношения:
ˆ
exp
A

ˆ
(1| )
PY X x

ˆ
(2| )
PY X x

exp exˆp
  
exp exˆp
  
1
AA
12
ˆ
exp
A

2
AA
12
; (58)
ˆ
. (59)
ˆ
В табл. 1 приведены апостериорные вероятности первого и второго класса для каждого наблюдения. Как видно из табл. 1, все наблюдения классифицированы верно. С помощью приведенных выше формул (56) – (59) можно классифицировать новое наблюдение, например, объект
х = (18, 42) с вероятностью 4 к первому классу
и с вероятностью 6
ˆ
(1| )0,4PY X x будет относиться
ˆ
(2| )0,5PY X x – ко второму.
41
1.6. ОЦЕНКА ТОЧНОСТИ МОДЕЛЕЙ КЛАССИФИКАЦИИ
Оценка точности является важным этапом в процессе решения за­дачи классификации и опирается на расчет набора метрик [18]. Метрики оценивают, насколько точно модель классификации предсказывает при­надлежность объекта определенному классу. Анализ рассчитанных зна­чений метрик точности позволяет сделать вывод о качестве и надежно­сти модели классификации и принять решение о ее дальнейшем
приме-
нении на практике.
Метрики точности рассчитываются на обучающей и тестовой вы­борке. Для формирования выборок из исходного набора данных исполь­зуются два подхода.
В первом случае наблюдения обучающей и тестовой выборки фор­мируются случайным образом в заданном соотношении с помощью ге­нератора случайных чисел. Наиболее часто используют соотношения
0,2 или 0,7 и 0,3, т. е. 80 % (70 %) наблюдений из исходных данных
0,8 и
составляют обучающую выборку и 20 % (30 %) наблюдений включают в тестовую выборку.
Во втором случае для формирования выборок используется алго­ритм K-блочной перекрестной проверки (K-fold cross-validation). Алго­ритм заключается в разбиении исходной выборки на K блоков (как пра­вило, задают K = 10) примерно
одинаковой длины, случайным образом, но со стратификацией классов. Каждый из K блоков поочередно объяв­ляется тестовой выборкой, остальные K – 1 блоков объединяются в обу- чающую выборку. Далее классификатор строится по обучающей вы­борке, затем классифицирует объекты тестовой выборки. Процедура обучения повторяется K раз, в результате все объекты используются как тестовые ровно
по одному разу и как обучающие – по K – 1 разу. Мет­рики точности рассчитываются K раз на тестовой и обучающей вы­борке. Для получения итоговых значений метрик выполняется усредне­ние по результатам K испытаний. Алгоритм K-блочной перекрестной проверки позволяет получить более надежную оценку точности модели по сравнению с использованием первого подхода
благодаря различным многократным разбиениям исходных данных на обучающий и тестовый наборы. Таким образом, алгоритм K-блочной перекрестной проверки учитывает вариативность в данных и снижает возможность переобуче­ния или недообучения модели. Кроме того, этот алгоритм позволяет ис­пользовать доступные исходные данные максимально эффективно, учи­тывать все наблюдения при обучении модели.
42
Далее рассмотрим основные метрики точности, которые используют для оценки качества классификационных решений. Для простоты сна­чала приведем расчет мер для случая бинарной классификации (два класса), а потом обобщим алгоритм расчета для случая многоклассовой классификации (более двух классов).
В результате применения метода классификации строится матрица ошибок классификации (confusion matrix), которая в случае двух
клас-
сов выглядит следующим образом (рис. 4).
Actually
Positive (1)
Negative (0)
Рис. 4. Матрица ошибок классификации (два класса)
Positive (1) Negative (0)
True Positive (TP) False Negative (FN)
False Positive (FP)
Type I error
Predicted
Type II error
True Negative (TN)
В матрице ошибок классификации один из классов обозначается как
Positive (1) – позитивный или предсказываемый; второй класс обознача­ется как Negative (0). Интерпретация классов зависит от конкретной за­дачи. Например, при классификации сообщений на два класса: «Спам» – Positive (1); «Не спам» – Negative (0). Каждая строка матрицы ошибок классификации представляет фактическое (Actually) количество объек-
классе, каждый столбец – предсказанное (Predicted) количество
тов в объектов в классе или, наоборот, – оба варианта встречаются в литера­туре. В каждой ячейке таблицы записано количество верно (не верно) классифицированных наблюдений класса:
True Positive (TP) – истинно положительное решение;
False Positive (FP, ошибка I рода) – ложноположительное реше-
ние;
True Negative (TN) – истинно отрицательное решение; False Negative (FN, ошибка II рода) – ложноотрицательное реше-
ние.
Базовыми метриками при оценке точности моделей классификации являются меры: Accuracy (точность); Precision (точность); Recall (пол­нота), которые используются в качестве основы для расчета производ­ных метрик.
43
Мера точности (Accuracy) измеряет долю правильно классифициро­ванных наблюдений (объектов) от общего числа наблюдений (N):
TP TN
Accuracy
. (60)
N
Достоинство меры Accuracy – простота интерпретации. Недостатки меры – чувствительность к дисбалансу классов и неадекватное отраже­ние точности классификации (миноритарный класс может прогнозиро­ваться с низкой точностью, при этом Accuracy будет иметь большие зна­чения за счет высокой точности прогнозирования мажоритарного класса).
Мера точности (Precision) – это доля объектов, классифицирован- ных к классу класса Positive. В литературе этот показатель еще обозначают как PPV –
Positive Predictive value (положительная прогностическая ценность):
Positive, которые действительно являются объектами
TP FP
TN
TP
. (61)
. (62)
TP
. (63)
TP FN
Мера Precision не чувствительна к дисбалансу классов, но отражает качество классификации только для класса Positive.
Показатель NPV – Negative Predictive Value (отрицательная прогно­стическая ценность) – это доля объектов, классифицированных к классу
Negative, которые действительно являются объектами класса Negative:
Precision PPV

NPV
FN TN
Мера полноты (Recall) – это доля объектов, классифицированных к классу Positive, относительно всех объектов этого класса. Меру Recall в литературе еще называют чувствительностью (Sensitivity) или истинно положительным показателем (TPR – True Positive Rate) и интерпрети­руют как вероятность того, что объект будет классифицирован как Po-
sitive при условии, что он действительно принадлежит классу Positive:
Recall Sensitivity TPR

44
Мера Recall не чувствительна к дисбалансу классов, но не учитывает
y
y
отрицательных классификаций.
Мера специфичности (Specificity), или истинно отрицательный пока­затель (TNR – True Negative Rate), – это вероятность того, что объект будет отнесен к классу Negative при условии, что он действительно при­надлежит к классу Negative:
Мера Specificity просто вычисляется и интерпретируется, но харак­теризует способность модели распознавать только класс Negative.
Показатель распространенности (Prevalence) – это доля объектов класса Positive в исходной выборке:
Specificity TNR
Prevalence

TN
FP TN
TP FN
. (64)
. (65)
N
Показатель скорости обнаружения (Detection Rate) – это доля объек­тов, верно классифицированных к классу Positive, относительно всех объектов исходной выборки:
Detection rate DR

TP
. (66)
N
Показатель выявленной распространенности (Detection Preva­lence) – это доля предсказанных объектов класса Positive (как истинных,
так и ложных) относительно всех объектов исходной выборки:
Detection Prevalence DP

TP FP
. (67)
N
Мера сбалансированной точности (Balanced Accuracy) вычисляется по формуле
Balanced Accuracy BA

Sensitivit
Specificit
. (68)
2
Мера BA учитывает несбалансированность классов, что является важным аспектом при решении задач, в которых присутствует дисба­ланс в количестве объектов разных классов в исходной выборке.
45
F-мера является метрикой, которая объединяет точность (Precision) и полноту (Recall) в одну меру качества в задачах классификации. Она представляет собой гармоническое среднее между точностью и полнотой и позволяет оценить баланс между этими двумя метриками. F-мера обычно используется в задачах, где важно достичь баланса между точностью и полнотой. Она позволяет
оценить качество класси­фикации, учитывая и ложноположительные, и ложноотрицательные предсказания:
Precision Recall
2
F
Precision Recall
. (69)
Формула (69) придает одинаковый вес точности и полноте, поэтому F-мера будет уменьшаться одинаково при снижении как точности, так и полноты. Можно рассчитать F-меру, придав различный вес точности и полноте, если наиболее важна одна из метрик при решении задачи классификации:
01
где
, если отдается приоритет точности; при
дается полноте; при
2
(1)
F
 
1
формула сводится к (69).
Precision Recall
2
Precision Recall

, (70)
1
приоритет от-
Недостатками F-меры являются чувствительность к дисбалансу классов и отсутствие симметрии, т. е. она может изменять свое значение при инверсии положительного и отрицательного класса.
Коэффициент Мэттьюса (MCC – Matthews Correlation Coefficient) яв-
мерой, которая учитывает все четыре значения из матрицы оши-
ляется бок (confusion matrix), оценивает качество классификации и учитывает баланс между полнотой (Recall) и точностью (Precision) для каждого класса. Мера MCC называется коэффициентом корреляции, поскольку указывает, насколько коррелированы фактические и предсказанные классы: значение 1 указывает на идеальный классификатор; –1 указы­вает на классификатор, который предсказывает противоположный
класс относительно фактического значения, а значение 0 показывает, что классификатор работает не лучше случайного угадывания:
TP TN FP FN
MCC
()()()( )
TP FP TP FN TN FP TN FN
  

46
. (71)
Коэффициент MCC не может использоваться, если один из множи-
A
y
телей в знаменателе обращается в нуль.
Мера Каппа Коэна (Cohen’s Kappa) используется при выраженном дисбалансе классов и основана на нормировке значений меры Accuracy: точность полученного решения (Accuracy) нормируется с помощью точ­ности, которую можно было получить случайно (Accuracy
):
n
ccuracyAccurac
K
Accuracy

n
 
()( )()()
TN FP TN FN FN TP FP TP
Accuracy
1
n
; (72)
n
. (73)
NN NN
Первое слагаемое в (73) определяет вероятность угадать класс Ne­gative, а второе слагаемое – класс Positive.
ROC-кривая (Receiver Operator Characteristic) – кривая, которая
наиболее часто используется для представления результатов бинарной классификации. ROC-кривая показывает зависимость количества верно классифицированных положительных наблюдений (TPR или Sensitivity) от количества неверно классифицированных отрицательных наблюде­ний (1 – TNR или 1 – Specificity). При этом предполагается, что у клас­сификатора имеется некоторый параметр, варьируя который можно по­лучить то
или иное разбиение на два класса. Этот параметр часто назы­вают порогом или точкой отсечения (cut-off value). В зависимости от него будут получаться различные величины ошибок I и II рода. Пред­полагается, что классификатор выдает вероятность принадлежности объекта к классу Positive. Методика оценки качества моделей бинарной классификации с помощью ROC-кривых известна как
ROC-анализ.
Рассмотрим совместно TPR и TNR классификаторы. Очевидно, что если все положительные наблюдения классифицированы правильно (т. е. число ложноотрицательных случаев равно 0), то TPR = 1. Мера TNR показывает, насколько хорошо модель классифицирует отрицательные наблюдения. Очевидно, что если все отрицательные наблюдения клас­сифицированы правильно (т. е. число ложноположительных случаев равно 0), то TNR = 1.
Совместное
использование TPR и TNR помогает создать метрику, поз-
воляющую выбирать значение дискриминационного порога, который
47
оптимально балансирует модель между способностью распознавать положительные и отрицательные наблюдения. Именно эта задача и ре­шается с помощью ROC-кривой. Действительно, если изменять дискри­минационный порог от 0 до 1 и наносить по оси абсцисс точки 1 − TNR, а по оси ординат TPR, то полученный график и будет ROC-кривой. Ве­личину 1 −
TNR называют долей ложноположительных классификаций
(False Positive Rate):
1FPTNR FPR

FP TN
. (74)
При пороге, равном единице, все примеры будут классифицированы как отрицательные (FPR = 1, TPR = 1), а при пороге, равном нулю, – как положительные (FPR = 0, TPR = 0). Поэтому ROC-кривая (рис. 5) всегда идет от точки (0; 0) до точки (1; 1).
Рис. 5. Варианты ROC-кривой
Несложно увидеть, что для идеальной модели ROC-кривая превра­щается в ломаную линию, проходящую через точки (0; 0), (0; 1) и (1; 1). При этом площадь под ROC-кривой (AUC – Area Under Curve) окажется равной единице. Точка (0; 1) соответствует идеальному состоянию мо­дели, в котором и TPR, и TNR одновременно равны единице. Идеальная модель является, скорее, гипотетической и на практике, как
правило,
недостижима. Поэтому обычно приходится иметь дело с ROC-кривыми,
48
которые не проходят через точку (0; 1), а приближаются к ней на опре­деленное расстояние. Соответственно и AUC оказывается меньше еди­нице. Таким образом, показатель AUC является удобной мерой качества классификатора относительно идеального. Принята следующая шкала оценки качества:
отличное: 0,9…1;
очень хорошее: 0,8…0,9;
хорошее: 0,7…0,8;
удовлетворительное: 0,6…0,7;
плохое: ниже 0,7.
Если AUC = 0,5, то ROC-кривая превращается в линию, проходящую через точки (0; 0) и (1; 1), которая соответствует бесполезному класси­фикатору, работающему как случайный предсказатель. Если AUC < 0,5, то получается модель, которая работает хуже случайного предсказателя и от ее использования следует отказаться.
В случае если классификатор выдает бинарные ответы (номер класса), а не вероятность
принадлежности объекта классу, можно также построить ROC-кривую и вычислить AUC. В этом случае ROC-кривая будет состоять только из трех точек, соединенных линиями: (0; 0), (FPR; TPR), (1; 1).
В рамках многоклассовой классификации для вычисления метрик точности используется подход One-vs-All («один против всех»): каждый класс один раз становится Positive, а
остальные при этом объявляются
как Negative (см. пример вычисления на рис. 6, а).
Существует три варианта получения итогового значения метрики из матрицы ошибок. Рассмотрим варианты на примере расчета F-меры
(рис. 6, б).
Алгоритм расчета
1.  Усреднение элементов матрицы ошибок (TP; FP; TN; FN) между бинарными классификаторами. Затем расчет Precision, Recall, F-меры по одной усредненной матрице ошибок. Это называют микроусредне­нием (Micro-average)
.
2.  Расчет Precision, Recall для каждого классификатора отдельно, а потом усреднение. Это называют макроусреднением (Macro-average).
3.  Расчет F-меры для каждого классификатора отдельно, а потом усреднение. Это называют усреднением (Average).
49
а б
Рис. 6. Вычисление метрик точности при многоклассовой классификации:
а – матрица ошибок классификации; б – схема вычисления F-меры
Различия в микро- и макроусреднениях достаточно просты. Если классы объектов в обучающей выборке не сбалансированы, то при мик­роусреднении они будут «теряться», тогда как при макроусреднении они будут иметь примерно тот же вес, что и мажоритарные классы. Таким образом, если при оценке модели важны как мажоритарные, так и миноритарные классы, то
лучше использовать макроусреднение. Если же главным образом анализируются мажоритарные классы, то ис­пользуется микроусреднение. Если же выборка сбалансирована, то осо­бых различий между этими подходами нет.
1.7. КОНТРОЛЬНЫЕ ВОПРОСЫ К РАЗДЕЛУ 1
1. Приведите математическую постановку задачи классификации данных «с учителем». В каких предметных областях решается задача классификации? Приведите примеры.
К какому типу относятся целевая переменная (признак) и предик-
2.
торные признаки при решении задачи классификации? Какие суще­ствуют типы шкал измерения значений признака, в чем их различия?
Что понимается под обучающей и тестовой выборкой при реше-
3. нии задачи классификации?
Какие основные этапы можно выделить в процессе решения за-
4.
дачи классификации данных? Приведите характеристику каждого из этапов.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]