Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы и модели решения задачи классификации данных. Основные этапы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
1.4.3.3. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ ВЗАИМОСВЯЗЕЙ
x
f
f
f
x
f
f
f
x
f
f
f
x
f
H
КЛАССИФИКАЦИОННЫХ ПРИЗНАКОВ
Корреляционный анализ качественных (классификационных) при­знаков связан с построением и анализом таблиц сопряженности [7, 8]. Таблица сопряженности, или таблица контингентности, – средство представления совместного распределения двух и более качественных признаков (переменных), предназначенное для исследования взаимо­связей между ними. Структура таблицы сопряженности для случая двух признаков приведена на рис. 3.
Значение
признака
1
2
… … … … …
q
Рис. 3. Таблица сопряженности для двух признаков
y
1
11
21
1q
y
12
22
2
2q
…
…
…
…
y
m
1m
2m
qm
Строки и столбцы таблицы соответствуют уровням значений каче­ственных признаков:
iq
i
, 1, ;
yj m
j
в ячейках таблицы – ко-
, 1, ;
личество наблюдений при заданном сочетании уровней значений при­знаков
; q и m – соответственно количество строк и столбцов
ij
в таблице сопряженности.
Для исследования взаимосвязей между признаками таблицы сопря­женности часто используют критерий
2
Критерий
Пирсона проверяет основную гипотезу
χ
2
Пирсона.
χ
о стати-
0
стической незначимости взаимосвязи между двумя качественными при­знаками.
Критическая статистика критерия имеет вид
qm
()
fe
2
χ
∑∑
ij

ij ij
11
31
2
(28)
e
ij
и подчиняется распределению
f
где
и ije – соответственно наблюдаемое и ожидаемое количество
ij
2
с (q – 1)(m – 1) степенями свободы,
χ
значений в i-й строке и j-м столбце таблицы сопряженности признаков.
В случае если хотя бы одна частота в таблице сопряженности 5,
f
ij
в формуле критической статистики используется поправка Йетса, кото­рая предотвращает переоценку статистической значимости для неболь­ших данных:
qm
2
χ
∑∑
ij

fe


ij ij
11
e
ij
2
0,5
. (29)
Если расчетное значение критической статистики
2
квантиля распределения
уровня 1 – :
χ
22
χχ
2
не превышает
χ
, то гипотеза
(1 )

об отсутствии взаимосвязи между исследуемыми признаками не отвер­гается при заданном уровне значимости .
2
Неудобство использования критической статистики
связано
χ
с тем, что ее верхняя граница стремится к бесконечности при возраста­нии объема выборки n [8]. Поэтому вместо
2
используют коэффици-
χ
ент Крамера:
2
C
nqm
min ( 1)( 1)

. (30)
Коэффициент Крамера обладает более удобным для интерпретации диапазоном изменения
1.4.3.4. ДИСПЕРСИОННЫЙ АНАЛИЗ ДАННЫХ
01C по сравнению с критерием
2
χ .
Метод дисперсионного анализа данных является широко использу­емым статистическим подходом и применяется для обнаружения влия­ния выделенного (контролируемого) набора факторов на результирую­щий признак. Выделяют однофакторный (ANalysis Of Variance, ANOVA) и многофакторный (MANOVA) варианты дисперсионного анализа [7, 8, 12, 16].
32
Факторы измеряются в неколичественной шкале, а результирующий
x
K
x
x
R
A
признак выражается числом (одномерный случай) или вектором с чис­ловыми компонентами (многомерный случай). Рассмотрим постановку задачи однофакторного одномерного дисперсионного анализа.
Пусть сравниваются K групп выборочных значений результирую­щего признака
меренного на i-м объекте в k-й группе;
, 1, , 1,
inkK – значение признака (атрибута), из-
ik k
n
– количество наблюдений
k
в k-й группе.
В дисперсионном анализе основная (нулевая) гипотеза
заключа-
H
0
ется в утверждении о равенстве средних значений признака по K-группам и об отсутствии статистически значимого влияния фактора на значения результирующего признака:
где
: ,
Hxx x
012
n
k
∑
ik
1
i
x
k
– групповое среднее.
n
k
(31)
Вычисляют общее среднее по всем группам:
Kn
k
∑∑
ki
x
11

ik
.
(32)
n
Рассматривают полную сумму квадратов отклонений значений при­знака от общего среднего, которая может быть разложена на две состав­ляющие:
Kn Kn
2
Sxx xx
kk

 
∑∑ ∑∑
11 11
 
ki ki
K
nx x S S

∑
kk R A
1
k
22
ik ik
2
22
.

(33)
Первая составляющая
сию, вторая составляющая – дисперсию между группами
2
описывает внутригрупповую диспер-
S

33
2
Далее
.
S

рассматривают отношение межгрупповой дисперсии к внутригруппо-
H
j
X
x
вой дисперсии, которое является критической статистикой критерия:
2
()
SnK
A
F
2
SK
R
()1
. (34)
Очевидно, что в случае хорошей различимости групп по значениям признака межгрупповая дисперсия имеет большое значение относи­тельно внутригрупповой дисперсии. Чем больше значение F-отноше­ния, тем сильнее различия.
В условиях справедливости нулевой гипотезы F-отношение подчи­няется распределению Фишера с (K – 1) и (n – K) степенями свободы.
Если расчетное значение критической квантиля распределения Фишера уровня 1 – :
не отвергается при уровне значимости .
0
статистики F не превышает
FF
, то гипотеза
1

Одномерный дисперсионный анализ основывается на предпосыл­ках, ограничивающих область его применения. Речь идет о нормальном распределении выборочных значений признака и стохастической неза­висимости значений признака.
В многомерном случае рассматривают вектор значений результиру­ющего признака:
X
⎛⎞
1
k
⎜⎟
XXxxx

kjkjkjknjk
⎜⎟ ⎜⎟
⎜⎟ ⎝⎠
, ,, , ,
X
pk

12
X
2
k
⎜⎟
T
k
(35)
где
– вектор значений j-го признака в k-й группе;
k
– i-е значе-
ijk
ние j-го признака в k-й группе.
Рассматривают вектор средних значений признаков в k-й группе:
x
⎛⎞
12k
⎜⎟
x
k
⎜⎟
X
k
. (36)
⎜⎟
⎜⎟ ⎜⎟
x
pk
⎝⎠
34
Основная гипотеза заключается в равенстве векторов средних зна-
K
F
H
чений признаков в
K группах:
:
HX X X
01 2
. (37)
Критическая статистика критерия имеет вид (для случая двух групп)
где
nn p nn

12 12


pn n n n

12 12
1S
– обратная объединенная ковариационная матрица, где объеди-
1
2
XX S XX

12 12
T
1
, (38)
ненная ковариационная матрица задается формулой:
()(2)11Sn S n

11 2 2
S
где
S
S
и
1
– ковариационные матрицы соответственно для первой
2
nn

12
1
SXXXX

11111
SXXXX

22222

n
1
1
1

n
1
2
T
T
; (39)
, (40)
, (41)
и второй группы. Критическая статистика подчиняется распределению Фишера с числом степеней свободы (
FF
сти
Если
.
, то гипотеза
1

не отвергается при уровне значимо-
0
р) и (
12
1nn p
).
Многомерный дисперсионный анализ основывается на следующих предпосылках:
многомерные результирующие признаки имеют многомерное
нормальное распределение;
ковариационные матрицы многомерных признаков, рассчитанные
K группам, равны;
по
векторы признаков, составляющие многомерный признак, стоха-
стически независимы.
35
К стохастической независимости векторов значений признаков
x
K
x
предъявляются высокие требования. При нарушении независимости степени свободы, фигурирующие в критической статистике, становятся совершенно нереальными. Устойчивость результатов дисперсионного анализа относительно равенств матриц ковариации признаков в разных группах тем выше, чем ближе друг к другу объемы сравниваемых групп.
В случае нарушения предпосылок использования дисперсионного анализа применяется
его непараметрический аналог – критерий Крас-
кела – Уоллиса [12].
1.5. НАИВНЫЙ БАЙЕСОВСКИЙ КЛАССИФИКАТОР
Построение наивного байесовского классификатора (Naive Bayes, NB)
основывается на теореме Байеса [4, 16] с использованием расчета
апостериорных вероятностей классов. Принадлежность объекта к классу определяется на основе максимальной апостериорной вероят­ности. В методе предполагается, что все признаки объектов независимы между собой и одинаково важны для классификации.
Пусть задана обучающая выборка, содержащая из которых описан вектором признаков:
( , , , ).
n объектов, каждый
xx x Для каж-
12
p
дого объекта известен класс, принимающий значение из множества
{, , , },
YCC C
12
K – количество классов.
Необходимо построить модель классификатора.
Для классификации используется следующая формула, основанная на теореме Байеса:
()(| )
PY C P X x Y C

PY C X x

(|)
PY C X x
где
(| )
PX xY C
()
PY C
(|)
k
k
объекта к классу
знаков
– априорная вероятность принадлежности случайно вы-
k
– апостериорная вероятность принадлежности
Ck K с учетом его вектора признаков х;
k
– правдоподобие, т. е. вероятность вектора при-
k
при заданном классе
бранного объекта к классу
()PX x
– априорная вероятность вектора признаков х.
kk
PX x
()
, (42)
,, 1,
C
;
k
C
;
k
36
Априорная вероятность принадлежности объекта классу
X
p
P
A
C
k
рассчи-
тывается по формуле
n
n
где
– количество объектов в обучающей выборке объемом n, при-
k
надлежащих классу
C
PY Cn
()
.
k
Поскольку случайные величины условно независимыми в рамках класса
k
k
, (43)
(, , , )
XX X считаются
12
C
, выражение (42) можно пе-
k
p
реписать:
p
()( | )
PY C PX x Y C

kiik
i
1
(|)
PY C X x

k
( , , , )
XxX x X x
112 2

. (44)
p
Учитывая, что знаменатель зависит только от значений признаков, а не от класса, при сравнении вероятностей его можно не использовать и перейти к выражению
p
(|)()( |).
PY C X x PY C P X x Y C
 
kkiik
i
1
(45)
Для упрощения вычислений используют логарифмирование:
p
ln ( ) ln ( | ).
PY C P X x Y C
  
∑
kiik
1
i
(46)
На последнем этапе находят класс, соответствующий максимальной апостериорной вероятности, для чего вычисляют выражение
ˆ
AA
arg max
{1, , }

kK
ˆ
ˆˆ
PY C P X x Y C
 
ln ( ) ln ( | )
kkiik
i
p
∑
1
37
ˆ
,
k
(47)
.
Наивный байесовский классификатор выбирает класс, которому со-
x
ответствует наибольшее значение ˆ. оценку априорных вероятностей ˆ()
ˆ
PX x Y C на основе обучающей выборки. Для перехода к апо-
(|
ii k
)
A Обучение модели включает
k
PY C и условных вероятностей
k
стериорной вероятности класса используют выражение
ˆ
p
ex
A

ˆ

(|)
PY C X x
k
K
∑
k
k
exˆp
A

1
k
. (48)
Возможно несколько реализаций наивного байесовского классифи­катора, отличающиеся предположениями о распределении признаков при заданном классе. Наиболее известный – гауссовский наивный бай­есовский классификатор (GaussianNB) – вариант для работы с непре­рывными признаками, которые имеют нормальное распределение.
C
Условная вероятность i-го признака при заданном классе
вычисля-
k
ется по формуле
2

C
2
ik
, (49)
. Эти параметры
k
где
ik
в классе

(|) exp
PX x Y C
ii k
и
C
– среднее и стандартное отклонение i-го признака
ik
;
– значение i-го признака в классе
k
ik
1
2

2
ik
⎛⎞
()
x
ik ik
⎜⎟ ⎜⎟
2
⎝⎠
оцениваются с помощью метода максимального правдоподобия по обу­чающей выборке.
Категориальный наивный байесовский классификатор (CategoricalNB) используется для категориально распределенных данных и основан на предположении, что каждый признак имеет свое собственное катего­риальное распределение. Условная вероятность i-го признака при задан-
C
ном классе
вычисляется по формуле
k
(| ; )

Px tY C a
ik
38
Na
tik
Nan
ki
, (50)
где
x
x
x
x
x
tik ik k
принимает значение t в классе объектов в k-м классе;
n
– количество доступных значений i-го при-
i
– количество раз, когда признак
C
;
k
|{ | }|
NkKYC 
kk
– количество
i
|{ | , }|
NkKxtYC  
знака; a – сглаживающий параметр.
Кроме рассмотренных выше вариантов реализации классификатора, возможны также следующие: мультиномиальный наивный байесовский классификатор (MultinomialNB); комплементарный наивный байесов­ский классификатор (ComplementNB); бернуллиевский наивный байе­совский классификатор (BernoulliNB).
Достоинства NB-алгоритма:
простота в реализации и интерпретации полученных результатов; практически не требует настройки параметров;
высокая скорость работы и точность прогнозов во многих ситуа-
циях;
имеет относительно хорошую устойчивость к шуму и выбросам,
так как классификатор основан на вероятностных распределениях и наивном предположении о независимости признаков.
Недостатки NB-алгоритма:
предполагает, что все признаки независимы друг от друга, что не
всегда соответствует реальности; в случае нарушения предположения о независимости признаков точность прогнозов может значительно сни­жаться;
отдает предпочтение классам с большим количеством объектов
(мажоритарным) в случае несбалансированных данных.
Пример. Рассмотрим пример использования наивного байесовского
классификатора. В исходной БД представлены данные о времени напи­сания программистами двух категорий (классов) тестовых программ:
– время написания тестовой программы первого типа (тест 1),
1
–
2
время написания тестовой программы второго типа (тест 2); табл. 1. Всего в БД содержится семь наблюдений, из которых четыре наблюде­ния относятся к первому классу и три наблюдения – ко второму.
Предположим, что признаки
и
1
независимы и подчиняются
2
нормальному закону распределения:
⎛⎞
()
1
(|) exp
Px Y

1
2

2
k
1
39
x
11
kk
⎜⎟ ⎜⎟ ⎝⎠
2

1
2
2
k
, (51)
⎛⎞
x
x
P
P
()
1
(|) exp
Px Y
Применение наивного байесовского классификатора

2
2

2
k
2
x
22
kk
⎜⎟ ⎜⎟ ⎝⎠
2

2
2
k
2
. (52)
Таблица 1
1
20 30 1 1 0
24 31 1 1 0
19 37 1 0,97 0,03
17 38 1 0,83 0,17
20
11
11
12
12
2,94
21 39 2 0,19 0,81
25 40 2 0,04 0,96
20 41 2 0,13 0,87
22
2, 65
21
21
22
2
34
4, 08
40
1
22
Класс
ˆ
(1| )
YXx (2| )
ˆ
YXx
Далее сформируем условные вероятности для первого и второго класса по правилу:
(, |) ( |)( |)Px x Y Px YPx Y
12 1 2
. (53)
В результате получим следующее:
22
 
22
Px x Y
(, | 1) exp
12

 
222
⎛⎞
()( )
1
11 21 11 21
xx
11 11 21 21
⎜⎟ ⎜⎟ ⎝⎠
; (54)
⎛⎞
()( )
Px x Y
(, | 2) exp
12

1
 
222
12 22 12 22
xx
12 12 22 22
⎜⎟ ⎜⎟ ⎝⎠
40
22
 
22
. (55)
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]