Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы и модели решения задачи классификации данных. Основные этапы. Учебное пособие
.pdf
1.4.3.3. КОРРЕЛЯЦИОННЫЙ АНАЛИЗ ВЗАИМОСВЯЗЕЙ
x
f
f
f
x
f
f
f
x
f
f
f
x
f
H
КЛАССИФИКАЦИОННЫХ ПРИЗНАКОВ
Корреляционный анализ качественных (классификационных) признаков связан с построением и анализом таблиц сопряженности [7, 8].
Таблица сопряженности, или таблица контингентности, – средство
представления совместного распределения двух и более качественных
признаков (переменных), предназначенное для исследования взаимосвязей между ними. Структура таблицы сопряженности для случая двух
признаков приведена на рис. 3.
Значение
признака
1
2
… … … … …
q
Рис. 3. Таблица сопряженности для двух признаков
y
1
11
21
1q
y
12
22
2
2q
…
…
…
…
y
m
1m
2m
qm
Строки и столбцы таблицы соответствуют уровням значений качественных признаков:
iq
i
, 1, ;
yj m
j
в ячейках таблицы – ко-
, 1, ;
личество наблюдений при заданном сочетании уровней значений признаков
; q и m – соответственно количество строк и столбцов
ij
в таблице сопряженности.
Для исследования взаимосвязей между признаками таблицы сопряженности часто используют критерий
2
Критерий
Пирсона проверяет основную гипотезу
χ
2
Пирсона.
χ
о стати-
0
стической незначимости взаимосвязи между двумя качественными признаками.
Критическая статистика критерия имеет вид
qm
()
fe
2
χ
∑∑
ij
ij ij
11
31
2
(28)
e
ij

и подчиняется распределению
f
где
и ije – соответственно наблюдаемое и ожидаемое количество
ij
2
с (q – 1)(m – 1) степенями свободы,
χ
значений в i-й строке и j-м столбце таблицы сопряженности признаков.
В случае если хотя бы одна частота в таблице сопряженности 5,
f
ij
в формуле критической статистики используется поправка Йетса, которая предотвращает переоценку статистической значимости для небольших данных:
qm
2
χ
∑∑
ij
fe
ij ij
11
e
ij
2
0,5
. (29)
Если расчетное значение критической статистики
2
квантиля распределения
уровня 1 – :
χ
22
χχ
2
не превышает
χ
, то гипотеза
(1 )
об отсутствии взаимосвязи между исследуемыми признаками не отвергается при заданном уровне значимости .
2
Неудобство использования критической статистики
связано
χ
с тем, что ее верхняя граница стремится к бесконечности при возрастании объема выборки n [8]. Поэтому вместо
2
используют коэффици-
χ
ент Крамера:
2
C
nqm
min ( 1)( 1)
. (30)
Коэффициент Крамера обладает более удобным для интерпретации
диапазоном изменения
1.4.3.4. ДИСПЕРСИОННЫЙ АНАЛИЗ ДАННЫХ
01C по сравнению с критерием
2
χ .
Метод дисперсионного анализа данных является широко используемым статистическим подходом и применяется для обнаружения влияния выделенного (контролируемого) набора факторов на результирующий признак. Выделяют однофакторный (ANalysis Of Variance,
ANOVA) и многофакторный (MANOVA) варианты дисперсионного
анализа [7, 8, 12, 16].
32

Факторы измеряются в неколичественной шкале, а результирующий
x
K
x
x
R
A
признак выражается числом (одномерный случай) или вектором с числовыми компонентами (многомерный случай). Рассмотрим постановку
задачи однофакторного одномерного дисперсионного анализа.
Пусть сравниваются K групп выборочных значений результирующего признака
меренного на i-м объекте в k-й группе;
, 1, , 1,
inkK – значение признака (атрибута), из-
ik k
n
– количество наблюдений
k
в k-й группе.
В дисперсионном анализе основная (нулевая) гипотеза
заключа-
H
0
ется в утверждении о равенстве средних значений признака по K-группам
и об отсутствии статистически значимого влияния фактора на значения
результирующего признака:
где
: ,
Hxx x
012
n
k
∑
ik
1
i
x
k
– групповое среднее.
n
k
(31)
Вычисляют общее среднее по всем группам:
Kn
k
∑∑
ki
x
11
ik
.
(32)
n
Рассматривают полную сумму квадратов отклонений значений признака от общего среднего, которая может быть разложена на две составляющие:
Kn Kn
2
Sxx xx
kk
∑∑ ∑∑
11 11
ki ki
K
nx x S S
∑
kk R A
1
k
22
ik ik
2
22
.
(33)
Первая составляющая
сию, вторая составляющая – дисперсию между группами
2
описывает внутригрупповую диспер-
S
33
2
Далее
.
S

рассматривают отношение межгрупповой дисперсии к внутригруппо-
H
j
X
x
вой дисперсии, которое является критической статистикой критерия:
2
()
SnK
A
F
2
SK
R
()1
. (34)
Очевидно, что в случае хорошей различимости групп по значениям
признака межгрупповая дисперсия имеет большое значение относительно внутригрупповой дисперсии. Чем больше значение F-отношения, тем сильнее различия.
В условиях справедливости нулевой гипотезы F-отношение подчиняется распределению Фишера с (K – 1) и (n – K) степенями свободы.
Если расчетное значение критической
квантиля распределения Фишера уровня 1 – :
не отвергается при уровне значимости .
0
статистики F не превышает
FF
, то гипотеза
1
Одномерный дисперсионный анализ основывается на предпосылках, ограничивающих область его применения. Речь идет о нормальном
распределении выборочных значений признака и стохастической независимости значений признака.
В многомерном случае рассматривают вектор значений результирующего признака:
X
⎛⎞
1
k
⎜⎟
XXxxx
kjkjkjknjk
⎜⎟
⎜⎟
⎜⎟
⎝⎠
, ,, , ,
X
pk
12
X
2
k
⎜⎟
T
k
(35)
где
– вектор значений j-го признака в k-й группе;
k
– i-е значе-
ijk
ние j-го признака в k-й группе.
Рассматривают вектор средних значений признаков в k-й группе:
x
⎛⎞
12k
⎜⎟
x
k
⎜⎟
X
k
. (36)
⎜⎟
⎜⎟
⎜⎟
x
pk
⎝⎠
34

Основная гипотеза заключается в равенстве векторов средних зна-
K
F
H
чений признаков в
K группах:
:
HX X X
01 2
. (37)
Критическая статистика критерия имеет вид (для случая двух групп)
где
nn p nn
12 12
pn n n n
12 12
1S
– обратная объединенная ковариационная матрица, где объеди-
1
2
XX S XX
12 12
T
1
, (38)
ненная ковариационная матрица задается формулой:
()(2)11Sn S n
11 2 2
S
где
S
S
и
1
– ковариационные матрицы соответственно для первой
2
nn
12
1
SXXXX
11111
SXXXX
22222
n
1
1
1
n
1
2
T
T
; (39)
, (40)
, (41)
и второй группы. Критическая статистика подчиняется распределению
Фишера с числом степеней свободы (
FF
сти
Если
.
, то гипотеза
1
не отвергается при уровне значимо-
0
р) и (
12
1nn p
).
Многомерный дисперсионный анализ основывается на следующих
предпосылках:
многомерные результирующие признаки имеют многомерное
нормальное распределение;
ковариационные матрицы многомерных признаков, рассчитанные
K группам, равны;
по
векторы признаков, составляющие многомерный признак, стоха-
стически независимы.
35

К стохастической независимости векторов значений признаков
x
K
x
предъявляются высокие требования. При нарушении независимости
степени свободы, фигурирующие в критической статистике, становятся
совершенно нереальными. Устойчивость результатов дисперсионного
анализа относительно равенств матриц ковариации признаков в разных
группах тем выше, чем ближе друг к другу объемы сравниваемых групп.
В случае нарушения предпосылок использования дисперсионного
анализа применяется
его непараметрический аналог – критерий Крас-
кела – Уоллиса [12].
1.5. НАИВНЫЙ БАЙЕСОВСКИЙ КЛАССИФИКАТОР
Построение наивного байесовского классификатора (Naive Bayes,
NB)
основывается на теореме Байеса [4, 16] с использованием расчета
апостериорных вероятностей классов. Принадлежность объекта
к классу определяется на основе максимальной апостериорной вероятности. В методе предполагается, что все признаки объектов независимы
между собой и одинаково важны для классификации.
Пусть задана обучающая выборка, содержащая
из которых описан вектором признаков:
( , , , ).
n объектов, каждый
xx x Для каж-
12
p
дого объекта известен класс, принимающий значение из множества
{, , , },
YCC C
12
K – количество классов.
Необходимо построить модель классификатора.
Для классификации используется следующая формула, основанная
на теореме Байеса:
()(| )
PY C P X x Y C
PY C X x
(|)
PY C X x
где
(| )
PX xY C
()
PY C
(|)
k
k
объекта к классу
знаков
– априорная вероятность принадлежности случайно вы-
k
– апостериорная вероятность принадлежности
Ck K с учетом его вектора признаков х;
k
– правдоподобие, т. е. вероятность вектора при-
k
при заданном классе
бранного объекта к классу
()PX x
– априорная вероятность вектора признаков х.
kk
PX x
()
, (42)
,, 1,
C
;
k
C
;
k
36

Априорная вероятность принадлежности объекта классу
X
p
P
A
C
k
рассчи-
тывается по формуле
n
n
где
– количество объектов в обучающей выборке объемом n, при-
k
надлежащих классу
C
PY Cn
()
.
k
Поскольку случайные величины
условно независимыми в рамках класса
k
k
, (43)
(, , , )
XX X считаются
12
C
, выражение (42) можно пе-
k
p
реписать:
p
()( | )
PY C PX x Y C
kiik
i
1
(|)
PY C X x
k
( , , , )
XxX x X x
112 2
. (44)
p
Учитывая, что знаменатель зависит только от значений признаков,
а не от класса, при сравнении вероятностей его можно не использовать
и перейти к выражению
p
(|)()( |).
PY C X x PY C P X x Y C
kkiik
i
1
(45)
Для упрощения вычислений используют логарифмирование:
p
ln ( ) ln ( | ).
PY C P X x Y C
∑
kiik
1
i
(46)
На последнем этапе находят класс, соответствующий максимальной
апостериорной вероятности, для чего вычисляют выражение
ˆ
AA
arg max
{1, , }
kK
ˆ
ˆˆ
PY C P X x Y C
ln ( ) ln ( | )
kkiik
i
p
∑
1
37
ˆ
,
k
(47)
.

Наивный байесовский классификатор выбирает класс, которому со-
x
ответствует наибольшее значение ˆ.
оценку априорных вероятностей ˆ()
ˆ
PX x Y C на основе обучающей выборки. Для перехода к апо-
(|
ii k
)
A Обучение модели включает
k
PY C и условных вероятностей
k
стериорной вероятности класса используют выражение
ˆ
p
ex
A
ˆ
(|)
PY C X x
k
K
∑
k
k
exˆp
A
1
k
. (48)
Возможно несколько реализаций наивного байесовского классификатора, отличающиеся предположениями о распределении признаков
при заданном классе. Наиболее известный – гауссовский наивный байесовский классификатор (GaussianNB) – вариант для работы с непрерывными признаками, которые имеют нормальное распределение.
C
Условная вероятность i-го признака при заданном классе
вычисля-
k
ется по формуле
2
C
2
ik
, (49)
. Эти параметры
k
где
ik
в классе
(|) exp
PX x Y C
ii k
и
C
– среднее и стандартное отклонение i-го признака
ik
;
– значение i-го признака в классе
k
ik
1
2
2
ik
⎛⎞
()
x
ik ik
⎜⎟
⎜⎟
2
⎝⎠
оцениваются с помощью метода максимального правдоподобия по обучающей выборке.
Категориальный наивный байесовский классификатор (CategoricalNB)
используется для категориально распределенных данных и основан
на предположении, что каждый признак имеет свое собственное категориальное распределение. Условная вероятность i-го признака при задан-
C
ном классе
вычисляется по формуле
k
(| ; )
Px tY C a
ik
38
Na
tik
Nan
ki
, (50)

где
x
x
x
x
x
tik ik k
принимает значение t в классе
объектов в k-м классе;
n
– количество доступных значений i-го при-
i
– количество раз, когда признак
C
;
k
|{ | }|
NkKYC
kk
– количество
i
|{ | , }|
NkKxtYC
знака; a – сглаживающий параметр.
Кроме рассмотренных выше вариантов реализации классификатора,
возможны также следующие: мультиномиальный наивный байесовский
классификатор (MultinomialNB); комплементарный наивный байесовский классификатор (ComplementNB); бернуллиевский наивный байесовский классификатор (BernoulliNB).
Достоинства NB-алгоритма:
простота в реализации и интерпретации полученных результатов;
практически не требует настройки параметров;
высокая скорость работы и точность прогнозов во многих ситуа-
циях;
имеет относительно хорошую устойчивость к шуму и выбросам,
так как классификатор основан на вероятностных распределениях
и наивном предположении о независимости признаков.
Недостатки NB-алгоритма:
предполагает, что все признаки независимы друг от друга, что не
всегда соответствует реальности; в случае нарушения предположения о
независимости признаков точность прогнозов может значительно снижаться;
отдает предпочтение классам с большим количеством объектов
(мажоритарным) в случае несбалансированных данных.
Пример. Рассмотрим пример использования наивного байесовского
классификатора. В исходной БД представлены данные о времени написания программистами двух категорий (классов) тестовых программ:
– время написания тестовой программы первого типа (тест 1),
1
–
2
время написания тестовой программы второго типа (тест 2); табл. 1.
Всего в БД содержится семь наблюдений, из которых четыре наблюдения относятся к первому классу и три наблюдения – ко второму.
Предположим, что признаки
и
1
независимы и подчиняются
2
нормальному закону распределения:
⎛⎞
()
1
(|) exp
Px Y
1
2
2
k
1
39
x
11
kk
⎜⎟
⎜⎟
⎝⎠
2
1
2
2
k
, (51)

⎛⎞
x
x
P
P
()
1
(|) exp
Px Y
Применение наивного байесовского классификатора
2
2
2
k
2
x
22
kk
⎜⎟
⎜⎟
⎝⎠
2
2
2
k
2
. (52)
Таблица 1
1
20 30 1 1 0
24 31 1 1 0
19 37 1 0,97 0,03
17 38 1 0,83 0,17
20
11
11
12
12
2,94
21 39 2 0,19 0,81
25 40 2 0,04 0,96
20 41 2 0,13 0,87
22
2, 65
21
21
22
2
34
4, 08
40
1
22
Класс
ˆ
(1| )
YXx (2| )
ˆ
YXx
Далее сформируем условные вероятности для первого и второго
класса по правилу:
(, |) ( |)( |)Px x Y Px YPx Y
12 1 2
. (53)
В результате получим следующее:
22
22
Px x Y
(, | 1) exp
12
222
⎛⎞
()( )
1
11 21 11 21
xx
11 11 21 21
⎜⎟
⎜⎟
⎝⎠
; (54)
⎛⎞
()( )
Px x Y
(, | 2) exp
12
1
222
12 22 12 22
xx
12 12 22 22
⎜⎟
⎜⎟
⎝⎠
40
22
22
. (55)
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
