Анализ таблиц сопряженности в пакетах Statistica, САНИ, Excel. Методические указания к лабораторным работам, практическим занятиям и самостоятельной р
.pdf
|
|
(n |
n |
22 |
n |
n |
21 |
) |
2 |
|
|
|
|
11 |
|
12 |
|
|
|
, (0;1). |
(8) |
||
n1*n2*n*1n*2 |
|
|
|||||||||
|
|
|
|
|
|
||||||
Справедлива формула |
V2 . |
Коэффициент называют |
коэффициентом |
||||||||
детерминации признаков Х и Y.
Меры связи, основанные на отношении преобладаний (шансов)
Часто один из двух признаков является исходным по отношению к другому.
Пусть Y – результативный признак, X – факторный. Нас интересует вероятность того, что Y y1. Введем две характеристики:
x |
|
P(Y y1 |
| X x1) |
|
p11 / p1* |
|
– шансы появления |
|||||
|
| X x ) |
p / p |
||||||||||
|
1 |
|
|
P(Y y |
2 |
|
|
|
|
|||
|
|
|
|
|
1 |
|
12 1* |
|
|
|||
x |
|
|
P(Y y1 | X x2) |
|
|
p21 / p2* |
|
– шансы появления |
||||
2 |
P(Y y2 | X x2) |
|
|
|||||||||
|
|
|
|
p22 / p2* |
|
|
||||||
Найдем оценки шансов:
Ox |
|
n11 /n1* |
|
n11 |
; Ox |
|
n21 /n2* |
||||
|
|
|
|||||||||
1 |
|
n |
/n |
|
n |
2 n |
22 |
/n |
2* |
||
|
12 |
1* |
12 |
|
|
|
|
||||
y1 при условии, чтоX x1;
y1 при условии, что X x2 .
n21 . n22
Сопоставляя различными способами шансы x1 и x2 , можно получают
различные меры связи.
1) Коэффициент ассоциации Юла [3, 5, 8]
|
x |
x |
2 |
Ox |
Ox |
|
n n |
|
n |
n |
|
||
Q |
1 |
|
, Q |
1 |
2 |
|
11 |
22 |
|
21 12 |
. |
(9) |
|
|
x |
x |
2 |
|
Ox |
Ox |
|
n11n22 n21n12 |
|
||||
1 |
|
1 |
2 |
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
11 |
Коэффициент ассоциации обладает свойствами коэффициента корреляции:
изменяется от -1 до +1;
если |
Q>0, то связь «положительная», т.е. если |
X x1, |
то вероятнее всего |
Y y1, если |
X x2 , то вероятнее всего Y y2; |
|
|
если |
Q<0, то связь «отрицательная», т.е. если |
X x1, |
то вероятнее всего |
Yy2, если X x2 , то вероятнее всего Y y1;
если Q=0, то признаки независимы;
если Q=1, то связь функциональная «положительная», т.е. p11 p1* p*1 и
p22 p2* p*2 ( p21 p12 0); |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
если Q=-1, то связь функциональная «отрицательная», т.е. |
|
p21 |
p2* |
p*1 и |
||||||||||||||||||||
p12 p1* p*2 ( p11 p22 0). |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
, где оценка дисперсии |
|||||||||||||
|
Оценка коэффициента ассоциации Q |
N Q;D(Q) |
|||||||||||||||||||||||
|
|
|
|
n |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
|
|
|
|
1 |
|
|
|
|
|
1 |
|
|
1 |
|
|
1 |
|
|
1 |
|
|
|||
|
|
2 |
|
|
2 |
|
2 |
|
|
|
|
|
|||||||||||||
Q |
|
|
|
|
|
|
|
|
|
|
|
|
|
||||||||||||
вычисляется по формуле |
S |
(Q) |
4(1 Q |
) |
|
|
n |
n |
|
n |
|
. Это |
|||||||||||||
|
|
|
n |
21 |
22 |
|
|||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
11 |
|
12 |
|
|
|
|
|
|
|
|
|||
асимптотическое свойство может использоваться как при проверке значимости коэффициента ассоциации, так и при построении для него доверительного интервала.
Если зависимость между признаками не является функциональной, но одна из
частот в клетке равна нулю, то Q 1, что дает преувеличенную оценку тесноты связи. В этих случаях целесообразно использовать коэффициент контингенции или коэффициент коллигации.
2) Коэффициент коллигации Юла [3, 5, 8]
|
|
x |
|
x |
|
|
Ox |
|
Ox |
|
|
|
n n |
22 |
|
n |
n |
|
|
||
Y |
|
1 |
|
2 |
|
, Y |
|
1 |
|
2 |
|
|
|
11 |
|
|
21 12 |
|
. |
(10) |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||
|
|
x |
|
x |
|
|
|
Ox |
|
Ox |
|
|
|
n11n22 |
n21n12 |
|
|||||
1 |
|
2 |
|
|
|
1 |
|
2 |
|
|
|
|
|
|
|
|
|
|
|
||
12
2Y
Коэффициенты ассоциации и коллигации связаны соотношением: Q . 1 Y2
Свойства коэффициента коллигации аналогичны |
свойствам |
|
коэффициента |
||
|
|
|
|
|
, где оценка |
ассоциации. Оценка коэффициента коллигации Y |
N Y;D(Y) |
||||
n |
|
|
|
|
|
|
|
|
|
||
|
|
|
|
1 |
|
|
|
|
1 |
|
|
2 |
|
2 |
|
2 |
|
||||||
дисперсии Y вычисляется по формуле S |
(Y) |
(1 Y |
) |
|
|
||||||
|
16 |
|
|
|
n |
||||||
|
|
|
|
|
|
|
|
|
|
11 |
|
3)Отношение преобладаний (шансов) [2]
x1 , O Ox1 n11n22 .
x |
Ox |
n21n12 |
2 |
|
2 |
1 |
1 |
1 |
|
||||
|
|||||||
|
|
|
|
|
|
|
. |
n |
n |
21 |
n |
22 |
|||
12 |
|
|
|
|
|
||
(11)
Эту характеристику связи ещё называют отношением перекрестных произведений. Если хотя бы одна из частот четырёхклеточной таблицы сопряженности равна нулю, то рассчитывается модифицированная характеристика связи:
|
|
|
|
1 |
|
|
|
1 |
|
n |
|
|
|
n |
|
|
|
|
|
|
|
|
|
||||||
O |
11 |
|
2 |
|
22 |
|
2 |
. |
|
|
|
|
|
1 |
|
|
|
1 |
|
n |
|
|
|
n |
|
|
|
||
|
2 |
2 |
|||||||
|
|
21 |
|
|
12 |
|
|
||
Отношение перекрестных произведений принимает значения из диапазона
(0; ), где значение 1 соответствует отсутствию связи. Это довольно необычно.
Более привычный диапазон значений получается при работе с натуральным логарифмом отношения преобладаний L lnO или L lnO , который изменяется в пределах от ( ; ), имея для случая отсутствия связи значение 0.
13
1.4 Меры связи для таблицы сопряженности r s
Меры связи, основанные на статистике Хи-квадрат
1) Фи-коэффициент (коэффициент Чупрова-Крамера)
Выборочное значение коэффициента рассчитывается по формуле (5). 2) Коэффициент сопряженности Пирсона [2, 3, 5, 8]
Выборочное значение коэффициента рассчитывается по формуле (6). Если связь между признаками отсутствует, то P 0. Чем ближе значение P к 1, тем теснее связь. Однако максимальное значение данного коэффициента зависит от числа строк и столбцов таблицы сопряженности и определяется по формуле
min(r 1,s 1) . Чтобы исправить этот недостаток, предлагаются следующие
1 min(r 1,s 1)
два коэффициента.
3) Коэффициент Чупрова Выборочное значение коэффициента рассчитывается по формуле [2, 3, 5, 8]:
|
|
2 |
|
|
|
||
C |
|
набл |
|
. |
(12) |
||
|
|
|
|
||||
n |
(r 1)(s 1) |
||||||
|
|
|
|
||||
Если r s, то коэффициент в пределе достигает значения 1. 4) Коэффициент Крамера
Выборочное значение коэффициента рассчитывается по формуле [2, 3, 8]:
|
|
2 |
|
|
K |
набл |
|
||
|
|
. |
(13) |
|
n min (r |
1),(s 1) |
|||
14
Предел коэффициента Крамера при росте числа наблюдений стремится к 1
независимо от числа строк и столбцов таблицы сопряженности. Для квадратных таблиц сопряженности (r s) K C. В остальных случаях K C.
При большом объеме выборки для коэффициентов Пирсона, Чупрова и Крамера можно построить доверительные интервалы, пользуясь следующими асимптотическими свойствами:
|
|
|
|
|
|
|
|
|
|
|
|
|
P N P;D(P) |
, C N C;D(C) |
, K |
N K;D(K) . |
|||||||||
n |
|
|
|
n |
|
|
|
|
n |
|
|
|
Выборочные дисперсии оценок коэффициентов Пирсона, Чупрова и Крамера
рассчитываются по формулам:
|
|
|
n2S2 |
2 |
|
|
|
|
S2 |
2 |
|
S |
2 |
2 |
|
|
S2ˆ |
|
|
|
|
|
|
|
, S |
2ˆ |
|
|
, S2ˆ |
|
|
|
, |
|
2 |
|
|
2 |
3 |
|
|
|
|
|
||||||
P |
|
|
(n |
|
C |
|
K |
|
|
|
||||||
|
|
4 |
набл |
набл) |
|
|
|
4n2(r 1)(s 1)C2 |
|
4n2 min (r 1)(s 1) 2 K2 |
|
|||||
|
|
2 |
|
r s |
|
* 2 |
|
2 |
|
|
2 |
2 |
|
|
2 |
|
|||
где |
S |
|
|
nij |
nij |
|
|
набл |
|
|
|
– выборочная |
|||||||
2 |
4 |
|
|
|
|
|
|
набл |
|
|
|
|
|
4 |
набл |
||||
|
|
n* |
|
|
n |
|
|||||||||||||
|
|
|
i 1 j 1 |
|
|
|
|
|
|
|
|
|
|
||||||
|
|
|
|
|
|
ij |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||
дисперсия статистики 2 .
Интерпретация значений коэффициентов Пирсона, Чупрова, Крамера сводится к следующему: квадрат коэффициента связи, выраженный в процентах, показывает насколько процентов изменение значения признака Y зависит от изменения значения признака Х или наоборот.
Коэффициенты сопряженности, основанные на статистике «Хи-квадрат», не позволяют описать зависимость категорий признака Y от категорий признака Х (и
наоборот) в терминах теории вероятностей.
15
Коэффициенты связи Гудмена и Краскала b, a ,
Коэффициенты b, a , имеют явную теоретико-вероятностную интерпретацию на всем диапазоне возможных значений от 0 до 1 и основаны на том,
что если признаки Х и Y зависимы, то информация о том, какое значение принял один из них, должна улучшить точность предсказания значения другого признака [2, 3, 7, 8].
Выборочное значение коэффициента b рассчитывается по формуле:
r
nimax n*max
|
b |
|
i 1 |
|
, |
(14) |
|
|
|||||
|
|
|
n n*max |
|
||
|
|
|
|
|
||
где nimax – максимальная частота в i-ой строке;
n*max – максимальная частота итоговой строки (максимальная маргинальная частота среди n* j , j 1,s).
Коэффициент b асимметричный, т.к. характеризует зависимость Y от Х. Он показывает насколько снижается вероятность ошибки предсказания категории признака Y при известной информации о принадлежности наблюдения к классу признака X по сравнению с ситуацией, когда такой информации нет.
Если для случайно выбранного объекта нет никакой информации о категории признака Х, то в качестве прогнозного значения признака Y выбирается его наиболее вероятная категория, т.е. категория, которой соответствует наибольшая маргинальная частота итоговой строки выборочной таблицы сопряженности. Если известна категория признака Х, то в качестве прогнозного значения Y выбирается та категория, которой соответствует наибольшая наблюдаемая частота в соответствующей строке.
При большом объеме выборки для коэффициента b можно построить доверительный интервал, пользуясь следующим асимптотическим свойством:
16
|
|
|
|
|
|
N |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
b |
|
|
|
|
|
|
|
|
||||
|
|
|
|
|
b |
;D( b ) . |
|
|
|
|
||||||
|
|
|
|
|
n |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Выборочная дисперсия статистики b |
рассчитывается по формуле: |
|||||||||||||||
|
|
|
r |
|
|
|
r |
|
|
n |
|
2 *n |
|
|
||
|
|
n n |
|
|
|
n |
|
|
|
|
||||||
S2 |
|
|
i 1 |
imax |
i 1 |
imax |
|
*max |
i |
imax |
|
, |
||||
|
|
|
|
|
n n |
|
3 |
|
|
|
|
|||||
b |
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
|
|
|
|
|
|
|
|
*max |
|
|
|
|
|
|
|
где *nimax – сумма только таких максимальных элементов строк nimax , для
i
которых значения I обеспечивают попадание в столбец, где находится наибольший итог n*max .
Коэффициент b обладает следующими свойствами:
1)если b 1, то существует взаимно-однозначная зависимость Y от Х;
2)если b 0, то признак Y не зависит от X, т.е. информация о категории
признака Х не улучшает прогноза категории признака Y.
Недостатком коэффициента b является то, что он обращается в 0, когда все nimax принадлежат одному столбцу, в котором находится n*max , но это не означает отсутствия зависимости Y от Х.
Коэффициент а эквивалентен коэффициенту b с учетом перемены строк и столбцов между собой. Коэффициент а асимметричный, характеризует зависимость Х от Y и показывает насколько снижается вероятность ошибки предсказания категории признака Х при известной информации о категории признака Y по сравнению с ситуацией, когда такой информации нет. Выборочное значение коэффициента a рассчитывается по формуле:
17
|
s |
|
|
|
|
nmax j nmax* |
|
||
j 1 |
|
. |
(15) |
|
а |
|
|||
|
|
|||
|
n nmax* |
|
||
Коэффициент à обращается в 0, |
если максимальные частоты в столбцах |
|||
принадлежат одной строке.
Если при анализе таблицы сопряженности неважно зависит Х от Y или
наоборот, то рассчитывается коэффициент :
|
|
r |
s |
|
|
|
|
|
nimax n*max |
nmax j |
nmax* |
|
|
|
|
i 1 |
j 1 |
|
. |
(16) |
|
2n nmax* n*max |
|
||||
|
|
|
|
|
||
Коэффициент |
|
используется |
для |
измерения |
усредненной |
|
(симметризованной) величины улучшения прогноза значений признаков и
удовлетворяет неравенству: min( a, b) max( a, b).
Коэффициенты связи Гудмена и Краскала b , а ,
Коэффициенты b , |
а , |
|
лишены недостатка -мер. Их отличие от |
коэффициентов b , a , состоит в ином методе предсказания значения одного признака при известном значении другого. Категории прогнозируемого признака предсказываются случайным образом, соответственно вероятностям их появления в той или иной ситуации [2, 7, 8].
Для характеристики зависимости признака Y от Х рассчитывается коэффициент b :
|
|
r s n nij ni* n* j 2 |
|
||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
n |
|
|
|
|
|
|
|
i 1j 1 |
|
|
|
|
|
|
|
|||
b |
|
|
|
|
|
i* |
|
|
|
. |
(17) |
|
|
|
|
s |
|
|
|||||
|
|
|
2 |
|
2 |
|
|
||||
|
|
|
|
|
|
|
|
||||
|
|
n n |
|
n* j |
|
||||||
|
|
|
|
|
|
j 1 |
|
|
|
||
Для характеристики зависимости признака Х от Y рассчитывается коэффициент à:
18
|
|
r s n n n |
n |
2 |
|
|||||
|
|
|
|
|
ij i* |
* j |
|
|
|
|
|
|
|
n* j |
|
|
|
|
|
||
|
i 1 j 1 |
|
|
|
|
. |
(18) |
|||
а |
|
|
|
|
||||||
|
2 |
r |
|
|
||||||
|
|
|
|
|
|
|
|
|||
|
|
|
|
2 |
|
|
|
|
|
|
|
|
n n |
|
ni* |
|
|
|
|
||
|
|
|
|
|
i 1 |
|
|
|
|
|
Значение коэффициента а , умноженное на 100%, показывает насколько процентов уменьшится неправильный прогноз категории признака Х для случайно взятого объекта при условном пропорциональном прогнозировании по сравнению с безусловным пропорциональным прогнозом.
Симметричный коэффициент связи рассчитывается по формуле:
|
r |
s n n |
ij |
n |
i* |
n |
2 |
|
||||||||
|
|
|
|
|
|
|
|
* j |
|
|
|
|
||||
|
1 |
|
|
|
1 |
|
|
|
|
|
|
|||||
|
i 1 |
j 1 |
|
|
|
|
|
|
|
|
||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||
|
|
|
n* j |
|
|
ni* |
. |
(19) |
||||||||
|
|
|
|
|
|
|
|
|
||||||||
|
|
r |
|
|
|
|
|
s |
|
|
|
|||||
|
n |
2n2 ni2* n*2j |
|
|||||||||||||
|
|
|
i 1 |
|
|
|
|
j 1 |
|
|
|
|||||
Коэффициент удовлетворяет неравенству: min( a, b) max( a, b).
Меры связи для таблиц сопряженности порядковых признаков
Если признаки X и Y являются порядковыми и их значения x1,x2,...,xr и
y1,y2,...,ys упорядочены по убыванию рангов, то дополнительно к ранее
рассмотренным мерам связи можно рассчитать ранговые коэффициенты корреляции
(порядковые меры связи) [2, 3, 7].
Рассмотрим две комбинации возможных значений признаков X и Y: |
(xi,yj ), |
||||||
(xi , yj ). Введем следующие обозначения: |
|
|
|
|
|
|
|
S – количество наблюдений, для |
которых |
одновременно либо xi |
xi и |
||||
r 1s 1 |
|
r |
s |
|
|
|
|
|
|
|
|
|
|
; |
|
yj yj , либо xi xi и yj yj , S nij |
nkl |
|
|||||
i 1 j 1 |
k i 1l j 1 |
|
|
|
|||
19
D – количество наблюдений, для которых либо xi xi |
и yj yj , либо xi |
xi |
|||||||||
r 1 s |
|
r |
j 1 |
|
|
|
|
|
|
|
|
и yj yj , D nij nkl ; |
|
|
|
|
|
|
|
||||
i 1 j 2 |
k i 1l 1 |
|
|
|
|
|
|
|
|
||
|
|
|
|
|
|
r s 1 |
|
s |
|
|
|
Tx – количество наблюдений, для которых xi xi , Tx |
|
|
|
|
|
; |
|
||||
nij |
nil |
|
|||||||||
|
|
|
|
|
|
i 1j 1 |
l j 1 |
|
|
|
|
Ty – количество наблюдений, для которых yj yj , Ty |
s r 1 |
|
r |
|
nij |
|
nkj . |
||
|
j 1i 1 |
k i 1 |
|
|
Тогда если между признаками X и Y сильная связь, то число S велико, а число
D мало. Поэтому порядковые меры связи основаны на вычислении разности S D,
аотличаются между собой способом нормирования этой разности.
1)-мера Гудмена и Краскала
Выборочное значение коэффициента рассчитывается по формуле [2, 7]:
|
S D |
, [ 1; 1]. |
(20) |
|
|
||
|
S D
Коэффициент интерпретируется как разность вероятностей правильного и неправильного порядка для двух объектов, случайно извлеченных из совокупности
при условии, что совпадающих рангов нет.
2) k -мера Кендалла
Выборочное значение коэффициента рассчитывается по формуле [2, 7]:
|
|
|
2(S D) |
|
|
||
k |
|
|
|
|
, k |
[ 1; 1]. |
(21) |
|
|
|
|||||
|
|||||||
|
|
|
(S D Tx)(S D Ty) |
|
|
||
Это известный ранговый коэффициент корреляции Кендалла, рассчитываемый
вслучае наличия множества одинаковых рангов.
3)S -мера Стьюарта
Выборочное значение коэффициента рассчитывается по формуле [3]:
20
