Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ таблиц сопряженности в пакетах Statistica, САНИ, Excel. Методические указания к лабораторным работам, практическим занятиям и самостоятельной р

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
891 Кб
Скачать

 

 

(n

n

22

n

n

21

)

2

 

 

 

 

11

 

12

 

 

 

, (0;1).

(8)

n1*n2*n*1n*2

 

 

 

 

 

 

 

 

Справедлива формула

V2 .

Коэффициент называют

коэффициентом

детерминации признаков Х и Y.

Меры связи, основанные на отношении преобладаний (шансов)

Часто один из двух признаков является исходным по отношению к другому.

Пусть Y – результативный признак, X – факторный. Нас интересует вероятность того, что Y y1. Введем две характеристики:

x

 

P(Y y1

| X x1)

 

p11 / p1*

 

– шансы появления

 

| X x )

p / p

 

1

 

 

P(Y y

2

 

 

 

 

 

 

 

 

 

1

 

12 1*

 

 

x

 

 

P(Y y1 | X x2)

 

 

p21 / p2*

 

– шансы появления

2

P(Y y2 | X x2)

 

 

 

 

 

 

p22 / p2*

 

 

Найдем оценки шансов:

Ox

 

n11 /n1*

 

n11

; Ox

 

n21 /n2*

 

 

 

1

 

n

/n

 

n

2 n

22

/n

2*

 

12

1*

12

 

 

 

 

y1 при условии, чтоX x1;

y1 при условии, что X x2 .

n21 . n22

Сопоставляя различными способами шансы x1 и x2 , можно получают

различные меры связи.

1) Коэффициент ассоциации Юла [3, 5, 8]

 

x

x

2

Ox

Ox

 

n n

 

n

n

 

Q

1

 

, Q

1

2

 

11

22

 

21 12

.

(9)

 

x

x

2

 

Ox

Ox

 

n11n22 n21n12

 

1

 

1

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

11

Коэффициент ассоциации обладает свойствами коэффициента корреляции:

изменяется от -1 до +1;

если

Q>0, то связь «положительная», т.е. если

X x1,

то вероятнее всего

Y y1, если

X x2 , то вероятнее всего Y y2;

 

 

если

Q<0, то связь «отрицательная», т.е. если

X x1,

то вероятнее всего

Yy2, если X x2 , то вероятнее всего Y y1;

если Q=0, то признаки независимы;

если Q=1, то связь функциональная «положительная», т.е. p11 p1* p*1 и

p22 p2* p*2 ( p21 p12 0);

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

если Q=-1, то связь функциональная «отрицательная», т.е.

 

p21

p2*

p*1 и

p12 p1* p*2 ( p11 p22 0).

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

, где оценка дисперсии

 

Оценка коэффициента ассоциации Q

N Q;D(Q)

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

 

1

 

 

1

 

 

1

 

 

1

 

 

 

 

2

 

 

2

 

2

 

 

 

 

 

Q

 

 

 

 

 

 

 

 

 

 

 

 

 

вычисляется по формуле

S

(Q)

4(1 Q

)

 

 

n

n

 

n

 

. Это

 

 

 

n

21

22

 

 

 

 

 

 

 

 

 

 

 

 

 

11

 

12

 

 

 

 

 

 

 

 

асимптотическое свойство может использоваться как при проверке значимости коэффициента ассоциации, так и при построении для него доверительного интервала.

Если зависимость между признаками не является функциональной, но одна из

частот в клетке равна нулю, то Q 1, что дает преувеличенную оценку тесноты связи. В этих случаях целесообразно использовать коэффициент контингенции или коэффициент коллигации.

2) Коэффициент коллигации Юла [3, 5, 8]

 

 

x

 

x

 

 

Ox

 

Ox

 

 

 

n n

22

 

n

n

 

 

Y

 

1

 

2

 

, Y

 

1

 

2

 

 

 

11

 

 

21 12

 

.

(10)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x

 

x

 

 

 

Ox

 

Ox

 

 

 

n11n22

n21n12

 

1

 

2

 

 

 

1

 

2

 

 

 

 

 

 

 

 

 

 

 

12

2Y

Коэффициенты ассоциации и коллигации связаны соотношением: Q . 1 Y2

Свойства коэффициента коллигации аналогичны

свойствам

 

коэффициента

 

 

 

 

 

, где оценка

ассоциации. Оценка коэффициента коллигации Y

N Y;D(Y)

n

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

1

 

2

 

2

 

2

 

дисперсии Y вычисляется по формуле S

(Y)

(1 Y

)

 

 

 

16

 

 

 

n

 

 

 

 

 

 

 

 

 

 

11

 

3)Отношение преобладаний (шансов) [2]

x1 , O Ox1 n11n22 .

x

Ox

n21n12

2

 

2

1

1

1

 

 

 

 

 

 

 

 

 

.

n

n

21

n

22

12

 

 

 

 

 

(11)

Эту характеристику связи ещё называют отношением перекрестных произведений. Если хотя бы одна из частот четырёхклеточной таблицы сопряженности равна нулю, то рассчитывается модифицированная характеристика связи:

 

 

 

 

1

 

 

 

1

 

n

 

 

 

n

 

 

 

 

 

 

 

 

O

11

 

2

 

22

 

2

.

 

 

 

 

1

 

 

 

1

 

n

 

 

 

n

 

 

 

 

2

2

 

 

21

 

 

12

 

 

Отношение перекрестных произведений принимает значения из диапазона

(0; ), где значение 1 соответствует отсутствию связи. Это довольно необычно.

Более привычный диапазон значений получается при работе с натуральным логарифмом отношения преобладаний L lnO или L lnO , который изменяется в пределах от ( ; ), имея для случая отсутствия связи значение 0.

13

1.4 Меры связи для таблицы сопряженности r s

Меры связи, основанные на статистике Хи-квадрат

1) Фи-коэффициент (коэффициент Чупрова-Крамера)

Выборочное значение коэффициента рассчитывается по формуле (5). 2) Коэффициент сопряженности Пирсона [2, 3, 5, 8]

Выборочное значение коэффициента рассчитывается по формуле (6). Если связь между признаками отсутствует, то P 0. Чем ближе значение P к 1, тем теснее связь. Однако максимальное значение данного коэффициента зависит от числа строк и столбцов таблицы сопряженности и определяется по формуле

min(r 1,s 1) . Чтобы исправить этот недостаток, предлагаются следующие

1 min(r 1,s 1)

два коэффициента.

3) Коэффициент Чупрова Выборочное значение коэффициента рассчитывается по формуле [2, 3, 5, 8]:

 

 

2

 

 

 

C

 

набл

 

.

(12)

 

 

 

 

n

(r 1)(s 1)

 

 

 

 

Если r s, то коэффициент в пределе достигает значения 1. 4) Коэффициент Крамера

Выборочное значение коэффициента рассчитывается по формуле [2, 3, 8]:

 

 

2

 

 

K

набл

 

 

 

.

(13)

n min (r

1),(s 1)

14

Предел коэффициента Крамера при росте числа наблюдений стремится к 1

независимо от числа строк и столбцов таблицы сопряженности. Для квадратных таблиц сопряженности (r s) K C. В остальных случаях K C.

При большом объеме выборки для коэффициентов Пирсона, Чупрова и Крамера можно построить доверительные интервалы, пользуясь следующими асимптотическими свойствами:

 

 

 

 

 

 

 

 

 

 

 

 

 

P N P;D(P)

, C N C;D(C)

, K

N K;D(K) .

n

 

 

 

n

 

 

 

 

n

 

 

 

Выборочные дисперсии оценок коэффициентов Пирсона, Чупрова и Крамера

рассчитываются по формулам:

 

 

 

n2S2

2

 

 

 

 

S2

2

 

S

2

2

 

S2ˆ

 

 

 

 

 

 

 

, S

2ˆ

 

 

, S2ˆ

 

 

 

,

 

2

 

 

2

3

 

 

 

 

 

P

 

 

(n

 

C

 

K

 

 

 

 

 

4

набл

набл)

 

 

 

4n2(r 1)(s 1)C2

 

4n2 min (r 1)(s 1) 2 K2

 

 

 

2

 

r s

 

* 2

 

2

 

 

2

2

 

 

2

 

где

S

 

 

nij

nij

 

 

набл

 

 

 

– выборочная

2

4

 

 

 

 

 

 

набл

 

 

 

 

 

4

набл

 

 

n*

 

 

n

 

 

 

 

i 1 j 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

ij

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

дисперсия статистики 2 .

Интерпретация значений коэффициентов Пирсона, Чупрова, Крамера сводится к следующему: квадрат коэффициента связи, выраженный в процентах, показывает насколько процентов изменение значения признака Y зависит от изменения значения признака Х или наоборот.

Коэффициенты сопряженности, основанные на статистике «Хи-квадрат», не позволяют описать зависимость категорий признака Y от категорий признака Х

наоборот) в терминах теории вероятностей.

15

Коэффициенты связи Гудмена и Краскала b, a ,

Коэффициенты b, a , имеют явную теоретико-вероятностную интерпретацию на всем диапазоне возможных значений от 0 до 1 и основаны на том,

что если признаки Х и Y зависимы, то информация о том, какое значение принял один из них, должна улучшить точность предсказания значения другого признака [2, 3, 7, 8].

Выборочное значение коэффициента b рассчитывается по формуле:

r

nimax n*max

 

b

 

i 1

 

,

(14)

 

 

 

 

 

n n*max

 

 

 

 

 

 

где nimax – максимальная частота в i-ой строке;

n*max – максимальная частота итоговой строки (максимальная маргинальная частота среди n* j , j 1,s).

Коэффициент b асимметричный, т.к. характеризует зависимость Y от Х. Он показывает насколько снижается вероятность ошибки предсказания категории признака Y при известной информации о принадлежности наблюдения к классу признака X по сравнению с ситуацией, когда такой информации нет.

Если для случайно выбранного объекта нет никакой информации о категории признака Х, то в качестве прогнозного значения признака Y выбирается его наиболее вероятная категория, т.е. категория, которой соответствует наибольшая маргинальная частота итоговой строки выборочной таблицы сопряженности. Если известна категория признака Х, то в качестве прогнозного значения Y выбирается та категория, которой соответствует наибольшая наблюдаемая частота в соответствующей строке.

При большом объеме выборки для коэффициента b можно построить доверительный интервал, пользуясь следующим асимптотическим свойством:

16

 

 

 

 

 

 

N

 

 

 

 

 

 

 

 

 

 

 

 

 

b

 

 

 

 

 

 

 

 

 

 

 

 

 

b

;D( b ) .

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Выборочная дисперсия статистики b

рассчитывается по формуле:

 

 

 

r

 

 

 

r

 

 

n

 

2 *n

 

 

 

 

n n

 

 

 

n

 

 

 

 

S2

 

 

i 1

imax

i 1

imax

 

*max

i

imax

 

,

 

 

 

 

 

n n

 

3

 

 

 

 

b

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

*max

 

 

 

 

 

 

где *nimax – сумма только таких максимальных элементов строк nimax , для

i

которых значения I обеспечивают попадание в столбец, где находится наибольший итог n*max .

Коэффициент b обладает следующими свойствами:

1)если b 1, то существует взаимно-однозначная зависимость Y от Х;

2)если b 0, то признак Y не зависит от X, т.е. информация о категории

признака Х не улучшает прогноза категории признака Y.

Недостатком коэффициента b является то, что он обращается в 0, когда все nimax принадлежат одному столбцу, в котором находится n*max , но это не означает отсутствия зависимости Y от Х.

Коэффициент а эквивалентен коэффициенту b с учетом перемены строк и столбцов между собой. Коэффициент а асимметричный, характеризует зависимость Х от Y и показывает насколько снижается вероятность ошибки предсказания категории признака Х при известной информации о категории признака Y по сравнению с ситуацией, когда такой информации нет. Выборочное значение коэффициента a рассчитывается по формуле:

17

 

s

 

 

 

 

nmax j nmax*

 

j 1

 

.

(15)

а

 

 

 

 

n nmax*

 

Коэффициент à обращается в 0,

если максимальные частоты в столбцах

принадлежат одной строке.

Если при анализе таблицы сопряженности неважно зависит Х от Y или

наоборот, то рассчитывается коэффициент :

 

 

r

s

 

 

 

 

 

nimax n*max

nmax j

nmax*

 

 

 

i 1

j 1

 

.

(16)

 

2n nmax* n*max

 

 

 

 

 

 

Коэффициент

 

используется

для

измерения

усредненной

(симметризованной) величины улучшения прогноза значений признаков и

удовлетворяет неравенству: min( a, b) max( a, b).

Коэффициенты связи Гудмена и Краскала b , а ,

Коэффициенты b ,

а ,

 

лишены недостатка -мер. Их отличие от

коэффициентов b , a , состоит в ином методе предсказания значения одного признака при известном значении другого. Категории прогнозируемого признака предсказываются случайным образом, соответственно вероятностям их появления в той или иной ситуации [2, 7, 8].

Для характеристики зависимости признака Y от Х рассчитывается коэффициент b :

 

 

r s n nij ni* n* j 2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

i 1j 1

 

 

 

 

 

 

 

b

 

 

 

 

 

i*

 

 

 

.

(17)

 

 

 

 

s

 

 

 

 

 

2

 

2

 

 

 

 

 

 

 

 

 

 

 

 

n n

 

n* j

 

 

 

 

 

 

 

j 1

 

 

 

Для характеристики зависимости признака Х от Y рассчитывается коэффициент à:

18

 

 

r s n n n

n

2

 

 

 

 

 

 

ij i*

* j

 

 

 

 

 

 

 

n* j

 

 

 

 

 

 

i 1 j 1

 

 

 

 

.

(18)

а

 

 

 

 

 

2

r

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

n n

 

ni*

 

 

 

 

 

 

 

 

 

i 1

 

 

 

 

 

Значение коэффициента а , умноженное на 100%, показывает насколько процентов уменьшится неправильный прогноз категории признака Х для случайно взятого объекта при условном пропорциональном прогнозировании по сравнению с безусловным пропорциональным прогнозом.

Симметричный коэффициент связи рассчитывается по формуле:

 

r

s n n

ij

n

i*

n

2

 

 

 

 

 

 

 

 

 

* j

 

 

 

 

 

1

 

 

 

1

 

 

 

 

 

 

 

i 1

j 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n* j

 

 

ni*

.

(19)

 

 

 

 

 

 

 

 

 

 

 

r

 

 

 

 

 

s

 

 

 

 

n

2n2 ni2* n*2j

 

 

 

 

i 1

 

 

 

 

j 1

 

 

 

Коэффициент удовлетворяет неравенству: min( a, b) max( a, b).

Меры связи для таблиц сопряженности порядковых признаков

Если признаки X и Y являются порядковыми и их значения x1,x2,...,xr и

y1,y2,...,ys упорядочены по убыванию рангов, то дополнительно к ранее

рассмотренным мерам связи можно рассчитать ранговые коэффициенты корреляции

(порядковые меры связи) [2, 3, 7].

Рассмотрим две комбинации возможных значений признаков X и Y:

(xi,yj ),

(xi , yj ). Введем следующие обозначения:

 

 

 

 

 

 

 

S – количество наблюдений, для

которых

одновременно либо xi

xi и

r 1s 1

 

r

s

 

 

 

 

 

 

 

 

 

 

;

 

yj yj , либо xi xi и yj yj , S nij

nkl

 

i 1 j 1

k i 1l j 1

 

 

 

19

D – количество наблюдений, для которых либо xi xi

и yj yj , либо xi

xi

r 1 s

 

r

j 1

 

 

 

 

 

 

 

 

и yj yj , D nij nkl ;

 

 

 

 

 

 

 

i 1 j 2

k i 1l 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

r s 1

 

s

 

 

 

Tx – количество наблюдений, для которых xi xi , Tx

 

 

 

 

 

;

 

nij

nil

 

 

 

 

 

 

 

i 1j 1

l j 1

 

 

 

Ty – количество наблюдений, для которых yj yj , Ty

s r 1

 

r

 

nij

 

nkj .

 

j 1i 1

k i 1

 

Тогда если между признаками X и Y сильная связь, то число S велико, а число

D мало. Поэтому порядковые меры связи основаны на вычислении разности S D,

аотличаются между собой способом нормирования этой разности.

1)-мера Гудмена и Краскала

Выборочное значение коэффициента рассчитывается по формуле [2, 7]:

 

S D

, [ 1; 1].

(20)

 

 

 

S D

Коэффициент интерпретируется как разность вероятностей правильного и неправильного порядка для двух объектов, случайно извлеченных из совокупности

при условии, что совпадающих рангов нет.

2) k -мера Кендалла

Выборочное значение коэффициента рассчитывается по формуле [2, 7]:

 

 

 

2(S D)

 

 

k

 

 

 

 

, k

[ 1; 1].

(21)

 

 

 

 

 

 

 

(S D Tx)(S D Ty)

 

 

Это известный ранговый коэффициент корреляции Кендалла, рассчитываемый

вслучае наличия множества одинаковых рангов.

3)S -мера Стьюарта

Выборочное значение коэффициента рассчитывается по формуле [3]:

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]