Анализ таблиц сопряженности в пакетах Statistica, САНИ, Excel. Методические указания к лабораторным работам, практическим занятиям и самостоятельной р
.pdfВо всех трех случаях наблюдаемый уровень значимости p меньше 0,05,
следовательно, можно сделать вывод о том, что нулевая гипотеза о независимости признаков X и Y отвергается. Таким образом, существует значимая связь между признаками «Занимаетесь ли Вы спортом?» и «Есть ли у Вас хронические заболевания?».
Врассматриваемом примере объем выборки большой (n 150), теоретических частот меньших 5 нет, поэтому использовать точный критерий Фишера нет необходимости, хотя и с помощью этого критерия гипотеза о независимости признаков отвергается ( p 0,00002 0,05).
Вшестой и седьмой строках таблицы, представленной на рисунке 11,
выводятся наблюдаемые значения статистики Мак-Нимара. Однако рассматриваемая таблица сопряженности 2 2 не относится к типу «до-после»,
поэтому интерпретации эти результаты не подлежат.
Поскольку связь между признаками «Занимаетесь ли Вы спортом?» и «Есть ли у Вас хронические заболевания?» доказана, перейдем к интерпретации коэффициентов связи, рассчитанных во второй части таблицы, представленной на рисунке 11.
3) Расчет и интерпретация коэффициентов связи признаков
Так как таблица сопряженности признаков «Занимаетесь ли Вы спортом?» и «Есть ли у Вас хронические заболевания?» имеет размерность 2 2, то рассчитаем две группы коэффициентов связи: меры связи, основанные на статистике 2, и
меры связи, основанные на отношении преобладаний (шансов).
Расчет мер связи, основанных на статистике 2
1) Выборочное значение Фи-коэффициент (коэффициента Чупрова-Крамера)
составляет 0,33 (восьмая строка (Phi for 2x2 tables) таблицы, представленной на рисунке 11).
31
2) Выборочное значение коэффициента сопряженности Пирсона составляет
P 0,31 (десятая строка (Contingency coefficient) таблицы, представленной на рисунке 11).
3) Выборочное значение коэффициента контингенции Крамера рассчитаем по
|
49 39 5 57 |
|
|
||
формуле (7): V |
|
|
0,33 0. |
||
|
|
|
|||
54 96 106 44 |
|||||
|
|
|
|
||
4) Выборочное значение - коэффициента Гудмена и Краскала рассчитаем по
|
(49 39 5 57) |
2 |
|
формуле (8): |
|
|
0,11. |
|
|
||
|
54 96 106 44 |
||
Расчет мер связи, основанных на отношении преобладаний (шансов)
1) Выборочное значение коэффициента ассоциации Юла рассчитаем по
|
49 39 5 57 |
|
|
|
|
|
формуле (9): Q |
|
0,74 0 |
. С вероятностью |
0,95 |
построим |
|
49 39 5 57 |
||||||
|
|
|
|
|
доверительный интервал для коэффициента ассоциации Юла: 0,51 Q 0,97.
2) Выборочное значение коэффициента коллигации Юла рассчитаем по
|
|
|
49 39 |
5 57 |
|
|
||
формуле (10): Y |
|
|
0,44 0. С вероятностью 0,95 построим |
|||||
|
|
|
|
|
||||
|
|
|
|
49 39 |
5 57 |
|||
доверительный интервал для коэффициента коллигации Юла: 0,24 Y 0,64. |
||||||||
3) |
Выборочное отношение преобладаний (шансов) рассчитаем по формуле |
|||||||
|
49 39 |
|
|
|
|
|
|
|
(11): |
|
6,70.>1 |
|
|
|
|||
5 57 |
|
|
|
|||||
|
|
|
|
|
|
|
|
|
По большинству значений коэффициентов, силу связи между признаками
«Занимаетесь ли Вы спортом?» и «Есть ли у Вас хронические заболевания?» можно охарактеризовать по шкале Чеддока как умеренную. Так как коэффициенты контингенции, ассоциации и коллигации принимают положительные значения, а
выборочное отношение преобладаний больше 1, то направление связи рассматриваемых признаков «положительное», т.е. если опрашиваемый занимается спортом, то, вероятнее всего, у него нет хронических заболеваний, а если опрашиваемый не занимается спортом, то, вероятнее всего, есть. Таким образом доказано, что занятия спортом способствуют укреплению здоровья. Однако
32
полученные результаты можно интерпретировать и иначе: наличие хронических
заболеваний препятствуют занятиям спортом.
Анализ взаимосвязи признаков «Возраст» и «Среднемесячный доход»
Аналогично предыдущему случае построим выборочную таблицу сопряженности признаков «Возраст» (Х: x1 – до 30 лет; x2 – от 30 до 50 лет; x3 – 50
лет и старше) и «Среднемесячный доход» (Y: y1 – до 20 тыс. руб.; y2 – от 20 до 30
тыс. руб.; y3 – 30 тыс. руб. и более). Результат представлен на рисунке 12.
Рисунок 12 – Результат построения выборочной таблицы сопряженности признаков
«Возраст» и «Среднемесячный доход»
Из 150 опрошенных 54 человека (или 36%) имеют возраст до 30 лет, 61
человек (41%) имеют возраст от 30 до 50 лет и 35 человек (23%) имеют возраст от
50 лет и старше. Большая часть респондентов (91 человек или 61%) имеют среднемесячный доход до 20 тыс. руб., 35 человек (23%) имеют среднемесячный доход от 20 до 30 тыс. руб. и 24 человека (16%) имеют среднемесячный доход 30
тыс. руб. и более. Большая часть респондентов (87%) из возрастной группы до 30
лет имеют доход до 20 тыс. руб. в месяц. Для второй возрастной группы этот процент составляет 44, а для третьей – 49. Среди респондентов с доходом от 30 до
50 тыс. руб. в месяц 86% имеют возраст старше 30 лет. Этот процент еще выше
(92%) для респондентов со среднемесячным доходом 30 тыс. руб. и более.
33
Результаты проверки гипотезы о независимости признаков «Возраст» и «Среднемесячный доход» представлены на рисунке 13.
Рисунок 13 – Результаты проверки гипотезы о независимости признаков «Возраст» и «Среднемесячный доход»
Наблюдаемое значение статистики Пирсона 2 (1) составляет |
набл2 |
25,26; |
||||||
наблюдаемое значение статистики инф2 (2) |
составляет |
инф2 |
набл 30,11. В обоих |
|||||
случаях наблюдаемый уровень |
значимости |
p меньше |
0,05, следовательно, |
|||||
можно сделать вывод о том, что нулевая гипотеза о независимости признаков X и Y |
||||||||
отвергается. Таким образом, |
существует |
значимая |
связь |
между |
признаками |
|||
«Возраст» и «Среднемесячный доход». |
|
|
|
|
|
|
|
|
Так как таблица сопряженности признаков «Возраст» и «Среднемесячный |
||||||||
доход» имеет размерность 3 3, то рассчитаем меры |
связи, |
основанные на |
||||||
статистике 2, и коэффициенты связи Гудмена и Краскала |
b, |
a , |
. |
|
|
|||
Расчет мер связи, основанных на статистике 2
1) Выборочное значение Фи-коэффициент (коэффициента Чупрова-Крамера)
составляет 0,43 (третья строка (Phi) таблицы, представленной на рисунке 13). 2) Выборочное значение коэффициента сопряженности Пирсона составляет
P 0,40 (четвертая строка (Contingency coefficient) таблицы, представленной на рисунке 13).
34
3) Выборочное значение коэффициента Чупрова рассчитаем по формуле (12):
|
28,26 |
|
|
|
C |
|
|
0,31. |
|
|
|
|
||
150 |
(3 1)(3 1) |
|||
4) Выборочное значение коэффициента Крамера составляет K 0,31 (пятая строка (Cramer’s V) таблицы, представленной на рисунке 13).
С вероятностью 0,95 построим доверительные интервалы для коэффициентов Пирсона, Чупрова и Крамера:
0,28 P 0,52; 0,25 C 0,37; 0,25 K 0,37.
По рассчитанным значениям коэффициентов можно сделать вывод, что между признаками «Возраст» и «Среднемесячный доход» существует умеренная связь.
Выборочное значение коэффициента сопряженности Пирсона означает, что на 16%
изменение значения признака Y («Среднемесячный доход») зависит от изменения значения признака X («Возраст»). По выборочным значениям коэффициентов Чупрова и Крамера доля дисперсии признака Y, обусловленная изменением признака Х, чуть меньше и составляет около 10%.
|
Расчет коэффициентов связи Гудмена и Краскала b, b |
|
|||||||
|
Для интерпретации зависимости среднемесячного дохода (Y) от возраста (X) |
||||||||
рассчитаем коэффициенты связи Гудмена и Краскала b, b |
по формулам (14) и (17) |
||||||||
соответственно. |
Выборочное |
значение |
коэффициента |
b |
составляет |
||||
|
47 27 17 91 |
0, т.к. |
максимальные |
частоты |
для |
каждой строки |
|||
|
|
|
|
||||||
|
|
|
|||||||
b |
150 91 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
принадлежат одному столбцу. Выборочное значение коэффициента b |
составляет |
||||||||
b 0,10 (смотри второй коэффициент в последней строке (Uncertainty coefficient)
таблицы, представленной на рисунке 13), т.е. ошибка предсказания категории признака Y при условном пропорциональном прогнозировании по сравнению с безусловным пропорциональным прогнозированием уменьшится на 10%.
35
Расчет мер связи для таблиц сопряженности порядковых признаков
Рассматриваемые признаки «Возраст» и «Среднемесячный доход» относятся к порядковым признакам, поэтому перейдем к расчету ранговых коэффициентов
корреляции. Выборочное значение -меры Гудмена и Краскала составляет 0,47
(седьмая строка (Gamma) таблицы, представленной на рисунке 13). Выборочное
значение k -меры Кендалла составляет k 0,29 (первое значение в шестой строке
(Kendall’s tau b & c) таблицы, представленной на рисунке 13). Выборочное значение
d-меры Сомерса составляет d 0,27 (второе значение в седьмой строке (Sommers D(X|Y), D(Y|X)) таблицы, представленной на рисунке 13). Кроме того, в девятой строке (Spearman Rank R) таблицы на рисунке 13 приводится выборочное значение рангового коэффициента корреляции Спирмена, составившее для рассматриваемого примера 0,33.
Все ранговые коэффициенты корреляции приняли положительные значения,
что указывает на то, что с увеличением возраста доход увеличивается. Сила связи между признаками «Возраст» и «Среднемесячный доход» по большинству коэффициентов слабая.
Для интерпретации связи признаков «Возраст» и «Среднемесячный доход» с
помощью пакета Statistica реализуем метод анализа соответствий. Для этого выберем пункты меню «Statistics», «Multivariate Exploratory Techniques», «Correspondence Analysis» (рисунок 14).
Рисунок 14 – Выбор пунктов меню для реализации метода анализа соответствий
36
Рисунок 15 – Вид формы «Correspondence Analysis (СА)»
Рисунок 16 – Выбор признаков для проведения анализа соответствий
После того, как признаки выбраны, необходимо нажать на кнопку «ОК» и
появится форма с результатами анализа соответствий. Вид формы на странице
«Advanced» представлен на рисунке 17.
37
Рисунок 17 – Вид формы «Correspondence Analysis Results»
Для построения двумерной карты соответствия категорий признаков
«Возраст» и «Доход» предназначена кнопка «Row & col, 2D». Вид полученной карты соответствия представлен на рисунке 18.
Рисунок 18 – Карта соответствия категорий признаков «Возраст» и «Среднемесячный доход»
38
Анализируя полученную карту с точки зрения расстояния между категориями признаков «Возраст» и «Доход» можно сделать следующие выводы:
респонденты в возрасте до 30 лет имеют преимущественно доход до 20
тыс. руб. в месяц;
респонденты в возрасте от 30 до 50 лет имеют преимущественно доход 30
тыс. руб. в месяц и более;
респонденты в возрасте 50 лет и старше имеют преимущественно доход от
20 до 30 тыс. руб. в месяц.
2.4 Порядок выполнения лабораторной работы в пакете САНИ
Ввести исходные данные в пакет САНИ удобно через «буфер обмена». Для этого необходимо скопировать ячейки с данными четырех признаков из пакетов
Excel или Statistica, затем после запуска программы САНИ выбрать пункты меню
«Файл», «Чтение из Буфера обмена…» (рисунок 19).
Рисунок 19 – Выбор пунктов меню в пакете САНИ для ввода исходных данных
После указанных действий на экране появится форма, представленная на рисунке 20. Для ввода исходных данных из «буфера обмена» необходимо нажать кнопку «ОК».
39
Рисунок 20 – Форма свойств текста в «буфере обмена»
По умолчанию признаки (столбцы матрицы) будут иметь названия Var1, Var2, Var3, Var4. Для удобства переобозначим их согласно названию вопросов в анкете.
Для этого необходимо в меню программы нажать кнопку с буковой «V». На экране появится форма, представленная на рисунке 21.
Рисунок 21 – Вид формы «Выбор элементов файла»
Для редактирования признаков выбрать «Признаки» и нажать кнопку «ОК».
На экране появится список признаков. Для редактирования первого признака выделить «Var1» и нажать правую кнопку мыши. Появится меню, в котором выбрать пункт «Редактировать…» (рисунок 22).
40
