Анализ таблиц сопряженности в пакетах Statistica, САНИ, Excel. Методические указания к лабораторным работам, практическим занятиям и самостоятельной р
.pdfМинистерство образования и науки Российской Федерации
Федеральное государственное бюджетное образовательное учреждение высшего профессионального образования
«Оренбургский государственный университет»
Кафедра математических методов и моделей в экономике
О.С. Чудинова
АНАЛИЗ ТАБЛИЦ СОПРЯЖЕННОСТИ В ПАКЕТАХ STATISTICA, САНИ, EXCEL
Рекомендовано к изданию Редакционно-издательским советом федерального государственного бюджетного образовательного учреждения высшего профессионального образования «Оренбургский государственный университет» в качестве методических указаний для студентов, обучающихся по программам высшего профессионального образования по специальности 080116.65 Математические методы в экономике, направлениям подготовки 231300.62 Прикладная математика, 080500.62 Бизнес-информатика, 080100.62 Экономика
Оренбург
2014
УДК 519.235:330.43(076.5) ББК 22.172я7+65в631я7
Ч 84
Рецензент – доцент, кандидат экономических наук С.В. Дьяконова
Чудинова, О.С.
Ч84 Анализ таблиц сопряженности в пакетах Statistica, САНИ, Excel: методические указания к лабораторным работам, практическим занятиям и самостоятельной работе студентов / О.С. Чудинова; Оренбургский гос. ун-т.– Оренбург: ОГУ, 2014. – 57 с.
Методические указания к лабораторным работам, практическим занятиям, самостоятельной работе студентов, в том числе для выполнения индивидуальных заданий, РГЗ, курсовых и дипломных работ, связанных со статистическим анализом нечисловой информации.
Предназначены для специальности 080116.65 Математические методы в экономике, направлений подготовки 231300.62 Прикладная математика, 080500.62 Бизнес-информатика, 080100.62 Экономика и других специальностей и направлений, изучающих дисциплины, связанные с обработкой нечисловых данных.
УДК 519.235:330.43(076.5) ББК 22.172я7+65в631я7
Чудинова О.С., 2014
ОГУ, 2014
2
Содержание
Введение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4 1 Теоретическая часть . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5 1.1 Выборочная двухфакторная таблица сопряженности: структура, свойства,
интерпретация . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5 1.2 Проверка гипотезы о независимости двух номинальных признаков . . . . . . 6 1.3 Меры связи для таблицы сопряженности 2 2 . . . . . . . . . . . . . . . . . . . . . . . . 9 1.4 Меры связи для таблицы сопряженности r s . . . . . . . . . . . . . . . . . . . . . . . . 14 1.5 Вопросы и задания, выносимые на семинарские занятия, по теме «Анализ таблиц сопряженности» . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 2 Практическая часть . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23 2.1 Содержание лабораторной работы . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23 2.2 Задание к лабораторной работе . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24 2.3 Порядок выполнения лабораторной работы в пакете Statistica . . . . . . . . . . . 24 2.4 Порядок выполнения лабораторной работы в пакете САНИ . . . . . . . . . . . . . 39 2.5 Порядок выполнения лабораторной работы с помощью надстройки
AtteStat табличного процессора Microsoft Excel. . . . . . . . . . . . . . . . . . . . . . . . . . . 46 2.6 Содержание письменного отчета . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48 2.7 Вопросы к защите лабораторной работы . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48
Список использованных источников . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49
Приложение А Исходные данные для анализа . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
3
Введение
Методические указания посвящены методам анализа двухфакторных таблиц сопряженности, используемым для исследования связи между двумя номинальными признаками. В теоретической части предлагаемых методических указаний изложены структура, свойства и интерпретация выборочной двухфакторной таблицы сопряженности, проверка гипотезы о независимости двух номинальных признаков,
меры связи, рассчитываемые на основе таблиц сопряженности 2 2 и r s.
Приведен широкий перечень теоретических вопросов и заданий по теме «Анализ таблиц сопряженности», позволяющий студенту систематизировать свои знания и облегчить подготовку к практическим занятиям. Часть вопросов в достаточном объеме освещены в методических указаниях, для ответа на остальные вопросы необходимо обратиться к указанным литературным источникам. В практической части методических указаний на конкретном примере описывается алгоритм
анализа двухфакторных таблиц сопряженности 2 2 и r s в статистических
пакетах Statistica, САНИ и надстройке AtteStat пакета Excel, приводится интерпретация полученных результатов исследования связи двух номинальных признаков. В методических указаниях сформулирована постановка задачи и определены варианты заданий, приведены требования к оформлению отчета и вопросы к защите лабораторной работы.
Использование предлагаемых методических указаний в учебном процессе позволит студенту в достаточной степени овладеть методами анализа двухфакторных таблиц сопряженности и приобрести навыки его практической реализации в пакетах прикладных программ.
4
1 Теоретическая часть
1.1 Выборочная двухфакторная таблица сопряженности: структура,
свойства, интерпретация
Рассмотрим два категоризованных номинальных признака X и Y. Признак X
может принимать значения x1,x2,...,xr ; признак Y – y1,y2,...,ys . Пусть имеется выборка объема n из генеральной совокупности (Х, Y). Тогда эмпирическое распределение генеральной совокупности (Х, Y) может быть представлено в виде двухфакторной таблицы сопряженности признаков Х и Y размерности r s,
имеющей вид [1, 2, 7, 8, 10]:
|
xi \ yj |
|
y1 |
y2 |
… |
ys |
|
ni* |
|
|
x1 |
|
n11 |
n12 |
… |
n1s |
|
n1* |
|
|
x2 |
|
n21 |
n22 |
… |
n2s |
|
n2* |
|
|
… |
|
… |
… |
… |
… |
|
… |
|
|
|
|
|
|
|
|
|
|
|
|
xr |
|
nr1 |
nr2 |
… |
nrs |
|
nr* |
|
|
n*j |
|
n*1 |
n*2 |
… |
n*s |
|
n |
|
где nij – наблюдаемая |
частота, |
т.е. |
число |
объектов в выборочной |
|||||
совокупности, характеризующихся i-ой категорией признака X и j-ой категорией признака Y, i 1,r , j 1,s;
ni* – маргинальная частота, характеризующая сколько объектов в выборочной
s
совокупности обладают i-ой категорией признака X, ni* nij , i 1,r ;
j 1
5
n*j – маргинальная частота, характеризующая сколько объектов в выборочной
|
|
|
r |
|
|
|
совокупности обладают j-ой категорией признака Y, n* j nij , |
j |
1,s |
; |
|||
|
|
|
i 1 |
|
|
|
r |
s |
r s |
|
|
|
|
ni* n* j |
nij |
n. |
|
|
|
|
i 1 |
j 1 |
i 1 j 1 |
|
|
|
|
Замечание: признаки X и/или Y могут быть измерены в порядковой или количественной шкале. В последнем случае для построения выборочной таблицы сопряженности наблюдаемые значения признаков должны быть сгруппированы в форме интервального вариационного ряда.
1.2 Проверка гипотезы о независимости двух номинальных признаков
Ставится задача на основе выборочных данных, сформированных методом перекрестного отбора и представленных в виде двухфакторной таблицы
сопряженности r s установить, есть ли связь между признаками X и Y.
Для решения этой задачи формулируются следующие гипотезы:
H0 : pij pi* |
p*j , i 1,r, j 1,s (признаки X и Y независимы); |
H1 : i, j: pij |
pi* p*j (признаки X и Y зависимы). |
В формулировке гипотез используются следующие обозначения:
pij – вероятность того, что случайно выбранный объект характеризуется i-ой категорией признака X и j-ой категорией признака Y, i 1,r , j 1,s;
pi* – вероятность того, что случайно выбранный объект характеризуется i-ой
категорией признака X, i 1,r ;
p* j – вероятность того, что случайно выбранный объект характеризуется j-ой
категорией признака Y, j 1,s.
Для проверки гипотезы H0 используется критерий Пирсона 2, статистика которого имеет вид:
6
r s |
(n |
n*)2 |
|
||
2 |
ij |
|
ij |
, |
(1) |
|
* |
|
|||
i 1 j 1 |
|
nij |
|
|
|
где nij* – теоретические частоты, т.е. те частоты, которые были бы при
справедливости нулевой гипотезы, nij* ni* n*j . n
Согласно теореме К. Пирсона и Р. Фишера статистика (1) при справедливости гипотезы H0 , n и отсутствии малых теоретических частот имеет
распределение «Хи-квадрат» с числом степеней свободы (r 1)(s 1) [1-3, 7-10].
Альтернативой критерию Пирсона 2 является информационный критерий или критерий 2-отношение правдоподобия [1, 2, 8, 9], статистика которого имеет вид:
|
r s |
n |
ij |
|
|
|
|
инф2 |
2 nij |
ln |
|
|
, |
(2) |
|
|
|
||||||
|
i 1 j 1 |
n* |
|
|
|||
|
|
ij |
|
|
|||
Статистика (2) обладает теми же свойствами, что и статистика (1). На практике редко встречаются значительные расхождения между наблюдаемыми значениями статистик (1) и (2).
Замечания
1)Критерий Пирсона и информационный критерий рекомендуется применять при n>20 [3] (n 30 [6]) и отсутствии теоретических частот nij* меньших 5.
2)Для таблиц сопряженности 2 2 при n<20 или при 20 n 40 и наличии теоретических частот nij* меньших 5 рекомендуется использовать точный критерий
Фишера [1, 3, 7, 8].
3) Для таблиц сопряженности 2 2 проверку гипотезы о независимости признаков рекомендуется осуществлять с помощью статистики 2 с поправкой Йетса на непрерывность [1, 6, 8], имеющую вид:
7
|
r s |
|
|
nij |
nij* |
|
|
0,5 2 |
|
|
|
|
|
|
|||||||
Йетс2 |
|
|
|
|
|
|
|
|
. |
(3) |
|
|
|
|
|||||||
|
|
|
n* |
|
||||||
|
i 1 j 1 |
|
|
|
ij |
|
|
|
||
4) Особый интерес представляет анализ таблиц сопряженности 2 2 типа
«до-после» с целью выявления влияния дихотомического качественного фактора на значение дихотомического результативного признака, например, влияния пропаганды на общественное мнение. При использовании схемы «до-после» ответы респондентов обычно представляются категориями типа «да-нет», «за-против», «положительно-отрицательно» и т.п. При этом принято положительный ответ обозначать знаком плюс, а отрицательный – знаком минус [6].
Пусть над одной и той же группой объектов производятся два эксперимента и необходимо установить, меняется ли распределение частот от одного эксперимента к другому. В этом случае исходные данные можно представить в виде таблицы сопряженности 2 2, однако составляющие её данные не являются независимыми
[5]. Для выявления изменения соотношения частот в таблице сопряженности при изменении условий опыта используется критерий Мак-Нимара [5, 6]. Рассмотрим выборочную таблицу сопряженности:
До\После |
+ |
– |
ni* |
+ |
n11 |
n12 |
n1* |
– |
n21 |
n22 |
n2* |
n*j |
n*1 |
n*2 |
n |
Для проверки гипотезы H0 : p12 p21 (условия опыта не влияют на результат)
Мак-Нимар предложил статистику:
8
2 |
|
(n |
n |
21 |
) |
2 |
|
|
|
12 |
|
|
|
; |
(4) |
||
|
|
|
|
|
n12 n21 1
Статистика (4) при справедливости гипотезы H0 и n12 n21 30 распределена
по закону «Хи-квадрат» с числом степеней свободы 1.
1.3 Меры связи для таблицы сопряженности 2 2
Рассмотрим два дихотомических признака X и Y. Признак X может принимать значения x1,x2 ; признак Y – y1,y2. Выборочные данные, содержащие значения признаков X и Y для n объектов наблюдения, представлены в виде двухфакторной таблицы сопряженности 2 2, имеющей вид:
xi \ yj |
y1 |
y2 |
ni* |
x1 |
n11 |
n12 |
n1* |
x2 |
n21 |
n22 |
n2* |
n*j |
n*1 |
n*2 |
n |
Если гипотеза о независимости признаков X и Y отвергнута, т.е. признаки связаны между собой, необходимо количественно измерить силу этой взаимосвязи.
Для описания связи предложено множество различных коэффициентов, называемых мерами связи.
Меры связи, основанные на статистике 2
Использование непосредственно статистики Пирсона 2 в качестве меры связи неудобно, так как, во-первых, она зависит от числа строк, столбцов таблицы сопряженности, от объема выборки и, во-вторых, изменяется на интервале от нуля до бесконечности.
9
1) Фи-коэффициент (коэффициент Чупрова-Крамера)
Выборочное значение коэффициента рассчитывается по формуле [8]:
|
|
2 |
|
|
|
набл |
, (0;1). |
(5) |
|
|
|
|||
|
|
n |
|
|
Чем ближе значение коэффициента к 1, тем теснее связи между признаками Х
и Y.
2) Коэффициент сопряженности Пирсона Выборочное значение коэффициента рассчитывается по формуле [8]:
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
2 |
|
|
|
|
2 |
|
|
|
||
P |
|
|
набл |
|
|
|
|
|
, P (0;0,7). |
(6) |
||
|
2 |
|
|
|
||||||||
|
|
|
n |
|
|
|
|
|
||||
|
|
набл |
|
|
1 |
2 |
|
|
||||
|
|
|
|
|
|
|
|
|
|
|
||
3) Коэффициент контингенции Крамера Выборочное значение коэффициента рассчитывается по формуле [3, 5, 8]:
|
n n |
22 |
n |
n |
21 |
|
|
|||||||
V |
11 |
|
|
|
12 |
|
, V ( 1;1). |
(7) |
||||||
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
n1*n2*n*1n*2 |
|||||||||||||
|
|
|
||||||||||||
Справедливы формулы |
|
|
V |
|
, |
2 nV2 . Коэффициент |
контингенции |
|||||||
|
|
|||||||||||||
называют коэффициентом корреляции между Х и Y.
Если V 0, то связь между признаками Х и Y «положительная», т.е. значение x1(x2) одного признака чаще сопровождается значением y1(y2) другого признака.
Если V 0, то связь между признаками Х и Y «отрицательная», т.е. значение x1(x2)
одного признака чаще сопровождается значением y2(y1) другого признака. 4) - коэффициент Гудмена и Краскала Выборочное значение коэффициента рассчитывается по формуле [8]:
10
