Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ таблиц сопряженности в пакетах Statistica, САНИ, Excel. Методические указания к лабораторным работам, практическим занятиям и самостоятельной р

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
891 Кб
Скачать

Министерство образования и науки Российской Федерации

Федеральное государственное бюджетное образовательное учреждение высшего профессионального образования

«Оренбургский государственный университет»

Кафедра математических методов и моделей в экономике

О.С. Чудинова

АНАЛИЗ ТАБЛИЦ СОПРЯЖЕННОСТИ В ПАКЕТАХ STATISTICA, САНИ, EXCEL

Рекомендовано к изданию Редакционно-издательским советом федерального государственного бюджетного образовательного учреждения высшего профессионального образования «Оренбургский государственный университет» в качестве методических указаний для студентов, обучающихся по программам высшего профессионального образования по специальности 080116.65 Математические методы в экономике, направлениям подготовки 231300.62 Прикладная математика, 080500.62 Бизнес-информатика, 080100.62 Экономика

Оренбург

2014

УДК 519.235:330.43(076.5) ББК 22.172я7+65в631я7

Ч 84

Рецензент – доцент, кандидат экономических наук С.В. Дьяконова

Чудинова, О.С.

Ч84 Анализ таблиц сопряженности в пакетах Statistica, САНИ, Excel: методические указания к лабораторным работам, практическим занятиям и самостоятельной работе студентов / О.С. Чудинова; Оренбургский гос. ун-т.– Оренбург: ОГУ, 2014. – 57 с.

Методические указания к лабораторным работам, практическим занятиям, самостоятельной работе студентов, в том числе для выполнения индивидуальных заданий, РГЗ, курсовых и дипломных работ, связанных со статистическим анализом нечисловой информации.

Предназначены для специальности 080116.65 Математические методы в экономике, направлений подготовки 231300.62 Прикладная математика, 080500.62 Бизнес-информатика, 080100.62 Экономика и других специальностей и направлений, изучающих дисциплины, связанные с обработкой нечисловых данных.

УДК 519.235:330.43(076.5) ББК 22.172я7+65в631я7

Чудинова О.С., 2014

ОГУ, 2014

2

Содержание

Введение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4 1 Теоретическая часть . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5 1.1 Выборочная двухфакторная таблица сопряженности: структура, свойства,

интерпретация . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5 1.2 Проверка гипотезы о независимости двух номинальных признаков . . . . . . 6 1.3 Меры связи для таблицы сопряженности 2 2 . . . . . . . . . . . . . . . . . . . . . . . . 9 1.4 Меры связи для таблицы сопряженности r s . . . . . . . . . . . . . . . . . . . . . . . . 14 1.5 Вопросы и задания, выносимые на семинарские занятия, по теме «Анализ таблиц сопряженности» . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21 2 Практическая часть . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23 2.1 Содержание лабораторной работы . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23 2.2 Задание к лабораторной работе . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24 2.3 Порядок выполнения лабораторной работы в пакете Statistica . . . . . . . . . . . 24 2.4 Порядок выполнения лабораторной работы в пакете САНИ . . . . . . . . . . . . . 39 2.5 Порядок выполнения лабораторной работы с помощью надстройки

AtteStat табличного процессора Microsoft Excel. . . . . . . . . . . . . . . . . . . . . . . . . . . 46 2.6 Содержание письменного отчета . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48 2.7 Вопросы к защите лабораторной работы . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48

Список использованных источников . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 49

Приложение А Исходные данные для анализа . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50

3

Введение

Методические указания посвящены методам анализа двухфакторных таблиц сопряженности, используемым для исследования связи между двумя номинальными признаками. В теоретической части предлагаемых методических указаний изложены структура, свойства и интерпретация выборочной двухфакторной таблицы сопряженности, проверка гипотезы о независимости двух номинальных признаков,

меры связи, рассчитываемые на основе таблиц сопряженности 2 2 и r s.

Приведен широкий перечень теоретических вопросов и заданий по теме «Анализ таблиц сопряженности», позволяющий студенту систематизировать свои знания и облегчить подготовку к практическим занятиям. Часть вопросов в достаточном объеме освещены в методических указаниях, для ответа на остальные вопросы необходимо обратиться к указанным литературным источникам. В практической части методических указаний на конкретном примере описывается алгоритм

анализа двухфакторных таблиц сопряженности 2 2 и r s в статистических

пакетах Statistica, САНИ и надстройке AtteStat пакета Excel, приводится интерпретация полученных результатов исследования связи двух номинальных признаков. В методических указаниях сформулирована постановка задачи и определены варианты заданий, приведены требования к оформлению отчета и вопросы к защите лабораторной работы.

Использование предлагаемых методических указаний в учебном процессе позволит студенту в достаточной степени овладеть методами анализа двухфакторных таблиц сопряженности и приобрести навыки его практической реализации в пакетах прикладных программ.

4

1 Теоретическая часть

1.1 Выборочная двухфакторная таблица сопряженности: структура,

свойства, интерпретация

Рассмотрим два категоризованных номинальных признака X и Y. Признак X

может принимать значения x1,x2,...,xr ; признак Y y1,y2,...,ys . Пусть имеется выборка объема n из генеральной совокупности (Х, Y). Тогда эмпирическое распределение генеральной совокупности (Х, Y) может быть представлено в виде двухфакторной таблицы сопряженности признаков Х и Y размерности r s,

имеющей вид [1, 2, 7, 8, 10]:

 

xi \ yj

 

y1

y2

ys

 

ni*

 

 

x1

 

n11

n12

n1s

 

n1*

 

 

x2

 

n21

n22

n2s

 

n2*

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

xr

 

nr1

nr2

nrs

 

nr*

 

n*j

 

n*1

n*2

n*s

 

n

 

где nij – наблюдаемая

частота,

т.е.

число

объектов в выборочной

совокупности, характеризующихся i-ой категорией признака X и j-ой категорией признака Y, i 1,r , j 1,s;

ni* – маргинальная частота, характеризующая сколько объектов в выборочной

s

совокупности обладают i-ой категорией признака X, ni* nij , i 1,r ;

j 1

5

n*j – маргинальная частота, характеризующая сколько объектов в выборочной

 

 

 

r

 

 

 

совокупности обладают j-ой категорией признака Y, n* j nij ,

j

1,s

;

 

 

 

i 1

 

 

 

r

s

r s

 

 

 

 

ni* n* j

nij

n.

 

 

 

i 1

j 1

i 1 j 1

 

 

 

 

Замечание: признаки X и/или Y могут быть измерены в порядковой или количественной шкале. В последнем случае для построения выборочной таблицы сопряженности наблюдаемые значения признаков должны быть сгруппированы в форме интервального вариационного ряда.

1.2 Проверка гипотезы о независимости двух номинальных признаков

Ставится задача на основе выборочных данных, сформированных методом перекрестного отбора и представленных в виде двухфакторной таблицы

сопряженности r s установить, есть ли связь между признаками X и Y.

Для решения этой задачи формулируются следующие гипотезы:

H0 : pij pi*

p*j , i 1,r, j 1,s (признаки X и Y независимы);

H1 : i, j: pij

pi* p*j (признаки X и Y зависимы).

В формулировке гипотез используются следующие обозначения:

pij – вероятность того, что случайно выбранный объект характеризуется i-ой категорией признака X и j-ой категорией признака Y, i 1,r , j 1,s;

pi* – вероятность того, что случайно выбранный объект характеризуется i-ой

категорией признака X, i 1,r ;

p* j – вероятность того, что случайно выбранный объект характеризуется j-ой

категорией признака Y, j 1,s.

Для проверки гипотезы H0 используется критерий Пирсона 2, статистика которого имеет вид:

6

r s

(n

n*)2

 

2

ij

 

ij

,

(1)

 

*

 

i 1 j 1

 

nij

 

 

 

где nij* – теоретические частоты, т.е. те частоты, которые были бы при

справедливости нулевой гипотезы, nij* ni* n*j . n

Согласно теореме К. Пирсона и Р. Фишера статистика (1) при справедливости гипотезы H0 , n и отсутствии малых теоретических частот имеет

распределение «Хи-квадрат» с числом степеней свободы (r 1)(s 1) [1-3, 7-10].

Альтернативой критерию Пирсона 2 является информационный критерий или критерий 2-отношение правдоподобия [1, 2, 8, 9], статистика которого имеет вид:

 

r s

n

ij

 

 

 

инф2

2 nij

ln

 

 

,

(2)

 

 

 

i 1 j 1

n*

 

 

 

 

ij

 

 

Статистика (2) обладает теми же свойствами, что и статистика (1). На практике редко встречаются значительные расхождения между наблюдаемыми значениями статистик (1) и (2).

Замечания

1)Критерий Пирсона и информационный критерий рекомендуется применять при n>20 [3] (n 30 [6]) и отсутствии теоретических частот nij* меньших 5.

2)Для таблиц сопряженности 2 2 при n<20 или при 20 n 40 и наличии теоретических частот nij* меньших 5 рекомендуется использовать точный критерий

Фишера [1, 3, 7, 8].

3) Для таблиц сопряженности 2 2 проверку гипотезы о независимости признаков рекомендуется осуществлять с помощью статистики 2 с поправкой Йетса на непрерывность [1, 6, 8], имеющую вид:

7

 

r s

 

 

nij

nij*

 

 

0,5 2

 

 

 

 

 

Йетс2

 

 

 

 

 

 

 

 

.

(3)

 

 

 

 

 

 

 

n*

 

 

i 1 j 1

 

 

 

ij

 

 

 

4) Особый интерес представляет анализ таблиц сопряженности 2 2 типа

«до-после» с целью выявления влияния дихотомического качественного фактора на значение дихотомического результативного признака, например, влияния пропаганды на общественное мнение. При использовании схемы «до-после» ответы респондентов обычно представляются категориями типа «да-нет», «за-против», «положительно-отрицательно» и т.п. При этом принято положительный ответ обозначать знаком плюс, а отрицательный – знаком минус [6].

Пусть над одной и той же группой объектов производятся два эксперимента и необходимо установить, меняется ли распределение частот от одного эксперимента к другому. В этом случае исходные данные можно представить в виде таблицы сопряженности 2 2, однако составляющие её данные не являются независимыми

[5]. Для выявления изменения соотношения частот в таблице сопряженности при изменении условий опыта используется критерий Мак-Нимара [5, 6]. Рассмотрим выборочную таблицу сопряженности:

До\После

+

ni*

+

n11

n12

n1*

n21

n22

n2*

n*j

n*1

n*2

n

Для проверки гипотезы H0 : p12 p21 (условия опыта не влияют на результат)

Мак-Нимар предложил статистику:

8

2

 

(n

n

21

)

2

 

 

 

12

 

 

 

;

(4)

 

 

 

 

 

n12 n21 1

Статистика (4) при справедливости гипотезы H0 и n12 n21 30 распределена

по закону «Хи-квадрат» с числом степеней свободы 1.

1.3 Меры связи для таблицы сопряженности 2 2

Рассмотрим два дихотомических признака X и Y. Признак X может принимать значения x1,x2 ; признак Y y1,y2. Выборочные данные, содержащие значения признаков X и Y для n объектов наблюдения, представлены в виде двухфакторной таблицы сопряженности 2 2, имеющей вид:

xi \ yj

y1

y2

ni*

x1

n11

n12

n1*

x2

n21

n22

n2*

n*j

n*1

n*2

n

Если гипотеза о независимости признаков X и Y отвергнута, т.е. признаки связаны между собой, необходимо количественно измерить силу этой взаимосвязи.

Для описания связи предложено множество различных коэффициентов, называемых мерами связи.

Меры связи, основанные на статистике 2

Использование непосредственно статистики Пирсона 2 в качестве меры связи неудобно, так как, во-первых, она зависит от числа строк, столбцов таблицы сопряженности, от объема выборки и, во-вторых, изменяется на интервале от нуля до бесконечности.

9

1) Фи-коэффициент (коэффициент Чупрова-Крамера)

Выборочное значение коэффициента рассчитывается по формуле [8]:

 

 

2

 

 

 

набл

, (0;1).

(5)

 

 

 

 

n

 

Чем ближе значение коэффициента к 1, тем теснее связи между признаками Х

и Y.

2) Коэффициент сопряженности Пирсона Выборочное значение коэффициента рассчитывается по формуле [8]:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

2

 

 

 

P

 

 

набл

 

 

 

 

 

, P (0;0,7).

(6)

 

2

 

 

 

 

 

 

n

 

 

 

 

 

 

 

набл

 

 

1

2

 

 

 

 

 

 

 

 

 

 

 

 

 

3) Коэффициент контингенции Крамера Выборочное значение коэффициента рассчитывается по формуле [3, 5, 8]:

 

n n

22

n

n

21

 

 

V

11

 

 

 

12

 

, V ( 1;1).

(7)

 

 

 

 

 

 

 

 

 

 

 

 

 

n1*n2*n*1n*2

 

 

 

Справедливы формулы

 

 

V

 

,

2 nV2 . Коэффициент

контингенции

 

 

называют коэффициентом корреляции между Х и Y.

Если V 0, то связь между признаками Х и Y «положительная», т.е. значение x1(x2) одного признака чаще сопровождается значением y1(y2) другого признака.

Если V 0, то связь между признаками Х и Y «отрицательная», т.е. значение x1(x2)

одного признака чаще сопровождается значением y2(y1) другого признака. 4) - коэффициент Гудмена и Краскала Выборочное значение коэффициента рассчитывается по формуле [8]:

10

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]