Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ данных в социологии. Учебно-методическое пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
󰇛󰇜   . Такое определение меры неопределенности со­гласуется и с тем, что при  она равна нулю и при возрастании k
возрастает. Не трудно показать, что единственной функцией аргумента
k, удовлетворяющей условиям f (k l) = f (k) + f (l), f (1) =0, f(k)  f (l) при k  l, является логарифмическая функция. Выбор основания системы
логарифмов несуществен, в силу чего от одного основания возможен легкий переход к другому, причем используемые формулы при этом бу­дут отличаться только на некоторый постоянный множитель, что несу­щественно для их интерпретации:
 .
Рассмотрим некоторые свойства энтропии.
1) H (Y)  0. Указанное равенство достигается тогда, когда Y при-
нимает только одно значение. В данной ситуации определенность мак­симальна. Для выбранного случайным образом объекта можем точно сказать, какое значение принимает рассматриваемый признак. Распре­деление Y для этого случая представлено на рис. 10. Единственная от­личная от нуля вероятность здесь равна 1. Легко убедиться, что энтро­пия для такого распределения равна нулю.
Рис. 10. Пример распределения с нулевой энтропией
31
2) Если k фиксировано, то значение энтропии будет максималь-
ным, когда все возможные значения Y равновероятны. В этом случае наблюдается ситуация максимальной неопределенности. Допустим, что k=4. Распределение Y для такой ситуации представлено на рис. 11.
Рис. 11. Пример распределения с максимальной энтропией
при заданном числе градаций признака
Понятно, что в рассматриваемом примере Pj = 0,25. При этом значение энтропии равно log 4, а в общем случае в ситуации полной неопреде­ленности значение энтропии равно log k. Отсюда очевидно, что чем больше градаций имеет рассматриваемый признак, тем большей энтро­пии может достичь отвечающее ему распределение.
Представленные рисунки иллюстрируют ситуации минимальной (нулевой) энтропии (полной определенности) и максимальной энтро­пии (полной неопределенности). Отметим, что на рис. 10 разброс рас­сматриваемого признака равен нулю, а на рис. 11 является максимально большим. Очевидно, что энтропия будет тем больше, чем ближе будет реальное распределение к ситуации, изображенной на рис. 11, и тем меньше, чем ближе оно к ситуации, изображенной на рис. 10. Этот факт позволяет использовать энтропию при оценке степени разброса значе­ний номинального признака. Однако в силу зависимости максималь­ного значения энтропии для распределения какого-либо признака от числа его градации необходимо провести операцию нормирования на значение максимальной энтропии, перейдя к энтропийному коэффици­енту:


.

32
Изучение связей между номинальными признаками
Номинальные данные являются основным видом исходной ин­формации, интересующей социолога, а анализ связей между призна­ками – его основной задачей. Такая ситуация обусловлена тем, что но­минальные данные сравнительно просто получаются, легко интерпре­тируются и являются более надежными.
Для оценки связей между признаками используются таблицы со­пряженности27. Допустим, имеется два признака X и Y, первый из кото­рых принимает r значений 1, 2, . . ., r, а второй – c значений 1, 2, . . ., c. Двумерной таблицей сопряженности называется некоторая матрица, на пересечении i-й строки и j-го столбца которой стоит число nij, означаю­щее количество объектов, обладающих i-м значением первого признака и j-м значением второго (i =1, . . ., r; j =1, . . ., c):
 
 
 
󰈐

󰈐
 
 
 
 



На практике ее изображают с явно обозначенными наименованиями признаков и их значений, а также выписанными маргинальными сум­мами (итоговыми суммами по столбцам и строкам) – см. табл. 3.
Правый крайний столбец образуют маргиналы по строкам, а ниж­няя строка образуется маргиналами по столбцам, n – объем выборки, равный сумме маргиналов по столбцам (либо по строкам). Допустимо и более широкое понимание таблицы сопряженности. В качестве ее эле­ментов могут использоваться не только частоты, но и другие числа: по­казатели центра распределения (среднее арифметическое, мода, меди­ана), дисперсии, величины отклонений от средних по строке (столбцу), разница между эмпирической и теоретической частотой и т.д.
При анализе эмпирических данных важную роль играет изучение связи между двумя переменными. Предположим, что исследуется жела­ние студентов-бакалавров пройти обучение на различных дистанцион­ных курсах в зависимости от их успеваемости. Студенты в зависимости от среднего балла по дисциплинам разделены на две группы: с высокой успеваемостью (закодирована цифрой 1) и со средней успеваемостью (закодирована цифрой 2). Предлагаемые студентам дистанционные
27
Толстова, Ю. Н. Указ. соч. С. 167–169.
33
X
Y
Марги­налы по стро­кам
1 2 …
j
c
1







2







… … … … … … …
i







… … … … … … …
r







Марги­налы по столб­цам












n
Таблица 3
Общий вид таблицы сопряженности
курсы кодируются цифрами от 1 до 5. Признак, отвечающий успевае­мости студента, обозначается через Х, признак отвечающий курсу, ин­тересующему студента, – через Y.
Предположим, что в процессе исследования опрошено 100 сту­дентов, полученные данные сведены в табл. 4.
34
Таблица 4
Интересующий студента
дистанционный курс
Успеваемость
Итого
1
2 1 15
10
25
2
9 6 15
3
12 8 20
4
15
10
25
5
9 6 15
Итого
60
40
100
Пример таблицы сопряженности
для двух независимых признаков
Анализ данных, приведенных в таблице сопряженности, свиде­тельствует о том, что первый и четвертый дистанционные курсы поль­зуются одинаковой популярностью у студентов вне зависимости от их успеваемости (каждый из этих курсов выбирает четверть опрошенных как в группе с высокой, так и в группе со средней успеваемостью). Среднюю популярность имеет третий дистанционный курс – его выби­рает пятая часть опрошенных в каждой из исследуемых групп. Менее всего интересны студентам второй и пятый дистанционные курсы, но и здесь доли интересующихся в исследуемых группах одинаковы. В це­лом же следует сделать вывод, что рассматриваемые переменные неза­висимы.
Однако следует помнить, что приведенная таблица отражает дан­ные, полученные при изучении выборочной совокупности, а она ис­пользуется в качестве модели генеральной совокупности. Выборочная совокупность отражает генеральную с определенной погрешностью. Таким образом, можно заключить, что незначительные отклонения в столбцах таблицы сопряженности от пропорциональности связаны с наличием такой погрешности. Вышеотмеченное следует учитывать при анализе таблиц сопряженности, например таких, как табл. 5–6.
Очевидно, что небольшие отклонения (на 1) в столбцах таблицы сопряженности следует интерпретировать как погрешности, возникшие вследствие использования выборочной совокупности, и, следова­тельно, можно говорить, что исследуемые переменные независимы.
35
Первый пример таблицы сопряженности
Интересующий студента
дистанционный курс
Успеваемость
Итого
1
2 1 16 9 25
2
10 5 15
3
12 8 20
4
16 9 25
5
9 6 15
Итого
60
40
100
Интересующий студента
дистанционный курс
Успеваемость
Итого
1
2 1 25 0 25
2
12 3 15
3
12 8 20
4
20 5 25
5
9 6 15
Итого
60
40
100
для двух независимых признаков
Второй пример таблицы сопряженности
для двух независимых признаков
Таблица 5
Таблица 6
Несколько иная ситуация возникает при анализе другой таблицы сопряженности – табл. 6. Здесь обращает на себя внимание тот факт, что отклонения между данными в столбцах таблицы довольно велики, поэтому их уже нельзя интерпретировать как погрешности, возникаю­щие вследствие использования выборочной совокупности, и следует предположить наличие взаимосвязи между переменными. Однако остается вопрос о том, насколько сильным должно быть отклонение для того, чтобы можно было бы считать его погрешностью. Для ответа на этот вопрос необходимо обратиться к методам математической ста­тистики.
Ответить на вопрос о наличии взаимосвязи между двумя пере­менными на основе полученной таблицы сопряженности можно с по­мощью процедур проверки гипотезы о статистической независимости
36
признаков28. Напомним некоторые понятия из теории проверки гипо­тез. Нулевой гипотезой H0 называется предположение об отсутствии связи или различия между определенными статистическими парамет­рами генеральной совокупности.
Альтернативной гипотезой H1 называется гипотеза о том, что между определенными статистическими параметрами генеральной со­вокупности существует связь или различие.
Для того чтобы проверить состоятельность статистической ги­потезы H0, необходимо воспользоваться некоторым статистическим критерием, предлагаемым математической статистикой. Он представ­ляет собой определенную числовую функцию f от наблюдаемых вели­чин. Распределение значений функции f в предположении, что прове­ряемая гипотеза справедлива (для генеральной совокупности), хорошо изучено. Известно, какова вероятность попадания каждого значения в любой интервал. Это означает, что если H0 справедлива, то для каж­дого полученного для конкретной выборки значения f можно сказать, какова вероятность его встретить. Для имеющейся выборки вычисля­ется значение f
критерия f и находится вероятность Р(f
выб
) этого зна-
выб
чения. Далее делается предположение, что если вероятность какого­либо события очень мала, то это событие практически не может про­изойти. Если же такое маловероятное событие происходит, то делается вывод, что вероятность была определена неверно, а произошедшее со­бытие немаловероятно. Рассматриваемое событие состоит в том, что критерий принял то или иное значение. Если вероятность события Р(fвыб) очень мала, то в силу вышеизложенного предполагается, что она неправильно определена. Причина этой ошибки в том, что поиск вероятности осуществлялся в предположении справедливости прове­ряемой гипотезы H0, из-за которого делалось предположение об очень малой величине вероятности встреченного значения. Это дает основа­ния отклонить гипотезу H0 и принять альтернативную гипотезу H1. Если вероятность Р(f
f
могло встретиться практически, то проверяемая гипотеза справед-
выб
) достаточно велика для того, чтобы значение
выб
лива и принимается с предположением, что она справедлива для гене­ральной совокупности. Таким образом, возможность использовать функцию f как критерий в состоятельности статических гипотез опре­деляется тем, что величина ее значения играет определяющую роль в принятии гипотезы H0 или в ее отклонении (в принятии гипотезы H1).
28
Малхотра, Н. К. Указ. соч. С. 562–568.
37
Следует отметить, что всегда существует риск сделать неверное заключение относительно изучаемой совокупности. Возможны два типа таких ошибок.
Ошибки I рода имеют место, когда по результатам выборочного наблюдения отклоняют нулевую гипотезу H0, когда она верна. Ошибки II рода имеют место, когда по результатам выборочного наблюдения принимают нулевую гипотезу H0, когда она ошибочна. Вероятность ошибки I рода называется уровнем значимости и обозна-
чается как . Она устанавливается исходя из допустимого уровня
риска отклонения истинной нулевой гипотезы. Строгих правил опре­деления уровня значимости нет, полагаются на практический опыт.
Обычно принимают, что уровень значимости = 0,05 либо = 0,01.
Следует учитывать, насколько социально значимым может быть при­нятие ложной или отвержение истинной гипотезы. Если с отклонением гипотезы связаны большие затраты, то следует сделать величину уровня значимости как можно меньшей, чтобы вероятность отклоне­ния правильной нулевой гипотезы H0 была как можно меньше. Если же затраты сопряжены с принятием нулевой гипотезы H0, то следует увеличить величину уровня значимости, чтобы уменьшить вероят­ность принятия ложной гипотезы.
Вероятность ошибки II рода называется мощностью статистиче-
ского критерия и обозначается как (рис. 12).
Рис. 12. Ошибки I и II рода
38
Отметим, что каждый метод исследования связей между двумя
n
nn
f
cr
e
=
переменными можно трактовать как реализацию процесса, в котором все исходные номинальные признаки разделяются на отдельные гра­дации, а затем комбинируются, позволяя построить новые признаки, взаимоотношения которых изучаются в дальнейшем. Таким образом, можно говорить об анализе связей типа признак – признак, альтерна­тива – альтернатива, группа альтернатив – группа альтернатив, при­знак – группа признаков29.
Анализ связей типа признак
признак
Для оценки статистической значимости и тесноты связи перемен­ных, содержащихся в таблице сопряженности, используется ряд стати­стических параметров30.
Самым важным таким параметром является критерий χ2, который позволяет измерить статистическую значимость наблюдаемой связи. Он помогает определить наличие или отсутствие систематической связи между двумя переменными. В данном случае мы имеем дело с нулевой гипотезой H0, утверждающей, что между двумя переменными не существует никакой связи. Для ее проверки необходимо проделать ряд расчетов. Прежде всего делается предположение, что между двумя переменными не существует никакой связи. Проверка этого предполо­жения выполняется вычислением частот распределения признаков ана­лизируемых переменных в ячейках таблицы, которые можно было бы ожидать, если бы зависимости между переменными не существовало, и при данных итоговых числах в каждой строке и столбце таблице. Ожи­даемая частота для каждой ячейки таблицы вычисляется с помощью следующей формулы:
,
где nr – итоговое число в строке; nc – итоговое число в столбце; n – пол­ный размер выборки.
Затем ожидаемые частоты сравниваются с фактическими наблю­даемыми частотами распределения признаков, соответствующими
29
Толстова, Ю. Н. Указ. соч. С. 177–180.
30
Малхотра, Н. К. Указ. соч. С. 575–578.
39
ячейкам таблицы. Очевидно, что, чем больше это разница, тем выше
( )
=
ячейкивсе
e
e
f
ff
2
0
2
( ) ( )
11 = crdf
n
2
=
значение статистики.
Значение критерия χ2 вычисляется следующим образом:
.
Важной характеристикой критерия χ2 является число степеней свободы df, которое вычисляется как
,
где r – число строк; c – число столбцов.
Предположение, что между двумя переменными не существует никакой связи (нулевая гипотеза H0), отклоняется, если полученное зна­чение χ2 больше, чем критическое значение χ2 распределения с соответ­ствующим числом степеней свободы. Для того чтобы определить кри­тическое значение χ2, необходимо обратиться к специальной таблице – к таблице значений χ2.
Для выяснения тесноты связи вычисляют коэффициент корреля­ции φ, коэффициент сопряженности признаков С, V-коэффициент Кра­мера.
Коэффициент корреляции φ используется очень редко – в случае, если таблица сопряженности состоит из двух столбцов и двух строк. Для его нахождения используют формулу
,
где n – размер выборки. Коэффициент корреляции φ принимает значе­ние 0, если связь между переменными отсутствует, и значение 1 – если связь является сильной.
оценки тесноты связи в таблицах любого размера. Для его вычисления используют формулу
Коэффициент сопряженности признаков C используется для
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]