Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Анализ данных в социологии. Учебно-методическое пособие
.pdf
. Такое определение меры неопределенности согласуется и с тем, что при она равна нулю и при возрастании k
возрастает. Не трудно показать, что единственной функцией аргумента
k, удовлетворяющей условиям f (k l) = f (k) + f (l), f (1) =0, f(k) f (l) при
k l, является логарифмическая функция. Выбор основания системы
логарифмов несуществен, в силу чего от одного основания возможен
легкий переход к другому, причем используемые формулы при этом будут отличаться только на некоторый постоянный множитель, что несущественно для их интерпретации:
.
Рассмотрим некоторые свойства энтропии.
1) H (Y) 0. Указанное равенство достигается тогда, когда Y при-
нимает только одно значение. В данной ситуации определенность максимальна. Для выбранного случайным образом объекта можем точно
сказать, какое значение принимает рассматриваемый признак. Распределение Y для этого случая представлено на рис. 10. Единственная отличная от нуля вероятность здесь равна 1. Легко убедиться, что энтропия для такого распределения равна нулю.
Рис. 10. Пример распределения с нулевой энтропией
31

2) Если k фиксировано, то значение энтропии будет максималь-
ным, когда все возможные значения Y равновероятны. В этом случае
наблюдается ситуация максимальной неопределенности. Допустим,
что k=4. Распределение Y для такой ситуации представлено на рис. 11.
Рис. 11. Пример распределения с максимальной энтропией
при заданном числе градаций признака
Понятно, что в рассматриваемом примере Pj = 0,25. При этом значение
энтропии равно log 4, а в общем случае в ситуации полной неопределенности значение энтропии равно log k. Отсюда очевидно, что чем
больше градаций имеет рассматриваемый признак, тем большей энтропии может достичь отвечающее ему распределение.
Представленные рисунки иллюстрируют ситуации минимальной
(нулевой) энтропии (полной определенности) и максимальной энтропии (полной неопределенности). Отметим, что на рис. 10 разброс рассматриваемого признака равен нулю, а на рис. 11 является максимально
большим. Очевидно, что энтропия будет тем больше, чем ближе будет
реальное распределение к ситуации, изображенной на рис. 11, и тем
меньше, чем ближе оно к ситуации, изображенной на рис. 10. Этот факт
позволяет использовать энтропию при оценке степени разброса значений номинального признака. Однако в силу зависимости максимального значения энтропии для распределения какого-либо признака от
числа его градации необходимо провести операцию нормирования на
значение максимальной энтропии, перейдя к энтропийному коэффициенту:
.
32

Изучение связей между номинальными признаками
Номинальные данные являются основным видом исходной информации, интересующей социолога, а анализ связей между признаками – его основной задачей. Такая ситуация обусловлена тем, что номинальные данные сравнительно просто получаются, легко интерпретируются и являются более надежными.
Для оценки связей между признаками используются таблицы сопряженности27. Допустим, имеется два признака X и Y, первый из которых принимает r значений 1, 2, . . ., r, а второй – c значений 1, 2, . . ., c.
Двумерной таблицей сопряженности называется некоторая матрица, на
пересечении i-й строки и j-го столбца которой стоит число nij, означающее количество объектов, обладающих i-м значением первого признака
и j-м значением второго (i =1, . . ., r; j =1, . . ., c):
На практике ее изображают с явно обозначенными наименованиями
признаков и их значений, а также выписанными маргинальными суммами (итоговыми суммами по столбцам и строкам) – см. табл. 3.
Правый крайний столбец образуют маргиналы по строкам, а нижняя строка образуется маргиналами по столбцам, n – объем выборки,
равный сумме маргиналов по столбцам (либо по строкам). Допустимо
и более широкое понимание таблицы сопряженности. В качестве ее элементов могут использоваться не только частоты, но и другие числа: показатели центра распределения (среднее арифметическое, мода, медиана), дисперсии, величины отклонений от средних по строке (столбцу),
разница между эмпирической и теоретической частотой и т.д.
При анализе эмпирических данных важную роль играет изучение
связи между двумя переменными. Предположим, что исследуется желание студентов-бакалавров пройти обучение на различных дистанционных курсах в зависимости от их успеваемости. Студенты в зависимости
от среднего балла по дисциплинам разделены на две группы: с высокой
успеваемостью (закодирована цифрой 1) и со средней успеваемостью
(закодирована цифрой 2). Предлагаемые студентам дистанционные
27
Толстова, Ю. Н. Указ. соч. С. 167–169.
33

X
Y
Маргиналы
по
строкам
1 2 …
j
…
c
1
…
…
2
…
…
…
… … … … … … …
i
…
…
…
… … … … … … …
r
…
…
Маргиналы
по
столбцам
n
Таблица 3
Общий вид таблицы сопряженности
курсы кодируются цифрами от 1 до 5. Признак, отвечающий успеваемости студента, обозначается через Х, признак отвечающий курсу, интересующему студента, – через Y.
Предположим, что в процессе исследования опрошено 100 студентов, полученные данные сведены в табл. 4.
34

Таблица 4
Интересующий студента
дистанционный курс
Успеваемость
Итого
1
2 1 15
10
25
2
9 6 15
3
12 8 20
4
15
10
25
5
9 6 15
Итого
60
40
100
Пример таблицы сопряженности
для двух независимых признаков
Анализ данных, приведенных в таблице сопряженности, свидетельствует о том, что первый и четвертый дистанционные курсы пользуются одинаковой популярностью у студентов вне зависимости от их
успеваемости (каждый из этих курсов выбирает четверть опрошенных
как в группе с высокой, так и в группе со средней успеваемостью).
Среднюю популярность имеет третий дистанционный курс – его выбирает пятая часть опрошенных в каждой из исследуемых групп. Менее
всего интересны студентам второй и пятый дистанционные курсы, но и
здесь доли интересующихся в исследуемых группах одинаковы. В целом же следует сделать вывод, что рассматриваемые переменные независимы.
Однако следует помнить, что приведенная таблица отражает данные, полученные при изучении выборочной совокупности, а она используется в качестве модели генеральной совокупности. Выборочная
совокупность отражает генеральную с определенной погрешностью.
Таким образом, можно заключить, что незначительные отклонения в
столбцах таблицы сопряженности от пропорциональности связаны с
наличием такой погрешности. Вышеотмеченное следует учитывать при
анализе таблиц сопряженности, например таких, как табл. 5–6.
Очевидно, что небольшие отклонения (на 1) в столбцах таблицы
сопряженности следует интерпретировать как погрешности, возникшие
вследствие использования выборочной совокупности, и, следовательно, можно говорить, что исследуемые переменные независимы.
35

Первый пример таблицы сопряженности
Интересующий студента
дистанционный курс
Успеваемость
Итого
1
2 1 16 9 25
2
10 5 15
3
12 8 20
4
16 9 25
5
9 6 15
Итого
60
40
100
Интересующий студента
дистанционный курс
Успеваемость
Итого
1
2 1 25 0 25
2
12 3 15
3
12 8 20
4
20 5 25
5
9 6 15
Итого
60
40
100
для двух независимых признаков
Второй пример таблицы сопряженности
для двух независимых признаков
Таблица 5
Таблица 6
Несколько иная ситуация возникает при анализе другой таблицы
сопряженности – табл. 6. Здесь обращает на себя внимание тот факт,
что отклонения между данными в столбцах таблицы довольно велики,
поэтому их уже нельзя интерпретировать как погрешности, возникающие вследствие использования выборочной совокупности, и следует
предположить наличие взаимосвязи между переменными. Однако
остается вопрос о том, насколько сильным должно быть отклонение
для того, чтобы можно было бы считать его погрешностью. Для ответа
на этот вопрос необходимо обратиться к методам математической статистики.
Ответить на вопрос о наличии взаимосвязи между двумя переменными на основе полученной таблицы сопряженности можно с помощью процедур проверки гипотезы о статистической независимости
36

признаков28. Напомним некоторые понятия из теории проверки гипотез. Нулевой гипотезой H0 называется предположение об отсутствии
связи или различия между определенными статистическими параметрами генеральной совокупности.
Альтернативной гипотезой H1 называется гипотеза о том, что
между определенными статистическими параметрами генеральной совокупности существует связь или различие.
Для того чтобы проверить состоятельность статистической гипотезы H0, необходимо воспользоваться некоторым статистическим
критерием, предлагаемым математической статистикой. Он представляет собой определенную числовую функцию f от наблюдаемых величин. Распределение значений функции f в предположении, что проверяемая гипотеза справедлива (для генеральной совокупности), хорошо
изучено. Известно, какова вероятность попадания каждого значения в
любой интервал. Это означает, что если H0 справедлива, то для каждого полученного для конкретной выборки значения f можно сказать,
какова вероятность его встретить. Для имеющейся выборки вычисляется значение f
критерия f и находится вероятность Р(f
выб
) этого зна-
выб
чения. Далее делается предположение, что если вероятность какоголибо события очень мала, то это событие практически не может произойти. Если же такое маловероятное событие происходит, то делается
вывод, что вероятность была определена неверно, а произошедшее событие немаловероятно. Рассматриваемое событие состоит в том, что
критерий принял то или иное значение. Если вероятность события
Р(fвыб) очень мала, то в силу вышеизложенного предполагается, что
она неправильно определена. Причина этой ошибки в том, что поиск
вероятности осуществлялся в предположении справедливости проверяемой гипотезы H0, из-за которого делалось предположение об очень
малой величине вероятности встреченного значения. Это дает основания отклонить гипотезу H0 и принять альтернативную гипотезу H1.
Если вероятность Р(f
f
могло встретиться практически, то проверяемая гипотеза справед-
выб
) достаточно велика для того, чтобы значение
выб
лива и принимается с предположением, что она справедлива для генеральной совокупности. Таким образом, возможность использовать
функцию f как критерий в состоятельности статических гипотез определяется тем, что величина ее значения играет определяющую роль в
принятии гипотезы H0 или в ее отклонении (в принятии гипотезы H1).
28
Малхотра, Н. К. Указ. соч. С. 562–568.
37

Следует отметить, что всегда существует риск сделать неверное
заключение относительно изучаемой совокупности. Возможны два
типа таких ошибок.
Ошибки I рода имеют место, когда по результатам выборочного
наблюдения отклоняют нулевую гипотезу H0, когда она верна.
Ошибки II рода имеют место, когда по результатам выборочного
наблюдения принимают нулевую гипотезу H0, когда она ошибочна.
Вероятность ошибки I рода называется уровнем значимости и обозна-
чается как . Она устанавливается исходя из допустимого уровня
риска отклонения истинной нулевой гипотезы. Строгих правил определения уровня значимости нет, полагаются на практический опыт.
Обычно принимают, что уровень значимости = 0,05 либо = 0,01.
Следует учитывать, насколько социально значимым может быть принятие ложной или отвержение истинной гипотезы. Если с отклонением
гипотезы связаны большие затраты, то следует сделать величину
уровня значимости как можно меньшей, чтобы вероятность отклонения правильной нулевой гипотезы H0 была как можно меньше. Если
же затраты сопряжены с принятием нулевой гипотезы H0, то следует
увеличить величину уровня значимости, чтобы уменьшить вероятность принятия ложной гипотезы.
Вероятность ошибки II рода называется мощностью статистиче-
ского критерия и обозначается как (рис. 12).
Рис. 12. Ошибки I и II рода
38

Отметим, что каждый метод исследования связей между двумя
n
nn
f
cr
e
=
переменными можно трактовать как реализацию процесса, в котором
все исходные номинальные признаки разделяются на отдельные градации, а затем комбинируются, позволяя построить новые признаки,
взаимоотношения которых изучаются в дальнейшем. Таким образом,
можно говорить об анализе связей типа признак – признак, альтернатива – альтернатива, группа альтернатив – группа альтернатив, признак – группа признаков29.
Анализ связей типа признак –
признак
Для оценки статистической значимости и тесноты связи переменных, содержащихся в таблице сопряженности, используется ряд статистических параметров30.
Самым важным таким параметром является критерий χ2, который
позволяет измерить статистическую значимость наблюдаемой связи.
Он помогает определить наличие или отсутствие систематической
связи между двумя переменными. В данном случае мы имеем дело с
нулевой гипотезой H0, утверждающей, что между двумя переменными
не существует никакой связи. Для ее проверки необходимо проделать
ряд расчетов. Прежде всего делается предположение, что между двумя
переменными не существует никакой связи. Проверка этого предположения выполняется вычислением частот распределения признаков анализируемых переменных в ячейках таблицы, которые можно было бы
ожидать, если бы зависимости между переменными не существовало, и
при данных итоговых числах в каждой строке и столбце таблице. Ожидаемая частота для каждой ячейки таблицы вычисляется с помощью
следующей формулы:
,
где nr – итоговое число в строке; nc – итоговое число в столбце; n – полный размер выборки.
Затем ожидаемые частоты сравниваются с фактическими наблюдаемыми частотами распределения признаков, соответствующими
29
Толстова, Ю. Н. Указ. соч. С. 177–180.
30
Малхотра, Н. К. Указ. соч. С. 575–578.
39

ячейкам таблицы. Очевидно, что, чем больше это разница, тем выше
( )
−
=
ячейкивсе
e
e
f
ff
2
0
2
( ) ( )
11 −−= crdf
n
2
=
значение статистики.
Значение критерия χ2 вычисляется следующим образом:
.
Важной характеристикой критерия χ2 является число степеней
свободы df, которое вычисляется как
,
где r – число строк; c – число столбцов.
Предположение, что между двумя переменными не существует
никакой связи (нулевая гипотеза H0), отклоняется, если полученное значение χ2 больше, чем критическое значение χ2 распределения с соответствующим числом степеней свободы. Для того чтобы определить критическое значение χ2, необходимо обратиться к специальной таблице –
к таблице значений χ2.
Для выяснения тесноты связи вычисляют коэффициент корреляции φ, коэффициент сопряженности признаков С, V-коэффициент Крамера.
Коэффициент корреляции φ используется очень редко – в случае,
если таблица сопряженности состоит из двух столбцов и двух строк.
Для его нахождения используют формулу
,
где n – размер выборки. Коэффициент корреляции φ принимает значение 0, если связь между переменными отсутствует, и значение 1 – если
связь является сильной.
оценки тесноты связи в таблицах любого размера. Для его вычисления
используют формулу
Коэффициент сопряженности признаков C используется для
40
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
