Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ данных в социологии. Учебно-методическое пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
n
С
+
=
2
2
,
)1(),1min(
2
=
cr
n
V
где n – размер выборки.
Как и коэффициент корреляции φ, коэффициент сопряженности признаков C принимает значение 0, если связь между переменными от­сутствует и стремится к значению 1, но никогда его не достигает, если связь является сильной.
Еще одной статистикой, которую можно вычислить для измере­ния тесноты связи в таблицах любого размера, является V-коэффициент Крамера. Он получается корректировкой коэффициента корреляции φ или по числу рядов, или по числу столбцов таблицы, причем выбира­ется меньшее значение.
V-коэффициент Крамера рассчитывается по формуле
,
где n – размер выборки; r – число сток; c – число столбцов.
V-коэффициент Крамера принимает значение 0, если связь между переменными отсутствует, и значение 1 – если связь является сильной.
Перейдем к описанию коэффициентов парной связи, которые ос­нованы на других априорных моделях. К ним относятся, например, ко­эффициенты связи, основанные на моделях прогноза31.
Совершенно очевидно, что если существует связь между двумя номинальными признаками, то знание значений одного признака поз­воляет улучшить прогноз значения другого признака. Коэффициенты связи, основанные на прогнозе, являются мерой улучшения качества прогноза значения одного признака на основе информации о значении другого признака по сравнению с ситуацией, когда значение другого признака неизвестно вовсе.
Следует отметить, что существуют два подхода к формализации понятия прогноза – модальный и пропорциональный. Наиболее часто используется первый. Mодальный подход исходит из того, что при вы­боре произвольного объекта и наличии информации о распределении рассматриваемого признака делается вывод о том, что для выбранного
31
Толстова, Ю. Н. Указ. соч. С. 206–211.
41
объекта этот признак принимает модальное значение, т. е. то значение, которое встречается с максимальной частотой и соответственно имеет максимальную вероятность. Коэффициентов, основанных на модаль­ном прогнозе, три: два из них отражают направления связи (асиммет­рические коэффициенты λ), а третий является их усреднением (симмет- ричный коэффициент λ).
Асимметрический коэффициент λ является мерой выраженного в процентах улучшения прогнозирования значения зависимой перемен­ной при данном значении независимой переменной. Расчет возможен в двух вариантах: когда X – независимая переменная, а Y – зависимая (прогноз значения Y по значению X) и, наоборот, когда Y – независимая переменная, а X – зависимая (прогноз значения X по значению Y)
Формулы для расчета коэффициентов λ:

 

  
где   – наибольшая частота в i-й строке;  
– наибольшая
столбцовая маргинальная (итоговая) частота; r – число строк; n – объем выборки;

 

  
где   – наибольшая частота в j-м столбце;  
– наибольшая
строковая маргинальная (итоговая) частота; с – число столбцов; n объем выборки.
Значения коэффициента λ лежат в пределах от 0 до 1. Значение λ, равное 0, означает, что никакого улучшения в прогнозировании не наблюдается. Значение λ, равное 1, указывает на то, что прогноз может быть сделан без ошибки. Это происходит в случае, когда каждая кате­гория независимой переменной связана с одной категорией зависимой переменной.
Также рассчитывают симметричный коэффициент λ – среднее значением двух асимметричных значений:


42

.
Симметричный коэффициент λ не делает предположения о том, какая из переменных зависимая, и измеряет общее улучшение прогнозирова­ния, когда прогноз уже выполнен в обоих направлениях.
Еще одна интересная группа коэффициентов связи – коэффици­енты, основанные на понятии энтропии32. Чтобы понять их смысл, об­ратимся к понятию энтропии.
В случае двумерного распределения энтропия определяется в следующем виде:
󰇛 󰇜
󰇛󰥍󰇜 󰇛󰥍󰇜

.
Приняв, что 󰇛󰥍󰇜, приходим к выражению в следую-
щем виде:
󰇛 󰇜
 
.

Аналогичным образом можно определить энтропию для n-мерного распределения.
Условная энтропия определяется в следующем виде:
󰇛󰇜 
󰇛󰇜  󰇛󰇜.
󰇛󰇜
Энтропия обладает следующими свойствами:
1) 󰇛 󰇜󰇛󰇜;
2) 󰇛 󰇜󰇛󰇜 󰇛󰇜;
3) 󰇛 󰇜󰇛󰇜 󰇛󰇜.
Понятием, противоположным энтропии, является понятие ин­формации, приобретение которой способствует уменьшению неопреде­ленности. Количество информации можно измерять степенью умень-
шения энтропии. Пусть величина 󰇛󰇜 характеризует неопределен­ность распределения Y. В ситуации, когда 󰇛󰇜, можно говорить об известном заранее исходе опыта. Если 󰇛󰇜, то это свидетель­ствует об определенной зависящей от величины 󰇛
󰇜
проблематично-
сти результата опыта. Уменьшение исходов опыта, а следовательно,
32
Толстова, Ю. Н. Указ. соч. С. 213–219.
43
уменьшение степени неопределенности опыта возможно за счет изме­рения признака X, предшествующего опыту по измерению Y.
При измерении X условная энтропия опыта, состоящего в изме­рении Y, не превысит первоначальную энтропию того же опыта. В слу­чае, если измерение Y не зависит от измерения X, сведения о X не
уменьшат энтропию Y, и будет наблюдаться равенство

󰇡
󰇢
󰇛󰇜. В случае, когда результат измерения X целиком определяет по-
следующее измерений Y, энтропия Y будет равна 0: 󰇛󰇜.
Указанные соотношения позволяют ввести понятие количества информации, которое можно вычислить по следующей формуле:
󰇛 󰇜󰇛󰇜 󰇛󰇜.
Другими словами, количество информации определяется тем, насколько при осуществлении измерения X уменьшается неопределен­ность Y.
Отметим, что 󰇛󰇜 есть взвешенная сумма всех условных эн-
тропий
󰇛󰇜 󰇛󰇜, причем каждое сла-
гаемое берется с весом, равным вероятности появления соответствую­щего условного распределения. Это позволяет сделать заключение о
том, что для выборки величина 󰇛󰇜представляет собой обычное
среднее взвешенное значение условных энтропий.
Информация, как и энтропия, обладает рядом свойств
1) 󰇛 󰇜󰇛󰇜 󰇛󰇜  󰇛󰇜, а функция H(X,Y) симмет-
рична по своему определению, в силу чего 󰇛 
󰇜
является функцией,
симметричной относительно аргументов.
2) Количество информации, содержащейся в X относительно Y,
эквивалентно количеству информации, содержащейся в Y относи-
тельно X, т.е. 󰇛 󰇜󰇛󰇜 󰇛󰇜 эквивалентно равенству 󰇛 󰇜󰇛󰇜 󰇛󰇜.
Мерой энтропийной, или информационной, связи может служить
функция 󰇛 󰇜. Мера энтропийной, или информационной, связи явля-
ется ненаправленной (в силу симметричности), и для нее выполняется
соотношение 󰇛󰇜 (равенство нулю достигается в случае, когда X и Y статистически независимы и 󰇛 󰇜󰇛󰇜).
Наиболее известными коэффициентами являются асимметрич­ные коэффициенты неопределенности, или коэффициенты нормиро­ванной информации:
44

󰇛󰇜
󰇛󰇜
,
󰇛󰇜

󰇛󰇜
.
Значения этих коэффициентов лежат в диапазоне от 0 до 1. Ра­венство 0 возникает тогда, когда переменные X и Y независимы. В слу­чае, когда X однозначно определяется значением Y, значение коэффи­циентов равно 1.
Кроме указанных коэффициентов, широко используются сим­метризованный коэффициент нормированной информации
󰇛󰇜
󰇛 󰇜
󰇛󰇛󰇜󰇛󰇜󰇜
.
Его значение лежит в диапазоне от 0 до 1. Равенство коэффициента 0 возникает тогда, когда переменные X и Y независимы, а равенство ко­эффициента 1 – в случае, когда X и Y однозначно детерминируют друг друга.
Также используется и коэффициент Райского
󰇛 󰇜
󰇛󰇜
󰇛󰇜
.
Его значение также лежит в диапазоне от 0 до 1. Как и в случае симмет­ризованного коэффициента нормированной информации, равенство ко­эффициента 0 возникает тогда, когда переменные X и Y независимы, а равенство коэффициента 1 – в случае, когда X и Y однозначно детерми­нируют друг друга.
Также интересны коэффициенты связи для четырехклеточных таблиц сопряженности, построенных для двух дихотомических призна­ков33. Общий вид четырехугольной таблицы сопряженности представ­лен в табл. 7.
33
Толстова, Ю. Н. Указ. соч. С. 219–226.
45
Таблица 7
Х
Y
Итого
1 0 1 a b
a+b
0 c d
c+d
Итого
a+c
b+d
a+b+c+d
Общий вид четырехугольной таблицы сопряженности
Коэффициенты, расчет которых возможен для подобных таблиц, основаны на сравнении произведений значений в ячейках таблицы ad и bc. Если значения этих произведений близки, то это свидетельствует о наличии связи между признаками X и Y. Использование именно этих произведений объясняется эквивалентностью равенства ad=bc равен-
ству
, означающему пропорциональность столбцов (строк) таб-
лицы и соответственно отсутствие статистической связи. Структура ко­эффициентов связи, основанных на указанной логике, может использо­вать либо разность произведений ad – bc, либо отношения ad/bc.
Наиболее часто используют коэффициент ассоциации Юла и ко­эффициент контингенции.
Коэффициент ассоциации Юла рассчитывают по формуле

 
.
Диапазон изменений этого коэффициента от 1 до +1 при отсутствии ста­тистической зависимости равен нулю. Значение + 1 или –1 коэффици­ент ассоциации Юла принимает в случае равенства нулю одного из эле­ментов главной диагонали.
Коэффициент контингенции рассчитывается по формуле


󰇛󰇜󰇛󰇜󰇛󰇜󰇛󰇜
.
Диапазон изменений этого коэффициента также лежит в диапазоне от – 1 до +1, при отсутствии статистической зависимости равен нулю. Зна­чение + 1 или –1 коэффициент контингенции принимает в случае ра­венства всех элементов главной диагонали 0.
46
В заключение остановимся на мере связанности для переменных с порядковой шкалой34. В основе расчета этих критериев лежит пред­ставление о так называемом количестве нарушений порядка, или инвер­сиях I. Для определения количества инверсий следует расположить в порядке возрастания значения одной из двух переменных, между кото­рыми требуется установить степень взаимосвязи, а рядом с ними запи­сать соответствующие значения другой переменной. Число выявленных таким образом нарушений порядка расположения второй переменной и будет количеством инверсий. Кроме понятия инверсии, используется и понятие проверсии – количества соблюдений порядка Р. Количество нарушений порядка вместе с количеством соблюдений порядка исполь­зуется в различных формулах для определения меры связанности. Зада­ющие ее значения находятся в диапазоне от -1 до +1.
Рассмотрим некоторые меры связанности. γ –Статистика, измеря- ющая связь между двумя порядковыми переменными, не делает по­правку на связанные ранги. Ее расчет ведется по формуле
  


  
где I – число инверсий; P – число проверсий.
Если не наблюдается инверсий (I = 0), то зависимость полная и γ =1. Если отсутствуют проверсии и имеются только инверсии (Р = 0), то зависимость максимально разнонаправленна (γ = -1). Если число ин­версий равно числу проверсий (Р= I), то зависимости вообще не суще­ствует (γ=0).
Еще одной статистикой является d-статистика Сомера. Для сопряженной асимметричной меры связанности d-статистики Сомера
используется корректирующий член
, соответствующий количеству
связей независимой переменной:



.
34
Бююль, А. SPSS: Искусство обработки информации. Анализ статистических данных и восстановление скрытых закономерностей / А. Бююль, П. Цеффель. СПб: ООО «ДиасофтЮП», 2001. С. 200.
47
В знаменателе симметричной d-статистики Сомера стоит среднее зна­чение двух асимметричных коэффициентов.
В завершение остановимся на статистиках тау-b и тау-с Кендалла. Тау-b Кендалла – вычисляемая статистика, которая измеряет связь между двумя порядковыми переменными. Она вычисляется с учетом числа связанных рангов, и ее лучше использовать для квадратных таб­лиц:


󰇛

󰇜

.
Тау-с Кендалла лучше использовать, когда таблица переменных не квадратна, а прямоугольна:
󰇜

󰇜

󰇛  
󰇛
  
где N – общая сумма частот, m – наименьшее из количеств строк и столб- цов.
Анализ связей типа альтернатива – альтернатива
Значительная масса информации получается социологами в неупорядоченных (номинальных) и полуупорядоченных шкалах. Даже в случае, когда используется порядковая шкала, может оказаться, что анализ лучше проводить так, как будто шкала является номинальной.
Самым надежным методом анализа остается визуальный анализ условных и безусловных частот, содержащихся в таблицах сопряжен­ности признаков. Техника работы при этом проста: производится под­счет условных частот, связывающих значения переменных, и эти услов­ные частоты сравниваются между собой. Интерпретация этих величин условных частот как показателей направленной связи между значени­ями признаков и позволяет сделать необходимые выводы. Например, если среди студентов, обучающихся по гуманитарным направлениям, процент подрабатывающих в свободное от учебы время больше, чем среди студентов, обучающихся по техническим направлениям, то дела­ется вывод, что направление подготовки влияет на подработку, причем студенты, обучающиеся по гуманитарным направлениям, склонны под­рабатывать больше, чем студенты, обучающиеся по техническим
48
направлениям. Приведенный пример показывает, что задача анализа
b1
b2
bn
a1
d
11 d12
d1n
a2
d
21 d22
d2n
an
d
n1 dn2
dnn
b1
a1
d
11 D12

D
21 D22
двумерных таблиц сопряженности, кажется, не представляет особой сложности35.
В то же время следует помнить, что в задачах такого плана мы имеем дело с отдельными альтернативами рассматриваемых признаков и изучаем локальные связи между ними. Связь в данном случае пони­мается как некоторое отношение между двумя конкретными градаци­ями а и b признаков х и у соответственно. Связь является сильной, если есть вероятность того, что для некоторого объекта первый признак при­нимает значение а, с большой вероятностью следует, что второй при­знак для того же объекта принимает значение b. Связь слабая, если ана- логичная вероятность мала. Для изучения локальной связи можно ис­пользовать коэффициенты связи, но прежде необходимо перейти от таблицы сопряженности произвольного размера (рис. 13) к таблице со­пряженности 2x2. Так, пусть мы имеем дело с группой респондентов, каждый из которых обладает свойствами a1, a2, …, an, которые могут проявлять поведение b1, b2, …, bn. Связь между свойствами и поведе­нием при этом будет представлена таблицей сопряженности (рис. 14). Понятно, что, если нас будет интересовать связь между свойством a1 и поведением b1, мы можем обратиться к таблице сопряженности между
свойствами  и  и поведением  и
. Если анализ двумерных таблиц
Рис. 13. Таблица сопряженности по переменным a и b
Рис. 14. Преобразованная таблица сопряженности по переменным
a и b относительно a1 и b1
35
Чесноков, С. В. Детерминационный анализ социально-экономических данных.
М.: Книжный дом «Либроком», 2009. С. 23–29.
49
несложен, то проанализировать подобным образом трехмерные таб-
y y≠b
300
200
y=b
100
400
x=a
x≠a
x
лицы сопряженности и таблицы сопряженности большей размерности уже затруднительно. Здесь необходимо использовать специальный ме­тод – детерминационный анализ.
Рассмотрим основные положения детерминационнного анализа. Предположим, что в процессе проведения социологического исследо­вания из группы всех обследуемых выделена группа обладающих свой­ством a, а затем выясняется, что из выделенной группы p% респонден­тов демонстрируют поведение b. Если рассматривать эту ситуацию в
терминах детерминационного анализа, то имеется детерминация a→b c интенсивностью I(a→b)=p%. В данном случае детерминация является
высказыванием «если a, то b», которому приписывается интенсивность I(a→b), отражающая его точность или истинность. Рассмотрим и обрат-
ную ситуацию. Допустим, в процессе проведения социологического ис­следования установлено, что среди респондентов, демонстрирующих тип поведения b, доля тех, кто обладает свойством a, составляет q%. В терминах детерминационного анализа это означает, что имеется детер-
минация a→b c емкостью С(a→b)= q%. Эта детерминация показывает долю случаев реализации поведения b, которая объясняется высказыва-
нием «из а следует b». Емкость С(a→b) отражает, насколько всеобъем­лющим является объяснение, построенное на детерминации a→b, или
полноту детерминации.
Покажем, как с помощью детерминационного анализа прово­дится анализ двумерных таблиц сопряженности. Пусть мы имеем дву­мерную таблицу сопряженности по переменным x и у, изображенную на рис. 15.
Рис. 15. Таблица сопряженности 2х2 по переменным x и у. Объем выборки
n=1000
Каждая клетка рассматриваемой таблицы характеризуется:
– абсолютной величиной числа, которое в ней находится;
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]