Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Анализ данных в социологии. Учебно-методическое пособие
.pdf
n
С
+
=
2
2
,
)1(),1min(
2
−−
=
cr
n
V
где n – размер выборки.
Как и коэффициент корреляции φ, коэффициент сопряженности
признаков C принимает значение 0, если связь между переменными отсутствует и стремится к значению 1, но никогда его не достигает, если
связь является сильной.
Еще одной статистикой, которую можно вычислить для измерения тесноты связи в таблицах любого размера, является V-коэффициент
Крамера. Он получается корректировкой коэффициента корреляции φ
или по числу рядов, или по числу столбцов таблицы, причем выбирается меньшее значение.
V-коэффициент Крамера рассчитывается по формуле
,
где n – размер выборки; r – число сток; c – число столбцов.
V-коэффициент Крамера принимает значение 0, если связь между
переменными отсутствует, и значение 1 – если связь является сильной.
Перейдем к описанию коэффициентов парной связи, которые основаны на других априорных моделях. К ним относятся, например, коэффициенты связи, основанные на моделях прогноза31.
Совершенно очевидно, что если существует связь между двумя
номинальными признаками, то знание значений одного признака позволяет улучшить прогноз значения другого признака. Коэффициенты
связи, основанные на прогнозе, являются мерой улучшения качества
прогноза значения одного признака на основе информации о значении
другого признака по сравнению с ситуацией, когда значение другого
признака неизвестно вовсе.
Следует отметить, что существуют два подхода к формализации
понятия прогноза – модальный и пропорциональный. Наиболее часто
используется первый. Mодальный подход исходит из того, что при выборе произвольного объекта и наличии информации о распределении
рассматриваемого признака делается вывод о том, что для выбранного
31
Толстова, Ю. Н. Указ. соч. С. 206–211.
41

объекта этот признак принимает модальное значение, т. е. то значение,
которое встречается с максимальной частотой и соответственно имеет
максимальную вероятность. Коэффициентов, основанных на модальном прогнозе, три: два из них отражают направления связи (асимметрические коэффициенты λ), а третий является их усреднением (симмет-
ричный коэффициент λ).
Асимметрический коэффициент λ является мерой выраженного в
процентах улучшения прогнозирования значения зависимой переменной при данном значении независимой переменной. Расчет возможен в
двух вариантах: когда X – независимая переменная, а Y – зависимая
(прогноз значения Y по значению X) и, наоборот, когда Y – независимая
переменная, а X – зависимая (прогноз значения X по значению Y)
Формулы для расчета коэффициентов λ:
где – наибольшая частота в i-й строке;
– наибольшая
столбцовая маргинальная (итоговая) частота; r – число строк; n – объем
выборки;
где – наибольшая частота в j-м столбце;
– наибольшая
строковая маргинальная (итоговая) частота; с – число столбцов; n –
объем выборки.
Значения коэффициента λ лежат в пределах от 0 до 1. Значение λ,
равное 0, означает, что никакого улучшения в прогнозировании не
наблюдается. Значение λ, равное 1, указывает на то, что прогноз может
быть сделан без ошибки. Это происходит в случае, когда каждая категория независимой переменной связана с одной категорией зависимой
переменной.
Также рассчитывают симметричный коэффициент λ – среднее
значением двух асимметричных значений:
42
.

Симметричный коэффициент λ не делает предположения о том, какая
из переменных зависимая, и измеряет общее улучшение прогнозирования, когда прогноз уже выполнен в обоих направлениях.
Еще одна интересная группа коэффициентов связи – коэффициенты, основанные на понятии энтропии32. Чтобы понять их смысл, обратимся к понятию энтропии.
В случае двумерного распределения энтропия определяется в
следующем виде:
.
Приняв, что , приходим к выражению в следую-
щем виде:
.
Аналогичным образом можно определить энтропию для
n-мерного распределения.
Условная энтропия определяется в следующем виде:
.
Энтропия обладает следующими свойствами:
1) ;
2) ;
3) .
Понятием, противоположным энтропии, является понятие информации, приобретение которой способствует уменьшению неопределенности. Количество информации можно измерять степенью умень-
шения энтропии. Пусть величина характеризует неопределенность распределения Y. В ситуации, когда , можно говорить
об известном заранее исходе опыта. Если , то это свидетельствует об определенной зависящей от величины
проблематично-
сти результата опыта. Уменьшение исходов опыта, а следовательно,
32
Толстова, Ю. Н. Указ. соч. С. 213–219.
43

уменьшение степени неопределенности опыта возможно за счет измерения признака X, предшествующего опыту по измерению Y.
При измерении X условная энтропия опыта, состоящего в измерении Y, не превысит первоначальную энтропию того же опыта. В случае, если измерение Y не зависит от измерения X, сведения о X не
уменьшат энтропию Y, и будет наблюдаться равенство
. В случае, когда результат измерения X целиком определяет по-
следующее измерений Y, энтропия Y будет равна 0: .
Указанные соотношения позволяют ввести понятие количества
информации, которое можно вычислить по следующей формуле:
.
Другими словами, количество информации определяется тем,
насколько при осуществлении измерения X уменьшается неопределенность Y.
Отметим, что есть взвешенная сумма всех условных эн-
тропий
, причем каждое сла-
гаемое берется с весом, равным вероятности появления соответствующего условного распределения. Это позволяет сделать заключение о
том, что для выборки величина представляет собой обычное
среднее взвешенное значение условных энтропий.
Информация, как и энтропия, обладает рядом свойств
1) , а функция H(X,Y) симмет-
рична по своему определению, в силу чего
является функцией,
симметричной относительно аргументов.
2) Количество информации, содержащейся в X относительно Y,
эквивалентно количеству информации, содержащейся в Y относи-
тельно X, т.е. эквивалентно равенству
.
Мерой энтропийной, или информационной, связи может служить
функция . Мера энтропийной, или информационной, связи явля-
ется ненаправленной (в силу симметричности), и для нее выполняется
соотношение (равенство нулю достигается в случае, когда
X и Y статистически независимы и ).
Наиболее известными коэффициентами являются асимметричные коэффициенты неопределенности, или коэффициенты нормированной информации:
44

,
.
Значения этих коэффициентов лежат в диапазоне от 0 до 1. Равенство 0 возникает тогда, когда переменные X и Y независимы. В случае, когда X однозначно определяется значением Y, значение коэффициентов равно 1.
Кроме указанных коэффициентов, широко используются симметризованный коэффициент нормированной информации
.
Его значение лежит в диапазоне от 0 до 1. Равенство коэффициента 0
возникает тогда, когда переменные X и Y независимы, а равенство коэффициента 1 – в случае, когда X и Y однозначно детерминируют друг
друга.
Также используется и коэффициент Райского
.
Его значение также лежит в диапазоне от 0 до 1. Как и в случае симметризованного коэффициента нормированной информации, равенство коэффициента 0 возникает тогда, когда переменные X и Y независимы, а
равенство коэффициента 1 – в случае, когда X и Y однозначно детерминируют друг друга.
Также интересны коэффициенты связи для четырехклеточных
таблиц сопряженности, построенных для двух дихотомических признаков33. Общий вид четырехугольной таблицы сопряженности представлен в табл. 7.
33
Толстова, Ю. Н. Указ. соч. С. 219–226.
45

Таблица 7
Х
Y
Итого
1 0 1 a b
a+b
0 c d
c+d
Итого
a+c
b+d
a+b+c+d
Общий вид четырехугольной таблицы сопряженности
Коэффициенты, расчет которых возможен для подобных таблиц,
основаны на сравнении произведений значений в ячейках таблицы ad
и bc. Если значения этих произведений близки, то это свидетельствует
о наличии связи между признаками X и Y. Использование именно этих
произведений объясняется эквивалентностью равенства ad=bc равен-
ству
, означающему пропорциональность столбцов (строк) таб-
лицы и соответственно отсутствие статистической связи. Структура коэффициентов связи, основанных на указанной логике, может использовать либо разность произведений ad – bc, либо отношения ad/bc.
Наиболее часто используют коэффициент ассоциации Юла и коэффициент контингенции.
Коэффициент ассоциации Юла рассчитывают по формуле
.
Диапазон изменений этого коэффициента от 1 до +1 при отсутствии статистической зависимости равен нулю. Значение + 1 или –1 коэффициент ассоциации Юла принимает в случае равенства нулю одного из элементов главной диагонали.
Коэффициент контингенции рассчитывается по формуле
.
Диапазон изменений этого коэффициента также лежит в диапазоне от
– 1 до +1, при отсутствии статистической зависимости равен нулю. Значение + 1 или –1 коэффициент контингенции принимает в случае равенства всех элементов главной диагонали 0.
46

В заключение остановимся на мере связанности для переменных
с порядковой шкалой34. В основе расчета этих критериев лежит представление о так называемом количестве нарушений порядка, или инверсиях I. Для определения количества инверсий следует расположить в
порядке возрастания значения одной из двух переменных, между которыми требуется установить степень взаимосвязи, а рядом с ними записать соответствующие значения другой переменной. Число выявленных
таким образом нарушений порядка расположения второй переменной и
будет количеством инверсий. Кроме понятия инверсии, используется и
понятие проверсии – количества соблюдений порядка Р. Количество
нарушений порядка вместе с количеством соблюдений порядка используется в различных формулах для определения меры связанности. Задающие ее значения находятся в диапазоне от -1 до +1.
Рассмотрим некоторые меры связанности. γ –Статистика, измеря-
ющая связь между двумя порядковыми переменными, не делает поправку на связанные ранги. Ее расчет ведется по формуле
где I – число инверсий; P – число проверсий.
Если не наблюдается инверсий (I = 0), то зависимость полная и
γ =1. Если отсутствуют проверсии и имеются только инверсии (Р = 0),
то зависимость максимально разнонаправленна (γ = -1). Если число инверсий равно числу проверсий (Р= I), то зависимости вообще не существует (γ=0).
Еще одной статистикой является d-статистика Сомера. Для
сопряженной асимметричной меры связанности d-статистики Сомера
используется корректирующий член
, соответствующий количеству
связей независимой переменной:
.
34
Бююль, А. SPSS: Искусство обработки информации. Анализ статистических
данных и восстановление скрытых закономерностей / А. Бююль, П. Цеффель.
СПб: ООО «ДиасофтЮП», 2001. С. 200.
47

В знаменателе симметричной d-статистики Сомера стоит среднее значение двух асимметричных коэффициентов.
В завершение остановимся на статистиках тау-b и тау-с Кендалла.
Тау-b Кендалла – вычисляемая статистика, которая измеряет связь
между двумя порядковыми переменными. Она вычисляется с учетом
числа связанных рангов, и ее лучше использовать для квадратных таблиц:
.
Тау-с Кендалла лучше использовать, когда таблица переменных
не квадратна, а прямоугольна:
где N – общая сумма частот, m – наименьшее из количеств строк и столб-
цов.
Анализ связей типа альтернатива – альтернатива
Значительная масса информации получается социологами в
неупорядоченных (номинальных) и полуупорядоченных шкалах. Даже
в случае, когда используется порядковая шкала, может оказаться, что
анализ лучше проводить так, как будто шкала является номинальной.
Самым надежным методом анализа остается визуальный анализ
условных и безусловных частот, содержащихся в таблицах сопряженности признаков. Техника работы при этом проста: производится подсчет условных частот, связывающих значения переменных, и эти условные частоты сравниваются между собой. Интерпретация этих величин
условных частот как показателей направленной связи между значениями признаков и позволяет сделать необходимые выводы. Например,
если среди студентов, обучающихся по гуманитарным направлениям,
процент подрабатывающих в свободное от учебы время больше, чем
среди студентов, обучающихся по техническим направлениям, то делается вывод, что направление подготовки влияет на подработку, причем
студенты, обучающиеся по гуманитарным направлениям, склонны подрабатывать больше, чем студенты, обучающиеся по техническим
48

направлениям. Приведенный пример показывает, что задача анализа
b1
b2
…
bn
a1
d
11 d12
…
d1n
a2
d
21 d22
…
d2n
…
…
…
…
…
an
d
n1 dn2
…
dnn
b1
a1
d
11 D12
D
21 D22
двумерных таблиц сопряженности, кажется, не представляет особой
сложности35.
В то же время следует помнить, что в задачах такого плана мы
имеем дело с отдельными альтернативами рассматриваемых признаков
и изучаем локальные связи между ними. Связь в данном случае понимается как некоторое отношение между двумя конкретными градациями а и b признаков х и у соответственно. Связь является сильной, если
есть вероятность того, что для некоторого объекта первый признак принимает значение а, с большой вероятностью следует, что второй признак для того же объекта принимает значение b. Связь слабая, если ана-
логичная вероятность мала. Для изучения локальной связи можно использовать коэффициенты связи, но прежде необходимо перейти от
таблицы сопряженности произвольного размера (рис. 13) к таблице сопряженности 2x2. Так, пусть мы имеем дело с группой респондентов,
каждый из которых обладает свойствами a1, a2, …, an, которые могут
проявлять поведение b1, b2, …, bn. Связь между свойствами и поведением при этом будет представлена таблицей сопряженности (рис. 14).
Понятно, что, если нас будет интересовать связь между свойством a1 и
поведением b1, мы можем обратиться к таблице сопряженности между
свойствами и и поведением и
. Если анализ двумерных таблиц
Рис. 13. Таблица сопряженности по переменным a и b
Рис. 14. Преобразованная таблица сопряженности по переменным
a и b относительно a1 и b1
35
Чесноков, С. В. Детерминационный анализ социально-экономических данных.
М.: Книжный дом «Либроком», 2009. С. 23–29.
49

несложен, то проанализировать подобным образом трехмерные таб-
y y≠b
300
200
y=b
100
400
x=a
x≠a
x
лицы сопряженности и таблицы сопряженности большей размерности
уже затруднительно. Здесь необходимо использовать специальный метод – детерминационный анализ.
Рассмотрим основные положения детерминационнного анализа.
Предположим, что в процессе проведения социологического исследования из группы всех обследуемых выделена группа обладающих свойством a, а затем выясняется, что из выделенной группы p% респондентов демонстрируют поведение b. Если рассматривать эту ситуацию в
терминах детерминационного анализа, то имеется детерминация a→b c
интенсивностью I(a→b)=p%. В данном случае детерминация является
высказыванием «если a, то b», которому приписывается интенсивность
I(a→b), отражающая его точность или истинность. Рассмотрим и обрат-
ную ситуацию. Допустим, в процессе проведения социологического исследования установлено, что среди респондентов, демонстрирующих
тип поведения b, доля тех, кто обладает свойством a, составляет q%. В
терминах детерминационного анализа это означает, что имеется детер-
минация a→b c емкостью С(a→b)= q%. Эта детерминация показывает
долю случаев реализации поведения b, которая объясняется высказыва-
нием «из а следует b». Емкость С(a→b) отражает, насколько всеобъемлющим является объяснение, построенное на детерминации a→b, или
полноту детерминации.
Покажем, как с помощью детерминационного анализа проводится анализ двумерных таблиц сопряженности. Пусть мы имеем двумерную таблицу сопряженности по переменным x и у, изображенную
на рис. 15.
Рис. 15. Таблица сопряженности 2х2 по переменным x и у. Объем выборки
n=1000
Каждая клетка рассматриваемой таблицы характеризуется:
– абсолютной величиной числа, которое в ней находится;
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
