Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ данных в социологии. Учебно-методическое пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
– долей в % относительно суммы чисел в столбце (условной ча­стотой по столбцу);
– долей в % относительно суммы чисел в строке (условной часто­той по строке);
Каждая клетка данной таблицы рассматривается как изображе­ние прямой и обратной детерминаций, а условные частоты по строке и столбцу – как интенсивность и емкость.
Рассмотрим клетку на пересечении столбца x=a и строки y=b. Она соответствует двум детерминациям: a→b и b→a.
Для детерминации a→b интенсивность и емкость равны соответ­ственно
󰇛󰇜󰇛󰇜

,

󰇛󰇜󰇛󰇜

.

Для детерминации b→a интенсивность и емкость находятся ана­логичным образом:
󰇛󰇜󰇛󰇜
Очевидно, что
Интенсивность и емкость детерминации изменяются от нуля до единицы:
  
󰇛󰇜󰇛󰇜
󰇛󰇜󰇛󰇜
󰇛󰇜󰇛󰇜.
󰇛󰇜



.

󰇛󰇜.
При проведении анализа данных важно учитывать как интенсив­ность, так и емкость детерминации. Учет только одного показателя мо­жет обернуться ошибкой.
51
Любую многомерную таблицу сопряженности можно преобразо-
z

0
150
350
0
c
100
100
100
200
 
 
 
 
x y
z

0
150
350
0
c
100
100
100
200




xу
z

0 0 0
200

0
0
450
0

0
250 0 0

100 0 0
0
 
 
 
 
x y
вать в двумерную за счет операции свертки (произведения переменных) и анализировать как двумерную. Так, например, трехмерная таблица сопряженности, изображенная на рис. 16 (представленная в двумерном виде), может быть преобразована в двумерную таблицу сопряженности
за счет перехода к переменным xy, z (рис. 17). , , и 
в данном
случае являются значениями переменной xy, которая называется произ- ведением переменных x и y.
Рис. 16. Трехмерная таблица сопряженности по переменным x, у, z.
Представление в двумерном виде
Рис. 17. Двумерная таблица сопряженности по переменным xy, z
Таблица сопряженности по переменным xy, x и у имеет вид, пред- ставленный на рис. 18.
Рис. 18. Таблица сопряженности по переменным xy, x, y
52
Произведение xy является взаимно однозначной функцией от пе-
x

100
150
200
0
a
100
0
100
350




zу
y
100
200
350
0
b
100
100
0
150




xz
ременных х и y, или, другими словами, xy=f(x, y). Соответствия (x, y) xy, образующие эту функцию, являются точными и полными
детерминациями:
I((x,y) xy)=C((x,y) xy)=1.
Могут быть построены таблицы сопряженности и для перемен­ных x, zy и y, xz (рис. 19 и рис. 20).
Рис. 19. Таблица сопряженности по переменным x, zy
Рис. 20. Таблица сопряженности по переменным y, xz
Анализ связей типа группа альтернатив – группа альтернатив
Встречаются ситуации, когда вместо отдельных альтернатив имеются целые группы. В этом случае мы имеем дело со связями типа группа альтернатив – группа альтернатив. В рамках таких задач возни­кает необходимость изучения зависимости между свойствами A1, A2, …, An и свойствами B1, B2, …, Bn. Решение поставленной задачи до­вольно простое: необходимо рассмотреть отвечающую альтернативам подтаблицу исходной таблицы сопряженности, применяя способы из­мерения связей между двумя номинальными признаками. Однако ис­следовательские задачи могут быть сложнее. Например, может потре­боваться найти подтаблицы исходной таблицы сопряженности, облада­ющие наибольшими коэффициентами сопряженности (или каким-либо
53
другим свойством, отличающим эти подтаблицы от исходной таблицы сопряженности или от других подтаблиц), и т.д. В зависимости от цели, поставленной исследователем, при анализе связей подобного рода вы­деляются два класса методов36.
Первый класс методов – группа альтернатив, отвечающих од­ному признаку. В таких случаях группа альтернатив состоит из значе­ний одного признака. Таким образом, исходная информация представ­ляет собой таблицу сопряженности между двумя признаками, отвечаю­щими двум группам альтернатив. Допустимо выделение двух подклас­сов задач. Первый подкласс задач опирается на методы математиче­ской статистики, и в нем выясняется, из каких компонент состоит вели­чина
2
, вычисленная для рассматриваемой частотной таблицы (и какой вклад в нее вносят разные подтаблицы таблицы сопряженности). Для соответствующих задач установлены строгие правила перенесения ре­зультатов с выборочной совокупности на генеральную. Второй под­класс методов составляют задачи, основанные на методах анализа дан­ных. Они связаны с поиском таких подтаблиц исходной таблицы, кото­рые отличаются наиболее сильной связью (понимаемой в каком-нибудь из известных нам смыслов) между определяющими эти подтаблицы группами альтернатив и решаются простым перебором всевозможных подтаблиц и вычислением отвечающих им показателей связи.
Второй класс методов – группа альтернатив, отвечающих разным признакам. Методы этого класса в силу отсутствия разработанного строгого математико-статистического подхода представлены типич­ными методами анализа данных.
Рассмотрим задачу, относящуюся к первому подклассу мето-
37
дов
. Попробуем разложить величину  вычисленную для рассматри-
ваемой таблицы сопряженности, на части, отвечающие подтаблицам таблицы сопряженности. Существует возможность такого разложения исходной таблицы сопряженности на четырехклеточные подтаблицы,
что исходное значение статистики
будет приблизительно равно
сумме значений статистик для четырехклеточных таблиц, число ко-
торых равно числу степеней свободы исходной таблицы:

36
Толстова, Ю. Н. Указ. соч. С. 243–244.
37
Там же. С. 244–256.
54
Величина
– величина отклонения частот, которые имели бы место при условии статистической независимости рассматриваемых признаков при пропорциональности столбцов (строк) таблицы сопря­женности (их называют ожидаемыми частотами или теоретическими
частотами), от наблюдаемых или эмпирических частот. При расчете
происходит суммирование таких отклонений, причем они могут быть разными – ожидаемые частоты могут совпадать с наблюдаемыми или, напротив, сильно отличаться друг от друга. Такое отличие наблюдается и для отдельных фрагментов исходной таблицы сопряженности.
Указанное ранее соотношение показывает, какой вклад в общее
отклонение частот от условия статистической независимости дают
фрагменты такого рода. Если все значения статистики
для четырех-
клеточных подтаблицы превышают (или не превышают) соответствую-
щие табличные критические значения статистики
(т.е. гипотеза о не­зависимости соответствующих пар альтернатив отвергается или прини­мается для всех четырехклеточных подтаблиц), то в таком случае и зна-
чение статистики
исходной таблицы сопряженности превышает (или не превышает) отвечающее ему табличное критическое значение, и можно считать, что отклонение (принятие) нулевой гипотезы равно­мерно опирается на все значения рассматриваемых признаков. Отсюда можно сделать вывод, что никаких интересующих нас подсвязей исход­ная таблица сопряженности не содержит.
Гораздо более интересная ситуация получается, если значения
статистики  для одних четырехклеточных подтаблиц будут превы-
шать соответствующее критическое значение, а для других не будут. Поэтому из всей совокупности полученных четырехклеточных подтаб-
лиц только для подтаблиц со значениями статистики
, превышаю-
щими критическое значение, отклоняется нулевая гипотеза, и получа-
ется, что значение статистики
для исходной таблицы сопряженности отличается от нуля (показывает отклонение ситуации от состояния ста­тистической независимости признаков) за счет наличия связи именно в
этих подтаблицах. Подтаблицы со значениями статистики
, не пре­вышающими критического значения, к наличию связи не имеют отно­шения.
Разложение исходной таблицы сопряженности на четырехкле­точные подтаблицы производится по определенным правилам. Подтаб­лицы получаются не только за счет выделения соответствующего фраг-
55
мента из исходной таблицы сопряженности, но и в результате сумми-
b1
a1
d
11 D12

D
21 D22
рования определенных строк и столбцов последней. Примером может служить таблица, фрагмент которой представлен на рис. 21, где D12=d12+… + d1n, D21=d21+… + dn1, D21=d22+… + d2n+…+ dn2+… + dnn.
Рис. 21. Четырехклеточный фрагмент таблицы
Учитывая это, а также то, что понятие маргинальной суммы имеет смысл не только для исходной таблицы, но и для всех ее подтаб­лиц, сформулируем правила получения четырехклеточных подтаблиц:
1. Каждая из частот исходной таблицы сопряженности должна
встречаться только в одной из подтаблиц.
2. Маргинальные частоты исходной таблицы сопряженности должны встречаться в одной из подтаблиц как частоты определенного типа – либо как стоящие в клетке частотной таблицы, либо как марги­нальные.
3. Каждая частота, содержащаяся в одной из подтаблиц, но отсут­ствующая в исходной таблице, должна появиться в другой компонент­ной таблице как частота другого типа – клеточная, если была марги­нальной, и наоборот.
Указанные правила не определяют разложение однозначным об­разом, при выборе разложения руководствуются в первую очередь со­держательными соображениями.
Интерес представляет и ситуация, когда группы альтернатив со­ставляются из значений разных признаков38. Как поступают в этом слу­чае? Для изучения причинно-следственных отношений необходимо вы­делить признаки, описывающие исследуемое явление, и признаки, яв­ляющиеся причинами, обусловливающими наблюдаемый вид явления. Признаки, описывающие исследуемое явление, выступают в качестве зависимых переменных (обозначаются как Y1, Y2, …, Yn). Признаки, яв­ляющиеся причинами, обусловливающими наблюдаемый вид явления, выступают в качестве независимых переменных (обозначаются как Х1, Х2, …, Хn). Взаимосвязь между двумя группами признаков выражется соотношением
38
Толстова, Ю. Н. Указ. соч. С. 256–260.
56
Y1=f(Х1, Х2, …, Хn) Y2=f(Х1, Х2, …, Хn)
….
Yn=f(Х1, Х2, …, Хn).
Типичным примером такой задачи является выявление того, ка­кими факторами обусловлен определенный тип поведения респон­дента. Рассматриваемое поведение описывается некоторым признаком Yk. Необходимо определить, какими характеристиками (сочетаниями значений рассматриваемых признаков) могут быть описаны респон­денты, обладающие рассматриваемым поведением. В рамках социоло­гического исследования мы можем оперировать лишь ответами респон­дентов на вопросы анкеты, задающими значения независимых перемен­ных. Решение задачи кажется простым – необходимо осуществить пе­ребор всех значений рассматриваемых признаков и найти среди них та­кие, обладателям которых присуще рассматриваемое поведение. Од­нако необходимо принимать во внимание, что объем выборочных сово­купностей в социологических исследованиях довольно велик – от не­скольких сотен до нескольких тысяч респондентов. При этом слож­ность задачи усугубляется неопределенностью. Неизвестен набор необ­ходимых для решения задачи признаков, неизвестно их необходимое количество, не ясно, какие сочетания значений каждого признака должны быть учтены. Таким образом, возникает необходимость в раз­работке алгоритма «сокращенного» перебора, пропускающего опреде­ленные сочетания независимых признаков в зависимости от заложен­ной модели, обусловленной пониманием поведения объекта.
Будем называть группу респондентов типом (относительно про­явления интересующего поведения), если для нее удовлетворяется вы­бранный критерий. Простейший алгоритм «сокращенного» перебора работает следующим образом. Осуществляется перебор всевозможных сочетаний значений рассматриваемых признаков, и для каждого прово­дится проверка на возможность приписать соответствующей совокуп­ности объектов определенный тип поведения. Если такой тип поведе­ния приписать можно, то считается, что решение поставленной задачи найдено и группу можно назвать типом, если нет – производится пере­ход к проверке следующего сочетания значений аргументов. Однако остается неясным, при каких условиях допустимо считать, что найдена группа, которую можно назвать типом, прежде всего из-за того, что не-
57
понятна доля респондентов, проявляющих изучаемое поведение, необ­ходимая для такого вывода. Таким образом, задача сводится к поиску взаимодействий – сочетаний значений независимых признаков, детер­минирующих определенным образом заданное поведение респонден­тов. Решаться эта задача может путем применения различных алгорит­мов39.
Алгоритм THAID исходит из того, что задан некоторый номи­нальный признак Y с несколькими альтернативами. Для каждой прове­ряемой группы объектов вычисляется распределение входящих в нее респондентов по этому признаку, подсчитывается соответствующее модальное значение и определяется доля его встречаемости. Соответ­ствующий процент служит оценкой качества группы, определяя воз­можность рассматривать ее как тип. Рассмотрим работу по этому алго­ритму, которая осуществляется в несколько этапов.
Этап 1. Работа с каждым признаком происходит отдельно. Например, выбирается признак A. Перебираются варианты разбиения всех его альтернатив следующим образом: первая – все остальные; пер­вая и вторая – все остальные; первая, вторая, третья – все остальные и т. д. до последнего варианта, все, кроме последней, – последняя. Для оценки качества всего разбиения (а это сумма оценок качества каждой из двух групп, получающихся при одном разбиении одного признака) используется формула
   
,
где n1 – число человек в первой группе; P1 – доля модальной частоты для первой группы; n2 – число человек во второй группе; P2 – доля мо­дальной частоты для второй группы. Выбираем разбиение с наилучшей оценкой качества разбиения.
Этап 2. Берутся респонденты первой группы, с которыми осу­ществляются те же действия, что ранее осуществлялись со всеми ре­спондентами. Выбирается самое хорошее разбиение совокупности ре­спондентов по новому признаку, например признаку Б. Аналогичная операция производится и для второй группы респондентов. Таким об­разом, получаются четыре группы респондентов (рис. 22).
Этап 3. Каждая из четырех групп респондентов делится на две путем указанных выше операций.
39
Толстова, Ю. Н. Указ. соч. С. 260–269.
58
Рис. 22. Результат действия алгоритма THAID
Причины останова работы алгоритма:
1) Найдена группа, в которой доля модальной частоты достато-
точно велика (например, 95 %).
2) Получена слишком малочисленная группа.
3) Получена слишком длинная цепочка.
4) Не найдено ни одной совокупности с интересующими нас
свойствами.
Наряду с описанным алгоритмом может быть использован и ал­горитм CHAID (Chi Squared Automatic Interaction Detection). При работе по этому алгоритму, как и при работе с алгоритмом ТHAID, задается номинальный признак-функция Y, аналогичен и подход к пониманию поведения каждого респондента. Отличие же состоит в оценке группо­вого поведения, которое ассоциируется со всем распределением этого признака. Процесс работы по алгоритму CHAID состоит из тех же эта­пов, что и процесс работы по алгоритму ТHAID.
Анализ связей типа признак – группа признаков
Предположим, что мы имеем признаки X и Y и хотим установить наличие зависимости между ними40. Допустим, что группа признаков состоит из признака X. О наличии связи между признаками свидетель­ствует коэффициент корреляции. Причем, чем ближе значение модуля коэффициента корреляции к 1, тем более сильной является связь между признаками. При этом с большей уверенностью мы можем полагать,
40
Толстова, Ю. Н. Указ. соч. С. 293–306.
59
что с изменением значений одного признака изменяются значения и другого признака. В то же время невозможно установить, в какой сте­пени возрастет значение признака Y при некотором увеличении при­знака X. Чтобы делать такие прогнозы, необходимо установить форму связи между переменными, т. е. найти функцию вида Y = f (X). Важно отметить, что речь идет именно о зависимости значения Y от X, так как отношение между ними несимметрично. В рамках поставленной задачи независимая переменная Х называется входной, экзогенной, внешней, а зависимая переменная Y – выходной, эндогенной, внутренней.
Нахождение функции f (X) основано на использовании модели связи между переменными, опирающейся на линейный регрессионный анализ. В результате использования линейного регрессионного анализа формируется модель реальности, в которой значения признака Y нахо­дятся на основе информации о значениях признака X. Сами значения признака при этом от модели не зависят, но определяют конкретный вид искомой зависимости. Значения зависимой переменной Y, напро­тив, целиком и полностью определяются исключительно используемой моделью.
Важно отметить, что в рамках регрессионного анализа искомая зависимость Y = f (X) статична, а не функциональна. В качестве неза­висимой переменной выступают некоторые условные средние значения Y, вычисленные для конкретного значения независимой переменной Х.
В принципе, следует отдавать себе отчет, что для социологиче­ских данных ситуация, когда одному значению Х соответствует множе­ство значений Y, является типичной. Поэтому для нахождения зависи­мости для каждого значения Х приходится производить подсчет сред­него арифметическое значения всех отвечающих ему значений Y и изу­чать зависимость от Х именно таких средних:
󰇛
󰇜
.
Однако в данном случае речь идет о выборочной ситуации, а нам необходимо установить зависимость для генеральной совокупности, а ее переменные имеют бесконечное число значений. Вышеприведенное соотношение для генеральной совокупности может быть записано в следующем виде:
󰇛 
󰇛󰇜,
󰇜
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]