Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Анализ данных в социологии. Учебно-методическое пособие
.pdf
– долей в % относительно суммы чисел в столбце (условной частотой по столбцу);
– долей в % относительно суммы чисел в строке (условной частотой по строке);
Каждая клетка данной таблицы рассматривается как изображение прямой и обратной детерминаций, а условные частоты по строке и
столбцу – как интенсивность и емкость.
Рассмотрим клетку на пересечении столбца x=a и строки y=b.
Она соответствует двум детерминациям: a→b и b→a.
Для детерминации a→b интенсивность и емкость равны соответственно
,
.
Для детерминации b→a интенсивность и емкость находятся аналогичным образом:
Очевидно, что
Интенсивность и емкость детерминации изменяются от нуля до
единицы:
.
.
.
При проведении анализа данных важно учитывать как интенсивность, так и емкость детерминации. Учет только одного показателя может обернуться ошибкой.
51

Любую многомерную таблицу сопряженности можно преобразо-
z
0
150
350
0
c
100
100
100
200
x
y
z
0
150
350
0
c
100
100
100
200
xу
z
0 0 0
200
0
0
450
0
0
250 0 0
100 0 0
0
x
y
вать в двумерную за счет операции свертки (произведения переменных)
и анализировать как двумерную. Так, например, трехмерная таблица
сопряженности, изображенная на рис. 16 (представленная в двумерном
виде), может быть преобразована в двумерную таблицу сопряженности
за счет перехода к переменным xy, z (рис. 17). , , и
в данном
случае являются значениями переменной xy, которая называется произ-
ведением переменных x и y.
Рис. 16. Трехмерная таблица сопряженности по переменным x, у, z.
Представление в двумерном виде
Рис. 17. Двумерная таблица сопряженности по переменным xy, z
Таблица сопряженности по переменным xy, x и у имеет вид, пред-
ставленный на рис. 18.
Рис. 18. Таблица сопряженности по переменным xy, x, y
52

Произведение xy является взаимно однозначной функцией от пе-
x
100
150
200
0
a
100
0
100
350
zу
y
100
200
350
0
b
100
100
0
150
xz
ременных х и y, или, другими словами, xy=f(x, y). Соответствия
(x, y) →xy, образующие эту функцию, являются точными и полными
детерминациями:
I((x,y) → xy)=C((x,y) → xy)=1.
Могут быть построены таблицы сопряженности и для переменных x, zy и y, xz (рис. 19 и рис. 20).
Рис. 19. Таблица сопряженности по переменным x, zy
Рис. 20. Таблица сопряженности по переменным y, xz
Анализ связей типа группа альтернатив – группа альтернатив
Встречаются ситуации, когда вместо отдельных альтернатив
имеются целые группы. В этом случае мы имеем дело со связями типа
группа альтернатив – группа альтернатив. В рамках таких задач возникает необходимость изучения зависимости между свойствами A1,
A2, …, An и свойствами B1, B2, …, Bn. Решение поставленной задачи довольно простое: необходимо рассмотреть отвечающую альтернативам
подтаблицу исходной таблицы сопряженности, применяя способы измерения связей между двумя номинальными признаками. Однако исследовательские задачи могут быть сложнее. Например, может потребоваться найти подтаблицы исходной таблицы сопряженности, обладающие наибольшими коэффициентами сопряженности (или каким-либо
53

другим свойством, отличающим эти подтаблицы от исходной таблицы
сопряженности или от других подтаблиц), и т.д. В зависимости от цели,
поставленной исследователем, при анализе связей подобного рода выделяются два класса методов36.
Первый класс методов – группа альтернатив, отвечающих одному признаку. В таких случаях группа альтернатив состоит из значений одного признака. Таким образом, исходная информация представляет собой таблицу сопряженности между двумя признаками, отвечающими двум группам альтернатив. Допустимо выделение двух подклассов задач. Первый подкласс задач опирается на методы математической статистики, и в нем выясняется, из каких компонент состоит величина
2
, вычисленная для рассматриваемой частотной таблицы (и какой
вклад в нее вносят разные подтаблицы таблицы сопряженности). Для
соответствующих задач установлены строгие правила перенесения результатов с выборочной совокупности на генеральную. Второй подкласс методов составляют задачи, основанные на методах анализа данных. Они связаны с поиском таких подтаблиц исходной таблицы, которые отличаются наиболее сильной связью (понимаемой в каком-нибудь
из известных нам смыслов) между определяющими эти подтаблицы
группами альтернатив и решаются простым перебором всевозможных
подтаблиц и вычислением отвечающих им показателей связи.
Второй класс методов – группа альтернатив, отвечающих разным
признакам. Методы этого класса в силу отсутствия разработанного
строгого математико-статистического подхода представлены типичными методами анализа данных.
Рассмотрим задачу, относящуюся к первому подклассу мето-
37
дов
. Попробуем разложить величину вычисленную для рассматри-
ваемой таблицы сопряженности, на части, отвечающие подтаблицам
таблицы сопряженности. Существует возможность такого разложения
исходной таблицы сопряженности на четырехклеточные подтаблицы,
что исходное значение статистики
будет приблизительно равно
сумме значений статистик для четырехклеточных таблиц, число ко-
торых равно числу степеней свободы исходной таблицы:
36
Толстова, Ю. Н. Указ. соч. С. 243–244.
37
Там же. С. 244–256.
54

Величина
– величина отклонения частот, которые имели бы
место при условии статистической независимости рассматриваемых
признаков при пропорциональности столбцов (строк) таблицы сопряженности (их называют ожидаемыми частотами или теоретическими
частотами), от наблюдаемых или эмпирических частот. При расчете
происходит суммирование таких отклонений, причем они могут быть
разными – ожидаемые частоты могут совпадать с наблюдаемыми или,
напротив, сильно отличаться друг от друга. Такое отличие наблюдается
и для отдельных фрагментов исходной таблицы сопряженности.
Указанное ранее соотношение показывает, какой вклад в общее
отклонение частот от условия статистической независимости дают
фрагменты такого рода. Если все значения статистики
для четырех-
клеточных подтаблицы превышают (или не превышают) соответствую-
щие табличные критические значения статистики
(т.е. гипотеза о независимости соответствующих пар альтернатив отвергается или принимается для всех четырехклеточных подтаблиц), то в таком случае и зна-
чение статистики
исходной таблицы сопряженности превышает (или
не превышает) отвечающее ему табличное критическое значение, и
можно считать, что отклонение (принятие) нулевой гипотезы равномерно опирается на все значения рассматриваемых признаков. Отсюда
можно сделать вывод, что никаких интересующих нас подсвязей исходная таблица сопряженности не содержит.
Гораздо более интересная ситуация получается, если значения
статистики для одних четырехклеточных подтаблиц будут превы-
шать соответствующее критическое значение, а для других не будут.
Поэтому из всей совокупности полученных четырехклеточных подтаб-
лиц только для подтаблиц со значениями статистики
, превышаю-
щими критическое значение, отклоняется нулевая гипотеза, и получа-
ется, что значение статистики
для исходной таблицы сопряженности
отличается от нуля (показывает отклонение ситуации от состояния статистической независимости признаков) за счет наличия связи именно в
этих подтаблицах. Подтаблицы со значениями статистики
, не превышающими критического значения, к наличию связи не имеют отношения.
Разложение исходной таблицы сопряженности на четырехклеточные подтаблицы производится по определенным правилам. Подтаблицы получаются не только за счет выделения соответствующего фраг-
55

мента из исходной таблицы сопряженности, но и в результате сумми-
b1
a1
d
11 D12
D
21 D22
рования определенных строк и столбцов последней. Примером может
служить таблица, фрагмент которой представлен на рис. 21, где
D12=d12+… + d1n, D21=d21+… + dn1, D21=d22+… + d2n+…+ dn2+… + dnn.
Рис. 21. Четырехклеточный фрагмент таблицы
Учитывая это, а также то, что понятие маргинальной суммы
имеет смысл не только для исходной таблицы, но и для всех ее подтаблиц, сформулируем правила получения четырехклеточных подтаблиц:
1. Каждая из частот исходной таблицы сопряженности должна
встречаться только в одной из подтаблиц.
2. Маргинальные частоты исходной таблицы сопряженности
должны встречаться в одной из подтаблиц как частоты определенного
типа – либо как стоящие в клетке частотной таблицы, либо как маргинальные.
3. Каждая частота, содержащаяся в одной из подтаблиц, но отсутствующая в исходной таблице, должна появиться в другой компонентной таблице как частота другого типа – клеточная, если была маргинальной, и наоборот.
Указанные правила не определяют разложение однозначным образом, при выборе разложения руководствуются в первую очередь содержательными соображениями.
Интерес представляет и ситуация, когда группы альтернатив составляются из значений разных признаков38. Как поступают в этом случае? Для изучения причинно-следственных отношений необходимо выделить признаки, описывающие исследуемое явление, и признаки, являющиеся причинами, обусловливающими наблюдаемый вид явления.
Признаки, описывающие исследуемое явление, выступают в качестве
зависимых переменных (обозначаются как Y1, Y2, …, Yn). Признаки, являющиеся причинами, обусловливающими наблюдаемый вид явления,
выступают в качестве независимых переменных (обозначаются как Х1,
Х2, …, Хn). Взаимосвязь между двумя группами признаков выражется
соотношением
38
Толстова, Ю. Н. Указ. соч. С. 256–260.
56

Y1=f(Х1, Х2, …, Хn)
Y2=f(Х1, Х2, …, Хn)
….
Yn=f(Х1, Х2, …, Хn).
Типичным примером такой задачи является выявление того, какими факторами обусловлен определенный тип поведения респондента. Рассматриваемое поведение описывается некоторым признаком
Yk. Необходимо определить, какими характеристиками (сочетаниями
значений рассматриваемых признаков) могут быть описаны респонденты, обладающие рассматриваемым поведением. В рамках социологического исследования мы можем оперировать лишь ответами респондентов на вопросы анкеты, задающими значения независимых переменных. Решение задачи кажется простым – необходимо осуществить перебор всех значений рассматриваемых признаков и найти среди них такие, обладателям которых присуще рассматриваемое поведение. Однако необходимо принимать во внимание, что объем выборочных совокупностей в социологических исследованиях довольно велик – от нескольких сотен до нескольких тысяч респондентов. При этом сложность задачи усугубляется неопределенностью. Неизвестен набор необходимых для решения задачи признаков, неизвестно их необходимое
количество, не ясно, какие сочетания значений каждого признака
должны быть учтены. Таким образом, возникает необходимость в разработке алгоритма «сокращенного» перебора, пропускающего определенные сочетания независимых признаков в зависимости от заложенной модели, обусловленной пониманием поведения объекта.
Будем называть группу респондентов типом (относительно проявления интересующего поведения), если для нее удовлетворяется выбранный критерий. Простейший алгоритм «сокращенного» перебора
работает следующим образом. Осуществляется перебор всевозможных
сочетаний значений рассматриваемых признаков, и для каждого проводится проверка на возможность приписать соответствующей совокупности объектов определенный тип поведения. Если такой тип поведения приписать можно, то считается, что решение поставленной задачи
найдено и группу можно назвать типом, если нет – производится переход к проверке следующего сочетания значений аргументов. Однако
остается неясным, при каких условиях допустимо считать, что найдена
группа, которую можно назвать типом, прежде всего из-за того, что не-
57

понятна доля респондентов, проявляющих изучаемое поведение, необходимая для такого вывода. Таким образом, задача сводится к поиску
взаимодействий – сочетаний значений независимых признаков, детерминирующих определенным образом заданное поведение респондентов. Решаться эта задача может путем применения различных алгоритмов39.
Алгоритм THAID исходит из того, что задан некоторый номинальный признак Y с несколькими альтернативами. Для каждой проверяемой группы объектов вычисляется распределение входящих в нее
респондентов по этому признаку, подсчитывается соответствующее
модальное значение и определяется доля его встречаемости. Соответствующий процент служит оценкой качества группы, определяя возможность рассматривать ее как тип. Рассмотрим работу по этому алгоритму, которая осуществляется в несколько этапов.
Этап 1. Работа с каждым признаком происходит отдельно.
Например, выбирается признак A. Перебираются варианты разбиения
всех его альтернатив следующим образом: первая – все остальные; первая и вторая – все остальные; первая, вторая, третья – все остальные
и т. д. до последнего варианта, все, кроме последней, – последняя. Для
оценки качества всего разбиения (а это сумма оценок качества каждой
из двух групп, получающихся при одном разбиении одного признака)
используется формула
,
где n1 – число человек в первой группе; P1 – доля модальной частоты
для первой группы; n2 – число человек во второй группе; P2 – доля модальной частоты для второй группы. Выбираем разбиение с наилучшей
оценкой качества разбиения.
Этап 2. Берутся респонденты первой группы, с которыми осуществляются те же действия, что ранее осуществлялись со всеми респондентами. Выбирается самое хорошее разбиение совокупности респондентов по новому признаку, например признаку Б. Аналогичная
операция производится и для второй группы респондентов. Таким образом, получаются четыре группы респондентов (рис. 22).
Этап 3. Каждая из четырех групп респондентов делится на две
путем указанных выше операций.
39
Толстова, Ю. Н. Указ. соч. С. 260–269.
58

Рис. 22. Результат действия алгоритма THAID
Причины останова работы алгоритма:
1) Найдена группа, в которой доля модальной частоты достато-
точно велика (например, 95 %).
2) Получена слишком малочисленная группа.
3) Получена слишком длинная цепочка.
4) Не найдено ни одной совокупности с интересующими нас
свойствами.
Наряду с описанным алгоритмом может быть использован и алгоритм CHAID (Chi Squared Automatic Interaction Detection). При работе
по этому алгоритму, как и при работе с алгоритмом ТHAID, задается
номинальный признак-функция Y, аналогичен и подход к пониманию
поведения каждого респондента. Отличие же состоит в оценке группового поведения, которое ассоциируется со всем распределением этого
признака. Процесс работы по алгоритму CHAID состоит из тех же этапов, что и процесс работы по алгоритму ТHAID.
Анализ связей типа признак – группа признаков
Предположим, что мы имеем признаки X и Y и хотим установить
наличие зависимости между ними40. Допустим, что группа признаков
состоит из признака X. О наличии связи между признаками свидетельствует коэффициент корреляции. Причем, чем ближе значение модуля
коэффициента корреляции к 1, тем более сильной является связь между
признаками. При этом с большей уверенностью мы можем полагать,
40
Толстова, Ю. Н. Указ. соч. С. 293–306.
59

что с изменением значений одного признака изменяются значения и
другого признака. В то же время невозможно установить, в какой степени возрастет значение признака Y при некотором увеличении признака X. Чтобы делать такие прогнозы, необходимо установить форму
связи между переменными, т. е. найти функцию вида Y = f (X). Важно
отметить, что речь идет именно о зависимости значения Y от X, так как
отношение между ними несимметрично. В рамках поставленной задачи
независимая переменная Х называется входной, экзогенной, внешней,
а зависимая переменная Y – выходной, эндогенной, внутренней.
Нахождение функции f (X) основано на использовании модели
связи между переменными, опирающейся на линейный регрессионный
анализ. В результате использования линейного регрессионного анализа
формируется модель реальности, в которой значения признака Y находятся на основе информации о значениях признака X. Сами значения
признака при этом от модели не зависят, но определяют конкретный
вид искомой зависимости. Значения зависимой переменной Y, напротив, целиком и полностью определяются исключительно используемой
моделью.
Важно отметить, что в рамках регрессионного анализа искомая
зависимость Y = f (X) статична, а не функциональна. В качестве независимой переменной выступают некоторые условные средние значения
Y, вычисленные для конкретного значения независимой переменной Х.
В принципе, следует отдавать себе отчет, что для социологических данных ситуация, когда одному значению Х соответствует множество значений Y, является типичной. Поэтому для нахождения зависимости для каждого значения Х приходится производить подсчет среднего арифметическое значения всех отвечающих ему значений Y и изучать зависимость от Х именно таких средних:
.
Однако в данном случае речь идет о выборочной ситуации, а нам
необходимо установить зависимость для генеральной совокупности, а
ее переменные имеют бесконечное число значений. Вышеприведенное
соотношение для генеральной совокупности может быть записано в
следующем виде:
,
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
