Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Анализ данных в социологии. Учебно-методическое пособие
.pdf
где – математическое ожидание. Такую функцию называют функцией
регрессии Y по Х, а ее графическое изображение – линией регрессии.
Точность, с которой линия регрессии передает изменение Y в
среднем при изменении Х, измеряется дисперсией величины Y, вычисленной для каждого значения Х:
.
Для нахождения конкретного вида функции регрессии следует учитывать тот факт, что для линии регрессии среди всех действительных
функций регрессии минимум математического ожидания
достигается для функции
.
Рассмотрим рис. 23. Вертикальные отрезки, изображенные на рисунке, являются отклонениями ординат рассматриваемых точек от графика функции регрессии. Средняя величина квадратов длин этих отрезков представляет собой выборочную оценку математического ожида-
ния
. Для точки, имеющей в признаковом пространстве ко-
ординаты Х и Y, в рассматриваемом признаковом пространстве можно
найти
имеющей по оси Х ту же координату, что и рассматриваемая точка.
– ординату точки, принадлежащей графику функции Y = f(X) и
в
данном случае является теоретическим значением зависимой переменной, которое имелось бы, если для расчетов использовалась бы искомая
функция Y = f (X). Для получения выборочного представления линии
регрессии необходимо минимизировать значение
. Рассматриваемый подход к нахождению f(X) называется методом наименьших
квадратов.
Рис. 23. Отклонения ординат точек от графика функции регрессии
61

Для поиска функции, отражающей искомую линию регрессии с
любой степенью приближения, целесообразно использовать многочлены произвольной степени m:
.
В первом приближении наиболее часто используется прямая
Y=a+b1X, где a – точка пересечения линии регрессии с осью Y; b1 –
тангенс угла наклона. Значения a и b1 рассчитываются на основе соотношений
,
Рассмотренное выше касалось ситуации с одной переменной, однако возможен и многомерный случай, т. е. возможна ситуация, когда
имеется не одна переменная X, а несколько независимых переменных
Х1, Х2, ..., Хn. Здесь используется такой же подход, как и в случае одной
переменной, только линейная регрессионная модель приобретает вид
не прямой линии, а гиперплоскости:
Техника линейного регрессионного анализа может быть использована по отношению к номинальным данным. Построение уравнения
регрессии на основе данных, полученных по номинальной шкале, возможно при предварительном преобразовании данных, которое называ-
.
.
ется дихотомизацией. Проведение дихотомизации номинальных данных состоит в том, что каждому номинальному признаку, принимающему n значений, ставится в соответствие n дихотомических признаков.
Указанные дихотомические признаки могут принимать два значения –
0 и 1.
Проиллюстрируем, как это может быть осуществлено, на основе
следующего примера. Предположим, в процессе исследования респонденту следует ответить, какая форма проведения досуга для него более
предпочтительна. Предлагается осуществить выбор из трех альтернатив – активной (занятия спортом, прогулки на свежем воздухе и т.д.),
62

пассивной (просмотр телепередач, игры на компьютере и т.д.) и их сочетания. Каждой из этих альтернатив может быть поставлен в соответствие дихотомический признак, задаваемый следующим правилом:
1) Активной форме досуга соответствует переменная X1, которая
принимает значение 1 в случае, если респондент отдает предпочтение
активной форме досуга, и значение 0 – если респондент не отдает ей
предпочтение.
2) Пассивной форме досуга соответствует переменная X2, которая принимает значение 1 в случае, если респондент отдает предпочтение активной форме досуга, и значение 0 – если респондент не отдает
ей предпочтение.
3) Сочетанию форм соответствует переменная X3, которая принимает значение 1 в случае, если респондент отдает предпочтение сочетанию форм досуга, и значение 0 – если респондент не делает такого
предпочтения.
Теперь предположим, что необходимо изучить связь вида
Y = (X), где Х – предпочитаемая форма досуга, а Y – место жительства
респондента (Казань, другие города и поселки городского типа Республики Татарстан, сельские районы Республики Татарстан).
Вместо признака Х в уравнение регрессии необходимо вставить
три новых предиктора – Х1, Х2, Х3, правила построения которых описаны ранее. Однако в регрессионную модель нежелательно включать
предикторы, связанные друг с другом. В нашем случае предикторы Х1,
Х
2, Х3
связаны между собой, так как если респондентом отдается предпочтение активной форме досуга (Х1=1), то одновременно отвергается
предпочтение пассивной формы и предпочтение сочетания форм, и тогда значения Х2 и Х3 автоматически равняются 0. Не трудно заметить,
что знание значений двух из трех дихотомических переменных автоматически позволяет узнать значение третей. Эта возможность довольно
важна, так как рекомендуется не включать в уравнение регрессии все
дихотомические переменные, а только то их количество, которое необходимо для установления остальных (таким образом, количество дихотомических переменных, включаемых в уравнение, на единицу
меньше).
Обратимся к признаку Y. В этом случае каждой из этих альтернатив, как и в случае признака X, может быть поставлен в соответствие
дихотомический признак, задаваемый следующим правилом:
63

1) Проживанию респондента в Казани соответствует переменная
Y1, которая принимает значение 1 в случае, если респондент проживает
в этом городе, в противном случае – значение 0.
2) Проживанию респондента в других городах и поселках городского типа республики соответствует переменная Y2, которая принимает значение 1 в случае, если респондент проживает в таких населенных пунктах, в противном случае – значение 0.
3) Проживанию респондента в сельских районах соответствует
переменная Y3, которая принимает значение 1 в случае, если респондент проживает в этом городе, в противном случае – значение 0.
Решение задачи сводится к решению системы регрессионных
уравнений:
Примечательным в этом примере является возможность применения регрессионного анализа к данным, полученным по номинальной
шкале, что стало возможным после преобразования шкалы в дихотомическую номинальную шкалу. Это следствие того, что дихотомическая
номинальная шкала формально является частным случаем интервальной шкалы, имеющей только один интервал – между 0 и 1, что позволяет в этой ситуации принять положение о том, что за равными числовыми интервалами стоят реальные эмпирические разности между объектами. Также для данных, полученных по номинальным дихотомическим шкалам, в отличие от полученных по многозначным номинальным шкалам, возможна осмысленная интерпретация.
Рассмотрим ситуацию, когда возникает необходимость оперировать линейными регрессионными уравнениями с номинальными переменными41. Предположим, что имеются некоторые номинальные признаки: зависимый признак Y и независимые признаки Х1, Х2, ..., Хn. Зависимый признак Y принимает k значений, а каждый признак Хi – mi
значений. В процессе дихотомизации исходных данных независимый
признак преобразуется в дихотомические признаки Y1, Y2, ..., Yk, а каж-
дый признак Х
– в дихотомические признаки
i
,
, ...,
. Ранее от-
мечалась возможность вследствие взаимозависимости отбросить один
41
Толстова, Ю. Н. Указ. соч. С. 310–315.
64

из дихотомических признаков в каждом из таких наборов (в данном
случае будем отбрасывать последний признак. Таким образом, необходимо решить систему k регрессионных уравнений:
Для лучшего понимания ситуации обратимся к случаю, когда
имеется одна градация зависимого признака Y, которой отвечает соответствующая дихотомическая переменная, и один независимый признак X, которому отвечают три дихотомические переменные Х1, Х2, Х3.
Искомая зависимость имеет вид
.
Обращаясь к примеру, который мы уже использовали ранее, будем считать, что переменная Y соответствует проживанию респондента в Казани, переменная X1 – предпочтению респондента активной форме проведения досуга, X2 – предпочтению респондента пассивной форме досуга. Переменная X3, соотвествующая предпочтению респондента смешанной форме проведения досуга, при составлении уравнения отброшена.
Коэффициенты уравнения интерпретируются как некоторые частоты. В рассматриваемом случае легче всего начинать этот процесс с
рассмотрения коэффициента а. Предположим, что Х1=0 и Х2=0, тогда
Y=a. Коэффициент a равен среднему арифметическому значению зависимой переменной X3. Так как Y является дихотомической переменной,
отвечающей свойству «проживать в Казани», то коэффициент a представляет собой долю жителей Казани, предпочитающих смешанную
форму досуга. Для интерпретации коэффициента b1 предположим, что
65

Х1=1 и Х2=0. Тогда уравнение принимает вид Y=a+b1. Понятно, что значение Y выросло на величину b1, представляющую собой долю жителей
Казани, предпочитающих активную форму досуга. Аналогично, приняв
Х1=0 и Х2=1, получаем значение Y=a+b2, где b2 представляет собой
долю жителей Казани, предпочитающих пассивную форму досуга.
Однако регрессионный анализ не сводится к получению исключительно условных частот. Уравнение регрессии является системой,
свойства которой не сводятся к свойствам отдельных составляющих ее
элементов. Возможно решение задач, связанных с установлением сочетаний значений независимых признаков, определяющих определенное
значение независимого. Так, наибольшие значения коэффициентов регрессии при определенных дихотомических независимых переменных
указывают на то, что именно свойства, стоящие за этими переменными,
и определяют определенную долю респондентов, обладающих свойством, стоящим за зависимой переменной. Повышению надежности
анализа может способствовать применение при регрессионном анализе
нелинейных моделей. При этом в случае номинальных дихотомических
переменных задача упрощается за счет возможности пренебречь их степенями в многочленах, поскольку степени дихотомических признаков
равны самим признакам. Коэффициенты регрессии при элементах вида
X_i×X_j в таком случае определяют долю респондентов, обладающих
одновременно обоими соответствующими Xi и Xj свойствами.
Еще одним вариантом использования номинального регрессионного анализа является возможность выявить изменение зависимой переменной при изменении какой-либо независимой переменной. Однако
это требует довольно сильных модельных предположений. Предполагается, что указанное уравнение справедливо не только тогда, когда независимые дихотомические переменные характеризуют отдельных респондентов, но и в случае, когда в качестве единиц наблюдения фигурируют группы людей, а независимые переменные представляют собой
доли респондентов в этих группах, обладающих соответствующим
свойством. В таком случае изменение доли респондентов, обладающих
свойством, соответствующим независимой дихотомической переменной на некоторое число процентных пунктов, приводит к изменению
доли респондентов, обладающих свойством, соответствующим зависимой дихотомической переменной, на число процентных пунктов определяемому коэффициенту регрессии при независимой дихотомической
переменной.
66

Класс решаемых с помощью номинального регрессионного анализа может быть расширен за счет применения логистической регрессии42. В обычном регрессионном уравнении объясняемая переменная Y
является величиной с математическим ожиданием μ, а линейное регрессионное уравнение имеет вид
.
Функция такого вида имеет вид так называемой связующей функции:
.
Если функция , то получается логлинейная модель:
.
В силу того что логарифм произведения равен сумме логарифмов, использование логлинейной модели дает преимущество за счет
возможности свести изучение сложных взаимодействий между независимыми переменными к поиску коэффициентов линейной зависимости.
Особый интерес представляет функция
, когда
имеет место так называемая логит-связь. В случае такой связи говорят
об использовании логит-модели, имеющей особую важность, когда Y –
дихотомическая переменная, так как тогда
, где p – доля
единичных значений Y, q=(1-p) – доля нулевых значений Y, и сама
функция является логарифмом отношения преобладания.
42
Толстова, Ю. Н. Указ. соч. С. 317–319.
67

Вопросы для дискуссий
Роль анализа данных в поиске статистических закономерностей
1. Каковы основные типы эмпирических данных в социологии?
2. В чем состоит содержание понятий «признак» и «значение при-
знака»?
3. Каковы основные виды представления статистических данных?
4. В чем смысл понятия статистической закономерности?
Математические методы как средство познания социальных дан-
ных
1. Какое место математические методы занимают в анализе социоло-
гических данных?
2. Каковы преимущества, получаемые при применении математиче-
ских методов для анализа социологической информации?
3. Дайте сравнительную характеристику содержательной, концепту-
альной и формальной моделям исследования.
4. В чем заключается смысл понятия «сжатие социологической инфор-
мации»?
5. Каково содержание основных задач анализа данных?
6. Назовите основные классы методов анализа данных.
Одномерные частотные распределения
1. Что такое частотное распределение?
2. Каковы показатели одномерного распределения?
3. Опишите порядок расчета относительной и накопленной частоты.
4. Опишите порядок построения полигона распределения.
5. Опишите порядок построения гистограммы для неравных интерва-
лов.
6. Опишите порядок построения кумуляты.
Меры средней тенденции и меры разброса
1. Назовите модели измерения, отвечающие мерам средней тенденции.
2. Опишите порядок нахождения квартилей графическим способом.
3. Что такое меры разброса?
68

4. Что такое дисперсия и в чем ее содержательный смысл?
2
2
5. В чем содержательный смысл квантильного размаха?
Изучение связей между номинальными признаками
1. В чем заключается смысл понятия условного распределения?
2. Каковы характеристики взаимосвязи признаков в таблице сопряжен-
ности?
3. Каковы задачи анализа, решаемые по таблицам сопряженности?
4. Что такое зависимые и независимые признаки?
5. В чем состоит смысл понятия статистической зависимости и стати-
стической независимости?
6. Каковы бывают характеристики связи между признаками?
7. В чем заключается понятие локальных и глобальных мер связи?
8. Опишите порядок расчета критерия
.
Анализ связей типа признак – признак
1. Каковы особенности коэффициентов связи, основанных на критерии
?
2. Каковы особенности коэффициентов связи, основанных на моделях
прогноза?
3. Каковы особенности коэффициентов связи, основанных на понятии
энтропии?
4. Каковы особенности коэффициентов связи для четырехклеточных
таблиц сопряженности?
5. В чем заключается проблема сравнения коэффициентов связи?
Анализ связей типа альтернатива – альтернатива
1. Что понимается под локальной связью?
2. В чем состоит суть метода детерминационного анализа?
3. Какими величинами задается детерминационный анализ?
Анализ связей типа группа альтернатив – группа альтернатив
1. Каковы коэффициенты, позволяющие установить связь между группами признаков?
69

2. Какие существуют правила разбиения четырехклеточных фрагментов?
3. Что такое независимые признаки и в каких моделях их используют?
Анализ связей типа признак – группа признаков
1. В чем состоят основные идеи классического регрессионного анализа?
2. В чем особенность применения номинального регрессионного анализа?
3. Можно ли проводить регрессионный анализ номинальных переменных на линейной модели?
4. Какие задачи можно решить с помощью номинального регрессионного анализа?
5. В чем отличие пробит-модели от логит-модели?
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
