Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ данных в социологии. Учебно-методическое пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
где  – математическое ожидание. Такую функцию называют функцией
регрессии Y по Х, а ее графическое изображение – линией регрессии.
Точность, с которой линия регрессии передает изменение Y в среднем при изменении Х, измеряется дисперсией величины Y, вычис­ленной для каждого значения Х:
󰇛 
󰇛󰇜.
󰇜
Для нахождения конкретного вида функции регрессии следует учиты­вать тот факт, что для линии регрессии среди всех действительных
функций регрессии минимум математического ожидания 󰇛  󰇛󰇜
󰇜
достигается для функции󰇛󰇜󰇛 
.
󰇜
Рассмотрим рис. 23. Вертикальные отрезки, изображенные на ри­сунке, являются отклонениями ординат рассматриваемых точек от гра­фика функции регрессии. Средняя величина квадратов длин этих отрез­ков представляет собой выборочную оценку математического ожида-
ния 󰇛  󰇛󰇜
󰇜
. Для точки, имеющей в признаковом пространстве ко-
ординаты Х и Y, в рассматриваемом признаковом пространстве можно
найти имеющей по оси Х ту же координату, что и рассматриваемая точка.
– ординату точки, принадлежащей графику функции Y = f(X) и
в данном случае является теоретическим значением зависимой перемен­ной, которое имелось бы, если для расчетов использовалась бы искомая функция Y = f (X). Для получения выборочного представления линии
регрессии необходимо минимизировать значение
󰇛  󰇜
. Рассмат­риваемый подход к нахождению f(X) называется методом наименьших квадратов.
Рис. 23. Отклонения ординат точек от графика функции регрессии
61
Для поиска функции, отражающей искомую линию регрессии с любой степенью приближения, целесообразно использовать много­члены произвольной степени m:
      
.
В первом приближении наиболее часто используется прямая Y=a+b1X, где a – точка пересечения линии регрессии с осью Y; b1 – тангенс угла наклона. Значения a и b1 рассчитываются на основе соот­ношений
 
,






Рассмотренное выше касалось ситуации с одной переменной, од­нако возможен и многомерный случай, т. е. возможна ситуация, когда имеется не одна переменная X, а несколько независимых переменных Х1, Х2, ..., Хn. Здесь используется такой же подход, как и в случае одной переменной, только линейная регрессионная модель приобретает вид
не прямой линии, а гиперплоскости:      
Техника линейного регрессионного анализа может быть исполь­зована по отношению к номинальным данным. Построение уравнения регрессии на основе данных, полученных по номинальной шкале, воз­можно при предварительном преобразовании данных, которое называ-
.
.
ется дихотомизацией. Проведение дихотомизации номинальных дан­ных состоит в том, что каждому номинальному признаку, принимаю­щему n значений, ставится в соответствие n дихотомических признаков. Указанные дихотомические признаки могут принимать два значения – 0 и 1.
Проиллюстрируем, как это может быть осуществлено, на основе следующего примера. Предположим, в процессе исследования респон­денту следует ответить, какая форма проведения досуга для него более предпочтительна. Предлагается осуществить выбор из трех альтерна­тив – активной (занятия спортом, прогулки на свежем воздухе и т.д.),
62
пассивной (просмотр телепередач, игры на компьютере и т.д.) и их со­четания. Каждой из этих альтернатив может быть поставлен в соответ­ствие дихотомический признак, задаваемый следующим правилом:
1) Активной форме досуга соответствует переменная X1, которая принимает значение 1 в случае, если респондент отдает предпочтение активной форме досуга, и значение 0 – если респондент не отдает ей предпочтение.
2) Пассивной форме досуга соответствует переменная X2, кото­рая принимает значение 1 в случае, если респондент отдает предпочте­ние активной форме досуга, и значение 0 – если респондент не отдает ей предпочтение.
3) Сочетанию форм соответствует переменная X3, которая при­нимает значение 1 в случае, если респондент отдает предпочтение со­четанию форм досуга, и значение 0 – если респондент не делает такого предпочтения.
Теперь предположим, что необходимо изучить связь вида Y = (X), где Х – предпочитаемая форма досуга, а Y – место жительства респондента (Казань, другие города и поселки городского типа Респуб­лики Татарстан, сельские районы Республики Татарстан).
Вместо признака Х в уравнение регрессии необходимо вставить три новых предиктора – Х1, Х2, Х3, правила построения которых опи­саны ранее. Однако в регрессионную модель нежелательно включать предикторы, связанные друг с другом. В нашем случае предикторы Х1, Х
2, Х3
связаны между собой, так как если респондентом отдается пред­почтение активной форме досуга (Х1=1), то одновременно отвергается предпочтение пассивной формы и предпочтение сочетания форм, и то­гда значения Х2 и Х3 автоматически равняются 0. Не трудно заметить, что знание значений двух из трех дихотомических переменных автома­тически позволяет узнать значение третей. Эта возможность довольно важна, так как рекомендуется не включать в уравнение регрессии все дихотомические переменные, а только то их количество, которое необ­ходимо для установления остальных (таким образом, количество дихо­томических переменных, включаемых в уравнение, на единицу меньше).
Обратимся к признаку Y. В этом случае каждой из этих альтер­натив, как и в случае признака X, может быть поставлен в соответствие дихотомический признак, задаваемый следующим правилом:
63
1) Проживанию респондента в Казани соответствует переменная Y1, которая принимает значение 1 в случае, если респондент проживает в этом городе, в противном случае – значение 0.
2) Проживанию респондента в других городах и поселках город­ского типа республики соответствует переменная Y2, которая прини­мает значение 1 в случае, если респондент проживает в таких населен­ных пунктах, в противном случае – значение 0.
3) Проживанию респондента в сельских районах соответствует переменная Y3, которая принимает значение 1 в случае, если респон­дент проживает в этом городе, в противном случае – значение 0.
Решение задачи сводится к решению системы регрессионных
уравнений:
󰇛 󰇛 󰇛
󰇜
󰇜
󰇜
Примечательным в этом примере является возможность приме­нения регрессионного анализа к данным, полученным по номинальной шкале, что стало возможным после преобразования шкалы в дихотоми­ческую номинальную шкалу. Это следствие того, что дихотомическая номинальная шкала формально является частным случаем интерваль­ной шкалы, имеющей только один интервал – между 0 и 1, что позво­ляет в этой ситуации принять положение о том, что за равными число­выми интервалами стоят реальные эмпирические разности между объ­ектами. Также для данных, полученных по номинальным дихотомиче­ским шкалам, в отличие от полученных по многозначным номиналь­ным шкалам, возможна осмысленная интерпретация.
Рассмотрим ситуацию, когда возникает необходимость опериро­вать линейными регрессионными уравнениями с номинальными пере­менными41. Предположим, что имеются некоторые номинальные при­знаки: зависимый признак Y и независимые признаки Х1, Х2, ..., Хn. За­висимый признак Y принимает k значений, а каждый признак Хi – mi значений. В процессе дихотомизации исходных данных независимый признак преобразуется в дихотомические признаки Y1, Y2, ..., Yk, а каж-
дый признак Х
– в дихотомические признаки
i
, 
, ..., 
. Ранее от-

мечалась возможность вследствие взаимозависимости отбросить один
41
Толстова, Ю. Н. Указ. соч. С. 310–315.
64
из дихотомических признаков в каждом из таких наборов (в данном случае будем отбрасывать последний признак. Таким образом, необхо­димо решить систему k регрессионных уравнений:


󰇛
 

 


 


󰇜
 

 



󰇛
 

 


 


󰇜
 

 



󰇛
 

 


 


󰇜
 

 

Для лучшего понимания ситуации обратимся к случаю, когда имеется одна градация зависимого признака Y, которой отвечает соот­ветствующая дихотомическая переменная, и один независимый при­знак X, которому отвечают три дихотомические переменные Х1, Х2, Х3. Искомая зависимость имеет вид
󰇛
󰇜
    
.
Обращаясь к примеру, который мы уже использовали ранее, будем счи­тать, что переменная Y соответствует проживанию респондента в Ка­зани, переменная X1 – предпочтению респондента активной форме про­ведения досуга, X2 – предпочтению респондента пассивной форме до­суга. Переменная X3, соотвествующая предпочтению респондента сме­шанной форме проведения досуга, при составлении уравнения отбро­шена.
Коэффициенты уравнения интерпретируются как некоторые ча­стоты. В рассматриваемом случае легче всего начинать этот процесс с рассмотрения коэффициента а. Предположим, что Х1=0 и Х2=0, тогда Y=a. Коэффициент a равен среднему арифметическому значению зави­симой переменной X3. Так как Y является дихотомической переменной, отвечающей свойству «проживать в Казани», то коэффициент a пред­ставляет собой долю жителей Казани, предпочитающих смешанную форму досуга. Для интерпретации коэффициента b1 предположим, что
65
Х1=1 и Х2=0. Тогда уравнение принимает вид Y=a+b1. Понятно, что зна­чение Y выросло на величину b1, представляющую собой долю жителей Казани, предпочитающих активную форму досуга. Аналогично, приняв Х1=0 и Х2=1, получаем значение Y=a+b2, где b2 представляет собой долю жителей Казани, предпочитающих пассивную форму досуга.
Однако регрессионный анализ не сводится к получению исклю­чительно условных частот. Уравнение регрессии является системой, свойства которой не сводятся к свойствам отдельных составляющих ее элементов. Возможно решение задач, связанных с установлением соче­таний значений независимых признаков, определяющих определенное значение независимого. Так, наибольшие значения коэффициентов ре­грессии при определенных дихотомических независимых переменных указывают на то, что именно свойства, стоящие за этими переменными, и определяют определенную долю респондентов, обладающих свой­ством, стоящим за зависимой переменной. Повышению надежности анализа может способствовать применение при регрессионном анализе нелинейных моделей. При этом в случае номинальных дихотомических переменных задача упрощается за счет возможности пренебречь их сте­пенями в многочленах, поскольку степени дихотомических признаков равны самим признакам. Коэффициенты регрессии при элементах вида X_i×X_j в таком случае определяют долю респондентов, обладающих одновременно обоими соответствующими Xi и Xj свойствами.
Еще одним вариантом использования номинального регрессион­ного анализа является возможность выявить изменение зависимой пе­ременной при изменении какой-либо независимой переменной. Однако это требует довольно сильных модельных предположений. Предпола­гается, что указанное уравнение справедливо не только тогда, когда не­зависимые дихотомические переменные характеризуют отдельных ре­спондентов, но и в случае, когда в качестве единиц наблюдения фигу­рируют группы людей, а независимые переменные представляют собой доли респондентов в этих группах, обладающих соответствующим свойством. В таком случае изменение доли респондентов, обладающих свойством, соответствующим независимой дихотомической перемен­ной на некоторое число процентных пунктов, приводит к изменению доли респондентов, обладающих свойством, соответствующим зависи­мой дихотомической переменной, на число процентных пунктов опре­деляемому коэффициенту регрессии при независимой дихотомической переменной.
66
Класс решаемых с помощью номинального регрессионного ана­лиза может быть расширен за счет применения логистической регрес­сии42. В обычном регрессионном уравнении объясняемая переменная Y является величиной с математическим ожиданием μ, а линейное регрес­сионное уравнение имеет вид
     
.
Функция такого вида имеет вид так называемой связующей функ­ции:
󰇛󰇜     
.
Если функция 󰇛󰇜󰇛󰇜, то получается логлинейная модель:
󰇛󰇜     
.
В силу того что логарифм произведения равен сумме логариф­мов, использование логлинейной модели дает преимущество за счет возможности свести изучение сложных взаимодействий между незави­симыми переменными к поиску коэффициентов линейной зависимости.
Особый интерес представляет функция 󰇛󰇜
, когда

имеет место так называемая логит-связь. В случае такой связи говорят об использовании логит-модели, имеющей особую важность, когда Y –
дихотомическая переменная, так как тогда 󰇛󰇜
, где p – доля
единичных значений Y, q=(1-p) – доля нулевых значений Y, и сама функция является логарифмом отношения преобладания.
42
Толстова, Ю. Н. Указ. соч. С. 317–319.
67
Вопросы для дискуссий
Роль анализа данных в поиске статистических закономерностей
1. Каковы основные типы эмпирических данных в социологии?
2. В чем состоит содержание понятий «признак» и «значение при- знака»?
3. Каковы основные виды представления статистических данных?
4. В чем смысл понятия статистической закономерности?
Математические методы как средство познания социальных дан-
ных
1. Какое место математические методы занимают в анализе социоло- гических данных?
2. Каковы преимущества, получаемые при применении математиче- ских методов для анализа социологической информации?
3. Дайте сравнительную характеристику содержательной, концепту- альной и формальной моделям исследования.
4. В чем заключается смысл понятия «сжатие социологической инфор- мации»?
5. Каково содержание основных задач анализа данных?
6. Назовите основные классы методов анализа данных.
Одномерные частотные распределения
1. Что такое частотное распределение?
2. Каковы показатели одномерного распределения?
3. Опишите порядок расчета относительной и накопленной частоты.
4. Опишите порядок построения полигона распределения.
5. Опишите порядок построения гистограммы для неравных интерва- лов.
6. Опишите порядок построения кумуляты.
Меры средней тенденции и меры разброса
1. Назовите модели измерения, отвечающие мерам средней тенденции.
2. Опишите порядок нахождения квартилей графическим способом.
3. Что такое меры разброса?
68
4. Что такое дисперсия и в чем ее содержательный смысл?
2
2
5. В чем содержательный смысл квантильного размаха?
Изучение связей между номинальными признаками
1. В чем заключается смысл понятия условного распределения?
2. Каковы характеристики взаимосвязи признаков в таблице сопряжен-
ности?
3. Каковы задачи анализа, решаемые по таблицам сопряженности?
4. Что такое зависимые и независимые признаки?
5. В чем состоит смысл понятия статистической зависимости и стати-
стической независимости?
6. Каковы бывают характеристики связи между признаками?
7. В чем заключается понятие локальных и глобальных мер связи?
8. Опишите порядок расчета критерия
.
Анализ связей типа признак – признак
1. Каковы особенности коэффициентов связи, основанных на критерии
?
2. Каковы особенности коэффициентов связи, основанных на моделях прогноза?
3. Каковы особенности коэффициентов связи, основанных на понятии энтропии?
4. Каковы особенности коэффициентов связи для четырехклеточных таблиц сопряженности?
5. В чем заключается проблема сравнения коэффициентов связи?
Анализ связей типа альтернатива – альтернатива
1. Что понимается под локальной связью?
2. В чем состоит суть метода детерминационного анализа?
3. Какими величинами задается детерминационный анализ?
Анализ связей типа группа альтернатив – группа альтернатив
1. Каковы коэффициенты, позволяющие установить связь между груп­пами признаков?
69
2. Какие существуют правила разбиения четырехклеточных фрагмен­тов?
3. Что такое независимые признаки и в каких моделях их используют?
Анализ связей типа признак – группа признаков
1. В чем состоят основные идеи классического регрессионного ана­лиза?
2. В чем особенность применения номинального регрессионного ана­лиза?
3. Можно ли проводить регрессионный анализ номинальных перемен­ных на линейной модели?
4. Какие задачи можно решить с помощью номинального регрессион­ного анализа?
5. В чем отличие пробит-модели от логит-модели?
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]