Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Анализ данных в социологии. Учебно-методическое пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
Меры средней тенденции и меры разброса
После проведения исследования получаются частотные распре­деления значений рассматриваемых признаков (выборочное представ­ление изучаемой одномерной случайной величины). Распределение ча­стот является самым удобным способом представления различных зна­чений переменной. Статистики, связанные с распределением частот, можно разделить на три группы:
– меры средней тенденции (показатели центра распределения);
– меры разброса (показатели вариации);
– показатели формы распределения.
Показатели центра распределения характеризуют положение центра распределения, вокруг которого концентрируются данные. Это – среднее арифметическое, мода и медиана14.
Наиболее часто используемым показателем является среднее арифметическое, или, как его еще называют, выборочное среднее. Эта величина получается делением суммы всех имеющихся значений пере­менной на число значений:
=

,
где xi – полученные значения переменной x; n – число наблюдений, или размер выборочной совокупности.
Если рассматривать какую-либо группу респондентов, то среднее арифметическое значение признака можно проинтерпретировать как значение, характерное для наиболее типичного человека из этой группы. Среднее значение в этом случае выступает в качестве характе­ристики рассматриваемого признака всей группы. Однако следует пом­нить, что подобная интерпретация среднего арифметического допу­стима не всегда.
Важным показателем центра распределения является медиана. Медианой называется значение переменной в середине ряда данных, расположенных в порядке возрастания или убывания. Если число дан­ных четное, то медиана равна полусумме двух срединных значений. Следует отметить, что медиана является так называемым пятидесятым процентилем и соответственно пятым децилем и вторым квартилем:
14
Малхотра, Н. К. Маркетинговые исследования. Практическое руководство. М.:
Издательский дом «Вильямс», 2002. С. 558–559.
21
 
.
Заметим, медиана обладает тем свойством, что половина всех вы­борочных значений изучаемого признака меньше нее, а половина – больше. Вычисление медианы имеет смысл только для порядкового или интервального признака, так как для номинального признака отсут­ствуют категории «больше» и «меньше».
Медиана может быть рассчитана и с помощью кумуляты (рис. 7), т. е. используется предположение о непрерывности изучаемого при­знака15. Для этого рассматривается кумулятивный ряд, т.е. ряд накоп­ленных частот. На так называемый медианный интервал приходится 0,5 N наблюдений. Присвоим медианному интервалу номер l, тогда
Nl=Fl – F
. Все эти варианты заключены между x'l и х"l. Так как точные
l–1
значения каждого из вариантов неизвестны, то в простейшем случае де­лается предположение, что внутри интервала все они расположены рав­номерно, т. е. прирост частоты пропорционален приросту интервала:
󰇛  
󰇜
󰇛  󰇜.

Рис. 7. Расчет медианы с помощью кумуляты
15
Рабочая книга социолога / под общ. ред. и с предисл. Г. В. Осипова. М.: Едито-
риал УРСС, 2003. С. 161, 157.
22
И, следовательно,
 


.
Еще одним показателем центра распределения является мода. Мода – это значение переменной, которое чаще всего встречается в вы­борочном распределении.
В завершение обзора характеристик центра распределения оста­новимся на некоторых методических аспектах их использования в си­туациях, возникающих при изучении статистических закономерностей произвольного вида.
Любая средняя является параметром распределения соответству­ющей случайной величины (либо статистикой, вычисленной для выбо­рочного частотного распределения изучаемого признака). Все методы нахождения статистических закономерностей основаны на расчете не­которых параметров рассматриваемых распределений, а любая законо­мерность может быть выражена через ту или иную их совокупность. Для всех параметров рассматриваемых распределений актуальной яв­ляется задача их точечного и интервального оценивания. Решение этой задачи для средних величин известно, однако для многих параметров теоретическая основа, дающая возможность построения интервала, не разработана, что не позволяет переносить результаты с выборки на ге­неральную совокупность. Единственным способом решения данной проблемы является использование процедуры компьютерного модели­рования большого числа выборок, наблюдение и вычисление парамет­ров получающихся при этом распределений статистик и построение на этой основе требующихся доверительных интервалов16.
Любая статистическая закономерность, выявляемая при работе с эмпирическими данными, является сжатием исходных данных. Напри­мер, от множества возрастов респондентов, составляющих выборочную совокупность исследования, возможно перейти к среднему арифмети­ческому их возрастов, выражаемому одним числом. При этом такое сжатие закономерно оборачивается потерей информации, которая про­исходит при нахождении любой закономерности. Учет этого обстоя­тельства необходим в процессе интерпретации данных. Например, сле­дует помнить, что за средним арифметическим возрастов респондентов
16
Толстова, Ю. Н. Указ. соч. С. 149.
23
стоит множество таких возрастов и их разброс может быть достаточно велик17.
Любая статистическая закономерность имеет смысл лишь при определенной однородности совокупности исследуемых объектов, для которой она рассчитывается. Любая средняя характеризует централь­ную тенденцию распределения лишь тогда, когда изучаемая совокуп­ность объектов однородна относительно исследуемых признаков – в тех случаях, когда объекты в основном сосредоточены вокруг этих сред­них. Это накладывает определенные ограничения на интерпретацию данных, например недопустимо оперировать понятием среднего ариф­метического в ситуациях, когда разброс данных слишком велик, а также использовать среднее арифметическое при сравнениях без учета раз­броса данных.
Еще одним важным аспектом является необходимость формаль­ной адекватности. Следует помнить, что спецификой социологических данных, обусловливающей особенности использования применительно к ним математической статистики, является то, что эти данные в про­цессе исследования зачастую бывают получены по шкалам низких ти­пов (номинальных и порядковых). Арсенал методов анализа определя­ется типом используемых шкал, а результаты их использования должны обладать свойством инвариантности относительно применения к ис­ходным данным допустимых преобразований тех шкал, по которым эти данные получены. Например, моду можно вычислять для шкал любых типов, так как объект, обладающий модальным значением, не изменя­ется при любом взаимно однозначном преобразовании исходных шкальных значений, а следовательно, и любые выводы, полученные на основе анализа модальных значений, удовлетворяют свойству инвари­антности. Аналогично расчет медианы и прочих квантилей требует по меньшей мере порядковой шкалы, а вот среднее арифметическое уже предполагает использование шкалы интервального типа18.
Помимо требования формальной адекватности необходима еще и содержательная адекватность. Это возникает из-за того, что формаль­ной адекватности метода недостаточно для его пригодности при реше­нии определенной конкретной задачи. Например, метод может быть
17
Толстова, Ю. Н. Указ. соч. С. 149–150.
18
Там же. С. 150–151.
24
пригодным с точки зрения используемых шкал, но может быть непри-
minmax
xxR =
годным с точки зрения содержания, не отвечать поставленной задаче19. Последнее методическое положение состоит в необходимости анализа модели, заложенной в методе. Применительно к показателям центра распределения такие модели базируются на предположениях о типе шкалы, отвечающей рассматриваемому признаку, о непрерывности признака, о расположении его значений внутри каждого интервала и т.д.20
В отличие от показателей центра распределения показатели вари­ации обозначают не разброс данных вокруг центра распределения, а просто меру разброса данных. Показатели вариации включают размах вариации, межквартильный размах, дисперсию, стандартное отклоне­ние и коэффициент вариации21.
Проще всего рассчитать размах вариации. Он равен разности между наибольшим и наименьшим значениями переменной в вариаци­онном ряду и отражает разброс данных. Таким образом, его можно рас­считать следующим образом:
,
где x
x
– минимальное значение вариационном ряду.
min
– максимальное значение переменной в вариационном ряду;
max
Для того чтобы ввести понятие межквартильного размаха, нужно более подробно остановиться на понятии «квантиль». Квантиль – это такое значение признака q, которое делит диапазон его изменения на две части таким образом, чтобы отношение числа элементов выборки, имеющих значение признака, меньшее q, к числу элементов, имеющих значение признака, большее q, было равно заранее заданной величине22.
Квантили объединяются в ряд семейств. Основой для такого объ­единения служит возможность квантилей делить диапазон изменения признака на заданное число равнонаполненных частей. Наиболее часто используются:
– квартили (разбивают диапазон изменения признака на 4 равно­наполненные части);
19
Толстова, Ю. Н. Указ. соч. С. 153.
20
Там же. С. 153.
21
Малхотра, Н. К. Указ соч. С. 559–560.
22
Толстова, Ю. Н. Указ. соч. С. 145.
25
– децили (разбивают диапазон изменения признака на 10 равно-
Q1 Q2
Q3
25 %
25 %
25 %
25 %
D
1
D
2
D
3
D
4
D
5
D
6
D
7
D
8
D
9
10 %
10 %
10 %
10 %
10 %
10 %
10 %
10 %
10 %
10 %
P
1
P
2
P
98
P
99
1 %
1 %
1 %
1 %
наполненных частей);
– процентили (разбивают диапазон изменения признака на 100 равнонаполненных частей).
Символически изображения семейств квантилей представлено на рис. 8.
Квартили
Децили
Процентили
Рис. 8. Наиболее употребительные квантили. Доля объектов выборки,
попавших в этот интервал, обозначена величиной процента,
указанной под интервалом
В социологических задачах и в задачах из области социальной статистики с квантилями приходится сталкиваться довольно часто. Так, например, все население по уровню дохода делится на 10 частей – так называемые децильные группы. Две крайние децильные группы объ­единяют 10 % наиболее бедных и 10 % наиболее богатых. Крайние де­цили D1 и D9 используются для расчета децильного коэффициента диф­ференциации населения по доходам.
Межквартильный размах, следующий показатель вариации, ра­вен разности между 75-м и 25-м процентилями:
 

.
26
Не трудно заметить, что 75-й процентиль является 3-м квартилем, а 25-й
( )
=
=
n
i
i
n
xx
1
2
2
1
( )
=
==
n
i
i
n
xx
1
2
2
1
процентиль – 1-м квартилем. Отсюда
 
.
Межквартильный размах обычно используют для порядковых шкал. Однако следует помнить, что, строго говоря, это некорректно, так как для порядковой шкалы разности между шкальными значениями не яв­ляются осмысленными.
Важными показателями вариации являются дисперсия и средне­квадратическое отклонение. Дисперсия представляет собой среднее из квадратов отклонений переменной от ее средней величины. Следует помнить, что если значения данных сгруппированы вокруг среднего, то дисперсия невелика. Если же значения данных разбросаны, то диспер­сия считается большой. Дисперсия вычисляется следующим образом:
,
где xi – полученные значения переменной x; x – среднее арифметиче­ское (выборочное среднее); n – число наблюдений, или размер выбо­рочной совокупности.
Следует отметить, что деление происходит не на n, а на n – 1, по- скольку генеральное среднее неизвестно, а вместо него используется выборочное среднее. Это делает выборку менее изменчивой, чем фак­тически. Таким образом, мы корректируем более слабую изменчивость значений переменной, наблюдаемую в выборке. Эта статистика явля­ется формально адекватной только для интервальных шкал (только в этом случае сохраняется смысл использования среднего арифметиче­ского).
Среднеквадратическое (стандартное) отклонение равно корню квадратному из значения дисперсии:
.
27
Последним показателем, на котором необходимо остановиться,
x
CV=
является коэффициент вариации. Он рассчитывается как отношение стандартного отклонения к среднему арифметическому, выраженное в процентах:
,
где  – стандартное отклонение; x – среднее арифметическое (выбо­рочное среднее).
Последняя группа показателей – показатели формы распределе­ния23. Асимметрия характеризует симметрию расположения значений относительно средней (рис. 9). Эксцесс является мерой относительной крутости кривой распределения частот.
Рис. 9. Асимметрия распределения
Если признаки номинальные, то использование рассмотренных по­казателей разброса некорректно. В данном случае максимальным разброс целесообразно считать при равномерном распределении. При этом раз­брос больше, если распределение ближе к равномерному, и, наоборот,
23
Малхотра, Н. К. Указ соч. С. 561–562.
28
разброс тем меньше, чем распределение дальше от равномерного. Для но­минальных признаков используются такие показатели меры разброса, как коэффициент качественной вариации и энтропийный коэффициент раз­броса24.
Рассчитаем коэффициент качественной вариации в предположе­нии дихотомической шкалы (возможности выбрать только два варианта ответа)25. Пусть первый ответ выбирали n1 респондентов, а второй ва­риант ответа – n2 респондентов. Понятно, что общее число респонден­тов равно n=n1+ n2. Произведение n
при заданном n минимально,
1n2
когда все респонденты выбирают один ответ, и максимально, когда оба ответа выбираются равным числом респондентов, т. е. когда n1 =n2=n/2. Значение произведения n
в этом случае
1n2
равно (n/2) (n/2)=n
2
/4. Ко-
эффициент качественной вариации для дихотомической шкалы равен отношению произведения n
1n2
к его максимальному значению:


.
Найдем коэффициент качественной вариации для общего случая номинальной шкалы (k вариантов ответа). Сверху в коэффициенте J бу- дет располагаться сумма всевозможных произведений вида n
n
1n2+n1n3
+ n
2n3
+ n
1n4
+…+ n
k-1nk
. В знаменателе должно стоять
inj
, т. е.
максимальное значение такой суммы, т. е. значение для ситуации, когда все ответы были выбраны равным числом респондентов. Для k вариан­тов и выборки объема n это число равно n/k человек. Значение произве-
дения в таком случае равно (n/k)(n/k)=n
n
вычисляется из комбинаторики как число сочетаний из k элемен-
inj
2/k2
. Число произведений вида
тов по 2 и равно 󰇛  󰇜. Отсюда формула для коэффициента ка-
чественной вариации:


󰇛
󰇜

.
24
Толстова, Ю. Н. Указ. соч. С. 155.
25
Там же. С. 155–159.
29
Далее рассмотрим социологический смысл понятия энтропии и его использование для характеристики меры неопределенности26. Эн­тропия распределения позволяет измерить степень меры неопределен­ности, которую имеет исследователь в смысле знания значения Y для какого-либо случайно выбранного объекта (неопределености распреде­ления некоторой случайной величины Y).
Пусть случайная величина Y принимает конечное число значений 1,2, ..., k с вероятностями, равными соответственно P1, P
, …, Pk. Веро-
2
ятность какого-либо значения для выборочной совокупности тожде­ственна относительной частоте его встречаемости). Введем обозначе­ние
Р
= P (Y = j).
j
Энтропией случайной величины Y (и энтропией соответствую­щего распределения) называется функция
󰇛󰇜

Предположим, что имеются признаки U и V, независимые друг от друга. Признак U принимает k равновероятностных значений, а при­знак Vl равновероятностных значений. Выясним, каким свойствам должна удовлетворять функция f, характеризующая неопределенность распределений этих признаков. Ясно, что рассматриваемая функция за­висит от числа градаций признака, для измерения неопределенности распределения которого она используется, f = f (k) и что f (1) = 0. Также
очевидно, что если , то f (k)
f (l). Число сочетаний значений при-
знаков U и V равно произведению   . Степень неопределенности
двумерного распределения f (kl) должна быть равна сумме неопреде­ленностей соответствующих одномерных распределений:
f (k l) = f (k) + f (l).
Последнее соотношение наталкивает на мысль, что за меру не-
определенности распределения можно принять число , так как
26
Толстова, Ю. Н. Указ. соч. С. 159–163.
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]