Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Анализ данных в социологии. Учебно-методическое пособие
.pdf
Меры средней тенденции и меры разброса
После проведения исследования получаются частотные распределения значений рассматриваемых признаков (выборочное представление изучаемой одномерной случайной величины). Распределение частот является самым удобным способом представления различных значений переменной. Статистики, связанные с распределением частот,
можно разделить на три группы:
– меры средней тенденции (показатели центра распределения);
– меры разброса (показатели вариации);
– показатели формы распределения.
Показатели центра распределения характеризуют положение
центра распределения, вокруг которого концентрируются данные.
Это – среднее арифметическое, мода и медиана14.
Наиболее часто используемым показателем является среднее
арифметическое, или, как его еще называют, выборочное среднее. Эта
величина получается делением суммы всех имеющихся значений переменной на число значений:
=
,
где xi – полученные значения переменной x; n – число наблюдений, или
размер выборочной совокупности.
Если рассматривать какую-либо группу респондентов, то среднее
арифметическое значение признака можно проинтерпретировать как
значение, характерное для наиболее типичного человека из этой
группы. Среднее значение в этом случае выступает в качестве характеристики рассматриваемого признака всей группы. Однако следует помнить, что подобная интерпретация среднего арифметического допустима не всегда.
Важным показателем центра распределения является медиана.
Медианой называется значение переменной в середине ряда данных,
расположенных в порядке возрастания или убывания. Если число данных четное, то медиана равна полусумме двух срединных значений.
Следует отметить, что медиана является так называемым пятидесятым
процентилем и соответственно пятым децилем и вторым квартилем:
14
Малхотра, Н. К. Маркетинговые исследования. Практическое руководство. М.:
Издательский дом «Вильямс», 2002. С. 558–559.
21

.
Заметим, медиана обладает тем свойством, что половина всех выборочных значений изучаемого признака меньше нее, а половина –
больше. Вычисление медианы имеет смысл только для порядкового или
интервального признака, так как для номинального признака отсутствуют категории «больше» и «меньше».
Медиана может быть рассчитана и с помощью кумуляты (рис. 7),
т. е. используется предположение о непрерывности изучаемого признака15. Для этого рассматривается кумулятивный ряд, т.е. ряд накопленных частот. На так называемый медианный интервал приходится
0,5 N наблюдений. Присвоим медианному интервалу номер l, тогда
Nl=Fl – F
. Все эти варианты заключены между x'l и х"l. Так как точные
l–1
значения каждого из вариантов неизвестны, то в простейшем случае делается предположение, что внутри интервала все они расположены равномерно, т. е. прирост частоты пропорционален приросту интервала:
.
Рис. 7. Расчет медианы с помощью кумуляты
15
Рабочая книга социолога / под общ. ред. и с предисл. Г. В. Осипова. М.: Едито-
риал УРСС, 2003. С. 161, 157.
22

И, следовательно,
.
Еще одним показателем центра распределения является мода.
Мода – это значение переменной, которое чаще всего встречается в выборочном распределении.
В завершение обзора характеристик центра распределения остановимся на некоторых методических аспектах их использования в ситуациях, возникающих при изучении статистических закономерностей
произвольного вида.
Любая средняя является параметром распределения соответствующей случайной величины (либо статистикой, вычисленной для выборочного частотного распределения изучаемого признака). Все методы
нахождения статистических закономерностей основаны на расчете некоторых параметров рассматриваемых распределений, а любая закономерность может быть выражена через ту или иную их совокупность.
Для всех параметров рассматриваемых распределений актуальной является задача их точечного и интервального оценивания. Решение этой
задачи для средних величин известно, однако для многих параметров
теоретическая основа, дающая возможность построения интервала, не
разработана, что не позволяет переносить результаты с выборки на генеральную совокупность. Единственным способом решения данной
проблемы является использование процедуры компьютерного моделирования большого числа выборок, наблюдение и вычисление параметров получающихся при этом распределений статистик и построение на
этой основе требующихся доверительных интервалов16.
Любая статистическая закономерность, выявляемая при работе с
эмпирическими данными, является сжатием исходных данных. Например, от множества возрастов респондентов, составляющих выборочную
совокупность исследования, возможно перейти к среднему арифметическому их возрастов, выражаемому одним числом. При этом такое
сжатие закономерно оборачивается потерей информации, которая происходит при нахождении любой закономерности. Учет этого обстоятельства необходим в процессе интерпретации данных. Например, следует помнить, что за средним арифметическим возрастов респондентов
16
Толстова, Ю. Н. Указ. соч. С. 149.
23

стоит множество таких возрастов и их разброс может быть достаточно
велик17.
Любая статистическая закономерность имеет смысл лишь при
определенной однородности совокупности исследуемых объектов, для
которой она рассчитывается. Любая средняя характеризует центральную тенденцию распределения лишь тогда, когда изучаемая совокупность объектов однородна относительно исследуемых признаков – в тех
случаях, когда объекты в основном сосредоточены вокруг этих средних. Это накладывает определенные ограничения на интерпретацию
данных, например недопустимо оперировать понятием среднего арифметического в ситуациях, когда разброс данных слишком велик, а также
использовать среднее арифметическое при сравнениях без учета разброса данных.
Еще одним важным аспектом является необходимость формальной адекватности. Следует помнить, что спецификой социологических
данных, обусловливающей особенности использования применительно
к ним математической статистики, является то, что эти данные в процессе исследования зачастую бывают получены по шкалам низких типов (номинальных и порядковых). Арсенал методов анализа определяется типом используемых шкал, а результаты их использования должны
обладать свойством инвариантности относительно применения к исходным данным допустимых преобразований тех шкал, по которым эти
данные получены. Например, моду можно вычислять для шкал любых
типов, так как объект, обладающий модальным значением, не изменяется при любом взаимно однозначном преобразовании исходных
шкальных значений, а следовательно, и любые выводы, полученные на
основе анализа модальных значений, удовлетворяют свойству инвариантности. Аналогично расчет медианы и прочих квантилей требует по
меньшей мере порядковой шкалы, а вот среднее арифметическое уже
предполагает использование шкалы интервального типа18.
Помимо требования формальной адекватности необходима еще и
содержательная адекватность. Это возникает из-за того, что формальной адекватности метода недостаточно для его пригодности при решении определенной конкретной задачи. Например, метод может быть
17
Толстова, Ю. Н. Указ. соч. С. 149–150.
18
Там же. С. 150–151.
24

пригодным с точки зрения используемых шкал, но может быть непри-
minmax
xxR −=
годным с точки зрения содержания, не отвечать поставленной задаче19.
Последнее методическое положение состоит в необходимости анализа
модели, заложенной в методе. Применительно к показателям центра
распределения такие модели базируются на предположениях о типе
шкалы, отвечающей рассматриваемому признаку, о непрерывности
признака, о расположении его значений внутри каждого интервала
и т.д.20
В отличие от показателей центра распределения показатели вариации обозначают не разброс данных вокруг центра распределения, а
просто меру разброса данных. Показатели вариации включают размах
вариации, межквартильный размах, дисперсию, стандартное отклонение и коэффициент вариации21.
Проще всего рассчитать размах вариации. Он равен разности
между наибольшим и наименьшим значениями переменной в вариационном ряду и отражает разброс данных. Таким образом, его можно рассчитать следующим образом:
,
где x
x
– минимальное значение вариационном ряду.
min
– максимальное значение переменной в вариационном ряду;
max
Для того чтобы ввести понятие межквартильного размаха, нужно
более подробно остановиться на понятии «квантиль». Квантиль – это
такое значение признака q, которое делит диапазон его изменения на
две части таким образом, чтобы отношение числа элементов выборки,
имеющих значение признака, меньшее q, к числу элементов, имеющих
значение признака, большее q, было равно заранее заданной величине22.
Квантили объединяются в ряд семейств. Основой для такого объединения служит возможность квантилей делить диапазон изменения
признака на заданное число равнонаполненных частей. Наиболее часто
используются:
– квартили (разбивают диапазон изменения признака на 4 равнонаполненные части);
19
Толстова, Ю. Н. Указ. соч. С. 153.
20
Там же. С. 153.
21
Малхотра, Н. К. Указ соч. С. 559–560.
22
Толстова, Ю. Н. Указ. соч. С. 145.
25

– децили (разбивают диапазон изменения признака на 10 равно-
Q1 Q2
Q3
25 %
25 %
25 %
25 %
D
1
D
2
D
3
D
4
D
5
D
6
D
7
D
8
D
9
10 %
10 %
10 %
10 %
10 %
10 %
10 %
10 %
10 %
10 %
P
1
P
2
P
98
P
99
1 %
1 %
1 %
1 %
наполненных частей);
– процентили (разбивают диапазон изменения признака на 100
равнонаполненных частей).
Символически изображения семейств квантилей представлено на
рис. 8.
Квартили
Децили
Процентили
Рис. 8. Наиболее употребительные квантили. Доля объектов выборки,
попавших в этот интервал, обозначена величиной процента,
указанной под интервалом
В социологических задачах и в задачах из области социальной
статистики с квантилями приходится сталкиваться довольно часто. Так,
например, все население по уровню дохода делится на 10 частей – так
называемые децильные группы. Две крайние децильные группы объединяют 10 % наиболее бедных и 10 % наиболее богатых. Крайние децили D1 и D9 используются для расчета децильного коэффициента дифференциации населения по доходам.
Межквартильный размах, следующий показатель вариации, равен разности между 75-м и 25-м процентилями:
.
26

Не трудно заметить, что 75-й процентиль является 3-м квартилем, а 25-й
( )
=
−
−
=
n
i
i
n
xx
1
2
2
1
( )
=
−
−
==
n
i
i
n
xx
1
2
2
1
процентиль – 1-м квартилем. Отсюда
.
Межквартильный размах обычно используют для порядковых шкал.
Однако следует помнить, что, строго говоря, это некорректно, так как
для порядковой шкалы разности между шкальными значениями не являются осмысленными.
Важными показателями вариации являются дисперсия и среднеквадратическое отклонение. Дисперсия представляет собой среднее из
квадратов отклонений переменной от ее средней величины. Следует
помнить, что если значения данных сгруппированы вокруг среднего, то
дисперсия невелика. Если же значения данных разбросаны, то дисперсия считается большой. Дисперсия вычисляется следующим образом:
,
где xi – полученные значения переменной x; x – среднее арифметическое (выборочное среднее); n – число наблюдений, или размер выборочной совокупности.
Следует отметить, что деление происходит не на n, а на n – 1, по-
скольку генеральное среднее неизвестно, а вместо него используется
выборочное среднее. Это делает выборку менее изменчивой, чем фактически. Таким образом, мы корректируем более слабую изменчивость
значений переменной, наблюдаемую в выборке. Эта статистика является формально адекватной только для интервальных шкал (только в
этом случае сохраняется смысл использования среднего арифметического).
Среднеквадратическое (стандартное) отклонение равно корню
квадратному из значения дисперсии:
.
27

Последним показателем, на котором необходимо остановиться,
x
CV=
является коэффициент вариации. Он рассчитывается как отношение
стандартного отклонения к среднему арифметическому, выраженное
в процентах:
,
где – стандартное отклонение; x – среднее арифметическое (выборочное среднее).
Последняя группа показателей – показатели формы распределения23. Асимметрия характеризует симметрию расположения значений
относительно средней (рис. 9). Эксцесс является мерой относительной
крутости кривой распределения частот.
Рис. 9. Асимметрия распределения
Если признаки номинальные, то использование рассмотренных показателей разброса некорректно. В данном случае максимальным разброс
целесообразно считать при равномерном распределении. При этом разброс больше, если распределение ближе к равномерному, и, наоборот,
23
Малхотра, Н. К. Указ соч. С. 561–562.
28

разброс тем меньше, чем распределение дальше от равномерного. Для номинальных признаков используются такие показатели меры разброса, как
коэффициент качественной вариации и энтропийный коэффициент разброса24.
Рассчитаем коэффициент качественной вариации в предположении дихотомической шкалы (возможности выбрать только два варианта
ответа)25. Пусть первый ответ выбирали n1 респондентов, а второй вариант ответа – n2 респондентов. Понятно, что общее число респондентов равно n=n1+ n2. Произведение n
при заданном n минимально,
1n2
когда все респонденты выбирают один ответ, и максимально, когда оба
ответа выбираются равным числом респондентов, т. е. когда n1 =n2=n/2.
Значение произведения n
в этом случае
1n2
равно (n/2) (n/2)=n
2
/4. Ко-
эффициент качественной вариации для дихотомической шкалы равен
отношению произведения n
1n2
к его максимальному значению:
.
Найдем коэффициент качественной вариации для общего случая
номинальной шкалы (k вариантов ответа). Сверху в коэффициенте J бу-
дет располагаться сумма всевозможных произведений вида n
n
1n2+n1n3
+ n
2n3
+ n
1n4
+…+ n
k-1nk
. В знаменателе должно стоять
inj
, т. е.
максимальное значение такой суммы, т. е. значение для ситуации, когда
все ответы были выбраны равным числом респондентов. Для k вариантов и выборки объема n это число равно n/k человек. Значение произве-
дения в таком случае равно (n/k)(n/k)=n
n
вычисляется из комбинаторики как число сочетаний из k элемен-
inj
2/k2
. Число произведений вида
тов по 2 и равно . Отсюда формула для коэффициента ка-
чественной вариации:
.
24
Толстова, Ю. Н. Указ. соч. С. 155.
25
Там же. С. 155–159.
29

Далее рассмотрим социологический смысл понятия энтропии и
его использование для характеристики меры неопределенности26. Энтропия распределения позволяет измерить степень меры неопределенности, которую имеет исследователь в смысле знания значения Y для
какого-либо случайно выбранного объекта (неопределености распределения некоторой случайной величины Y).
Пусть случайная величина Y принимает конечное число значений
1,2, ..., k с вероятностями, равными соответственно P1, P
, …, Pk. Веро-
2
ятность какого-либо значения для выборочной совокупности тождественна относительной частоте его встречаемости). Введем обозначение
Р
= P (Y = j).
j
Энтропией случайной величины Y (и энтропией соответствующего распределения) называется функция
Предположим, что имеются признаки U и V, независимые друг от
друга. Признак U принимает k равновероятностных значений, а признак V – l равновероятностных значений. Выясним, каким свойствам
должна удовлетворять функция f, характеризующая неопределенность
распределений этих признаков. Ясно, что рассматриваемая функция зависит от числа градаций признака, для измерения неопределенности
распределения которого она используется, f = f (k) и что f (1) = 0. Также
очевидно, что если , то f (k)
f (l). Число сочетаний значений при-
знаков U и V равно произведению . Степень неопределенности
двумерного распределения f (kl) должна быть равна сумме неопределенностей соответствующих одномерных распределений:
f (k l) = f (k) + f (l).
Последнее соотношение наталкивает на мысль, что за меру не-
определенности распределения можно принять число , так как
26
Толстова, Ю. Н. Указ. соч. С. 159–163.
30
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
