Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы математической статистики в социальных науках (описательная статистика). Учебник
.pdf
4.1. Меры центральной тенденции
N
–
x
✁ ✁
, (10)
i = 1
✂
✁
i
N
ãäå
N – количество элементов генеральной совокупности,
– среднее генеральной совокупности.
✂
Ранее было отмечено, что на практике обычно располага-
ем только выборкой значений наблюдений, по которым можем
лишь оценить среднее отклонение. Может быть показано, что
для выборки из n измерений очень хорошую оценку среднего отклонения в генеральной совокупности, из которой извлечена выборка, дает формула:
✁
i = 1
N
– x
)
(x
i
. (11)
N – 1
Преимущество этой меры в том, что используются все полу-
ченные значения измерений. Недостаток в том, что она трудоемка для вычисления вручную.
4.2.4. Дисперсия
Äисперсия является наиболее предпочтительной мерой рассеи-
вания, когда измерения произведены в интервальной шкале или
шкале отношений. Дисперсия определяется как среднее арифметическое квадрата отклонений. Если дисперсия нас интересует только как описательная статистика, то необходимо возвести
в квадрат сумму всех отклонений от среднего, суммировать их и
разделить полученную сумму на количество отклонений.
Так как существуют особенности в вычислении дисперсии для
генеральной совокупности и выборки, рассмотрим эти два случая
отдельно. Обозначим дисперсию генеральной совокупности как
2
, а дисперсию выборки или статистическую дисперсию как
✁
2
(в литературе можно встретить и другие обозначения, но сущ-
s
ность формул от этого не меняется). Соответствующие им формулы рассмотрим ниже.
Дисперсия генеральной совокупности
Если известны наблюдения для всей генеральной совокупно-
сти, то дисперсия определяется как среднее арифметическое квадрата отклонения, или
81

4. Описание распределения: меры центральной тенденции и рассеивания
N
1
=
✁
✁
N
i = 1
2
–
)
, (12)
(x
✂
i
ãäå
N – количество измерений в генеральной совокупности,
– среднее генеральной совокупности.
✂
Дисперсия выборки
На практике обычно располагаем только выборкой из рассматриваемой генеральной совокупности. Тогда дисперсия может
быть оценена по формуле исправленной выборочной дисперсии:
1
2
=
s
n – 1
✁
2
(xi – x)
, (13)
ãäå
– количество измерений в выборке,
✂
– выборочное среднее.
x
Выражение
– x)2 называется суммой квадратов отклонений
(x
i
от среднего, или скорректированной суммой квадратов.
2
Отметим, что s
à íå íà
äà
n. Причина в том, что s
– x)2 разделим на n. Åñëè æå (xi – x)2 разделим на (n – 1),
(x
i
вычисляется, если разделить
2
будет заниженной оценкой
то результатом будет неискаженная
оценка
(xi – x)2 íà (n – 1),
2
. Оценка называется
✁
2
, êîã-
✁
неискаженной (несмещенной), если среднее всех значений оценки, полученное по всем возможным выборкам с данным фиксированным объемом, равно оцениваемому параметру. Эта концепция
формализуется и используется при статистическом выводе. Таким
2
образом, допуская увеличенное значение дисперсии
, мы увели-
s
чиваем и надежность прогноза для повторения на генеральной
совокупности результата, полученного на выборочной совокупности.
Суть проблемы в следующем. Выборочная дисперсия является смещенной оценкой генеральной дисперсии, и, если дисперсию
данных выборочной совокупности мы будем вычислять по формуле (12), у нас неизбежно произойдет смещение результата, так
как математическое ожидание выборочной дисперсии (
). В действительности
но оцениваемой генеральной дисперсии (
D
Ã
) íå ðàâ-
D
оно равно
n – 1
.
D
✄
n
82
M[D
] =
✁

4.1. Меры центральной тенденции
Очевидно, что исправленная дисперсия (s
2
) примет значение
генеральной дисперсии в том случае, если будет равно
n – 1
Иначе говоря, если
2
s
=
В том случае, если
2
=
s
n
✂
n
i = 1
n – 1
xi представлено группами значений, форму-
.
D
✁
n
n
2
)
– x
(x
i
n
=
✂
i = 1
(x
i
n – 1
– x
2
)
.
ла (13) принимает, соответственно, вид
n
n
✂
i = 1
2
= .
s
n – 1
(xi – x)
i
2
Однако следует заметить, что при больших объемах выборки
различия между делением числителя на
ся. Поэтому на практике обычно деление на (
n èëè íà (n – 1) стирают-
n – 1) используется
(например, в психологии или экономике) тогда, когда размер выборки невелик. В социологии, где число респондентов чаще всего более 380 (что в целом по выборке дает отклонение от значений на генеральной совокупности не более ±0,05, и вероятность
повторения результата составляет более 95 %) чаще всего применяется деление на
n.
Рассмотрим пример. Для иллюстрации вычисления диспер-
сии используем данные из таблицы 10. Предположим, что это
выборочные данные, т. е. они определяют распределение параметра генеральной совокупности, и в нашу задачу входит, поскольку объем выборки невелик, определить исправленную дисперсию.
В этом случае дисперсия может использоваться только для описательной цели и будет вычисляться по формуле (13):
2
(9 – 6)
2
= = 12,67.
=
s
+ (12 – 6)2 + … + (3 – 6)2 + (4 – 6)
6
2
76
6
Приведенная выше формула для вычисления дисперсии ге-
неральной совокупности называется формулой отклонения, так
как использует значения квадратов отклонений. Она применяется для небольшого количества измерений. В случае с данными
для 180 студентов-первокурсников вычисление дисперсии значи-
83

4. Описание распределения: меры центральной тенденции и рассеивания
тельно затрудняется, если не использовать современные технические средства.
На практике проще дисперсию вычислить по эквивалентным
формулам: для генеральной совокупности (генеральной дисперсии) –
2
xi)
(
✂
✂
2
x
–
i
]
; (14)
N
1
2
=
[
✁
N
для исправленной выборочной дисперсии –
2
(
xi)
s
2
=
n – 1
1
[
✂
2
x
✂
–
i
]
. (15)
n
Эти формулы известны как формулы исходных измерений.
Рассмотрим алгебраический вывод этих формул. Приведенная последовательность алгебраических преобразований приводит к формуле (14).
N
=
1
N
2
✁
1
=
N
[
x
✂
i
✂
i = 1
2
– 2
(x
N
N
–
i
✂
✂
✂
2
)
=
xi + N
1
N
✂
[
✂
2
]
=
=
✂✂✂
i
2
x
– 2N
i
2
x
i
–
2
)]=
✂
(
✂
N
xi)
2
N
+ N
2
]
.
[
✂
2
✂
2
x
– 2
i
]
=
1
N
xi +
✂
✂
[
x
✂
2
(x
– 2x
i
1
[
✂
N
1
[
✂
N
2
✂
✂
✂
2
– N ( )
i
N
]
=
x
i
2
]
1
Вывод формулы (15) осуществляется аналогичным образом.
Рассмотрим nример. Используя формулу (14) для данных
из таблицы 8, получим:
2
1
2
= ✁450624 – ✁ = 80,64.
✁
180
(8860)
180
Понятию дисперсии можно дать несколько описательных
определений, каждое из которых является истинным и характеризует содержание формул:
– дисперсия – это средняя величина суммы квадратов разностей наблюдаемых частот и их среднего значения;
– дисперсия равна разнице среднего значения квадратов наблюдаемых частот и квадрата их общей средней;
– дисперсия представляет собой сумму квадратов остатков, деленную на число наблюдений.
84
=

4.1. Меры центральной тенденции
4.2.5. Стандартное отклонение
Несмотря на то, что дисперсия представляет собой надежную
меру рассеивания, она имеет размерность, равную квадрату измерений, что может привести к трудностям в содержательной
интерпретации. В этом случае лучше использовать производную
меру, называемую стандартным отклонением.
Стандартное отклонение вычисляется по формуле:
n
✂(xi – ✂)
i = 1
2
=
✁
=
☎
✁
☎
2
. (16)
N
Аналогично для исправленного среднего квадратического от-
клонения имеем:
n
✂(xi – x)
2
s =
☎
èëè
s =
i = 1
☎
2
. (17)
N
В социологической практике ввиду оперирования с большим
объемом данных чаще всего не делается различий между генеральным и выборочным средним квадратическим отклонением
и используется стандартное отклонение
.
✁
Отметим преимущества стандартного отклонения:
а) для его расчета используются все значения измерения;
б) оно математически относительно легко рассчитывается, осо-
бенно при наличии современных информационно-технических
средств;
в) его размерность такая же, как и размерность исходного из-
мерения.
Среди недостатков необходимо отметить его чувствительность
к резко отличающимся наблюдениям (анормальным выбросам).
Интуитивная привлекательность стандартного отклонения как
индикатора рассеивания измерения состоит в следующем. Очень
часто стандартное отклонение используется при интерпретации
и определении процентильного значения в распределении данных, которые отстоят на расстоянии одного стандартного отклонения влево и вправо от среднего. Если наблюдение представляет собой нормальное распределение (этот термин мы рассмотрим
в гл. 5), то в интервале [
– ✁, ✂ + ✁] находится 68,26 % всех значе-
✂
85

4. Описание распределения: меры центральной тенденции и рассеивания
ний измерения или, что то же самое, с вероятностью P = 0,6826
наблюдаемые частоты будут находиться в названном интервале
(т. е. функция Лапласа при аргументе t = 1,00 имеет значение
(t) = 0,3413 è 2✁(t) = P = 0,6826).
✁
Большинство распределений на практике в разной степени отличаются от нормального распределения, но, вопреки этому, можно сказать, что приблизительно 2/3 значений для большинства
распределений попадают в этот интервал.
Так как стандартное отклонение представляется в тех же единицах измерения, что и исходные данные, то это дает некоторые
преимущества. Например, рассмотрим тест интеллекта (
IQ), который имеет среднее около 100 баллов, стандартное отклонение
15 баллов и дисперсию 225 баллов. Если какой-то студент имеет
IQ равное 115 баллам, то это означает, что данный студент имеет
результат, отличающийся на одно стандартное отклонение (вправо) от среднего. Дисперсия (она равна 225) в этом случае непоказательна для описания данных ввиду того, что измерена в системе, отличной от непосредственно примененной для измерения
2
». Но обе эти меры рассеивания часто ис-
и не ясно, что значит «
IQ
IQ,
пользуются при интерпретации распределений в статистических
методах анализа. Сравнение дисперсий или среднего квадратического отклонения особенно информативно в случае рассмотрения
групп наблюдаемых частот. Большая дисперсия (большее значение среднего квадратического отклонения) соответствует большему разбросу наблюдаемых частот, что демонстрирует более мощное воздействие изучаемого фактора на анализируемые данные.
Напротив, меньшая дисперсия (меньшее значение среднего квадратического отклонения) показывает меньшее отличие наблюдаемых частот от их среднего значения, а значит, полученные данные имеют распределение, мало отличающееся от равномерного,
и изучаемый фактор действует слабо или вообще не определяет
анализируемый материал.
4.2.6. Коэффициент вариации
Интерпретация абсолютной меры рассеивания зависит от шкалы, в которой измеряется наблюдение. Эффект измерительной
шкалы преодолевается через стандартизацию абсолютной меры
рассеивания с помощью величины, которая соизмерима со шка-
86

4.1. Меры центральной тенденции
лой измерения, чаще всего это среднее значение. Базовая формула может быть записана как:
Abs
Aver
,
Rel =
ãäå:
Rel – относительная мера рассеивания;
Abs – абсолютная мера рассеивания;
Aver – избранная мера среднего.
В случае если в качестве абсолютной меры возьмем стандарт-
ное отклонение, а мерой среднего – среднее арифметическое значение, получаем коэффициент вариации. Обыкновенно он выражается в процентах. Для коэффициента вариации обычно (в литературе встречаются и другие обозначения) используется сим-
V(x), коэффициент может быть получен для генеральной со-
вол
вокупности по формуле:
✁
(x) = × 100 %; (18)
V
✄
✂
а для оценки вариации в генеральной совокупности по вариации в выборочной совокупности как
V
✁
x
s
(x) = × 100 %.
Преимущества: коэффициент вариации – безразмерная вели-
чина, т. е. не зависит от единиц измерения.
Недостатки:
а) может привести к неправильным выводам при отсутствии
специфической информации для среднего и стандартного отклонения;
б) не очень удобен для интерпретации;
в) может использоваться только при условии, что среднее –
положительная величина.
Коэффициент вариации может применяться и для оценки раз-
личия в распределении значений двух переменных. В этом случае он называется коэффициентом ковариации, а его формальное выражение имеет следующий вид:
cov (x,y) = M [(X – MX)(Y – MY)]= M(X×Y) – MX ×MY
,
87

4. Описание распределения: меры центральной тенденции и рассеивания
т. е. коэффициент ковариации представляет собой разность математического ожидания произведения переменных X è Y и произведения математических ожиданий переменных X è Y. Иначе говоря, это величина, определенная разностью среднего значения
произведений величин x
è yi и произведения их средних значе-
i
íèé:
cov (x,y) = xy
– x y.
Нами рассмотрены меры центральной тенденции и рассеивания, использующиеся чаще всего. С помощью этих мер можно
описывать частотное распределение не только по его форме, но и
в терминах центральной тенденции и рассеивания около среднего значения. Использование мер центральной тенденции и рассеивания зависит от типа шкалы, по которой измерена изучаемая переменная. Таблица 11 обобщает связь между шкалами
и соответствующими мерами центральной тенденции и рассеивания. Столбцы таблицы с 3-го по 6-й показывают, для какого
типа шкал какие меры разработаны в математической статистике и применимы в смысле получения строго обоснованных результатов.
Таблица 11
Связь между шкалами измерений и мерами центральной тенденции
и рассеивания
Типы шкал измерения
Меры
центральной
тенденции
Меры
рассеивания
Íîìè-
нальная
шкала
Мода õ õ õ х
Медиана - õ õ х
Среднее - - õ õ
Размах - - õ õ
Квартильное
отклонение
Дисперсия - õ õ х
Стандартное
отклонение
- õ õ õ
- - õ õ
Ранговая
шкала
Интер-
вальная
шкала
Шкала от-
ношений
88

4.1. Меры центральной тенденции
Однако, если придерживаться этих критериев, окажется, что
применимость методик статистического анализа категорически
ограничивается. Дело в том, что, скажем, интервальные шкалы
в практике социологических исследований встречаются достаточно редко. Тем более, при рассмотрении сопряженностей вопросов
пересечение двух интервальных или абсолютных шкал – случай,
по сути, исключительный. Равным образом порядковые шкалы,
хотя и чаще используются и, соответственно, чаще могут наблюдаться при сопряженности вопросов, но все же преимущественно в социологических исследованиях прибегают к номинальным
шкалам, которые, по-видимому, проще формировать.
Между тем статистические методы анализа социологической
информации представляют собой очень ценные приемы, позволяющие производить анализ собранного статистического материала
с необходимым уровнем надежности выводов. Важным моментом
здесь выступает, безусловно, субъективность как субъекта, осуществляющего научную работу и по составлению программы исследования, и по изучению собранных данных, так и субъектов,
чье мнение, положение, состояние, деятельность попадают в сферу научного интереса. Так, например, являются ли ответные позиции какого-либо вопроса анкеты, определенные нами как принадлежащие к номинальной шкале, действительно номинальными?
Во-первых, они кодируются соответствующими номерами, а значит, сознательно или бессознательно мы приписываем им определенный порядок расположения. Так же и респонденты воспринимают расположенные в заданном порядке ответные позиции
как не совсем равнозначные. Следовательно, любая номинальная
шкала при необходимости во время анализа ее содержания может
рассматриваться как условно порядковая. И наоборот, любая порядковая шкала при необходимости может рассматриваться как
условно номинальная. Соответственно, и интервальная шкала может приниматься в качестве условно порядковой, так как интервалы в ней носят упорядоченный характер.
Следует иметь в виду и еще один момент: все программы компьютерного анализа составлены с учетом того, что каждой переменной приписан определенный код, являющийся порядковым
номером ответной позиции, а это дает основание технически оценивать шкалу переменной как порядковую. Однако в большинстве случаев приходится обращаться к рассмотрению процентной
89

4. Описание распределения: меры центральной тенденции и рассеивания
представленности ответов безотносительно к коду ответной пози-
ции, т. е. подходить к ним просто как к ряду (рядам) цифр. На-
пример, первый вариант ответа выделен 15 % респондентов, вто-
рой – 5 %, третий – 20 %, четвертый – 50 %, а пятый – 10 %.
Нет никаких формальных ограничений, чтобы не использовать
при анализе этого ряда цифр стандартное отклонение, диспер-
сию, коэффициент вариации, среднее значение или какую-либо
другую меру рассеивания или центральной тенденции.
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
