Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы математической статистики в социальных науках (описательная статистика). Учебник

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
4.1. Меры центральной тенденции
N
–
x
✁ ✁
, (10)
i = 1
✂
✁
i
N
ãäå
N – количество элементов генеральной совокупности,
– среднее генеральной совокупности.
✂
Ранее было отмечено, что на практике обычно располага-
ем только выборкой значений наблюдений, по которым можем лишь оценить среднее отклонение. Может быть показано, что для выборки из n измерений очень хорошую оценку среднего от­клонения в генеральной совокупности, из которой извлечена вы­борка, дает формула:
✁
i = 1
N
– x
)
(x
i
. (11)
N – 1
Преимущество этой меры в том, что используются все полу-
ченные значения измерений. Недостаток в том, что она трудоем­ка для вычисления вручную.
4.2.4. Дисперсия
Äисперсия является наиболее предпочтительной мерой рассеи-
вания, когда измерения произведены в интервальной шкале или шкале отношений. Дисперсия определяется как среднее ариф­метическое квадрата отклонений. Если дисперсия нас интересу­ет только как описательная статистика, то необходимо возвести в квадрат сумму всех отклонений от среднего, суммировать их и разделить полученную сумму на количество отклонений.
Так как существуют особенности в вычислении дисперсии для
генеральной совокупности и выборки, рассмотрим эти два случая отдельно. Обозначим дисперсию генеральной совокупности как
2
, а дисперсию выборки или статистическую дисперсию как
✁
2
(в литературе можно встретить и другие обозначения, но сущ-
s
ность формул от этого не меняется). Соответствующие им форму­лы рассмотрим ниже.
Дисперсия генеральной совокупности
Если известны наблюдения для всей генеральной совокупно-
сти, то дисперсия определяется как среднее арифметическое ква­драта отклонения, или
81
4. Описание распределения: меры центральной тенденции и рассеивания
N
1
=
✁
✁
N
i = 1
2
–
)
, (12)
(x
✂
i
ãäå
N – количество измерений в генеральной совокупности,
– среднее генеральной совокупности.
✂
Дисперсия выборки
На практике обычно располагаем только выборкой из рассма­триваемой генеральной совокупности. Тогда дисперсия может быть оценена по формуле исправленной выборочной дисперсии:
1
2
=
s
n – 1
✁
2
(xi – x)
, (13)
ãäå
– количество измерений в выборке,
✂
– выборочное среднее.
x
Выражение
– x)2 называется суммой квадратов отклонений
(x
i
от среднего, или скорректированной суммой квадратов.
2
Отметим, что s à íå íà äà
n. Причина в том, что s
– x)2 разделим на n. Åñëè æå (xi – x)2 разделим на (n – 1),
(x
i
вычисляется, если разделить
2
будет заниженной оценкой
то результатом будет неискаженная
оценка
(xi – x)2 íà (n – 1),
2
. Оценка называется
✁
2
, êîã-
✁
неискаженной (несмещенной), если среднее всех значений оцен­ки, полученное по всем возможным выборкам с данным фиксиро­ванным объемом, равно оцениваемому параметру. Эта концепция формализуется и используется при статистическом выводе. Таким
2
образом, допуская увеличенное значение дисперсии
, мы увели-
s
чиваем и надежность прогноза для повторения на генеральной совокупности результата, полученного на выборочной совокупно­сти.
Суть проблемы в следующем. Выборочная дисперсия являет­ся смещенной оценкой генеральной дисперсии, и, если дисперсию данных выборочной совокупности мы будем вычислять по фор­муле (12), у нас неизбежно произойдет смещение результата, так как математическое ожидание выборочной дисперсии (
). В действительности
но оцениваемой генеральной дисперсии (
D
Ã
) íå ðàâ-
D
оно равно
n – 1
.
D
✄
n
82
M[D
] =
✁
4.1. Меры центральной тенденции
Очевидно, что исправленная дисперсия (s
2
) примет значение
генеральной дисперсии в том случае, если будет равно
n – 1
Иначе говоря, если
2
s
=
В том случае, если
2
=
s
n
✂
n
i = 1
n – 1
xi представлено группами значений, форму-
.
D
✁
n
n
2
)
– x
(x
i
n
=
✂
i = 1
(x
i
n – 1
– x
2
)
.
ла (13) принимает, соответственно, вид
n
n
✂
i = 1
2
= .
s
n – 1
(xi – x)
i
2
Однако следует заметить, что при больших объемах выборки
различия между делением числителя на ся. Поэтому на практике обычно деление на (
n èëè íà (n – 1) стирают-
n – 1) используется
(например, в психологии или экономике) тогда, когда размер вы­борки невелик. В социологии, где число респондентов чаще все­го более 380 (что в целом по выборке дает отклонение от значе­ний на генеральной совокупности не более ±0,05, и вероятность повторения результата составляет более 95 %) чаще всего приме­няется деление на
n.
Рассмотрим пример. Для иллюстрации вычисления диспер-
сии используем данные из таблицы 10. Предположим, что это выборочные данные, т. е. они определяют распределение параме­тра генеральной совокупности, и в нашу задачу входит, посколь­ку объем выборки невелик, определить исправленную дисперсию. В этом случае дисперсия может использоваться только для описа­тельной цели и будет вычисляться по формуле (13):
2
(9 – 6)
2
= = 12,67.
=
s
+ (12 – 6)2 + … + (3 – 6)2 + (4 – 6)
6
2
76
6
Приведенная выше формула для вычисления дисперсии ге-
неральной совокупности называется формулой отклонения, так как использует значения квадратов отклонений. Она применяет­ся для небольшого количества измерений. В случае с данными для 180 студентов-первокурсников вычисление дисперсии значи-
83
4. Описание распределения: меры центральной тенденции и рассеивания
тельно затрудняется, если не использовать современные техниче­ские средства.
На практике проще дисперсию вычислить по эквивалентным формулам: для генеральной совокупности (генеральной диспер­сии) –
2
xi)
(
✂
✂
2
x
–
i
]
; (14)
N
1
2
=
[
✁
N
для исправленной выборочной дисперсии –
2
(
xi)
s
2
=
n – 1
1
[
✂
2
x
✂
–
i
]
. (15)
n
Эти формулы известны как формулы исходных измерений.
Рассмотрим алгебраический вывод этих формул. Приведен­ная последовательность алгебраических преобразований приво­дит к формуле (14).
N
=
1
N
2
✁
1
=
N
[
x
✂
i
✂
i = 1
2
– 2
(x
N
N
–
i
✂
✂
✂
2
)
=
xi + N
1
N
✂
[
✂
2
]
=
=
✂✂✂
i
2
x
– 2N
i
2
x
i
–
2
)]=
✂
(
✂
N
xi)
2
N
+ N
2
]
.
[
✂
2
✂
2
x
– 2
i
]
=
1
N
xi +
✂
✂
[
x
✂
2
(x
– 2x
i
1
[
✂
N
1
[
✂
N
2
✂
✂
✂
2
– N ( )
i
N
]
=
x
i
2
]
1
Вывод формулы (15) осуществляется аналогичным образом.
Рассмотрим nример. Используя формулу (14) для данных из таблицы 8, получим:
2
1
2
= ✁450624 – ✁ = 80,64.
✁
180
(8860)
180
Понятию дисперсии можно дать несколько описательных определений, каждое из которых является истинным и характе­ризует содержание формул:
– дисперсия – это средняя величина суммы квадратов разно­стей наблюдаемых частот и их среднего значения;
– дисперсия равна разнице среднего значения квадратов на­блюдаемых частот и квадрата их общей средней;
– дисперсия представляет собой сумму квадратов остатков, де­ленную на число наблюдений.
84
=
4.1. Меры центральной тенденции
4.2.5. Стандартное отклонение
Несмотря на то, что дисперсия представляет собой надежную
меру рассеивания, она имеет размерность, равную квадрату из­мерений, что может привести к трудностям в содержательной интерпретации. В этом случае лучше использовать производную меру, называемую стандартным отклонением.
Стандартное отклонение вычисляется по формуле:
n
✂(xi – ✂)
i = 1
2
=
✁
=
☎
✁
☎
2
. (16)
N
Аналогично для исправленного среднего квадратического от-
клонения имеем:
n
✂(xi – x)
2
s =
☎
èëè
s =
i = 1
☎
2
. (17)
N
В социологической практике ввиду оперирования с большим
объемом данных чаще всего не делается различий между гене­ральным и выборочным средним квадратическим отклонением и используется стандартное отклонение
.
✁
Отметим преимущества стандартного отклонения: а) для его расчета используются все значения измерения; б) оно математически относительно легко рассчитывается, осо-
бенно при наличии современных информационно-технических средств;
в) его размерность такая же, как и размерность исходного из-
мерения.
Среди недостатков необходимо отметить его чувствительность
к резко отличающимся наблюдениям (анормальным выбросам).
Интуитивная привлекательность стандартного отклонения как
индикатора рассеивания измерения состоит в следующем. Очень часто стандартное отклонение используется при интерпретации и определении процентильного значения в распределении дан­ных, которые отстоят на расстоянии одного стандартного откло­нения влево и вправо от среднего. Если наблюдение представля­ет собой нормальное распределение (этот термин мы рассмотрим в гл. 5), то в интервале [
– ✁, ✂ + ✁] находится 68,26 % всех значе-
✂
85
4. Описание распределения: меры центральной тенденции и рассеивания
ний измерения или, что то же самое, с вероятностью P = 0,6826 наблюдаемые частоты будут находиться в названном интервале (т. е. функция Лапласа при аргументе t = 1,00 имеет значение
(t) = 0,3413 è 2✁(t) = P = 0,6826).
✁
Большинство распределений на практике в разной степени от­личаются от нормального распределения, но, вопреки этому, мож­но сказать, что приблизительно 2/3 значений для большинства распределений попадают в этот интервал.
Так как стандартное отклонение представляется в тех же еди­ницах измерения, что и исходные данные, то это дает некоторые преимущества. Например, рассмотрим тест интеллекта (
IQ), ко­торый имеет среднее около 100 баллов, стандартное отклонение 15 баллов и дисперсию 225 баллов. Если какой-то студент имеет IQ равное 115 баллам, то это означает, что данный студент имеет результат, отличающийся на одно стандартное отклонение (впра­во) от среднего. Дисперсия (она равна 225) в этом случае непока­зательна для описания данных ввиду того, что измерена в систе­ме, отличной от непосредственно примененной для измерения
2
». Но обе эти меры рассеивания часто ис-
и не ясно, что значит «
IQ
IQ,
пользуются при интерпретации распределений в статистических методах анализа. Сравнение дисперсий или среднего квадратиче­ского отклонения особенно информативно в случае рассмотрения групп наблюдаемых частот. Большая дисперсия (большее значе­ние среднего квадратического отклонения) соответствует больше­му разбросу наблюдаемых частот, что демонстрирует более мощ­ное воздействие изучаемого фактора на анализируемые данные. Напротив, меньшая дисперсия (меньшее значение среднего ква­дратического отклонения) показывает меньшее отличие наблюда­емых частот от их среднего значения, а значит, полученные дан­ные имеют распределение, мало отличающееся от равномерного, и изучаемый фактор действует слабо или вообще не определяет анализируемый материал.
4.2.6. Коэффициент вариации
Интерпретация абсолютной меры рассеивания зависит от шка­лы, в которой измеряется наблюдение. Эффект измерительной шкалы преодолевается через стандартизацию абсолютной меры рассеивания с помощью величины, которая соизмерима со шка-
86
4.1. Меры центральной тенденции
лой измерения, чаще всего это среднее значение. Базовая форму­ла может быть записана как:
Abs
Aver
,
Rel =
ãäå:
Rel – относительная мера рассеивания; Abs – абсолютная мера рассеивания; Aver – избранная мера среднего.
В случае если в качестве абсолютной меры возьмем стандарт-
ное отклонение, а мерой среднего – среднее арифметическое зна­чение, получаем коэффициент вариации. Обыкновенно он выра­жается в процентах. Для коэффициента вариации обычно (в ли­тературе встречаются и другие обозначения) используется сим-
V(x), коэффициент может быть получен для генеральной со-
вол вокупности по формуле:
✁
(x) = × 100 %; (18)
V
✄
✂
а для оценки вариации в генеральной совокупности по вариа­ции в выборочной совокупности как
V
✁
x
s
(x) = × 100 %.
Преимущества: коэффициент вариации – безразмерная вели-
чина, т. е. не зависит от единиц измерения.
Недостатки: а) может привести к неправильным выводам при отсутствии
специфической информации для среднего и стандартного откло­нения;
б) не очень удобен для интерпретации; в) может использоваться только при условии, что среднее –
положительная величина.
Коэффициент вариации может применяться и для оценки раз-
личия в распределении значений двух переменных. В этом слу­чае он называется коэффициентом ковариации, а его формаль­ное выражение имеет следующий вид:
cov (x,y) = M [(X – MX)(Y – MY)]= M(X×Y) – MX ×MY
,
87
4. Описание распределения: меры центральной тенденции и рассеивания
т. е. коэффициент ковариации представляет собой разность мате­матического ожидания произведения переменных X è Y и произ­ведения математических ожиданий переменных X è Y. Иначе го­воря, это величина, определенная разностью среднего значения произведений величин x
è yi и произведения их средних значе-
i
íèé:
cov (x,y) = xy
– x y.
Нами рассмотрены меры центральной тенденции и рассеива­ния, использующиеся чаще всего. С помощью этих мер можно описывать частотное распределение не только по его форме, но и в терминах центральной тенденции и рассеивания около средне­го значения. Использование мер центральной тенденции и рас­сеивания зависит от типа шкалы, по которой измерена изуча­емая переменная. Таблица 11 обобщает связь между шкалами и соответствующими мерами центральной тенденции и рассеи­вания. Столбцы таблицы с 3-го по 6-й показывают, для какого типа шкал какие меры разработаны в математической статисти­ке и применимы в смысле получения строго обоснованных ре­зультатов.
Таблица 11
Связь между шкалами измерений и мерами центральной тенденции
и рассеивания
Типы шкал измерения
Меры цен­тральной тенден­ции
Меры рассеива­ния
Íîìè-
нальная
шкала Мода õ õ õ х Медиана - õ õ х Среднее - - õ õ
Размах - - õ õ
Квартильное отклонение
Дисперсия - õ õ х Стандартное
отклонение
- õ õ õ
- - õ õ
Ранговая
шкала
Интер-
вальная
шкала
Шкала от-
ношений
88
4.1. Меры центральной тенденции
Однако, если придерживаться этих критериев, окажется, что применимость методик статистического анализа категорически ограничивается. Дело в том, что, скажем, интервальные шкалы в практике социологических исследований встречаются достаточ­но редко. Тем более, при рассмотрении сопряженностей вопросов пересечение двух интервальных или абсолютных шкал – случай, по сути, исключительный. Равным образом порядковые шкалы, хотя и чаще используются и, соответственно, чаще могут наблю­даться при сопряженности вопросов, но все же преимуществен­но в социологических исследованиях прибегают к номинальным шкалам, которые, по-видимому, проще формировать.
Между тем статистические методы анализа социологической информации представляют собой очень ценные приемы, позволя­ющие производить анализ собранного статистического материала с необходимым уровнем надежности выводов. Важным моментом здесь выступает, безусловно, субъективность как субъекта, осу­ществляющего научную работу и по составлению программы ис­следования, и по изучению собранных данных, так и субъектов, чье мнение, положение, состояние, деятельность попадают в сфе­ру научного интереса. Так, например, являются ли ответные пози­ции какого-либо вопроса анкеты, определенные нами как принад­лежащие к номинальной шкале, действительно номинальными? Во-первых, они кодируются соответствующими номерами, а зна­чит, сознательно или бессознательно мы приписываем им опре­деленный порядок расположения. Так же и респонденты воспри­нимают расположенные в заданном порядке ответные позиции как не совсем равнозначные. Следовательно, любая номинальная шкала при необходимости во время анализа ее содержания может рассматриваться как условно порядковая. И наоборот, любая по­рядковая шкала при необходимости может рассматриваться как условно номинальная. Соответственно, и интервальная шкала мо­жет приниматься в качестве условно порядковой, так как интер­валы в ней носят упорядоченный характер.
Следует иметь в виду и еще один момент: все программы ком­пьютерного анализа составлены с учетом того, что каждой пере­менной приписан определенный код, являющийся порядковым номером ответной позиции, а это дает основание технически оце­нивать шкалу переменной как порядковую. Однако в большин­стве случаев приходится обращаться к рассмотрению процентной
89
4. Описание распределения: меры центральной тенденции и рассеивания
представленности ответов безотносительно к коду ответной пози-
ции, т. е. подходить к ним просто как к ряду (рядам) цифр. На-
пример, первый вариант ответа выделен 15 % респондентов, вто-
рой – 5 %, третий – 20 %, четвертый – 50 %, а пятый – 10 %.
Нет никаких формальных ограничений, чтобы не использовать
при анализе этого ряда цифр стандартное отклонение, диспер-
сию, коэффициент вариации, среднее значение или какую-либо
другую меру рассеивания или центральной тенденции.
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]