Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Методы математической статистики в социальных науках (описательная статистика). Учебник

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
3.6. Перцентили
мер измерения, которое больше или равно 34 % всех измере­ний – 0,34 180 = 61, т. е. ближайшее к результату целое чис­ло равно 61. Из таблицы 3 с упорядоченными значениями следу­ет, что найденное значение равно 46, так как это значение стоит на 61-м месте.
Ðèñ. 14. Использование огивы для определения процентилей и процен-
тильных рангов
3.6.2. Процентильный ранг
Тесно связано с понятием процентиль понятие процентиль-
íûé ðàíã. Но, с другой стороны, эти понятия различаются суще-
ственно. Предположим, что какой-то студент-первокурсник пока­зал результат в 63 балла и хочет узнать относительное место свое­го достижения в частотном распределении (желает понять: на ка­кое место номинируется его результат), т. е. какой процент сту­дентов имеет результат хуже (ниже) его. Другими словами, сту­дент хочет понять процентильный ранг своего результата, равно- го 63-м баллам. По определению процентильный ранг является точкой на процентной шкале (но не точкой на шкале измерения), которая соответствует проценту баллов в распределении, мень­шем 63. Процентильный ранг – это место, которое занимает дан­ное измерение в частотном распределении. Для определения про-
61
3. Формы представления и описания данных
центильного ранга данного значения 63 (
) рассмотрим снова
✂
6Ç
данные из таблицы 7. Как видим, этот результат попадает в груп­повой интервал 59,5–64,5 и имеет 159 измерений, меньшая точка соответствующего интервала – нижняя граница 59,5. При пред­положении, что 15 измерений, попадающих в этот интервал, рав­номерно распределены, можем определить, какая часть из них меньше 63. Так как расстояние от начала интервала до точки 63 равно (63 – 59,5) : 5 = 0,7, имеем 15
0,7 = 10,5 измерений
из этого интервала, меньше 63. Тогда, прибавив 10,5 к 159, опре­делим общее количество измерений перед 63-м и найдем
159 × 10,5
PR
=
63
180
= 94,17
.
PR
:
63
Скажем, что процентильный ранг измерения со значением 63 равен 94,17. Эта процедура может быть обобщена для вычис­ления процентильного ранга произвольного значения распреде­ления в виде следующей формулы:
x – ll
cf +
=
PR
x
× f
i
i
, (4)
N
× 100
ãäå:
– измерение, для которого необходимо определить процен-
✂
тильный ранг;
ll – точная нижняя граница интервала, содержащая измере-
íèå õ;
N – общее количество измерений;
cf – кумулятивная частота измерения в предшествующем ин-
тервале, который содержит процентильную точку;
– количество измерений в интервале, содержащем нужный
f
i
процентиль;
i – ширина группового интервала.
Используем эту формулу для нахождения
PR по данным та-
блицы 7:
PR
62
61
=
159 +
61 – 59,5
5
180
× 15
× 100
159 + 4,50
=
180
× 100
.
3.6. Перцентили
Следовательно, измерение со значением 61 имеет процентиль-
ный ранг равный 90,83.
Процентильный ранг может быть определен и через использо-
вание огивы.
Например, для определения
нужно восстановить перпен-
PR
45
дикуляр от соответствующего измерения со значением 45, распо­ложенного на оси абсцисс, к кривой распределения и когда они пересекутся, провести перпендикуляр к ординате. Там, где пер­пендикуляр пересекает ординату, находится искомое значение для
. Это проиллюстрировано на рисунке 14 для PR
PR
x
, которо-
45
му соответствует процентильное значение равное 48,45.
Для понимания разницы между процентильным значением
и процентильным рангом рассмотрим пример. Предположим, что мы имеем распределение измерений, в котором измерение со значением 83 балла соответствует 72-му перцентилю. Гово­рим, что 83 – это 72-й процентиль. С другой стороны, процен­тильный ранг измерения со значением 83 равен 72.
3.6.3. Применение процентилей
Аппарат процентилей используется широко при представле-
нии результатов стандартизированных тестов. Это определено тем обстоятельством, что процентили сравнительно просто ин­терпретируемы при определении индивидуального ранга или по­зиции заданного индивида из группы и не только внутри груп­пы, но и в генеральной совокупности. Однако процентили имеют одну существенную слабость: так как многие переменные в со­циологии стремятся к распределению, близкому к нормально­му, расстояния между процентильными точками расположены неравномерно на шкале измерения. Это ведет к тому, что про­центили задают ранговую шкалу измерения. Это хорошо вид­но на рисунке 15: в то время как значение 48 корреспондирует­ся с 50-м процентилем, значения 45 и 51 корреспондируют соот­ветственно с 40-м и 60-м процентилями, т. е. 6-балльная разни­ца в середине распределения значений переменной соответствует разнице в 20 процентильных баллов на его периферии. Из-за раз­броса процентильных значений в середине распределения часто практически невозможно (в рамках выбранной точности) разли-
P
è
чить близкие процентильные значения, например
P
49
.
47
63
3. Формы представления и описания данных
Ðèñ. 15. Расположение процентилей на шкале измерений при нормаль-
ном частотном распределении
Как становится ясно из иллюстрации, когда интерпретирует­ся измерение, лежащее близко к центру распределения, нали­цо тенденция, дающая чрезмерный вес незначительной разнице в измерении. С другой стороны, когда процентили используют­ся для крайних значений, налицо тенденция недооценки суще­ственной разницы в измерении. Так как процентильная шкала неравномерна, процентили не могут быть подвержены арифмети­ческим операциям. Следовательно, нет основания их значениям быть усредненными, собранными или использованными в вычис­лениях каким-то арифметическим способом. Процентили могут быть использованы только для описания значений распределе­ния. Если требуется провести статистическое представление, не­обходимо процентили трансформировать в некоторый другой вид измерения, например в исходные наблюдения, и после этого про­извести нужные манипуляции. Каждый, кто использует процен­тили, полученные по стандартизованным шкалам, должен пом­нить о ранговых свойствах процентилей и о соответствующих ограничениях, которые эти свойства налагают на манипуляции с данными.
В этой главе описаны процедуры организации, классифика­ции и обобщения данных с использованием частотного распре­деления. Рассмотрено, каким образом частотное распределение представляет наблюдаемые значения и место, где имеется наи-
64
3.6. Перцентили
большее их скопление. Были показаны различные виды частот­ного распределения, введены графические формы представления данных: гистограмма, частотный полигон и др. Кроме процедуры организации и классификации данных, были описаны процеду­ры для определения относительного места заданного измерения в распределении. Процентили или процентильные значения были определены как индикаторы расположения точки на кривой ча­стотного распределения. В частности, процентиль был определен как значение распределения, перед которым лежит определен­ный процент измерений. Процентили представляют привлека­тельный подход, так как могут предложить интерпретацию ин­дивидуальных измерений сравниваемой по статистическим ха­рактеристикам группы в свете нормативно-референтного подхо­да, т. е. они могут служить диагностическим инструментом. Не­зависимо от того, что процентили удобны для описания относи­тельного расположения измерения в распределении, они не рав­номерно распределены по процентильной шкале и, следователь­но, возможные статистические манипуляции с ними ограничены.
Отметим, что частотное распределение и процентили показы-
вают только часть информации, которую можно извлечь из дан­ных. Существуют и другие характеристики распределения, тен­денции и рассеивания, которые дают дополнительные сведения для интерпретации и осмысления данных. Эти характеристики рассмотрим в следующих главах.
65
4. ОПИСАНИЕ РАСПРЕДЕЛЕНИЯ:
МЕРЫ ЦЕНТРАЛЬНОЙ ТЕНДЕНЦИИ
И РАССЕИВАНИЯ
КЛЮЧЕВЫЕ ТЕРМИНЫ: мода, взвешенное среднее, бимодальное
распределение, многомодальное распределение, квартильное отклоне­ние, одномодальное распределение, дисперсия, медиана, параметр, сред­нее (значение), объективная оценка, сумма отклонения, статистика, квадрат отклонения, формула отклонения, сумма квадратов, стандарт­ное отклонение, наименьшие квадраты, коэффициент вариации.
Мы рассмотрели конструирование частотного распределения в виде процедуры организации и обобщения данных при пред­ставлении его характеристик. Были рассмотрены различные виды распределения и место отдельных измерений в частотном распределении, в частности, в терминах процентиль и процен­тильный ряд. Но наряду с приведенными существуют и другие процедуры, которые раскрывают более глубокие свойства частот­ного распределения. Эти процедуры предусматривают расчет не­которых полезных характеристик или мер распределения наблю­дений.
Существует три основные характеристики, которые представ­ляют информацию для описания частотного распределения:
1) формы распределения;
2) расположения распределения по шкале измерения;
3) рассеивания различий между измерениями и данной (обыч-
но фиксированной) точкой.
Отсюда мы можем заключить, что знание распределения озна­чает наличие ответов на три вопроса: 1. Как выглядит его форма?
2. Как организовано расположение данных? 3. Что собой пред­ставляет рассеивание измерений около фиксированной точки?
В связи с первым вопросом – мы уже обсуждали возможные формы распределения, а также фигуры графического представ­ления распределения, такие как гистограмма или частотный по­лигон. В связи со вторым вопросом – наиболее часто используют­ся меры расположения, так называемые меры центральной тен­денции. Эти меры можно рассматривать как своего рода средние
66
4.1. Меры центральной тенденции
значения, так как все они отражают тенденции в расположении центра распределения частот. Мерами центральной тенденции, которые наиболее часто используются и которые будут здесь рас­сматриваться, являются: среднее, мода и медиана.
Третий вопрос относится к рассеиванию измерений в распре-
делении, и наиболее часто используемыми мерами рассеивания являются: размах, (полуразмах), межквартильный размах, дис- персия è стандартное отклонение.
Размах распределения уже был упомянут в главе 3. Здесь
мы опишем его свойства более полно в связи с описанием частот­ного распределения.
4.1. Меры центральной тенденции
Меры центральной тенденции являются точками на шкале из-
мерения переменной. Многие переменные в социологии имеют распределение, в котором точки группируются вокруг его сере­дины, и только отдельные значения расположены на его концах (ветвях). Примерами таких распределений являются нормаль­ное распределение и близкие к нему распределения. Кроме того, часто наблюдаются и асимметричные распределения, для кото­рых меры центральной тенденции расположены близко к центру интервальной шкалы, по которой измерена данная переменная. Следовательно, важно не только вычисление меры центральной тенденции на заданном множестве точек, но и то, как они могут истолковываться по отношению к форме распределения.
4.1.1. Ìîäà
Ìîäà – самый общий показатель центральной тенденции. Она
определяется как наиболее часто встречающееся значение в ча­стотном распределении и находится элементарным подсчетом, а не путем алгебраических вычислений. Рассмотрим снова данные результатов экзамена по статистике студентов-первокурсников. Для удобства приведем еще раз полученные данные (табл. 8). Мода этого распределения, очевидно, 56, так как это значение встречается в 14 раз чаще, чем многие другие.
67
4. Описание распределения: меры центральной тенденции и рассеивания
Таблица 8
Частотное распределение результатов экзамена по статистике
у первокурсников
Измерение Частота, f Измерение Частота, f Измерение Частота, f
69 1 54 7 39 3 68 2 53 7 38 4 67 3 52 6 37 5 66 0 51 3 36 4 65 2 50 7 35 2 64 4 49 11 34 1 63 5 48 8 33 3 62 3 47 7 32 2 61 1 46 9 31 0 60 2 45 7 30 1 59 3 44 4 29 1 58 2 43 4 28 0 57 6 42 5 27 0 56 14 41 5 26 0 55 12 40 4 25 1
Здесь следует отметить, что, когда данные группируются в ча­стотном распределении с фиксированной длиной интервала, для моды берется середина классового интервала с наибольшей ча­стотой. Например, если обратиться к сгруппированным данным таблицы 9, в качестве моды должно быть выбрано значение в се­редине диапазона 45–49, следовательно, выберем значение, рав­ное 47.
Если два соседних значения (или интервала для сгруппиро­ванных данных) встречаются чаще, чем соседние значения (или интервалы), то распределение называют многомодальным (ïîëè- модальным). Особый случай представляет распределение с двумя модами. Тогда оно называется бимодальным (двухмодальным).
Рассмотрим данные, приведенные в таблице 9. Интервал 55–59 содержит 37 значений измерений, а несмежный интер­вал 45–49 – 42 значения. В соответствии с определением моды, мы приходим к выводу, что это распределение имеет только одну моду – 47 (7 повторений), но так как значение 57 на соседнем интервале встречается примерно такое же количество раз (6 по-
68
4.1. Меры центральной тенденции
вторений), мы должны предположить, что распределение бимо­дально.
Таблица 9
Частотное распределение результатов экзамена по статистике
✝✞
Кумулятивная
частота
Относительная
частота, %
Кумулятивная
относительная
частота, %
Групповой ин-
тервал
студентов-
Точные границы
✂☎✞✝✁✁✂✆✄✁
Средняя точка
интервала
Частота, f 20–24 19,5–24,5 22 1 1 0,56 0,56 25–29 24,5–29,5 27 2 3 1,11 1,67 30–34 29,5–34,5 32 7 10 3,89 5,56 35–39 34,5–39,5 37 18 28 10,00 15,56 40–44 39,5–44,5 42 22 50 12,22 27,78 45–49 44,5–49,5 47 42 92 23,33 51,11 50–54 49,5–54,5 52 30 122 16,67 67,78 55–59 54,5–59,5 57 37 159 20,56 88,34 60–64 59,5–64,5 62 15 174 8,33 96,67 65–69 64,5–69,5 67 6 180 3,33 100,00
Всего – – 180 – 100,00 –
Мода – очень общая мера центральной тенденции. Она не под­дается математическим манипуляциям и поэтому имеет ограни­ченное практическое значение в качестве статистического индек­са. Единственная ситуация, в которой мода может быть полно­ценно использована – наличие большого количества измерений, причем в сочетании с другими описательными мерами распреде­ления.
4.1.2. Медиана
Второй мерой центральной тенденции является медиана. Ме­диана определяется как 50-й процентиль, т. е. это точка на шка­ле измерения, до которой находится ровно 50 % всех измерений.
При наличии сгруппированных данных расчет медианы явля­ется частным случаем вычисления процентиля по формуле:
69
4. Описание распределения: меры центральной тенденции и рассеивания
Med = ll +
ãäå:
N/2 – cf
, (5)
× i
f
i
ll – точная нижняя граница интервала, содержащего точку
с номером, равным
N/2;
N – общее количество измерений;
– кумулятивная частота измерений в интервале, предше-
✂
ствующем интервалу, который содержит точку с номером, равным
– количество измерений в диапазоне, который содержит точ-
f
i
ку с номером, равным
N/2, т. е. медиану;
N/2, т. е. медиану;
i – ширина группового интервала.
Рассмотрим nример, и покажем использование формулы (5) на материале данных таблицы 9. Медиана будет рассчитываться следующим образом:
Med = 44,5 +
180/2 – 50
42
× 5 = 44,5 + 4,76 = 49,26
.
В случае несгруппированных данных медиана определяется как среднее значение измерений в выборке упорядоченных изме­рений, как такое значение, при котором одна половина измере­ний меньше или равна, а другая половина больше или равна это-
– значение переменной с ранго-
му среднему значению. Если вым номером
а) при нечетном имеет ранг [(
i в упорядоченной выборке, то:
N медиана равна среднему значению, которое
N + 1)/2], ò. å. ýòî
x
i
✁
(квадратные скобки озна-
[(N+1)/2]
чают, что берем только целую часть частного);
б) при четном двух значений с рангами
N медиана равна среднему арифметическому
N/2 è N/2+1, т. е. рассчитывается как
(
+
✁
N/2
✁
N/2+1
)/2.
Рассмотрим пример. Если мы находим медиану до того, как сгруппировали результаты теста, т. е. по упорядоченным исхо­дным данным (см. табл. 9), то единственное, что необходимо – определить номер медианного значения. У нас есть 180 значе­ний измерений. Следовательно, медиана лежит между двумя зна­чениями с номерами 180/2 и 180/2+1, т. е. будет находиться между 90-м и 91-м измерением, и определяется она как среднее арифметическое этих двух значений. Так как эти два измерения
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]