Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы математической статистики в социальных науках (описательная статистика). Учебник
.pdf
3.6. Перцентили
мер измерения, которое больше или равно 34 % всех измерений – 0,34 180 = 61, т. е. ближайшее к результату целое число равно 61. Из таблицы 3 с упорядоченными значениями следует, что найденное значение равно 46, так как это значение стоит
на 61-м месте.
Ðèñ. 14. Использование огивы для определения процентилей и процен-
тильных рангов
3.6.2. Процентильный ранг
Тесно связано с понятием процентиль понятие процентиль-
íûé ðàíã. Но, с другой стороны, эти понятия различаются суще-
ственно. Предположим, что какой-то студент-первокурсник показал результат в 63 балла и хочет узнать относительное место своего достижения в частотном распределении (желает понять: на какое место номинируется его результат), т. е. какой процент студентов имеет результат хуже (ниже) его. Другими словами, студент хочет понять процентильный ранг своего результата, равно-
го 63-м баллам. По определению процентильный ранг является
точкой на процентной шкале (но не точкой на шкале измерения),
которая соответствует проценту баллов в распределении, меньшем 63. Процентильный ранг – это место, которое занимает данное измерение в частотном распределении. Для определения про-
61

3. Формы представления и описания данных
центильного ранга данного значения 63 (
) рассмотрим снова
✂
6Ç
данные из таблицы 7. Как видим, этот результат попадает в групповой интервал 59,5–64,5 и имеет 159 измерений, меньшая точка
соответствующего интервала – нижняя граница 59,5. При предположении, что 15 измерений, попадающих в этот интервал, равномерно распределены, можем определить, какая часть из них
меньше 63. Так как расстояние от начала интервала до точки
63 равно (63 – 59,5) : 5 = 0,7, имеем 15
0,7 = 10,5 измерений
из этого интервала, меньше 63. Тогда, прибавив 10,5 к 159, определим общее количество измерений перед 63-м и найдем
159 × 10,5
PR
=
63
180
= 94,17
.
PR
:
63
Скажем, что процентильный ранг измерения со значением
63 равен 94,17. Эта процедура может быть обобщена для вычисления процентильного ранга произвольного значения распределения в виде следующей формулы:
x – ll
cf +
=
PR
x
× f
i
i
, (4)
N
× 100
ãäå:
– измерение, для которого необходимо определить процен-
✂
тильный ранг;
ll – точная нижняя граница интервала, содержащая измере-
íèå õ;
N – общее количество измерений;
cf – кумулятивная частота измерения в предшествующем ин-
тервале, который содержит процентильную точку;
– количество измерений в интервале, содержащем нужный
f
i
процентиль;
i – ширина группового интервала.
Используем эту формулу для нахождения
PR по данным та-
блицы 7:
PR
62
61
=
159 +
61 – 59,5
5
180
× 15
× 100
159 + 4,50
=
180
× 100
.

3.6. Перцентили
Следовательно, измерение со значением 61 имеет процентиль-
ный ранг равный 90,83.
Процентильный ранг может быть определен и через использо-
вание огивы.
Например, для определения
нужно восстановить перпен-
PR
45
дикуляр от соответствующего измерения со значением 45, расположенного на оси абсцисс, к кривой распределения и когда они
пересекутся, провести перпендикуляр к ординате. Там, где перпендикуляр пересекает ординату, находится искомое значение
для
. Это проиллюстрировано на рисунке 14 для PR
PR
x
, которо-
45
му соответствует процентильное значение равное 48,45.
Для понимания разницы между процентильным значением
и процентильным рангом рассмотрим пример. Предположим,
что мы имеем распределение измерений, в котором измерение
со значением 83 балла соответствует 72-му перцентилю. Говорим, что 83 – это 72-й процентиль. С другой стороны, процентильный ранг измерения со значением 83 равен 72.
3.6.3. Применение процентилей
Аппарат процентилей используется широко при представле-
нии результатов стандартизированных тестов. Это определено
тем обстоятельством, что процентили сравнительно просто интерпретируемы при определении индивидуального ранга или позиции заданного индивида из группы и не только внутри группы, но и в генеральной совокупности. Однако процентили имеют
одну существенную слабость: так как многие переменные в социологии стремятся к распределению, близкому к нормальному, расстояния между процентильными точками расположены
неравномерно на шкале измерения. Это ведет к тому, что процентили задают ранговую шкалу измерения. Это хорошо видно на рисунке 15: в то время как значение 48 корреспондируется с 50-м процентилем, значения 45 и 51 корреспондируют соответственно с 40-м и 60-м процентилями, т. е. 6-балльная разница в середине распределения значений переменной соответствует
разнице в 20 процентильных баллов на его периферии. Из-за разброса процентильных значений в середине распределения часто
практически невозможно (в рамках выбранной точности) разли-
P
è
чить близкие процентильные значения, например
P
49
.
47
63

3. Формы представления и описания данных
Ðèñ. 15. Расположение процентилей на шкале измерений при нормаль-
ном частотном распределении
Как становится ясно из иллюстрации, когда интерпретируется измерение, лежащее близко к центру распределения, налицо тенденция, дающая чрезмерный вес незначительной разнице
в измерении. С другой стороны, когда процентили используются для крайних значений, налицо тенденция недооценки существенной разницы в измерении. Так как процентильная шкала
неравномерна, процентили не могут быть подвержены арифметическим операциям. Следовательно, нет основания их значениям
быть усредненными, собранными или использованными в вычислениях каким-то арифметическим способом. Процентили могут
быть использованы только для описания значений распределения. Если требуется провести статистическое представление, необходимо процентили трансформировать в некоторый другой вид
измерения, например в исходные наблюдения, и после этого произвести нужные манипуляции. Каждый, кто использует процентили, полученные по стандартизованным шкалам, должен помнить о ранговых свойствах процентилей и о соответствующих
ограничениях, которые эти свойства налагают на манипуляции
с данными.
В этой главе описаны процедуры организации, классификации и обобщения данных с использованием частотного распределения. Рассмотрено, каким образом частотное распределение
представляет наблюдаемые значения и место, где имеется наи-
64

3.6. Перцентили
большее их скопление. Были показаны различные виды частотного распределения, введены графические формы представления
данных: гистограмма, частотный полигон и др. Кроме процедуры
организации и классификации данных, были описаны процедуры для определения относительного места заданного измерения
в распределении. Процентили или процентильные значения были
определены как индикаторы расположения точки на кривой частотного распределения. В частности, процентиль был определен
как значение распределения, перед которым лежит определенный процент измерений. Процентили представляют привлекательный подход, так как могут предложить интерпретацию индивидуальных измерений сравниваемой по статистическим характеристикам группы в свете нормативно-референтного подхода, т. е. они могут служить диагностическим инструментом. Независимо от того, что процентили удобны для описания относительного расположения измерения в распределении, они не равномерно распределены по процентильной шкале и, следовательно, возможные статистические манипуляции с ними ограничены.
Отметим, что частотное распределение и процентили показы-
вают только часть информации, которую можно извлечь из данных. Существуют и другие характеристики распределения, тенденции и рассеивания, которые дают дополнительные сведения
для интерпретации и осмысления данных. Эти характеристики
рассмотрим в следующих главах.
65

4. ОПИСАНИЕ РАСПРЕДЕЛЕНИЯ:
МЕРЫ ЦЕНТРАЛЬНОЙ ТЕНДЕНЦИИ
И РАССЕИВАНИЯ
КЛЮЧЕВЫЕ ТЕРМИНЫ: мода, взвешенное среднее, бимодальное
распределение, многомодальное распределение, квартильное отклонение, одномодальное распределение, дисперсия, медиана, параметр, среднее (значение), объективная оценка, сумма отклонения, статистика,
квадрат отклонения, формула отклонения, сумма квадратов, стандартное отклонение, наименьшие квадраты, коэффициент вариации.
Мы рассмотрели конструирование частотного распределения
в виде процедуры организации и обобщения данных при представлении его характеристик. Были рассмотрены различные
виды распределения и место отдельных измерений в частотном
распределении, в частности, в терминах процентиль и процентильный ряд. Но наряду с приведенными существуют и другие
процедуры, которые раскрывают более глубокие свойства частотного распределения. Эти процедуры предусматривают расчет некоторых полезных характеристик или мер распределения наблюдений.
Существует три основные характеристики, которые представляют информацию для описания частотного распределения:
1) формы распределения;
2) расположения распределения по шкале измерения;
3) рассеивания различий между измерениями и данной (обыч-
но фиксированной) точкой.
Отсюда мы можем заключить, что знание распределения означает наличие ответов на три вопроса: 1. Как выглядит его форма?
2. Как организовано расположение данных? 3. Что собой представляет рассеивание измерений около фиксированной точки?
В связи с первым вопросом – мы уже обсуждали возможные
формы распределения, а также фигуры графического представления распределения, такие как гистограмма или частотный полигон. В связи со вторым вопросом – наиболее часто используются меры расположения, так называемые меры центральной тенденции. Эти меры можно рассматривать как своего рода средние
66

4.1. Меры центральной тенденции
значения, так как все они отражают тенденции в расположении
центра распределения частот. Мерами центральной тенденции,
которые наиболее часто используются и которые будут здесь рассматриваться, являются: среднее, мода и медиана.
Третий вопрос относится к рассеиванию измерений в распре-
делении, и наиболее часто используемыми мерами рассеивания
являются: размах, (полуразмах), межквартильный размах, дис-
персия è стандартное отклонение.
Размах распределения уже был упомянут в главе 3. Здесь
мы опишем его свойства более полно в связи с описанием частотного распределения.
4.1. Меры центральной тенденции
Меры центральной тенденции являются точками на шкале из-
мерения переменной. Многие переменные в социологии имеют
распределение, в котором точки группируются вокруг его середины, и только отдельные значения расположены на его концах
(ветвях). Примерами таких распределений являются нормальное распределение и близкие к нему распределения. Кроме того,
часто наблюдаются и асимметричные распределения, для которых меры центральной тенденции расположены близко к центру
интервальной шкалы, по которой измерена данная переменная.
Следовательно, важно не только вычисление меры центральной
тенденции на заданном множестве точек, но и то, как они могут
истолковываться по отношению к форме распределения.
4.1.1. Ìîäà
Ìîäà – самый общий показатель центральной тенденции. Она
определяется как наиболее часто встречающееся значение в частотном распределении и находится элементарным подсчетом,
а не путем алгебраических вычислений. Рассмотрим снова данные
результатов экзамена по статистике студентов-первокурсников.
Для удобства приведем еще раз полученные данные (табл. 8).
Мода этого распределения, очевидно, 56, так как это значение
встречается в 14 раз чаще, чем многие другие.
67

4. Описание распределения: меры центральной тенденции и рассеивания
Таблица 8
Частотное распределение результатов экзамена по статистике
у первокурсников
Измерение Частота, f Измерение Частота, f Измерение Частота, f
69 1 54 7 39 3
68 2 53 7 38 4
67 3 52 6 37 5
66 0 51 3 36 4
65 2 50 7 35 2
64 4 49 11 34 1
63 5 48 8 33 3
62 3 47 7 32 2
61 1 46 9 31 0
60 2 45 7 30 1
59 3 44 4 29 1
58 2 43 4 28 0
57 6 42 5 27 0
56 14 41 5 26 0
55 12 40 4 25 1
Здесь следует отметить, что, когда данные группируются в частотном распределении с фиксированной длиной интервала, для
моды берется середина классового интервала с наибольшей частотой. Например, если обратиться к сгруппированным данным
таблицы 9, в качестве моды должно быть выбрано значение в середине диапазона 45–49, следовательно, выберем значение, равное 47.
Если два соседних значения (или интервала для сгруппированных данных) встречаются чаще, чем соседние значения (или
интервалы), то распределение называют многомодальным (ïîëè-
модальным). Особый случай представляет распределение с двумя
модами. Тогда оно называется бимодальным (двухмодальным).
Рассмотрим данные, приведенные в таблице 9. Интервал
55–59 содержит 37 значений измерений, а несмежный интервал 45–49 – 42 значения. В соответствии с определением моды,
мы приходим к выводу, что это распределение имеет только одну
моду – 47 (7 повторений), но так как значение 57 на соседнем
интервале встречается примерно такое же количество раз (6 по-
68

4.1. Меры центральной тенденции
вторений), мы должны предположить, что распределение бимодально.
Таблица 9
Частотное распределение результатов экзамена по статистике
✝✞
Кумулятивная
частота
Относительная
частота, %
Кумулятивная
относительная
частота, %
Групповой ин-
тервал
студентов-
Точные границы
✂☎✞✝✁✁✂✆✄✁
Средняя точка
интервала
Частота, f
20–24 19,5–24,5 22 1 1 0,56 0,56
25–29 24,5–29,5 27 2 3 1,11 1,67
30–34 29,5–34,5 32 7 10 3,89 5,56
35–39 34,5–39,5 37 18 28 10,00 15,56
40–44 39,5–44,5 42 22 50 12,22 27,78
45–49 44,5–49,5 47 42 92 23,33 51,11
50–54 49,5–54,5 52 30 122 16,67 67,78
55–59 54,5–59,5 57 37 159 20,56 88,34
60–64 59,5–64,5 62 15 174 8,33 96,67
65–69 64,5–69,5 67 6 180 3,33 100,00
Всего – – 180 – 100,00 –
Мода – очень общая мера центральной тенденции. Она не поддается математическим манипуляциям и поэтому имеет ограниченное практическое значение в качестве статистического индекса. Единственная ситуация, в которой мода может быть полноценно использована – наличие большого количества измерений,
причем в сочетании с другими описательными мерами распределения.
4.1.2. Медиана
Второй мерой центральной тенденции является медиана. Медиана определяется как 50-й процентиль, т. е. это точка на шкале измерения, до которой находится ровно 50 % всех измерений.
При наличии сгруппированных данных расчет медианы является частным случаем вычисления процентиля по формуле:
69

4. Описание распределения: меры центральной тенденции и рассеивания
Med = ll +
ãäå:
N/2 – cf
, (5)
× i
f
i
ll – точная нижняя граница интервала, содержащего точку
с номером, равным
N/2;
N – общее количество измерений;
– кумулятивная частота измерений в интервале, предше-
✂
ствующем интервалу, который содержит точку с номером,
равным
– количество измерений в диапазоне, который содержит точ-
f
i
ку с номером, равным
N/2, т. е. медиану;
N/2, т. е. медиану;
i – ширина группового интервала.
Рассмотрим nример, и покажем использование формулы (5)
на материале данных таблицы 9. Медиана будет рассчитываться
следующим образом:
Med = 44,5 +
180/2 – 50
42
× 5 = 44,5 + 4,76 = 49,26
.
В случае несгруппированных данных медиана определяется
как среднее значение измерений в выборке упорядоченных измерений, как такое значение, при котором одна половина измерений меньше или равна, а другая половина больше или равна это-
– значение переменной с ранго-
му среднему значению. Если
вым номером
а) при нечетном
имеет ранг [(
i в упорядоченной выборке, то:
N медиана равна среднему значению, которое
N + 1)/2], ò. å. ýòî
x
i
✁
(квадратные скобки озна-
[(N+1)/2]
чают, что берем только целую часть частного);
б) при четном
двух значений с рангами
N медиана равна среднему арифметическому
N/2 è N/2+1, т. е. рассчитывается как
(
+
✁
N/2
✁
N/2+1
)/2.
Рассмотрим пример. Если мы находим медиану до того, как
сгруппировали результаты теста, т. е. по упорядоченным исходным данным (см. табл. 9), то единственное, что необходимо –
определить номер медианного значения. У нас есть 180 значений измерений. Следовательно, медиана лежит между двумя значениями с номерами 180/2 и 180/2+1, т. е. будет находиться
между 90-м и 91-м измерением, и определяется она как среднее
арифметическое этих двух значений. Так как эти два измерения
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
