Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы математической статистики в социальных науках (описательная статистика). Учебник
.pdf
3.4. Графическое представление частотного распределения
Как и «ящичная» диаграмма, диаграмма типа «ствол-лист»
используется для разведочного анализа, давая общее представление о распределении значений переменной.
4) Гистограмма – это графическое представление частотного
распределения данной непрерывной переменной в виде прямоугольных столбиков, площадь которых пропорциональна частоте
случаев, попадающих в данный класс. Она подобна столбиковой
диаграмме (рис. 8).
Если интервалы для каждого класса имеют одинаковые раз-
меры, то высота прямоугольников пропорциональна соответствующей классовой частоте. Если интервалы различны, то высоты
прямоугольников должны быть выровнены соответственно интервалам ширины. Отметим, что по горизонтали нанесены измерения, а по вертикали – частоты.
Ðèñ. 8. Гистограмма результатов экзамена по статистике студентов-
первокурсников
5) Линейная диаграмма èëè полигон частот. Это точечная
диаграмма, в которой измерения нанесены по горизонтали и связаны отсечки так, что образуется ломаная линия или совокупность точек, которые могут быть аппроксимированы кривой линией (рис. 9).
51

3. Формы представления и описания данных
Эта диаграмма применима только в том случае, если переменная по оси абсцисс непрерывна и для любого значения абсциссы
имеется соответствующее значение ординаты.
Ðèñ. 9. Линейная диаграмма или полигон частот
Эта диаграмма называется полигон частот, если одна ось,
как правило – ордината, представляет частоту, а другая, как
правило – ось абсцисс, задает соответственно метрическую шкалу. Если по абсциссе располагаются временные отрезки, а по ординате – соответственно частоты, то такой график называется
временным рядом.
3.5. Различия в форме частотного распределения
После того как мы рассмотрели графическое изображение нескольких частотных распределений, становится ясно, что все они
отличаются по своей форме, т. е. имеет место разница в форме
52

3.5. Различия в форме частотного распределения
частотного распределения. Существует группа терминов, которые
используются для описания различных форм частотного распределения, изображенных графически.
Предположим, что наблюдаются высокие частоты в правой ча-
сти полигона и невысокие частоты слева, так что они делают левый край распределения длинным. Тогда считается, что данное
распределение левостороннее èëè отрицательно асимметрич-
íîå. С другой стороны, если налицо более высокое значение частот
переменной слева от математического ожидания (т. е. их среднего
значения), а низкие значения частот расположены в правой части
частотного полигона, распределение называется правосторонним
èëè положительно асимметричным.
Примеры такого распределения показаны на рисунке 10, пер-
вое распределение (а) отрицательно асимметрично, второе (б) – положительно асимметрично.
Ðèñ. 10. Различные типы частотного полигона (распределения)
Будем считать, что частотное распределение симметрично,
когда существует линия, перпендикулярная к оси абсцисс (горизонтальная ось, на которой нанесены возможные значения переменной), которая делит частотный полигон на две одинаковые ча-
53

3. Формы представления и описания данных
сти. Наиболее известное симметричное распределение – нормальное распределение èëè нормальная кривая. Это распределение
по ряду причин играет центральную роль во многих науках.
На рисунке 11 показаны три различные кривые. Все они симметричны, но отличаются по наклону или скошенности. Степень
скошенности называется эксцессом.
Ветви графика распределения могут быть круче нормального,
и тогда говорят, что оно имеет положительный эксцесс (эксцесс
больше чем у нормального распределения). Если же ветви графика более пологие в сравнении с нормальным распределением,
говорят, что оно имеет отрицательный эксцесс (эксцесс меньше,
чем у нормального распределения). Если эксцесс близок по виду
к нормальному распределению, говорится, что у распределения
нулевой эксцесс.
Ðèñ. 11. Симметричное частотное распределение
Понятия симметрия, асимметрия и эксцесс используются,
для описания формы частотного распределения случайной переменной. Эти понятия показывают, каким образом и где сосредоточены частоты отдельных значений.
54

3.5. Различия в форме частотного распределения
Математическое выражение асимметрии выглядит следую-
щим образом:
=
✂3✁
3
.
A
s
Здесь представление о количественном значении асимметрии
дает отношение центрального момента третьего порядка (т. е. математического ожидания – иначе говоря, среднего значения переменной, взятого в третьей степени) к кубу среднего квадратического отклонения (о котором речь еще впереди).
Математическое выражение эксцесса содержит вычитание аб-
солютной величины 3 из отношения центрального момента четвертого порядка (т. е. среднего значения переменной в четвертой
степени) к среднему квадратическому отклонению четвертой степени:
=
✂4✁
4
– 3,
Таким образом, при
E
k
4
= 3, эксцесс равен нулю, и даже если
✂4✁
находится вблизи этой величины, распределение значений переменной соответствует или близко к нормальному. При положительном значении эксцесса кривая, характеризующая распределение значений переменной, имеет более высокую и острую вершину по сравнению с нормальной кривой. Отрицательная величина эксцесса дает более низкую и плоскую вершину кривой,
чем та, что наблюдается при нормальном распределении.
Оценка переменной по эксцессу и асимметрии имеет важное
значение, поскольку при наличии нормального распределения собранных данных факторы, которые мы приняли в качестве определяющих, действуют системно, а значит – один из них является наиболее значимым, а все остальные только вызывают рассеивание значений переменной. Более того, если отбросить результат действия всех прочих факторов, как, например, поступил Галилео Галилей в опытах со свободным падением тел разной массы, мы получаем строгую детерминацию одним фактором результата эксперимента. Тем самым, при наличии эксцесса выше значения нормального распределения можно говорить о наличии
фактора, поглощающего действие всех прочих возможных факторов. Однако все же чаще всего мы имеем дело либо с рассеиванием данных, в этом случае факторы весьма существенно «растя-
55

3. Формы представления и описания данных
гивают», «рассеивают» значения переменной ниже уровня нормального распределения либо сдвигают его «вправо» или «влево», что означает, в лучшем случае, что в изучаемом объекте действительно имеет место сдвиг исследуемого параметра генеральной совокупности, в худшем случае, что сформулированный вопрос и соотношение ответных позиций не являются корректными, т. е. сформулированы неверно. Последнее проявляется тогда,
когда, скажем, в анкетном опросе приведены ответные позиции
так, что их выбор заранее предрешен.
3.6. Перцентили
До этого момента мы обсуждали процедуры организации,
классификации и обобщения множества данных с помощью частотного распределения. Сейчас же переместим наше внимание
к вопросу о том, где находится заданное значение в частотном
распределении по отношению к измерениям, значения которых
больше или меньше заданного. Ответ на этот вопрос важен, когда
интерпретируются индивидуальные значения, например, нужно
определить положение значения индивидуального результата достижения определенного студента или развитие интересующего
нас ребенка. Одним из способов оценить относительное положение статуса студента или ребенка выступает определение в процентах достижений индивидуума в соответствующей группе,
представители которой дали значения измерений ниже и выше
рассматриваемого. Этот подход приводит к понятию процентиль
(перцентиль).
Процентиль èëè процентильная точка (значение) опреде-
ляется как такая точка частотного распределения, слева от которой лежит определенный процент точек, имеющих меньшие
значения. Например, 38-й процентиль распределения отмечается как
чений, меньших заданного. Рассмотрим результаты прохождения теста студентами-первокурсниками. Предположим, что необходимо определить то значение, до которого находятся 75 %
результатов, т. е. необходимо определить 75-й процентиль. Этот
процентиль может быть определен, если построим расширенную
таблицу частот, включающую кумулятивные частоты и кумулятивные относительные частоты.
56
✂
, это – точка, левее которой расположены 38 % зна-
38

3.6. Перцентили
3.6.1. Кумулятивное частотное распределение
Кумулятивное частотное распределение – это распределе-
ние, при котором частоты для заданного группового интервала
получаются как сумма частот в текущем интервале и всех предыдущих интервалов. Подобным способом получается и кумуля-
тивное относительное частотное распределение с той разницей, что оно отражает относительные доли, накопленные до этого момента. Все расчеты обыкновенно осуществляются в процентах. Кумулятивное относительное частотное распределение получается, если разделим соответствующую кумулятивную частоту для заданного классового интервала на количество всех измерений, полученное значение умножим на 100, чтобы представить
это распределение в процентах, а не в частях от единицы.
Рассмотрим снова результаты экзамена по статистике. В та-
блице 7 показаны два новых столбца (¹ 5, 7) – один с кумулятивными частотами, а другой – с кумулятивными относительными частотами. Например, для интервала 40–44 получим
50/180 = 0,2778, или 27,78 %.
Таблица 7
Частотное распределение результатов экзамена по статистике
студентов-первокурсников
Ñðåä-
Группо-
âîé èí-
тервал
20 – 24 19,5 – 24,5 22 1 1 0,56 0,56
25 – 29 24,5 – 29,5 27 2 3 1,11 1,67
30 – 34 29,5 – 34,5 32 7 10 3,89 5,56
35 – 39 34,5 – 39,5 37 18 28 10,00 15,56
40 – 44 39,5 – 44,5 42 22 50 12,22 27,78
45 – 49 44,5 – 49,5 47 42 92 23,33 51,11
50 – 54 49,5 – 54,5 52 30 122 16,67 67,78
55 – 59 54,5 – 59,5 57 37 159 20,56 88,34
60 – 64 59,5 – 64,5 62 15 174 8,33 96,67
65 – 69 64,5 – 69,5 67 6 180 3,33 100,00
Всего – – 180 – 100,00 –
Точные гра-
íèöû
íÿÿ
точка
интер-
âàëà
Часто-
òà, f
Êóìó-
лятив-
íàÿ ÷à-
стота
Относительная
частота,
%
Кумуля-
тивная
относи-
тельная
частота,
%
57

3. Формы представления и описания данных
Графическое изображение кумулятивного частотного распределения подобно линейной диаграмме, и называется оно – êóìó-
лятивный полигон частот. Он изображен на рисунке 12. Ку-
мулятивный полигон частот называется также огивой, а кумулятивный относительный частотный полигон называется ïðî-
центной огивой, он показан на рисунке 13. Из процентной огивы можно сразу увидеть, что 60 % измерений имеют значения,
меньше 52, т. е. 108 студентов показали результаты, ниже или
равные 52 баллам.
Ðèñ. 12. Кумулятивный полигон абсолютных частот или огива
Предположим, что необходимо определить 75-й процентиль,
. Это будет то значение, перед кото-
который обозначим как
рым лежат 75 % измерений, или 180
P
75
0,75 = 135 измерений,
меньших или равных данному значению. Если обратимся к таблице 7, то увидим в столбце кумулятивных относительных частот, что нужная нам точка лежит в групповом интервале 55–59
или в точном интервале 54,5–59,5.
Кроме того, из столбца, содержащего кумулятивные частоты,
видим, что 122 человека имеют результат, меньший или равный
точной верхней границе интервала, предшествующего тому, который содержит нужное нам измерение, т. е. 122 студента име-
58

3.6. Перцентили
ют результат, меньше чем 54,5. Следовательно, остальные 135 –
122 = 13 значений, включая и то, которое нужно определить, будут
лежать в следующем интервале. Рассмотрим интервал 54,5–59,5,
в который попадает интересующий нас процентиль.
Ðèñ. 13. Кумулятивный полигон относительных частот или процентная
огива
Этот интервал содержит 37 измерений, для которых мы пред-
положили, что они равномерно расположены внутри него. Очевидно, из всего интервала нужно будет определить только число случаев, попадающих в отсечку длинной, пропорциональной частоте измерений, которые нам нужны дополнительно,
т. е. 13/37. Весь интервал имеет длину 5 единиц. Нас интересует часть (13/37)
5 = 1,76. Тогда 75-й процентиль может быть
определен как точная нижняя граница интервала, который содержит этот процентиль. Прибавив частоту, которая отсекается
от этого интервала, получаем:
13
P
=
34
54,5 +
× 5 = 54,5 + 1,76 = 56,26
37
.
Эта процедура может быть обобщена для нахождения
59

3. Формы представления и описания данных
любого процентиля в виде следующей формулы:
Np – cf
, (3)
× i
f
i
ãäå:
P
= ll +
x
ll – точная нижняя граница интервала, содержащая интересую-
щий нас процентиль (процентильную точку);
N – общее количество измерений;
p – часть единицы, соответствующая интересующему нас про-
центилю, например, для 25-го процентиля p = 0,25;
cf – кумулятивная частота измерения в интервале, предшеству-
ющем интервалу, который содержит процентильную точку;
f
– количество измерений в интервале, содержащем нужный
i
процентиль;
i – ширина группового интервала.
Рассмотрим на примере. Определим 34-й процентиль (P
данных из таблицы 7. По формуле (3) имеем:
) äëÿ
34
P
=
34
44,5 +
180 × 0,34 – 50
42
× 5 = 45,83
.
Следовательно, измерение, перед которым находятся 34 % измерений, равно 45,83 единицы.
Процентили могут быть получены графически с использованием огивы. Например, для нахождения 74-го процентиля строим
горизонтальную линию из точки с ординатой 74 (на процентной
шкале, которая соответствует номеру процентиля) к огиве до пересечения с ней. Из точки пересечения опускаем перпендикуляр
к оси абсцисс, на которой расположены измерения. Точка, в которой этот перпендикуляр пересекает ось X, есть искомое процентильное значение. Эта процедура проиллюстрирована на рисунке 14 с 74-м процентилем, для которого имеем значение, равное 55.
Отметим, что описанные методы для определения процентилей в известном смысле неточны, так как они работают со сгруппированными данными. Если располагаем несгруппированными данными, операция по определению процентилей сводится
к упорядочению измерения в нарастающем вариационном ряду
(от наименьшего к наибольшему) и определению номера процентиля в этом ряду. Например, пусть снова определяется
60
P
. Íî-
34
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
