Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Элементы математических теорий для юристов. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
993 Кб
Скачать

признака и частот (частостей) попаданий признака в каждый из них. Рассмотрим последовательность построения такого ряда.

Для построения интервального ряда весь диапазон варьирования признака в выборке (между минимальной и максимальной вариантами выборки) делят на интервалы группировки обычно одинаковой длины. Для каждого интервала устанавливают его верхнюю и нижнюю границы, а затем распределяют выборочные данные по полученным интервалам группировки. При этом в интервал включают значения больше или равные нижней границе и меньше верхней границы. Длину частичного интервала h выбираюттак, чтобы построенный ряд несодержал случайных деталей, не был громоздким и позволял выявить характерные черты изменения значений исследуемого признака.

Приблизительно число интервалов k можно оценить исходя только из объема выборки n с помощью табл. 2.

Таблица 2

Число интервалов и объем выборки

Объем выборки

25-40

40-60

60-100

100-200

> 200

Число интервалов

5-6

6-8

7-10

8-12

10-15

Начало первого интервала (нижнюю границу интервального ряда) рекомендуется выбирать по формуле хнач = хмин - 0,5h. Промежуточные интервалы получают, прибавляя h к верхней границе предыдущего интервала. Верхняя граница хкон интервального ряда должна удовлетворять

условию хкон - h хмакс хкон. Выполнение этих условий приведет к увеличению числа интервалов на единицу.

Пример. Для определения защитных свойств органического материала по немупроизведено 50 выстрелов из пистолета. Выборка, полученная в результате измерения глубины пулевых следов, представлена следующими значениями:

13,9

19,8

18,5

20,2

24,0

16,7

20,4

11,8

18,6

19,1

15,4

17,2

19,2

23,3

18,1

21,9

16,5

19,7

23,5

19,4

16,8

13,2

21,4

16,5

18,7

21,5

21,9

12,5

19,3

15,3

18,1

16,8

14,7

20,8

19,5

15,3

18,1

18,4

10,0

14,3

17,8

16,2

15,7

22,8

21,9

12,5

17,7

18,3

19,1

17,5

Необходимо построить интервальный вариационный ряд.

Для построения ряда по приведенным выше показателям приближенно определяем число интервалов группировки k = 7. Длину интервала группировки найдем по формуле h = R / k, где R – размах варьирования исследуемого признака.

R = xмакс - xмин = 24,0 - 10,0 = 14, поэтому h = 14/7 = 2.

41

Далеенайдемнижнююграницуинтервальногорядахнач = хмин -0,5h= 10- 1= 9. Прибавляядлинуинтервала к полученномузначению, определимверхнюю границупервого интервала – 11. Остальные границы определим аналогично, в ре-

зультате получим восемь интервалов: 9-11; 11-13; 13-15, 15-17; 17-19; 19-21; 21-23; 23-25. Соответствующий интервальный вариационный ряд частот представлен табл. 3.

 

 

Интервальный вариационный ряд частот

Таблица 3

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

xi

9-11

 

11-13

13-15

15-17

17-19

19-21

21-23

23-25

 

mi

1

 

3

4

10

12

11

6

3

 

Построение интервального вариационногоряда в Excel

Интервальный вариационный ряд частот в табличном процессоре Excel можно построить с помощью статистической функции ЧАСТОТА.

В качестве примера рассмотрим распределение спортсменов с ве-

сом 60, 67, 65, 70, 77, 92, 78, 90, 87, 79, 83, 85, 58, 92, 81, 88, 59, 63, 74, 66, 69, 59, 72, 82, 75, 91, 64, 57, 62, 56 по весовым категориям 0-60, 6170, 71-80, 81-90 и > 90 кг. Чтобы применить функцию ЧАСТОТА для построения интервального вариационного ряда, нужно на рабочем листе с массивом анализируемых данных (диапазон A2:F6, рис. 14) создать столбец границ интервалов (столбец Интервал, диапазон H2:H5). Затем выделить диапазон для выходных данных (столбец Частота, диапазон I2:I6) и в Мастере функций выбрать указанную статистическую функцию.

 

A

B

C

D

E

F

G

H

I

 

H

I

1

 

 

Вес

 

Интервал

Частота

 

Интервал

Частота

2

60

67

65

70

77

92

 

60

 

 

60

6

3

78

90

87

79

83

85

 

70

 

 

70

8

4

58

92

81

88

59

63

 

80

 

 

80

6

5

74

66

69

59

72

82

 

90

 

 

90

7

6

75

91

64

57

62

56

 

 

 

 

 

3

Рис. 14. Вид таблиц в табличном процессоре Excel

Выходной диапазон может содержать только один столбец ячеек, число которых должно быть на единицу больше, чем в столбце интервалов (дополнительная ячейка нужна для значений, выходящих за границу верхнего интервала). В качестве параметров для функции ЧАСТОТА нужнозадатьдва массива:анализируемыхданныхи интервалов.Диапазоны ячеек, содержащих эти массивы, можно ввести на втором шаге Мастера функций (рис. 15) путем их выделения на рабочем листе.

42

Рис. 15. Окно ввода аргументов функции ЧАСТОТА

ФункциюЧАСТОТАследуетвводитьв выходнойдиапазон какформулу массива. Для этого после ввода параметров функции в поля Массив_данныхи Массив_интерваловследует нажатьна клавиатурекомбинацию клавиш Ctrl+Shift+Enter. Столбец Частота с результатами расчета показан на приведенном рис. 14 справа.

7. Числовые характеристики выборки

Эмпирическое распределение содержит наиболее полную информацию ослучайной величине, однако пользоваться им не всегда удобно. Для анализа результатов проведенного эксперимента лучше иметь дело с характеристиками, представленными числовыми величинами. В качестве характеристик используют абсолютные, относительные и удельные показатели. Абсолютными называются неделимыехарактеристики. Примерами абсолютных показателей являются минимум и максимум, т. е. минимальное и максимальное значения переменной. Относительноезначениепоказателя – этоотношениечислаобъектов, имеющих этот показатель,квеличиневыборки.Выражаетсяотносительным числомили в процентах (процентное значение).

Пример. Успеваемость в группе равна числуположительных итоговых отметок m, деленномуна числовсехчленов группы n. При m = 25 и n = 50успеваемость равна 25 / 50 = 0,5. Умножение этогозначения на 100 дает успеваемость в процентах – 50%.

Удельное значение показателя – это расчетная величина, показывающая количество объектов с данным показателем, которое содержалось бы в условной выборке, состоящей из 10, 100, 1000 и т. д. объектов.

Пример. Для сравнения уровня правонарушений в разных регионах берется удельная величина – количество правонарушений на 1000 человек (N), которая называется индексом преступления.

Числовые характеристики выборки дают количественное представление об эмпирических данных и позволяют сравнивать их между со-

43

бой. Наибольшее практическое значение имеют характеристики положения, рассеяния и асимметрии эмпирических распределений.

Характеристики положения

Характеристики положения определяютположение центра эмпирического распределения. Чаще всего употребляются такие характеристи-

ки положения, как среднее, медиана и мода.

Среднее значение (среднее арифметическое) – величина того же наименования, что и значения признаков, она является одной из основных характеристик выборки. Среднее (выборочное среднее) – сумма значенийпеременной,деленнаяначислозначенийпеременной. Егопринято обозначать той же буквой, что и варианты выборки, с той лишь разницей, что над буквой ставится символ усреднения – черта. Например, если обозначить исследуемый признак через X, а его числовые значения – через xi, то среднее арифметическое имеет обозначение х. Выборочное среднее является той точкой, сумма отклонений наблюдений от которой равна 0:

n

(х - xi) = 0.

i= 1

Выборочное среднее может вычисляться как по данным необработанной выборки, так и по вариационным рядам частот или частостей. В первом случае выборочное среднее определяется по формуле:

 

 

x x

 

... x

 

1

n

x

 

 

xi ,

 

1

2

 

n

 

 

 

 

n

 

n

 

 

 

 

 

 

i 1

где n – объем выборки; хi – варианты выборки.

Если данные представлены вариационным рядом частот, то

 

 

n x n

x

 

... n

x

 

 

1

k

x

 

 

 

 

nixi ,

1 1 2

 

2

k

 

k

 

 

 

n

 

 

n

 

 

 

 

 

 

 

i 1

где n – объем выборки; k – число интервалов группировки; ni – частота i-го интервала; хi – срединное значение i-го интервала.

Пример. Определить среднесуточную температуру, если в течение недели она принимала значения 35, 37, 42, 39, 26, 23 и 18° С. Среднее значение темпе-

ратуры составляет (35 + 37 + 42 + 39 + 26 + 23) / 7 = 31,4° С.

Медиана – это число, которое находится в середине ранжированного ряда распределения, т. е. медиана разбивает выборку на две равные части.Водной частивсечислаимеютзначениябольше, ав другоймень-

44

ше, чем медиана. Медиана дает общее представление о том, где сосредоточенызначенияпеременной, инымисловами,гденаходитсяеецентр. В некоторых случаях, например при описании доходов населения, медиана более удобна, чем среднее. В ранжированной выборке, имеющей объем n, порядковый номер медианы (ранг R) определяют по следующей формуле R = (n + 1) / 2 .

Пример. Имеется ранжированная выборка, содержащая нечетное число элементов (n = 9): 12, 14, 14, 18, 20, 22, 22, 26, 28. Тогда ранг медианы

R = (9 + 1) / 2 = 5 и медиана, обозначаемая символом Ме, совпадает с пятым членом ряда: Ме = 20.

Если выборка содержит четное числочленов, то медиана будет равна среднему арифметическому двух чисел, расположенных в середине ранжированной выборки.

Пример. Имеетсяранжированная выборка,содержащая четноечислоэле-

ментов (n = 10): 6, 8, 10, 12, 14, 16, 18, 20, 22, 24. Тогда ранг медианы R = (10 + 1) / 2 = 5,5 и медиана будет равна Ме = (14 + 16) / 2 = 15.

Мода – это наиболее часто встречающееся или повторяющееся значениев выборкеданных.Рядназываетсяунимодальным,есливнемтолькоодномодальноезначение,и полимодальным,если естьнесколькозначенийпризнака, которыевстречаютсяодинаковочасто. Дляполимодального ряда моду не вычисляют.

Пример. Модой выборки, состоящей из чисел 1, 2, 2, 3, 3, 1, 2, 3, 1, 1, является число 1.

Характеристики рассеяния

Характеристики положения не дают полной информации об изменяющемся признаке. Например, существует множество эмпирических распределений, укоторыхсредниеодинаковы, аразбросы значенийпризнака существенно отличаются. Поэтому в статистических расчетах наряду с характеристиками положения широко применяются характерис-

тики рассеяния выборки – размах вариации, дисперсия и стандартное отклонение.

Размах вариации – это разность между максимальной и минимальной вариантами выборки:

R = хмакс - хмин.

Размахвариации используетсяиногда в практических исследованиях при малых (не более 10) объемах выборки. Например, по размаху вариации легко оценить, насколько различаются лучший и худший результаты в группе спортсменов.

45

Дисперсияи стандартноеотклонениеявляютсяважнейшимихарактеристиками рассеяния и используются для оценки степени разброса (отклонения) какого-либо показателя от его среднего значения.

Дисперсия выборки (выборочнаядисперсия) – этомера изменчивости переменной.

Выборочная дисперсия вычисляется по формуле:

 

n

 

 

 

 

 

 

(x

x

)2

 

 

i -

D

i 1

 

,

 

 

 

 

n

где х – выборочное среднее, а n – число наблюдений в выборке.

Дисперсия меняется от нуля до бесконечности. Нулевое значение означает отсутствие изменчивости, когда значения переменной постоянны.

Стандартное отклонение, или среднее квадратичное отклонение, вычисляетсякак корень квадратный издисперсии. Чем выше дисперсия или стандартное отклонение, тем сильнее разбросаны значения переменной относительно среднего:

= D .

Пример. Посещаемость четырех занятий в двух группах численностью 20 и 30 человек соответственносоставила: 18, 20, 20, 18 и 15, 23, 10, 28. Требуется вычислить среднее значение посещаемости, дисперсию и стандартное отклонение.

Группы

x

D

?

1

(18+20+20+18) / 4 = 19

(1+1+1+1) / 4 = 1

1 = 1

2

(15+23+10+28) / 4 = 19

(16+16+81+81) = 48,5

48,5 = 6,964

Средние значения посещаемости в обеих группах одинаковы. Однако посещаемость занятий во второй группе отличается большим разбросом, о чем свидетельствуют значения дисперсии и стандартного отклонения. Стандартное отклонение выражается в тех же единицах измерения, что и характеризуемый им признак, т. е. в первой группе в среднем один человек не посещал занятия, а во второй – семь человек.

Коэффициент вариации

Если требуется сравнить между собой степень варьирования признаков,выраженныхв разныхединицахизмерения,тодисперсиюистандартное отклонение использовать неудобно. Пусть, например, результаты в беге, показанные спортсменами, имеют стандартное отклонение 0,9 сек (при среднем времени 13 сек), а стандартное отклонение их роста составляет6 см (при среднем росте 168 см). На основании сравнения стандартных отклонений нельзя утверждать, что один из признаков варьируетсябольше,чем другой.Втакихслучаях нужносопоставлятьстандартныеотклонениясосреднимиарифметическимиэтих признаков.Для

46

этоговводится относительныйпоказатель рассеянияпризнака, называемый коэффициентом вариации – V = / х 100%.

Если среднеезначение признака равно 0, то коэффициент вариации неприменим, так как в этом случае он становится бесконечно большим, независимо от разброса признака.

С помощью коэффициента вариации оценивают не только рассеяние, но и однородность выборочных наблюдений. Считается, что если коэффициент вариации не превышает 10%, то выборку можно считать однородной, т. е. полученной из одной генеральной совокупности. Коэффициент вариации применяется в основном для сравнения выборок из однотипных генеральных совокупностей.

Характеристики асимметрии и эксцесса

Асимметрия – это свойство распределения выборки, которое характеризует несимметричность распределения случайной величины. Симметричные распределения встречаются редко, и чтобы выявить и оценить степень асимметрии, вводят безразмерный коэффициент асимметрии:

n

(xi - x)3 /n

3

i 1

 

 

.

 

 

3

 

 

 

 

Если 3 = 0, то распределение симметрично относительно математического ожидания, если 3 > 0, то преобладают положительные отклонения от математического ожидания, если 3 < 0 – отрицательные.

Эксцесс – это мера крутости кривой распределения. Его значение зависит от остроты вершины кривой распределения и определяется по формуле:

 

n

 

 

 

 

 

 

 

 

(x

x

)4

/n

4

i -

 

 

 

 

-3 .

i 1

 

 

 

 

 

 

4

 

 

 

 

 

 

 

 

 

Если 4 < 0, то распределение имеет острый пик (по сравнению с нормальнымраспределением). Если 4 > 0,тораспределениеимеетплосковершиннуюформу(посравнению снормальным распределением, для которого 4 = 0).

8.Выборочная функция распределения

Втеории вероятностей для характеристики распределения случайной величины X служит функция распределения F(x) = P(X < x), равная вероятности события {X < x}, где x – любое действительное число.

Вприкладной статистикеполученныеэкспериментальныеданныеобыч-

47

но представляют с помощью выборочного аналога функции распределения – выборочной (эмпирической) функции распределения:

F*(x) = nx / n,

где nx – количествоэлементов выборки,меньшихчем x. Другими словами, F*(x) есть относительная частота появления события А = {X < x} в n независимых испытаниях. Главное различие между F(x) и F*(x) состоит в том, что F(x) определяет вероятность события А, а выборочная функция распределения F*(x) – относительную частоту этого события.

Функция F*(x) имеет такой же вид и обладает такими же свойства-

ми, как и F(x) (рис. 7, 8):

1.0 F*(x) 1;

2.F*(x) – неубывающая функция;

3.F*(- ) = 0; F*( ) = 1.

Функция F*(x) равна относительной частоте появления события А = {X < x}, следовательно, при любом значении x величина F*(x) является случайной. Тогда конкретной выборке (x1, x2xn) объема n соответствует функция распределения F*(x), которая в силу своей случайности будет отличаться от F*(x), построенной по другой выборке из той же генеральной совокупности.

По теореме Бернулли относительная частота появления события А в n независимых опытах сходится к вероятности P(X < x) этого события при увеличении n. Следовательно, при больших объемах выборки выборочная функция распределения F*(x) близка к теоретической функции F(x) и выступает ее оценкой.

9. Графическое представление данных

Для наглядности используется графическоепредставлениеэмпирических распределений.Наиболеераспространеннымиспособами графического представления в статистике являются гистограмма, полигон частот и полигон накопленных частот.

Построимтакиеграфики длярассмотренногоранеепримеравыборки, полученной в результате измерения глубины пулевых следов. Соответствующая вариационная таблица приведена ниже (табл. 4). Кроме частот интервалов mi она содержит относительные частоты интервалов pi и накопленные относительные частоты интервалов F(x).

Гистограмма – это столбчатая диаграмма, которая отображает число значений выборки (частотвариантов), попадающих в интервалы разбиения (рис. 16).

48

 

 

Вариационная таблица

 

Таблица 4

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

xi

9-11

11-13

13-15

15-17

17-19

19-21

21-23

23-25

 

mi

1

3

4

10

12

11

6

3

 

pi

1/50

3/50

4/50

10/50

12/50

11/50

6/50

3/50

 

F(x)

1/50

4/50

8/50

18/50

30/50

41/50

47/50

50/50

 

По форме гистограммы можно сделать качественные оценки некоторых характеристик эмпирического распределения. Например, гистограмма дает представление об отличиях данного распределения от нормального, осимметричности и остротевершины кривой распределения.

Рис. 16. Гистограмма

Полигон частот – это график, образованный ломаной линией, соединяющей точки, соответствующие срединным значениям интервалов группировки и частотам этих интервалов. Срединные значения интервалов откладываются по оси х, а частоты – по оси у.

Изсравнениядвухрассмотренныхспособов графическогопредставления эмпирических распределений следует, что для получения полигона частот (рис. 17) из построенной гистограммы нужно середины вершин прямоугольников, образующих гистограмму, соединить отрезками прямых.

Полигон накопленных частот – этографик, образованныйломаной линией, соединяющей точки, координаты которых соответствуют верхним границам интервалов группировки и накопленным частотам.

Для построения полигона накопленных относительных частот составим таблицу соответствия верхних границ интервалов и накопленных относительных частот (табл. 5).

49

Рис. 17. Полигон частот

Таблица 5

Соответствие верхних границ интервалов и накопленных относительных частот

x

9

11

13

15

17

19

21

23

25

F(x)

0

0,02

0,08

0,016

0,036

0,6

0,082

0,094

1

Точки, соответствующие верхним границам интервалов группировки, откладываются по оси х, а накопленные частоты – по оси у. Так как таблицаопределяетнепрерывную функцию F(x)неполностью,тосоединим точки графика аппроксимирующей кривой линией (рис. 18), что и будет графиком эмпирической функции распределения.

Рис. 18. Полигон накопленных частот (график функции распределения F(x))

Теоретическим аналогом полигона накопленных частот является график функции распределения случайной величины F(х), рассмотренный в параграфе «Случайная величина».

По данному графику можно оценить вероятность пробоя защитного материала пулей. Например, с вероятностью 0,94 пуля не пробьет материал толщиной 23 см.

50

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]