Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Элементы математической статистики. Учебное пособие-1

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
792 Кб
Скачать

Крон Р. В., Попова С. В.

ЭЛЕМЕНТЫ

МАТЕМАТИЧЕСКОЙ

СТАТИСТИКИ

Учебное пособие

Ставрополь «АГРУС»

2018

УДК 519.22/.25 ББК 22.172я73 К83

Крон, Р. В.

: . / . . , . . ; . -: , 2018. - 68 .

Учебное пособие входит в серию методических разработок, способствующих овладению студентами теоретическими основами материала и появлению у них навыков решения задач по основным разделам курса математики.

Предназначена для использования во время практических занятий и в качестве задачника для самостоятельной работы и контроля знаний студентов.

УДК 519.22/.25 ББК 22.172я73

© Авторский коллектив, 2018 © ФГБОУ ВО Ставропольский государственный аграрный университет, 2018

Введение

Математическая статистика – раздел математики, в котором изучаются методы сбора, систематизации и обработки результатов наблюдений массовых случайных явлений для выявления существующих закономерностей.

Результаты измерений (наблюдений) называются статистическими данными.

Основные задачи математической статистики

1)Определение способов сбора и группировки этих статистических данных;

2)Разработка методов анализа полученных данных в зависимости от целей исследования, к которым относятся:

а) оценка неизвестной вероятности события; оценка неизвестной функции распределения; оценка параметров распределения, вид которого известен; оценка зависимости от других случайных величин и т.д.;

б) проверка статистических гипотез о виде неизвестного распределения или о значениях параметров известного распределения.

Для решения этих задач необходимо выбрать из большой совокупности однородных объектов ограниченное количество объектов, по результатам, изучения которыхможносделатьпрогнозотносительноисследуемогопризнакаэтихобъектов.

Результаты исследования статистических данных методами математической статистики используются для принятия решения (в задачах планирования, управления, прогнозирования и организации производства, при контроле качества продукции, при выборе оптимального времени настройки или замены действующей аппаратуры и т. д.), то есть для научных и практических выводов.

Математическая статистика – это теория принятия решений в условиях неопределенности.

Основные понятия математической статистики

Генеральная совокупность – все множество имеющихся однородных объектов.

Выборка – набор объектов, случайно отобранных из генеральной совокупности.

Объем генеральной совокупности N и объем выборки n – число объектов

врассматриваемой совокупности.

Виды выборки:

повторная – каждый отобранный объект перед выбором следующего возвращается в генеральную совокупность;

бесповторная – отобранный объект в генеральную совокупность не возвращается.

Замечание. Для того чтобы по исследованию выборки можно было сделать выводы о поведении интересующего нас признака генеральной совокупности, необходимо,чтобывыборкаправильнопредставлялапропорциигенеральнойсовокупности, то есть была репрезентативной (представительной). Учитывая закон больших чисел, можно утверждать, что это условие выполняется, если каждый объект выбран случайно, причем для любого объекта вероятность попасть в выборку одинакова.

3

1. ПЕРВИЧНАЯ ОБРАБОТКА РЕЗУЛЬТАТОВ

Приведем оценки 45 студентов по курсу статистика в порядке сдачи экза-

мена: 5, 3, 3, 4, 2, 4, 4, 3, 5, 4, 4, 5, 5, 4, 4, 3, 3, 3, 2, 5, 5, 4, 4, 4, 3, 4, 3, 4, 5, 4, 4, 4, 4, 3, 3, 4, 3, 4, 3, 2, 3, 2, 3, 3, 3.

При таком представлении информации трудно делать какие-либо выводы об успеваемости. Произведем группировку данных путем подсчета количества различных оценок.

Оценки

2

3

4

5

Количество

4

16

18

7

Как видим, вместо 45 чисел осталось 8, при этом повысилась информативность таблицы: более 50 % студентов сдали предмет на «хорошо» и «отлично».

Пример показывает, что числа из условия задачи лучше сгруппировать, то есть разделить их на однородные группы по некоторому признаку. Благодаря группировке данные приобретают систематизированный вид.

Если данные систематизированы по времени, то моделью группировки будет временной ряд; если же по любому другому признаку – то ряд распределения; а для количественных признаков – вариационный ряд.

Пусть интересующая нас случайная величина X принимает значение x1 в

 

k

 

выборке m1 раз, x2 m2 раз, …, xk

mk раз, причем тk n,

где n – объем

 

i 1

 

выборки. Тогда наблюдаемые значения случайной величины

x1, x2, , xk

называются вариантами, а m1, m2,

, mk частотами (весом).

Если разделить каждую частоту на объем выборки, то получим относи-

тельные частоты (частость) wi mni .

Упорядочение статистических данных, то есть расположение вариантов в порядке возрастания (убывания) называется ранжированием вариантов ряда.

Последовательностьвариант,записанныхвпорядкевозрастания,называют вариационным рядом, а перечень вариант и соответствующих им частот или от-

носительных частот – дискретным вариационным рядом (статистическим рядом или статистическим распределением):

x

x

x

x

k

i

1

2

 

m

m

m

m

i

1

2

 

k

w

w

w

w

i

1

2

 

k

Пример 1. При проведении 20 серий из 10 бросков игральной кости число выпадений шести очков оказалось равным 1, 1, 4, 0, 1, 2, 1, 2, 2, 0, 5, 3, 3, 1, 0, 2, 2, 3, 4, 1. Составить вариационный ряд.

Решение. Пусть число выпадений шести очков в каждой серии из 10 бросков игральной кости является случайной величиной X , которая в данном исследовании принимала значения: 0, 1, 2, 3, 4, 5.

4

Подсчитаем число повторений каждого значения случайной величины X в проводимой выборке: x1 0 выпало m1 3 раза, x2 1 выпало m2 6 раз, x3 2

выпало m3 5 раз, x4 3 выпало m4 3 раза, x5 4 выпало m5 2 раза, x6 5 выпало m6 1 раз.

Объём данной выборки равен числу проведённых серий бросков, то есть n 20.

 

6

 

 

Равенство mi 3

6 5 3 2 1 20 n выполняется, следовательно,

i 1

 

 

подсчёт частот mi

произведён правильно.

По формуле

w

mi

найдём относительные частоты и внесём полученные

 

i

n

 

 

 

 

результаты в таблицу, тогда дискретный вариационный ряд для частот и частостей примет вид:

x

0

1

2

3

4

5

i

 

 

 

 

 

 

m

3

6

5

3

2

1

i

 

 

 

 

 

 

w

0,15

0,3

0,25

0,15

0,1

0,05

i

 

 

 

 

 

 

В случае, когда число значений случайной величины x1, x2, , xk велико

или значения являются непрерывными (то есть когда случайная величина X можетпринятьлюбоезначениевнекотороминтервале),составляютинтервальный

вариационный (статистический) ряд.

В первую строку таблицы интервального вариационного ряда вписывают частотные промежутки x0, x1 , x1, x2 , , xk 1, xk , которые берут обычно одинаковыми по длине: h x1 x0 x2 x1 ... xk xk 1.

Для определения величины интервала

h можно использовать формулу

Стерджеса:

h

 

 

xmax xmin

, где xmax xmin

– разность между наибольшим и

1

3,322lgn

 

 

 

 

наименьшим значениями признака; l 1 3,322lgn – число интервалов.

Если возможно, величину h округляют до целого числа. За начало первого интервала рекомендуется брать величину хнач хmin h2 . Все значения признака

xi попадут в интервал a; b , где a x0 , …,xk b .

Во второй строчке статистического ряда вписывают количество наблюдений mi , i 1, n , попавших в каждый интервал.

Границы интервалов

(a; a h)

(a h; a 2h)

(b h; b)

Сумма частот вариант,

m1

m2

mk

попавших в интервал

 

 

 

 

5

Пример 2. Измерили рост 30 наудачу отобранных студентов (с точностью до сантиметров). Результаты измерений таковы: 160, 154, 183, 155, 153, 167, 186, 163, 155, 157, 175, 170, 166, 159, 173, 182, 167, 171, 169, 179, 165, 156, 179, 158, 171, 175, 173, 164, 172. Построить интервальный вариационный ряд.

Решение.Отметим,что X – ростстудента–непрерывнаяслучайнаявеличина. При более точном измерении роста значения обычно не повторяются (ве-

роятность наличия на Земле двух человек, рост которых равен, скажем 3 = 1,732050808... метров, равна нулю!).

Объём выборки составил n 30.

Для удобства проранжируем в порядке возрастания полученные данные: 153, 154, 155, 155, 156, 157, 158, 159, 160, 163, 164, 165, 166, 167, 167, 169, 170, 171, 171, 172, 173, 173, 175, 175, 178, 179, 179, 182, 183, 186.

Среди всех вариант выберем наименьшее и наибольшее значение:

xmin 153,

xmax 186.

 

 

 

 

 

 

 

 

По формуле Стерджеса находим длину частотного интервала:

h

 

 

186 153

 

33

 

33

 

5,59.

1

3,322lg30

1 4,907

5,907

 

 

 

 

 

 

Примем h 6. Тогда величина

x

153

6

150.

нач 2

Значения случайной величины X попадут в следующие промежутки: [150,156), [156,162), [162,168), [168,174), [174, 180), [180, 186].

Последний промежуток составляется так, чтобы его правая граница совпадала с числом xmax или превышала его.

Подсчитавчислостудентов,попавшихвкаждыйизполученныхпромежутков, получим интервальный вариационный ряд:

Рост

[150 156)

[156 162)

[162 168)

[168 174)

[174 180)

[180 186]

Частота, mi

4

5

6

7

5

3

Частость, wi

0,13

0,17

0,20

0,23

0,17

0,10

При изучении вариационных рядов наряду с понятием частоты используется понятие накопленной частоты (обозначается miнак ), которая показывает, сколько наблюдалось вариантов со значением признака, меньшим x .

Отношение накопленной частоты miнак к общему числу наблюдений n

называется накопленной частостью wiнак .

Накопленные частоты (частости) для каждого интервала находятся последовательным суммированием частот (частостей) всех предшествующихинтервалов, включая данный интервал.

Пример 3. Дана выборка, вариационный ряд которой имеет вид:

10,8; 11,1; 11,7; 12,2; 13,1; 13,4; 13,9; 14,3; 14,3; 14,4; 14,8; 16,5; 17,7; 18,2; 19,9; 20,0; 20,3; 20,8; 23,1; 24,2; 25,1; 25,1; 25,7; 28,4; 28,5; 29,3; 29,8; 29,9; 30,2; 30,4.

6

Составить вариационный ряд распределения частот и частостей, состоящий из пяти интервалов. Найти накопленную частоту и частость.

Решение. Объем выборки n 30.

По формуле Стерджеса найдём величину интервала: h 30,4 10,8 3,92. 5

Округляя в большую сторону до целого числа получим h 4.

Удобно за начало первого интервала взять число a 10,5. Так как по усло-

виюнужносоставитьпятьинтервалов,топравойграницейпоследнегоинтервала будет число b a 5h 10,5 5 4 30,5.

Вариационный ряд распределения частот и частостей, а также значения накопленных частот и частостей занесём в таблицу:

Номер

Интервалы

Ча-

Накопленная ча-

Частость,

Накопленная

стота,

интервала

распределения

стота, miнак

 

wi

частость, wiнак

 

 

 

mi

 

 

 

 

 

 

 

1

10,5;

14,5

10

10

1

 

1

 

3

 

3

 

 

 

 

 

 

 

 

2

14,5;

18,5

4

14

 

2

 

 

7

 

15

 

15

 

 

 

 

 

 

 

 

3

18,5;

22,5

4

18

 

2

 

 

9

 

15

 

15

 

 

 

 

 

 

 

 

4

22,5;

26,5

5

23

1

 

 

23

 

6

 

30

 

 

 

 

 

 

 

 

5

26,5;

30,5

7

30

 

7

 

1

 

30

 

 

 

 

 

 

 

 

 

 

 

2. ГРАФИЧЕСКОЕ ИЗОБРАЖЕНИЕ ВАРИАЦИОННЫХ РЯДОВ

Для наглядного представления о поведении исследуемой случайной величины в выборке можно строить различные графики. Один из них – полигон частот: ломаная, отрезки которой соединяют точки с координатами (x1; m1),

(x2; m2), …, (xk ; mk ), где xi откладываются на оси абсцисс, а mi – на оси ординат. Если на оси ординат откладывать не частоты mi , а частости wi , то получим

полигон частостей (рис. 1). mi

m3

mk-1

m2

mk

1

х1

х2

х3

хk-1 хk

хi

Рис. 1 Полигон

7

Для интервального вариационного ряда графической иллюстрацией служит гистограмма, то есть ступенчатая фигура, состоящая из прямоугольников, основаниями которых служат частотные интервалы длиной h , а высотами от-

резки длиной mhi (гистограмма частот) или whi (гистограмма частостей). В первом

случае площадь гистограммы равна объему выборки, во втором – единице (рис. 2). mi

xi

Рис. 2 Гистограмма

Гистограмма используется в тех случаях, когда имеется одно распределение. Если необходимо сравнить два (или более) распределений, используют полигон.

Кумулятивная кривая (кумулята) – кривая накопленных частот (частостей). Для дискретного ряда кумулята представляет собой ломаную, соединяю-

щую точки хi , тiнак или хi , wiнак , i 1, k . Для интервального вариационного

ряда ломаная начинается с точки, абсцисса которой равна началу первого интервала, а ордината – накопленной частоте (частости), равной нулю. Другие точки этой ломаной соответствуют концам интервалов.

Огивой называется ломаная, соединяющая точки, абсциссы которых являются накопленными частотами, а ординаты – значениями признака.

Графики кумуляты и огивы симметричны относительно биссектрисы первого координатного угла.

В зависимости от вида кривых, изображающих распределение, выделяют несколько основных типов распределения:

1.одновершинные;

2.многовершинные.

Кодновершинным относятся те, в которых один, обычно центральный вариант, имеет наибольшую частоту (плотность распределения). Частоты же остальных вариантов убывают по мере удаления от центрального.

Есличастотыубываютслеваисправаотцентральногозначенияодинаково, то такие распределения называются симметричными.

Если частоты убывают слева и справа от центра распределения с разной скоростью, то такие распределения называют асимметричными.

Многовершинные распределения — это распределения, в которых несколько центров, то есть такие, у которых несколько максимумов частот.

Для однородных совокупностей, как правило, характерны одновершинные распределения.

Многовершинность распределения свидетельствует о неоднородности изучаемого явления. В этом случае необходимо произвести перегруппировку данных с целью выделения более однородных групп.

8

Кривые распределения бывают:

1.симметричными

2.асимметричными.

Взависимости от того, какая ветвь кривой распределения вытянута, различают:

1.правостороннюю асимметрию

2.левостороннюю асимметрию.

3.ЧИСЛОВЫЕ ХАРАКТЕРИСТИКИ ВАРИАЦИОННОГО РЯДА

Мода М0 дискретного вариационного ряда – варианта, имеющая наибольшую частоту.

Для интервального вариационного ряда при нахождении М0 используют

формулу: М0 x0 h

 

mi

mi1

 

 

, где x0 – начало модального (со-

m m

m m

 

 

i

i1

i

i1

 

 

 

держащего моду) интервала; h – длина частичного интервала; mi

– частота мо-

дального интервала; mi1 – частота предмодального интервала;

mi1 – частота

постмодального интервала.

 

 

 

 

 

 

Замечания.

1.Если все значения вариационного ряда имеют одинаковую частоту, то этот вариационный ряд не имеет моды.

2.Если две соседние варианты имеют одинаковую доминирующую частоту, то мода вычисляется как среднее арифметическое этих вариант.

3.Если две не соседние варианты имеют одинаковую доминирующую частоту, то такой вариационный ряд называется бимодальным.

4.Если таких вариант более двух, то ряд – полимодальный.

В случае интервального вариационного ряда с равными интервалами модальный интервал определяется по наибольшей частоте, а при неравных интервалах – по наибольшей плотности.

Медиана Mе – варианта, которая делит дискретный вариационный ряд на две части, равные по числу вариант. Если число вариант нечетно (n 2k 1), то

Me xk 1, а при четном (n 2k ) числе вариант Mе xk 2xk 1 .

При вычислении медианы интервального вариационного ряда сначала находят медианный интервал [xMe ;xMe h], где h – длина медианного интервала.

Для этого можно использовать кумулятивное распределение частот или частостей.Медианномуинтервалусоответствуеттот,вкоторомсодержитсянакоплен-

ная частость, равная ½ или накопленная частота, большая величины n2 , где п

объем выборки.

Внутри найденного интервала расчет медианы производится по формуле:

 

 

 

 

n

mнак

 

M

e

x

h

2

i1

, где mнак

– накопленная частота интервала, предшествую-

 

 

 

0

 

 

l 1

 

 

 

 

 

 

mi

 

щего медианному интервалу; mi – частота медианного интервала.

9

Выборочной средней называется среднее арифметическое значений случайной величины, принимаемых в выборке:

 

 

 

 

 

 

 

k

 

 

 

 

 

m x

m x

... m x

 

mi xi

 

 

х

В

1 1

2 2

k k

i 1

, где x

– варианты; m – частоты.

 

 

 

 

 

 

 

n

 

 

n

i

i

 

 

 

 

 

 

 

 

Пример 1. На шоссе длиной 100 км имеется 10 гаражей. Для проектирования строительства бензоколонки были собраны данные о числе предполагаемых поездок на заправку с каждого гаража. Результаты обследования представлены в таблицу.

Километр шоссе, на ко-

 

 

 

 

 

 

 

 

 

 

Всего

тором расположен га-

7

26

28

37

40

46

60

78

86

92

поездок

раж

 

 

 

 

 

 

 

 

 

 

 

Проектируемое число

10

15

5

20

5

25

15

30

10

65

200

поездок

 

 

 

 

 

 

 

 

 

 

 

Необходимо поставить бензоколонку так, чтобы общий пробег автомашин на заправку был наименьшим.

Решение. Табличные значения являются дискретным вариационным рядом. Рассмотрим различные варианты решения задачи, с точки зрения числовых характеристик вариационного ряда.

Вариант 1. Если бензоколонку поставить на середине шоссе, то есть на 50- м километре (медиана данного вариационного ряда), то пробеги с учетом числа поездок составят:

а) в одном направлении: 43·10 + 24·15 + 22·5 + 13·20 + 10·5 + 4·25 =1310 км; б) в противоположном направлении: 10·17 + 28·30+ 36·10 + 42·65 = 4080 км.

Общий пробег в оба направления окажется равным 5390 км.

Вариант2. Уменьшенияпробегаможнодостигнуть,еслибензоколонкупоставить на 63,85-м километре (средний участок шоссе с учетом числа поездок), то есть выборочная средняя:

xв 7 10 26 15 37 20 40 5 46 25 60 15 78 30 86 10 92 85 63,85. 200

В этом случае пробеги составят:

а) в одном направлении: 56,85·10 + 37,85·5 + 26,85·20 + 23,85·25 + 3,85·15 = = 2475,75 км;

б) в противоположном направлении: 14,15·30 + 22,15·10 + 28,15·65 = =2475,75 км.

Общий пробег в оба направления составит 4951,5 км и окажется меньше, чем при первом варианте, на 438,5 км.

Вариант 3. Наилучший результат, то есть минимальный общий пробег, будет получен в том случае, если мы поставим бензоколонку на 78-м километре. Если данный вариационный ряд считать интервальным, то медиану находим по правилу: медианой является варианта, соответствующая первой из накопленных

10

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]