Математическая статистика. Учебное пособие по курсу «Теория вероятностей и математическая статистика»
.pdfМИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ федеральное государственное бюджетное образовательное учреждение
высшего образования
«УЛЬЯНОВСКИЙ ГОСУДАРСТВЕННЫЙ ТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ»
МАТЕМАТИЧЕСКАЯ
СТАТИСТИКА
Учебное пособие по курсу «Теория вероятностей и математическая статистика»
Составители: В.Р. Крашенинников М.Н. Служивый
Ульяновск
УлГТУ
2023
УДК 519.2(075.8) ББК 22.17я73
М 34
Рецензенты: доктор технических наук, профессор Клячкин В.Н.; доктор технических наук, профессор Смагин А.А.
Утверждено редакционно-издательским советом университета в качестве учебного пособия
Математическая статистика : учебное пособие по курсу «Теория
М34 вероятностей и математическая статистика» / сост. В.Р. Крашенинников, М.Н. Служивый. – Ульяновск : УлГТУ, 2023. – 54 с.
ISBN 978-5-9795-2351-4
Учебное пособие составлено в соответствии с программой курса «Теория вероятностей и математическая статистика» по разделу «Математическая статистика» для бакалавриата инженерно-технических специальностей высших учебных заведений. Приведены статистические методы обработки наблюдений случайных величин: определения типа распределения вероятностей, оценивания параметров, составления уравнения среднеквадратической линейной регрессии, проверки статистических гипотез. Дан образец выполнения типового расчета по математической статистике и приведены необходимые справочные данные.
УДК 519.2(075.8) ББК 22.17я73
|
© Крашенинников В. Р., Служивый М.Н., составление, 2023 |
ISBN 978-5-9795-2351-4 |
© Оформление. УлГТУ, 2023 |
СОДЕРЖАНИЕ |
|
|
Введение ............................................................................................................... |
4 |
|
1. |
Случайные величины и их основные характеристики.......................... |
5 |
2. |
Статистический анализ наблюдений отдельных случайных |
|
величин................................................................................................................. |
7 |
|
|
2.1. Выборка. Вариационный ряд. Группированная выборка .................... |
7 |
|
2.2. Статистическая функция распределения. Гистограмма. Полигон...... |
9 |
|
2.3. Точечные оценки математического ожидания и дисперсии .............. |
12 |
|
2.4. Интервальные оценки ............................................................................. |
15 |
|
2.5. Теоретический закон распределения. Метод моментов...................... |
18 |
|
2.6. Критерии согласия .................................................................................. |
20 |
|
2.7. Критерий хи-квадрат............................................................................... |
21 |
3. |
Системы случайных величин. линейная среднеквадратическая |
|
регрессия ............................................................................................................. |
25 |
|
4. |
Статистический анализ наблюдений системы двух случайных |
|
величин................................................................................................................ |
30 |
|
|
4.1. Выборочная линейная среднеквадратическая регрессия ................... |
30 |
|
4.2. Проверка значимости коэффициента корреляции .............................. |
31 |
5. |
Задание типового расчета............................................................................ |
33 |
6. |
Контрольные вопросы ................................................................................. |
34 |
7. |
Пример выполнения типового расчета .................................................... |
35 |
Заключение ......................................................................................................... |
47 |
|
Приложение 1. Список законов распределения .......................................... |
48 |
|
Приложение 2. Критические точки распределения хи-квадрат................. |
52 |
|
Приложение 3. Критические точки распределения Стьюдента................. |
52 |
|
Приложение 4. Таблицы нормального распределения ............................... |
53 |
|
Библиографический список ............................................................................ |
54 |
|
- 3 -
ВВЕДЕНИЕ
Втеории вероятностей изучаются случайные события и случайные величины. При этом заданы прямо или косвенно вероятности событий и распределения вероятностей значений случайных величин. Основные вопросы относятся к определению возможности появления результатов различных наблюдений или экспериментов, связанных с этими событиями и случайными величинами. Пусть, например, вероятность события А в одном опыте равна p. Тогда типичный вопрос – какова вероятность того, что это событие произойдет m раз в n опытах?
Вматематической статистике изучаются методы извлечения информации из опытных данных, то есть обратная задача. В нашем примере: пусть событие А произошло m раз в n опытах, тогда что можно сказать о вероятности p ?
Объектом изучения математической статистики, как и теории вероятностей, являются случайные события и случайные величины, поэтому
вматематической статистике широко применяются методы теории вероятностей.
Настоящие учебное пособие может оказать помощь при выполнении расчетно-графической работы по математической статистике.
Основное содержание работы состоит в следующем. Пусть имеются результаты наблюдений n объектов, характеризующихся двумя случайными параметрами X и Y. Возникают вопросы: какие законы распределения вероятностей имеют X и Y, имеется ли линейная зависимость между ними и насколько обоснованы ответы на эти вопросы?
Даны необходимые сведения из теории вероятностей и математической статистики и приведен подробный разбор примера выполнения работы. Сформулированы контрольные вопросы, на которые нужно уметь ответить при защите работы. Для удобства подготовки указаны разделы и номера формул, где можно найти ответы на эти вопросы.
- 4 -
1. СЛУЧАЙНЫЕ ВЕЛИЧИНЫ И ИХ ОСНОВНЫЕ ХАРАКТЕРИСТИКИ
Значения многих величин, встречающихся в практической деятельности, зависят от ряда случайных факторов. Поэтому нельзя указать заранее, какое значение примет такая величина, так как оно меняется случайным образом от опыта к опыту. Такие величины называются случайными и изучаются в теории вероятностей. Например, случайными величинами являются: температура и давление атмосферы, емкость изготовленного конденсатора, диаметр выточенного вала, уровень помех в канале связи и так далее. Случайная величина X полностью определяется в теоретико-вероятностном смысле своей функцией распределения
вероятностей [1–4]
Fx x = P X < x , |
(1.1) |
которая при любом x равна вероятности события X x. Если Fx(x) известна, то применение методов теории вероятностей позволяет решить ряд задач, связанных с величиной X. В частности, вероятность попадания X в полуинтервал a, b) может быть найдена по формуле
P(a ≤ X b) = Fx(b) – Fx(a). |
(1.2) |
Функция распределения является универсальным способом задания случайных величин. Дискретная случайная величина, принимающая
только дискретный (конечный или счетный) набор значений x1 , x2 ,… может
быть задана рядом распределения вероятностей путем указания вероятностей этих значений pi = P(X = xi). При этом p1 + p2 + … = 1.
Непрерывная случайная величина может быть задана своей плотностью распределения вероятностей, равной производной ее функции распределения:
fx(x) = F' |
x . |
|
(1.3) |
x |
|
|
|
Из определения (1.3) следует, что |
|
|
|
|
|
ai+1 |
|
P(ai ≤ x ai+1) = Fx(ai+1) – Fx(ai) = |
fx (x)dx . |
(1.4) |
|
ai
Математическим ожиданием (или средним значением) случайной величины X называется число, обозначаемое M[X] или mx, которое для дискретной величины вычисляется по формуле
M[X] xipi , |
(1.5) |
i |
|
- 5 -
а для непрерывной величины по формуле
M[X] xfx (x)dx. (1.6)
Математическое ожидание характеризует значение величины «в среднем», в том смысле, что среднее арифметическое значений величины по большому количеству наблюдений приблизительно равно математическому ожиданию.
Дисперсией случайной величины X называется число, обозначаемое D[X] или σ2x , определяемое формулой
D[X] = M[(X – mx)2], |
(1.7) |
то есть это математическое ожидание квадрата отклонения случайной величины от ее математического ожидания. Чем больше эти отклонения, тем больше дисперсия. Таким образом, дисперсия является мерой разброса, рассеяния случайной величины.
Дисперсию можно представить в двух формах:
D[X] = M[(X – mx)2] = M[X2] – mx2 , |
(1.8) |
то есть еще и как математическое ожидание квадрата величины минус квадрат ее математического ожидания.
Из (1.5) – (1.8) следуют формулы для вычисления дисперсии.
Для дискретной величины:
D[X] = (xi mx )2 pi |
= xi2pi mx2 |
(1.9) |
i |
i |
|
и для непрерывной величины: |
|
|
|
|
|
D[X] = (x mx )2 fx (x)dx = |
x2fx (x)dx mx2 . |
(1.10) |
|
|
|
Среднеквадратическим отклонением σx |
случайной величины называется |
|||||
корень квадратный из ее дисперсии: |
|
|
|
|
||
|
|
|
|
|
|
|
x = |
|
= |
2x |
|
|
(1.11) |
D[X] |
. |
|||||
Для большинства встречающихся на практике случайных величин имеет место правил «трех сигм»: случайная величина практически не отклоняется от своего математического ожидания больше чем на три сигма, то есть практически почти наверняка значение случайной величины Х в опыте будет находиться в пределах [mx –3 x; mx +3 x].
- 6 -
2. СТАТИСТИЧЕСКИЙ АНАЛИЗ НАБЛЮДЕНИЙ ОТДЕЛЬНЫХ СЛУЧАЙНЫХ ВЕЛИЧИН
2.1. Выборка. Вариационный ряд. Группированная выборка
Предположим, что исследуется некоторое явление, описываемое двумя количественными признаками X и Y, которые будем считать случайными величинами. Требуется на основании ряда наблюдений охарактеризовать X и Y, а также оценить связь между ними.
Статистическое исследование начинается со сбора данных. Для этого производится n опытов (наблюдений), результаты которых регистрируются. Если (xi , yi) – значения X и Y, полученные в i-м опыте, то получаем последовательность:
(x1 , y1) , (x2 , y2) , … , (xn , yn), |
(2.1) |
называемую выборкой. Число опытов n называется объемом выборки. Выборка является исходным материалом для всех дальнейших статистических выводов о случайных величинах X и Y.
Для начала будем исследовать X и Y по отдельности, поэтому сформируем из совместной выборки (2.1) две выборки для X и Y раздельно:
x1 , x2 , … , xn , |
(2.2) |
y1 , y2 , … , yn . (2.3)
На этом этапе обе выборки будут обрабатываться совершенно одинаково, поэтому рассмотрим только случайную величину X и ее выборку (2.2).
Если элементы выборки (2.2) записать в порядке их возрастания, то полученная последовательность будет называться вариационным рядом. Вариационный ряд значительно удобнее для дальнейшей обработки, чем неупорядоченная (простая) выборка (2.2).
При большом объеме n простая выборка и вариационный ряд становятся очень громоздкими и малонаглядными. Для придания им большей наглядности и компактности производится группировка данных. Для этого весь интервал значений выборки разбивают на k частичных интервалов или разрядов и подсчитывают число mi значений выборки, попавших в каждый i-й разряд [ai , ai+1 ) . Значение xg относится к i-му интервалу, если ai xg <ai+1 .
Числа mi называются частотами. Результат этой группировки сводится в таблицу 2.1, называемую группированной выборкой. Первые три колонки этой таблицы и представляют нашу группированную выборку.
- 7 -
В дальнейшем нам также понадобятся представители интервалов zi ai ai+1
2, то есть средние точки интервалов, относительные частоты
p m |
i |
n |
и плотности относительных частот f |
* m |
n a |
i+1 |
a |
. Для |
i |
|
|
i |
i |
i |
|
контроля правильности вычислений следует проверить равенства:
|
K |
K |
|
mi n ; |
pi 1. |
Относительная частота pi |
i 1 |
i 1 |
равна доле элементов выборки, попавших в i-й |
||
интервал, поэтому числа pi |
дают более наглядное представление о выборке, |
|
чем частоты mi .
При всех своих положительных качествах группированная выборка является некоторым огрублением статистического материала, так как известно только, что mi значений выборки находятся между ai и ai+1 , точные же значения становятся неизвестными. Поэтому и вводится представитель интервала zi , который принимается за «среднее» значение элементов выборки из этого интервала.
Для того чтобы огрубление не было слишком сильным, нужно стремиться делать частичные интервалы как можно короче, то есть увеличивать их количество. При этом следует соблюдать меру, так как при большом числе интервалов и группированная выборка сможет стать слишком громоздкой. Как правило, более 20 интервалов не используется. При объеме выборки порядка 100 следует взять 8 – 10 интервалов.
Таблица 2.1. Группированная выборка
Номер |
Границы |
Частотa mi |
Представител |
Относительн |
Плотность |
интервала |
интервала |
|
ь интервала |
ая частота |
относительной |
|
(ai ; ai+1) |
|
zi |
|
|
|
|
|
|
pi |
частоты fi |
1 |
[ a1 ; a2 ) |
m1 |
z1 |
|
|
|
|
|
|
p1 |
f1 |
………… |
………… |
………… |
………… |
………… |
…………… |
… |
… |
… |
… |
… |
|
k |
[ ak ; ak+1 ) |
mk |
zk |
|
|
|
|
|
|
pk |
fk |
Замечание. При подсчете частот mi следует учитывать способ получения выборки. Пусть, например, производится округление до ближайшего деления в одну сотую, тогда элемент выборки xg = 6.50 должен восприниматься как число от 6.495 до 6.505. Если при этом 6.50 является границей интервалов, то становится неясным, к какому из двух соседних интервалов отнести xg = 6.50. Учитывая, что шансы попасть в любой из этих
- 8 -
двух интервалов равны, общее число r значений выборки, равных 6.50, делят между интервалами поровну (если r нечетно, то в какой-нибудь интервал относят на одно значение больше). Если же округление производится до сотых путем отбрасывания остальных значащих цифр, то xg = 6.50 должно восприниматься как число от 6.50 до 6.51 с соответствующими выводами при подсчете частот.
2.2. Статистическая функция распределения. Гистограмма. Полигон
Статистической функцией распределения величины X по имеющейся выборке называется функция Fx x , равная относительной частоте события (X x), то есть
Fx x nx
n ,
где nx – число значений в выборке, меньших x; n – объем выборки. Например, если имеется вариационный ряд (–3, –2, 2, 4, 5), то Fx x
имеет график, изображенный на рис. 2.1.
Fx
1
0,8
0,6
0,4
0,2
-3 -2 -1 0 1 2 3 4 5 6 |
x |
Рис. 2.1. Статистическая функция распределения Fx x выборки
Функция Fx x имеет скачки, кратные 1/n, в точках значений выборки. При большом объеме выборки становится затруднительно строить точный график Fx x . Поэтому можно построить ее приближенный график. Это
делается следующим образом. Находятся точки графика для границ частичных интервалов группированной выборки и соседние точки графика соединяются прямолинейными отрезками. Образец такого графика приведен на рис. 2.2.
- 9 -
Fx
1
0 |
x |
Рис. 2.2. Статистическая функция распределения группированной выборки
Гистограммой называется совокупность прямоугольников, основаниями которых служат частичные интервалы, а высоты равны соответствующим плотностям относительных частот. При этом площадь i–го прямоугольника равна
|
|
|
mi |
|
, (2.4) |
si ai+1 ai fi |
ai+1 ai mi |
n ai+1 ai |
n pi |
то есть она равна относительной частоте попадания элементов выборки в этот интервал. Очевидно, что сумма этих площадей равна единице. Таким
образом, площадь всей гистограммы равна единице.
f
0 |
x |
Рис. 2.3. Гистограмма и полигон группированной выборки
Если середины верхних сторон прямоугольников соединить ломаной линией, то получается полигон. На рис. 2.3 изображены образцы гистограммы и полигона.
- 10 -
