Математическая статистика и анализ данных. Учебное пособие
.pdf

Сделаем вывод параметров для среднего случайных величин.
|
|
|
|
|
|
|
1 |
M 1 |
2 |
n |
||||
M |
1 |
|
2 |
|
|
|
n |
|
||||||
|
|
|
n |
|
n |
|||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
1 |
n |
|
|
|
1 |
|
|
|
||
|
|
|
|
M i |
|
|
|
|
||||||
|
|
|
|
|
|
|
nm m. |
|||||||
|
|
|
n |
n |
||||||||||
|
|
|
|
|
|
i 1 |
|
|
|
|
|
|
|
|
Таким образом, математическое ожидание среднего совпадает с математическим ожиданием одной случайной величины:
|
|
|
|
|
|
|
1 |
|
нез. |
|
n |
|
|
|
|||||||
D |
1 |
2 |
|
|
|
|
|
D 1 2 |
n |
|
|
|
n |
|
n |
2 |
|||||
|
|
|
|
|
|
|
|
|
||
|
|
|
|
|
|
|
|
1 |
n |
|
1 |
|
2 |
|
|
|
||||||||||
|
|
|
|
|
|
|
нез. |
|
|
|
D i |
|
|
|
|
|
|
|
|
|
|
|
|
|
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
n 2 . |
|
|
|
|||||||||
|
|
|
|
|
|
n |
2 |
n |
2 |
|
|
|
||||||||||||||
|
|
|
|
|
|
|
|
|
i 1 |
|
|
|
n |
|
|
|
||||||||||
|
|
Дисперсия среднего в n раз меньше дисперсии одной слу- |
||||||||||||||||||||||||
чайной величины, а СКО среднего будет в |
n раз меньше |
|||||||||||||||||||||||||
СКО одной случайной величины. |
|
|
|
|
|
|
|
|
|
|
|
|
||||||||||||||
|
|
f (x) |
|
|
ȟ~N(m, ı2) |
|
|
|
|
|
|
|
|
|
|
|
f(x) |
|
|
ȟ m ~N(0,1) |
||||||
|
|
|
|
|
|
|
|
|
|
|
||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
ı |
||
1 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
|
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
|
|
|
|
|
¥ |
|
|
|
|
|
|
|||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
ı¥ |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
|
|
|
|
|
ı ı |
|
|
|
|
|
|
|
|
|
|
1 |
|
|
|
|
1 |
|
|
||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
0 |
|
|
|
m |
|
|
|
|
x |
|
|
|
|
|
0 |
|
|
|
x |
|||||
|
|
|
|
|
|
а |
|
|
|
|
|
|
|
|
|
|
|
|
|
б |
|
|
|
|||
Рис. 4.3.
Для нормированных сумм провести доказательство самостоятельно. Приведем лишь графическую интерпретацию нормировки для ~ N(m, 2) (рис. 4.3).
61
(*2) Известно, что средняя масса гвоздя составляет 2 г со стандартным отклонением 0,3 г. Оцените с вероятностью p = 0,8 суммарную массу пачки из 100 таких гвоздей с помощью симметричного интервала относительно среднего.
Пусть i = {масса i-го гвоздя}, i = 1;100 . Тогда имеем = 1 +
+2 + … + 100 – масса коробки из 100 гвоздей:
1)1, 2, …, 100 – последовательность независимых слу-
чайных величин;
2)n = 100 30 (велико);
3)M( 1) = M( 2) = … = M( n) = m = 2, D( 1) = D( 2) = … =
=D( n) = 2 = 0,32.
Тогда в силу ЦПТ: n
= 1 + 2 +…+ n N(nm, n 2), где nm = 200, n 2 = 9, т.е. N(200, 9).
Необходимо найти симметричный интервал относительно среднего, который будет задаваться неравенством (200 – < < < 200 + ). С учетом формулы (4.1) для нормального закона имеем
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
4.1 |
|
|
|
по условию |
|
|
P(200 – < < 200 + ) |
|
2Ф |
|
|
0,8. |
||
|
|
|
|||||||
|
|
|
|
|
|
|
3 |
|
|
Тогда Ф |
|
= 0,4 и по таблице Лапласа находим значе- |
|||||||
|
|||||||||
|
|
3 |
|
|
|
|
|
||
ние |
1,28 , откуда = 3,84. |
|
|
|
|
|
|||
|
|
|
|
|
|
||||
3 |
|
|
|
|
|
|
|
|
|
Получаем, что с вероятностью 0,8 суммарная масса пачки гвоздей находится в пределах 200 г ± 3,84 г.
Закон больших чисел (ЗБЧ): теорема Бернулли. Пусть наблюдается эксперимент с бросанием правильной монеты. Известно, что вероятность выпадения орла в таком случае p = 0,5. Верно ли, что если мы стократно повторим эксперимент в одинаковых условиях, то орел выпадет ровно 50 раз? Безусловно, точно утверждать это мы не можем, но число орлов будет около 50. Предсказания, использующие знание
62
вероятности события, носят приблизительный характер, если число событий невелико. Однако эти предсказания становятся тем точнее, чем длиннее серия событий. Если число подбрасываний увеличить до 1000, орел также при повторах серии опытов редко появится ровно 500 раз. Но будут серии, где отношение числа появляющихся орлов к 1000 будет совсем близко к 0,5. Заслуга этого открытия принадлежит Якобу Бернулли13. Якоб Бернулли строго доказал, что разности отношения удачных бросков к общему числу бросков и теоретического числа вероятности p = 0,5 с возрастанием числа бросков могут быть сделаны меньше любого малого наперед заданного числа.
Теорема Бернулли (без доказательства). Пусть проводятся испытания Бернулли с вероятностью успеха в одном испытании p, а число k – число успехов в n испытаниях, тогда для произвольного положительного > 0
|
|
|
|
k |
|
|
|
|
|
|
|
|
|
|
|
||||||
lim P |
|
|
|
p |
|
|
1. |
(4.2) |
||
n |
||||||||||
n |
|
|
|
|
|
|
|
|||
Теорема Бернулли дает обоснование статистическому определению вероятности: по мере увеличения числа опытов «частота» события сближается с ее теоретической вероятностью.
Следствие: теорема Муавра – Лапласа19. Пусть k – число успехов в n независимых испытаниях, в каждом из которых p – вероятность появления некоторого события. Тогда имеют место следующие формулы:
|
|
|
|
|
|
1 |
|
|
|
k np 2 |
|
||
|
|
|
|
Pn(k) |
|
e |
2npq |
; |
|
||||
|
|
|
|
|
|
|
|||||||
|
|
|
|
2 npq |
|
|
|
|
|||||
|
|
|
|
|
|
|
|
|
|
|
|
||
|
|
|
|
|
k np |
|
k np |
||||||
P |
n |
(k |
1 |
k < k ) Ф |
2 |
|
|
Ф |
|
1 |
. |
||
|
|
|
|
||||||||||
|
|
2 |
|
npq |
|
|
|
|
|
|
|||
|
|
|
|
|
|
|
|
|
|
npq |
|||
(4.3)
(4.4)
63
Первая формула дает приближенное значение того, что событие появится k раз в n независимых испытаниях. Поэтому формула (4.3) задает локальную теорему Муавра – Лапласа. Формула (4.4) позволяет вычислять вероятность того, что в n независимых испытаниях событие появится от k1 до k2 раз. Эта формула содержит интеграл (функцию Лапласа), поэтому называется интегральной теоремой Муавра – Лапласа.
Рассмотрим i = {число успехов в i-м испытании Бернулли}. Заметим, что i принимает значения лишь 0 и 1 с вероятностями q и p соответственно, так как в одном испытании
Бернулли событие либо происходит, либо нет. Тогда i ~ B(p), причем M( i) = p, D( i) = pq (см. раздел 2). Число успехов
в n независимых испытаниях есть сумма k = 1 + 2 + … + n.
n
По ЦПТ 1 + 2 +…+ n N(nm, n 2).
Так как для данного случая m = p, 2 = pq, то
n
k = 1 + 2 +…+ n N(np, npq).
|
|
|
|
|
|
|
|
|
|
|
|
k np |
|
|
|
|
|
|
|
|
норм. закон |
|
1 |
|
2 |
||
|
Следовательно, Pn(k) |
f x k |
|
e |
2npq и |
||||||||
|
|
|
|||||||||||
|
|
|
|
|
|
|
|
|
|
|
2 npq |
|
|
|
|
|
k np |
k np |
|
||||||||
P (k k < k ) Ф |
2 |
|
|
Ф |
1 |
|
|
(см. формулу (3.1)). |
|||||
|
|
|
|
|
|||||||||
n |
1 |
2 |
|
|
|
|
npq |
|
|
|
|||
|
|
|
|
npq |
|
|
|
|
|||||
Замечание. Формула Муавра – Лапласа дает приемлемое приближение при n 30, npq порядка 10 и больше.
4.3. Законы распределения НСВ, часто применяемые в математической статистике
В 1901 г. был основан журнал Biometrika статистиками Пирсоном, Гальтоном и Уэлдоном, одной из целей которого было распространение знаний о такой статистической тео-
64
рии, которая может потребоваться для их научной обработки. Продолжительный период времени (период «расцвета» математической статистики) этот журнал1 был одним из ведущих в мире академических журналов по статистике, в котором публиковались новые законы и подходы к обработке данных.
Рассмотрим некоторые важные для методов математической статистики законы распределения: Пирсона2, Стьюдента3 и Фишера4.
1. 2-распределение Пирсона.
Определение 1. Пусть 1, 2, …, n – независимые случайные величины, распределенные по стандартному нормальному закону i ~ N(0, 1). 2-распределением с n степенями свободы называется распределение случайной величины 12 + 22 + + … + n2.
1 Текущие выпуски и архив журнала Biometrika доступны по ссылке https://elibrary.ru/contents.asp?id=33201154 (дата обращения: 07.09.2022).
2 Карл Пирсон (1857–1936 гг.) – основатель математической статистики, один из основоположников биометрии. «Можно считать, что Пирсон как бы вспахал почву, подготовив ее для дальнейшего развития» Р. Фишер, 1951 г.
3 Стьюдент – псевдоним британского ученого-статистика Уильяма Госсета (1876–1937 гг.). Работая на известном пивоваренном заводе «Гиннесс» над выведением самого урожайного сорта ячменя, проводил исследования на малых выборках. Госсет не мог опубликовать результаты своих работ под своим именем из-за запрета работодателя, поэтому взял псевдоним Стьюдент, чтобы скрыть себя от него. «Стьюдент – один из самых оригинальных умов современной науки. …Сомнительно, что он когда-либо представлял себе все значение своего вклада в теорию ошибок». Р. Фишер, 1939 г.
4 Рональд Фишер (1890–1962 гг.) – виднейший продолжатель классических работ и методов К. Пирсона; разработал фундамент теории оценок параметров, статистических решений, планирования эксперимента и проверки гипотез.
65
f x Ȥ2-ɪɚɫɩɪɟɞɟɥɟɧɢɟ
Q í2 x
Рис. 4.4
Обозначение: ~ n2.
График плотности вероятностей такой случайной величины при n 3 представлен на рис. 4.4.
2. Распределение Стьюдента.
Определение 2. Пусть и – независимые случайные величины, причем ~ N(0, 1), а ~ n2.
f x
t ɪɚɫɩɪɟɞɟɥɟɧɢɟ
0 |
x |
Рис. 4.5
Распределением Стьюдента (t-распределением) с n степенями свободы называется распределение случайной величины:
= |
|
. |
|
||
|
/ n |
|
Обозначение: ~ tn.
66
График плотности вероятностей изображен на рис. 4.5. Если случайная величина распределена по закону Стью-
дента, то в силу закона больших чисел /n 1 (где ~ n2), поэтому t-распределение при достаточно больших n (n 30) мало отличается от стандартного нормального N(0, 1).
3. Распределение Фишера.
Определение 3. Пусть и – независимые случайные величины, причем ~ n2, а ~ m2.
f x
)-ɪɚɫɩɪɟɞɟɥɟɧɢɟ
0 |
§ |
x |
Рис. 4.6
Распределением Фишера (F-распределением) с параметрами n и m называется распределение случайной величины:
/ n
=/ m .
Обозначение: ~ F(n, m).
График плотности вероятностей изображен на рис. 4.6.
Контрольные вопросы
1.Найдите P( < 0) для ~ N(0, 1).
2.Найдите P( < –1) для ~ N(0, 1); P( > 2).
3.Найдите P( < c) для ~ N(m, 2).
4.В чем заключается правило трех сигм для нормального закона распределения?
67
5.К какому закону сходятся средние арифметические большого числа независимых и одинаково распределенных случайных величин с конечной дисперсией?
6.Сформулируйте ЦПТ. Вероятность каких величин она позволяет вычислять?
7.Приведите пример задачи на применение ЦПТ.
8.Как себя ведет отношение числа успехов в схеме Бернулли к числу испытаний с ростом последнего?
9.Можно ли при каком-нибудь большом числе бросаний правильной монеты гарантировать, что частота выпадения орла отклонится от 0,1 не боле, чем на 0,05?
10.Сформулируйте теорему Муавра – Лапласа. При каких условиях ее целесообразно применять?
11.Проведите оценку в примере (*2) для вероятности 0,9. Сравните длину получившегося интервала с длиной интервала для вероятности 0,8, поясните.
68
РАЗДЕЛ 5 ВЫБОРОЧНЫЙ МЕТОД
Грубую прозу статистики поэты когда-нибудь облекут в стихи, потому что цифрами открывается сила, власть, людские слабости,
пути истории и много других... сторон мира...
Д.И. Менделеев, 1888 г.
1.Первое, с чем придется столкнуться исследователю, – определение генеральной совокупности и выборки, а также характеристика признаков, подлежащих изучению. Прежде чем собирать данные для исследования, сначала нужно решить, что вы с ними будете делать и как будете их собирать – во времени или пространстве.
2.Сбор данных для изучаемого признака должен быть организован так, чтобы обеспечить их репрезентативность. Статистические задачи возникают тогда, когда по результатам выборки нужно сделать выводы о генеральной совокупности.
3.На первом этапе делается графическое представление данных (и его анализ), подход к которому выбирается в зависимости от того, дискретные это данные или непрерывные: для дискретных строится многоугольник распределения,
адля непрерывных – гистограмма.
4.На втором этапе рассчитываются числовые характеристики. По результатам наблюдений можно рассчитать приближенное значение какой-либо интересующей исследователя характеристики, а можно указать целый интервал ее возможных значений, согласующихся с опытными данными. В первом случае говорят о точечной оценке, а во втором – об интервальной.
5.Для одной и той же характеристики можно предложить разные точечные оценки. Для выбора наилучшей оценки разработаны критерии их сравнения для суждения об их качестве: несмещенность, состоятельность и эффективность.
69
5.1. Задачи и терминология математической статистики
Математическая статистика возникла и развивалась вместе с теорией вероятностей, но в самостоятельную науку она сформировалась лишь в XX в.
Как в своих трудах отмечал бельгийский математик Адольф Кетле (один из родоначальников научного подхода к анализу данных): «Теория вероятностей родилась почти в то же время, что и ее младшая сестра, статистика, для которой она стала самой надежной и незаменимой спутницей. Это соответствие совсем не случайно; одна из этих наук в некотором роде спрашивает своим исчислением и согласовывает то, что другая добывает своими наблюдениями и своим опытом».
Определение 1. Математическая статистика (МС) – наука о сборе, систематизации и обработке данных с помощью математических методов с целью получения обоснованных выводов о случайных явлениях.
В приложениях МС часто используется схема, приведенная после определения 3, и связанные с ней понятия.
Определение 2. Пусть имеется некоторая совокупность однородных объектов или явлений, каждый из которых служит носителем каких-либо признаков, подлежащих изучению. Такую совокупность будем называть генеральной совокупностью. По-другому, можно сказать, что имеется случайная величина X, о которой ничего не известно (рис. 5.1).
Далее для изучения генеральной совокупности выбирают наугад часть ее элементов, если сплошное обследование по каким-либо причинам неприемлемо.
Прежде чем собирать данные для исследования, сначала нужно решить, что вы с ними будете делать и как вы их будете собирать – во времени или пространстве. Например, если вы хотите изучить длину хвоста кошек города A, то будете
70
