Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Специальные главы математического анализа. Теория вероятностей. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
672 Кб
Скачать

Задачи для самостоятельного решения

10.1Какова вероятность того, что в 100 партиях одинаковых по силе противников один из них выиграет более 70 раз? Ничьих нет.

10.2Каждая буква текста может оказаться опечаткой с вероятностью 10−4. Какова вероятность того, что в тексте из 40 000 букв окажется более 2 опечаток?

10.3Известно, что вероятность рождения мальчика приблизительно равна 0.515. Какова вероятность того, что среди 10 тыс. новорожденных окажется мальчиков меньше, чем девочек?

10.4Для лица, дожившего до двадцатилетнего возраста, вероятность смерти на 21-м году жизни равна 1/400. Застрахована группа из 104 лиц 20-летнего возраста, причем каждый застрахованный внес 350 рублей страховых взносов за год. В случае смерти застрахованного его родственникам выплачивается 105 рублей. Оценить вероятность того, что:

(а)к концу года страховое учреждение окажется в убытке;

(б) его доход превысит 106 рублей;

(в)его доход превысит 2 · 106 рублей.

10.5Известно, что вероятность выпуска сверла повышенной хрупкости (брак) равна 0.02. Сверла укладываются в коробки по 100 шт. Чему равна вероятность того, что в коробке не окажется бракованных сверл? Какое наименьшее количество сверл нужно класть в коробку для того, чтобы с вероятностью, не меньшей 0.9, в ней было не менее 100 исправных?

10.6Игральная кость подбрасывается 120 раз. Вычислить приближенно вероятность каждого из двух событий: выпало не менее 10 единиц; выпало не менее 60 четных чисел.

10.7Сколько в среднем изюминок должны содержать калорийные булочки, чтобы с вероятностью не менее 0,99 в булочке была хотя бы одна изюминка?

10.8При производстве матрицы каждый из 2 · 107 пикселей может быть поврежден с вероятностью 10−7 независимо от других. Какова вероятность

того, что будет повреждено более 3 пикселей?

10.9Вероятность угадывания 6 номеров в спортлото (6 из 49) равна 7.2·10−8. При подсчете оказались заполненными 5 млн. карточек. Какова вероятность, что никто не угадал все 6 номеров? Какое наименьшее количество карточек нужно заполнить, чтобы с вероятностью не менее 0.9 хотя бы один угадал 6 номеров?

61

Индивидуальные домашние задания

Для заданных параметров n и p биномиального распределения вычислить вероятности в пунктах а) и б) по формуле Бернулли, с помощью теорем Муавра—Лапласа и Пуассона. Выяснить, какая из теорем дает более точное приближение.

Вариант 1 а) n = 30, p = 0.01, P(Sn ≥ 4); б) n = 40, p = 0.4, P(Sn ≥ 10). Вариант 2 а) n = 20, p = 0.02, P(Sn < 5); б) n = 50, p = 0.3, P(Sn ≥ 9). Вариант 3 а) n = 15, p = 0.04, P(Sn ≥ 3); б) n = 60, p = 0.2, P(Sn < 8). Вариант 4 а) n = 40, p = 0.03, P(Sn ≥ 5); б) n = 30, p = 0.45, P(Sn ≥ 9). Вариант 5 а) n = 50, p = 0.05, P(Sn < 6); б) n = 20, p = 0.5, P(Sn ≥ 10). Вариант 6 а) n = 25, p = 0.06, P(Sn ≥ 4); б) n = 80, p = 0.25, P(Sn < 7). Вариант 7 а) n = 35, p = 0.01, P(Sn ≥ 4); б) n = 45, p = 0.4, P(Sn ≥ 10). Вариант 8 а) n = 25, p = 0.02, P(Sn < 5); б) n = 55, p = 0.3, P(Sn ≥ 9). Вариант 9 а) n = 20, p = 0.04, P(Sn ≥ 3); б) n = 65, p = 0.2, P(Sn < 8). Вариант 10 а) n = 45, p = 0.03, P(Sn ≥ 5); б) n = 35, p = 0.45, P(Sn ≥ 9). Вариант 11 а) n = 55, p = 0.05, P(Sn < 6); б) n = 25, p = 0.5, P(Sn ≥ 10). Вариант 12 а) n = 30, p = 0.06, P(Sn ≥ 4); б) n = 85, p = 0.25, P(Sn < 7). Вариант 13 а) n = 30, p = 0.02, P(Sn ≥ 4); б) n = 40, p = 0.45, P(Sn ≥ 10). Вариант 14 а) n = 20, p = 0.03, P(Sn < 5); б) n = 50, p = 0.35, P(Sn ≥ 9). Вариант 15 а) n = 15, p = 0.05, P(Sn ≥ 3); б) n = 60, p = 0.25, P(Sn < 8). Вариант 16 а) n = 40, p = 0.04, P(Sn ≥ 5); б) n = 30, p = 0.5, P(Sn ≥ 9). Вариант 17 а) n = 50, p = 0.06, P(Sn < 6); б) n = 25, p = 0.45, P(Sn ≥ 10). Вариант 18 а) n = 25, p = 0.07, P(Sn ≥ 4); б) n = 80, p = 0.3, P(Sn < 7). Вариант 19 а) n = 30, p = 0.01, P(Sn ≥ 3); б) n = 40, p = 0.4, P(Sn ≥ 9). Вариант 20 а) n = 20, p = 0.02, P(Sn < 4); б) n = 50, p = 0.3, P(Sn ≥ 8). Вариант 21 а) n = 15, p = 0.04, P(Sn ≥ 4); б) n = 60, p = 0.2, P(Sn < 7). Вариант 22 а) n = 40, p = 0.03, P(Sn ≥ 6); б) n = 30, p = 0.45, P(Sn ≥ 7). Вариант 23 а) n = 50, p = 0.05, P(Sn < 7); б) n = 20, p = 0.5, P(Sn ≥ 6). Вариант 24 а) n = 25, p = 0.06, P(Sn ≥ 3); б) n = 80, p = 0.25, P(Sn < 6). Вариант 25 а) n = 30, p = 0.07, P(Sn ≥ 4); б) n = 40, p = 0.4, P(Sn ≥ 8). Вариант 26 а) n = 20, p = 0.08, P(Sn < 5); б) n = 50, p = 0.3, P(Sn ≥ 7). Вариант 27 а) n = 15, p = 0.09, P(Sn ≥ 3); б) n = 60, p = 0.2, P(Sn < 6). Вариант 28 а) n = 40, p = 0.1, P(Sn ≥ 5); б) n = 30, p = 0.45, P(Sn ≥ 7). Вариант 29 а) n = 50, p = 0.12, P(Sn < 6); б) n = 20, p = 0.5, P(Sn ≥ 8). Вариант 30 а) n = 25, p = 0.2, P(Sn ≥ 4); б) n = 80, p = 0.25, P(Sn < 5).

62

Глава 3

Математическая статистика

§11. Выборка и выборочные характеристики

В математической статистике рассматривается ситуация, когда распределение наблюдаемой в случайном эксперименте величины X неизвестно (хотя бы частично), зато исследователь располагает результатами эксперимента (статистическими данными), по которым он должен сделать выводы о неизвестном распределении случайной величины X. К этому стоит добавить, что задачей математической статистики является использовать результаты эксперимента по возможности оптимальным образом.

Основным объектом исследования в математической статистике является

выборка X = (X1, X2, ..., Xn), то есть набор значений случайной величины X, полученных в результате n независимых воспроизведений эксперимента. Иначе говоря, выборка представляет собой случайный вектор, координаты которого — элементы выборки X1, X2, ..., Xn — независимые случайные величины, имеющие общее распределение с функцией распределения F (t).

Конкретный набор числовых значений случайных величин X1, X2, ..., Xn, полученный в результате эксперимента, будем называть реализацией выборки и обозначать x = (x1, x2, ..., xn).

Если элементы выборки X1, . . . , Xn упорядочить по возрастанию, то получится новый набор случайных величин, называемый вариационным рядом:

X(1) ≤ X(2) ≤ . . . ≤ X(n−1) ≤ X(n).

В частности, X(1) = min{X1, . . . , Xn}, X(n) = max{X1, . . . , Xn}.

Эмпирической функцией распределения Fn (t) называется относительная частота элементов выборки, меньших заданного t. Эмпирическая

функция распределения, соответствующая выборке X = (X1, X2, ..., Xn), может быть построена по этой выборке с помощью любой из следующих

63

формул:

Fn (t) =

 

число Xi < t

=

1

 

n

I(Xi < t),

(3.1)

 

 

 

 

Xi

 

n

n

 

 

 

=1

 

 

 

 

 

 

 

 

 

 

где функция

I(Xi < t) =

0

иначе, i

 

1,

если X < t,

— индикатор события {Xi < t}.

Заметим, что эмпирическая функция распределения, соответствующая

случайной выборке X, сама является случайной, поскольку определяется через элементы выборки X1, X2, . . . , Xn, являющиеся случайными вели-

чинами. В то же время любая реализация x = (x1, x2, . . . , xn) выборки X порождает соответствующую реализацию эмпирической функции распределения (по той же формуле (3.1)), которая является обычной (а не случайной) функцией распределения.

С помощью вариационного ряда (или его реализации) эмпирическая функция распределения может быть построена графически.

 

 

 

 

 

Fn(t)

 

6

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

 

 

 

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

u

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

u

 

 

 

 

 

 

 

 

 

 

 

 

 

u

 

 

 

 

 

 

 

 

1

 

 

 

 

n

 

 

 

 

 

 

 

 

 

n

 

 

u

 

 

 

 

 

 

 

 

 

 

 

 

 

-

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

X(1)

X(2)

 

 

 

 

X

 

 

 

 

 

 

X

 

 

 

 

 

 

 

u

 

 

 

 

0

 

 

 

 

 

(i)

 

 

 

 

(n)

t

 

 

 

 

 

 

 

 

 

 

 

 

 

Рис. 3.1. Эмпирическая функция распределения Fn (t).

Эмпирическая функция распределения Fn (t) является выборочным аналогом неизвестной теоретической функции распределения F (t), ее называют также оценкой для F (t). Выборочным аналогом для теоретической плотности распределения f(t) является гистограмма, или эмпирическая плот-

ность распределения, которая строится по выборке X = (X1, X2, ..., Xn) следующим образом.

Пусть h > 0 — произвольное число. Разобьем область значений изучаемой случайной величины (например, всю числовую ось) на промежутки ∆k = [zk−1, zk) длины h и построим ступенчатую функцию fn(t), которая на каждом промежутке ∆k принимает постоянное значение, вычисляемое по любой из формул:

f (t) =

число Xi k

=

1

 

n

I(X

∆ ) =

νk

, t

∆ ,

 

 

 

Xi

 

n

nh

nh

 

i k

nh

k (3.2)

=1

 

 

 

 

 

 

 

 

 

 

 

64

где νk — число элементов выборки, попавших в промежуток ∆k. Так построенная функция называется гистограммой с шагом h и имеет график, изображенный на рис. 3.2.

fn(t

)6

 

 

 

 

 

 

 

 

 

 

 

 

 

νk

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

nh

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

ν2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

nh

 

 

 

 

 

 

 

 

 

νk

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

ν1

 

 

 

 

 

 

 

 

ν2

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

nh

 

 

 

 

 

ν1

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

-

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

0

 

 

 

z0

z1

z2 zk−1 zk

 

 

t

Рис. 3.2. Гистограмма fn(t).

Заметим, что площадь каждого прямоугольника гистограммы равна νnk , то есть частоте попадания в соответствующий интервал ∆k.

Иногда шаг гистограммы h выбирают следующим образом. Сначала расчитывают число интервалов K по формуле Стеджеса

K = [log2 n] + 1.

(3.3)

Здесь [·] — целая часть числа. Потом длина интервала рассчитывается по формуле

h = X(n) − X(1) .

K

При построении гистограммы последний промежуток выбирается замкнутым: ∆K = [zK−1; zK]. Величину X(n) −X(1) = max{Xi}−min{Xi} называют размахом выборки.

По выборке X = (X1, X2, ..., Xn) можно построить эмпирические (выборочные) аналоги числовых характеристик распределения. Наиболее употребительными являются выборочное математическое ожидание, или выборочное среднее, X, и выборочная дисперсия S2:

 

1

 

n

1

 

n

 

 

 

 

Xi

X

(3.4)

 

 

 

 

 

 

 

X = n

Xi, S2 = n

=1

(Xi − X)2.

 

 

 

 

 

 

 

i=1

 

Подобно выборочным среднему и дисперсии определяются выборочные моменты порядка k

n

Xk = n1 XXik,

i=1

65

которые являются эмпирическими аналогами моментов EX1k.

Отметим, что выборочная дисперсия вычисляется аналогично дисперсии:

S2 = X2 − (X)2.

Несмещенная выборочная дисперсия — это статистика

S02 = n −n 1S2.

Задачи для самостоятельного решения

11.1 По данной реализации выборки x = (0, 0, 1, 1, 0, 0, 0, 0, 0, 1): а) построить график эмпирической функции распределения; б) построить график гистограммы;

в) вычислить выборочное среднее, выборочную дисперсию, несмещенную выборочную дисперсию.

11.2 Измерен рост (в см) студентов одной учебной группы. Результаты измерений дали выборку (171; 186; 164; 190; 158; 181; 176; 180; 174; 157; 176; 169; 164; 186).

а) Построить реализацию гистограммы.

б) Вычислить реализации выборочного среднего, выборочной дисперсии и выборочного стандартного отклонения S. На одном графике с гистограммой построить график плотности нормального закона с параметрами X, S2.

11.3 Пассажир маршрутного такси измерил 8 раз время ожидания такси и получил следующие результаты (в минутах): 8; 4; 5; 4; 2; 15; 1; 6. У него есть две гипотезы относительно графика движения такси: либо график движения соблюдается, и время ожидания имеет равномерное распределение на отрезке [0, θ], либо график движения не соблюдается, и время ожидания имеет показательное распределение с параметром λ.

а) Вычислить реализации оценок параметров θ и λ, использовав оценки

θe= (n + 1)X(n)/n и λe = nnX−1.

б) Построить на одном графике реализацию эмпирической функции распределения и теоретические функции распределения равномерного и показательного законов, в которые вместо неизвестных параметров подставлены реализации их оценок.

в) Построить на одном графике реализацию гистограммы и теоретические плотности распределения равномерного и показательного законов, в которые вместо неизвестных параметров подставлены реализации их оценок. На основании проведенного исследования сделать вывод о том, какая из гипотез выглядит более соответствующей экспериментальным данным.

66

Индивидуальные домашние задания

Каждой букве своих имени, отчества и фамилии сопоставьте ее номер в алфавите в соответствии с таблицей. По полученной выборке постройте вариационный ряд, графики эмпирической функции распределения и гистограммы. Вычислите выборочное среднее, выборочную дисперсию и выборочное среднеквадратическое (стандартное) отклонение, а также несмещенную выборочную дисперсию.

а

 

б

в

 

 

г

д

е

е

ж

з

и

й

к

л

м

н

о

п

p

1

 

2

 

 

3

4

5

 

6

 

7

 

8

 

9

 

10

 

11

 

12

 

13

 

14

 

15

 

16

 

17

 

18

 

 

 

с

 

т

 

у

 

ф

 

х

 

ц

 

ч

 

ш

 

щ

 

ъ

 

ы

 

ь

 

э

 

ю

 

я

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

19

 

 

20

 

 

21

 

22

 

23

 

24

 

 

 

25

 

 

26

 

 

27

 

 

28

 

 

29

 

 

30

 

 

31

 

 

32

 

 

33

 

 

Пример: Наталья Станиславовна Закревская 15 1 20 1 13 30 33 19 20 1 15 10 19 13 1 3 16 3 15 1 9 1 12 18 6 3 19 12 1 33, n = 30.

§12. Статистики и оценки

Задача оценивания параметров возникает в ситуации, когда распределение F не является полностью неизвестным, а известен его математический вид F = F (t, θ), содержащий неизвестный параметр θ (или несколько, то-

гда θ - многомерный параметр). Задача состоит в том, чтобы по выборке X

вычислить приближенное значение θ (X) для неизвестного параметра, причем сделать это в том или ином смысле оптимальным образом. Это задача точечного оценивания. Другой подход состоит в построении по выборке

 

 

X интервала (θ(X);

θ+(X)), который накрывает неизвестное значение

параметра θ с заданной (высокой) вероятностью. Этот подход называется

интервальным оцениванием, а (θ(X); θ+(X)) называется доверительным интервалом.

Пусть X = F (t, θ), причем параметр θ может принимать значения из множества Θ, которое называется параметрическим множеством. Будем на-

зывать статистикой любую случайную величину вида T (X), которая является функцией только от элементов выборки. Оценкой параметра θ

˜ ˜

называется статистика θ = θ(X), которая принимает значения из параметрического множества Θ.

Метод моментов

Пусть θ Θ - одномерный параметр, и g : R −→ R некоторая числовая

функция. Тогда по данной выборке X = (X1, X2, ..., Xn) можно построить

67

выборку g(X) = (g(X1), g(X2), ..., g(Xn)). Обозначим

 

1

 

n

 

Xi

 

 

 

 

g(X) = n

g(Xi)

 

 

 

 

=1

выборочное среднее этой выборки. С другой стороны, можно найти теоретическое среднее

m(θ) = Eg(X1).

Определение 3.1 Оценкой метода моментов (ОММ) называется такое значение θ , при котором теоретическое среднее выборки g(X) совпадает с выборочным средним:

m(θ ) =

g(X)

,

(3.5)

то есть ОММ является решением уравнения (3.5) относительно неизвестного

θ .

В качестве функции g чаще всего выбирают степенные функции: g(x) = xk, где k = 1, 2, .... Оценка по методу моментов в этом случае называется

оценкой по k-тому моменту и обозначается θk.

Задачи для самостоятельного решения

12.1 По выборке (X1, . . . , Xn) из бернуллиевского распределения Bp с неизвестным параметром p (0; 1) построить оценки параметра p:

a) по первому моменту; б) по второму моменту;

в) по произвольному k-му моменту.

Можно ли отдать предпочтение какой-либо из построенных оценок? 12.2 При каких значениях параметра θ > 0 распределения Парето с плотностью

 

 

θ

, t ≥ 1,

fθ(t) =

 

tθ+1

 

0, t < 1

существует оценка параметра по первому моменту?

Индивидуальные домашние задания

В тексте задачи через N обозначен номер студента по списку группы.

1.Для выборки X1, . . . , Xn из равномерного распределения на [0, θ] получить оценки параметра θ методом моментов на основании первого, второго, (N+2)-го момента.

68

2.Генерировать реализацию выборки объема n = 100+N из равномерного распределения на [0, θ], приняв θ = N.

˘

3. Вычислить реализации всех полученных оценок, а также оценки θ = n+1n X(n). Подсчитать абсолютные погрешности оценивания и ранжировать оценки по абсолютной погрешности.

§13. Линейная регрессия

В простейшем варианте задачи о линейной регрессии даны пары точек (x1, y1), . . . , (xn, yn). Задача состоит в отыскании прямой y = bkx+b, наилучшим образом приближающей эти точки в следующем смысле: значение суммы квадратов отклонений значений yi от соответствующих значений bkxi + b достигает минимума:

n

X

(yi bkxi −b)2 → min .

i=1

Решение задачи дается следующими формулами:

bk = xy − x y ; x2 − (x)2

b = y − kx.

Вероятностная постановка задачи, приводящая к тому же ответу, состоит в следующем: случайные величины yi независимы и имеют нормальное распределение с одной и той же дисперсией и с математическим ожиданием kxi + b. Тогда bk и b — это оценки параметров k, b.

Задачи для самостоятельного решения

13.1 Методом наименьших квадратов оценить неизвестные параметры регрессии.

xi 1 2 3

yi 5 −1 2

13.2 Методом наименьших квадратов оценить неизвестные параметры регрессии.

xi

1

2

3

4

yi

2

4

3

5

69

Индивидуальные домашние задания

Постройте модель линейной регрессии числа букв своих имени, отчества, фамилии на число гласных букв (а, е, е, и, о, у, ы, э, ю, я).

Оцените параметры регрессии и постройте на одном графике точки данных и прямую регрессии.

xi — число гласных букв в имени (x1), отчестве (x2), фамилии (x3). yi — число букв в имени (y1), отчестве (y2), фамилии (y3).

Пример: Наталья Станиславовна Закревская xi 3 5 4

yi 7 13 10

Примечание. Если число гласных букв в имени, отчестве, фамилии одинаково (x1 = x2 = x3), то используйте однопараметрическую модель c b = 0. При этом прямая регрессии y = bkx, где bk = xyx2 .

§14. Интервальное оценивание

Пусть имеется выборка объема n из распределения, известного с точно-

 

 

стью до параметра: X = F (t, θ), θ Θ. Доверительным интервалом с уров-

нем доверия

1 − ε ( (1 − ε)-доверительным интервалом) для неизвестного

параметра θ

называют случайный интервал (θ; θ+) Θ, построенный

по выборке, который накрывает неизвестное значение параметра с вероятностью, равной 1 − ε, или по крайней мере стремящейся к 1 − ε с ростом объема выборки, то есть

P{θ (θ; θ+)} → 1 − ε

(3.6)

при n → ∞.

 

 

θ, θ+ — это оценки параметра

θ, называемые нижней и верхней до-

верительными границами. Число

1 − ε (0; 1)

— уровень доверия, или

доверительная вероятность, — выбирается заранее и отражает «степень готовности мириться с возможностью ошибки»: чем менее мы готовы мириться с возможной ошибкой, тем большее (более близкое к единице) значение 1 − ε должны устанавливать.

Для построения доверительных интервалов используется центральная

предельная теорема: если 0 < σ2(θ) = DX1 < ∞, то

n(X − m(θ)) σ(θ)

70

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]