Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Лекции по теории вероятностей и математической статистике (для слушателей Института сокращенных программ). Учебное пособие для бакалавров направлений

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

Если из некоторой совокупности извлекаются ряд элементов, то данная совокупность называется генеральной, а совокупность, образованная извлеченными элементами, называется выборочной совокупностью, или просто выборкой.

Главной задачей математической статистики является построение достаточно надежных заключений о генеральной совокупности по выборочным данным.

Пусть x1,x2,,xn,– статистическая совокупность объема n. Упорядочив по возрастанию значения статистических элементов, получим ряд неравенств:

x(1) x(2) ≤… ≤ x(n),

где x(i) значение элемента статистической совокупности с порядковым номером i.

Порядковый центр совокупности называется медианой. Точнее определим так: если объем совокупности n = 2k +1 (нечетное количество), то медиана равна x(k),‌ если же n = 2k (четное количество), то медиана равна

12 (x(k) + x(k+1) ) — среднее арифметическое двух централь-

ных элементов.

Совокупность называется симметричной, если числа x(1),x(2),…,x(n) расположены на числовой прямой симметрично относительно медианы.

Например, совокупность {1,2,3,4,5} является симметричной, а совокупность {2,7,10,15,24} симметричной не является.

Вместо медианы в качестве центра совокупности чаще используется среднее арифметическое, или просто среднее:

x = x1 + x2 +…+ xn . n

Мерой рассеяния возможных значений совокупности относительно среднего, является дисперсия. Дисперсия совокупности x1, x2, , xn определяется как среднее квадратов отклонений значений xn от их среднего x :

σ2 = (x1 x)2 + (x2 x)2 +…+ (xn x)2 . n

91

Наряду с дисперсией для определения величины рассеяния используется стандартное (или среднее квадратичное) отклонение σ = σ2 .

Вариантом статистической совокупности x1, x2, …, xn называется значение любого её элемента. Как прави-

ло, варианты записываются в виде возрастающего ряда

α1 < α2 < …< αs.

Для каждого варианта αi символом mi обозначается частота — количество элементов совокупности, значения которых равны αi.

Отношение

mi

называют относительной частотой.

 

n

 

Вариант с наибольшей частотой называется модой.

Статистическим распределением совокупности x1, x2,

…,xn называется таблица относительных частот всех её вариантов.

Варианты

α1

α2

αs

 

 

 

 

 

Относит.

m

m

 

ms

1

2

n

частоты

n

n

 

 

 

 

 

 

Сумма всех относительных частот равна единице. Используя статистическое распределение, среднее

можно записать в виде: x = α1 mn1 + α2 mn2 +…+ αs mns .

Как можно заметить, среднее является аналогом математического ожидания в теории вероятностей. Следовательно, оно наследует все его свойства. Кроме того, для любой функции f(x) её среднее значение на совокупности x1,x2,…,xn находится аналогично:

f (x) = f1) mn1 + f (α2 ) mn2 +…+ fs ) mns .

Только все вычисления проводятся по таблице относительных частот (то есть по выборочным данным) и поэтому, в общем случае, найденные значения с числовыми характеристиками распределения не совпадают.

92

Пример 31

На экзамене по математике в группе из 20 студентов были получены следующие оценки: 5 баллов получили 8 студентов, 4 балла — 6, 3 балла — 4 и 2 балла — 2 студента. Найти средний балл и дисперсию статистической совокупности баллов.

Решение

Составим распределение баллов.

Варианты

2

3

4

5

Частоты

2

4

6

8

 

 

 

 

 

Относит. частоты

0,1

0,2

0,3

0,4

 

 

 

 

 

x = 2 0,1+ 3 0,2 + 4 0,3 + 5 0,4 = 4 ,

σ2 = µ2 = (2 − 4)2 0,1+ (3 − 4)2 0,2 + (4 − 4)2 0,3 + (5 − 4)2 0,4 = 1,

Следует отметить, что при большом количестве выборочных данных, статистические вычисления следует проводить с использованием известного программного обеспечения. Примером таких вычислений в Excel является пособие 7 в списке литературы.

Понятие гистограммы

Пусть x1, x2, , xn — некоторая совокупность, все значения которой содержатся в интервале [a; b). Процесс построения гистограммы начинается с выбора точек a = d1 < d2 < …< dk < dk+1 = b,

разбивающих интервал [a; b) на так называемые интервалы группировки:

[d1;d2 );[d2;d3 );…;[dk;dk+1 ).

Затем для каждого интервала [di;di+1 ). подсчитывается интервальная частота mi — количество статистических элементов, значения которых принадлежат данному интервалу.

На каждом отрезке di;di+1 оси абсцисс строится прямоугольник с высотой: hi = mni или hi = mi .

93

Площадь участка гистограммы над отрезком di;di+1 оси абсцисс равна той доле в общем объёме совокупности, которую составляют элементы со значениями из интерва-

ла [di;di+1 ). Площадь всей гистограммы равна единице. Для получения качественной гистограммы рекомен-

дуется выбирать точки деления, отличные от вариантов, имеющих большие частоты.

Для совокупности баллов из примера 31, построим гистограмму (рисунок 13). Для этого выберем следующие точки:

d1 = 1,5; d2 = 2,5; d3 = 3,5; d4 = 4,5; d5 = 5,5

0,4

0,3

0,2

0,1

1

2

3

4

5

Рис. 13. Гистограмма оценок на экзамене

Часто приходится иметь дело не с одной статистической совокупностью, а с несколькими одновременно. Определим характеристики для объединенной совокупности нескольких групп. Рассмотрим совокупность, полученную в результате объединения k попарно непересекающихся совокупностей-групп:

x1 = {x1,1, x1,2, , x1, n1 };

x2 = {x2,1, x2,2, , x2, n2 };

............................

xk = {xk,1, xk,2, , xk, nk }.

94

k

Имеем: n = ni — объем объединенной совокупности i=1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

ni

(общий объем),

 

=

 

xi, j — среднее i-ой группы;

xi

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

=

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

i

j

1

 

 

 

 

1

 

k

 

ni

 

 

 

 

 

 

 

 

=

 

∑∑xi, j — общее среднее;

x

 

 

 

 

 

 

 

 

n i=1 j=1

 

 

 

 

 

 

 

 

 

 

 

1

ni

 

 

 

 

 

 

σi2

=

(xi, j

 

 

)2

— дисперсия i-ой группы;

xi

 

n

 

 

 

 

 

 

=

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

i

j

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

k

ni

 

 

 

)2

 

σ2 =

∑∑(xi, j

 

— дисперсия объединения (общая

x

 

 

 

 

 

 

n i=1 j=1

 

 

 

 

 

 

дисперсия).

Суммувсехчисел xi, j можнопредставить,как n x и как n1 x1 + n2 x2 +…+ nk xk .

Следовательно, общее среднее объединенной совокупности имеет вид:

x = n1 x1 + n2 x2 +…+ nk xk . n1 + n2 +…+ nk

Аналогичная формула для общей дисперсии σ2 выгля-

дит несколько сложнее:

σ2 = σ2 + δ2,

 

 

 

 

 

1

 

k

 

где

σ2

=

i=1niσi2

— взвешенное среднее групповых

n

дисперсий,

 

 

 

 

 

 

 

1

 

k

 

 

 

 

 

 

δ2 =

ni (

 

 

)2

 

xi

— так называемая межгрупповая

x

дисперсия.n i=1

Для понимания применения этих формул, рассмотрим пример.

Пример 32

Проводится исследование благосостояния жителей одного из городов Сибири. По статистическим данным средняя заработная плата в государственном секторе этого города составляет 22000 руб. при стандартном отклонении 2300 руб. А средняя заработная плата в частном секторе составляет 34500 руб. при стандартном отклоне-

95

нии 3500 руб. Найти среднюю зарплату и её стандартное отклонение для всех трудоустроенных жителей города, если количество занятых в частном и государственном секторах одинаково. Оценить разброс возможных доходов

жителей этого города.

 

 

 

 

 

 

 

 

 

 

 

 

Решение

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

По

 

условию

имеем две

выборочные совокуп-

ности

одинакового

 

 

 

объёма.

Введем

обозначения:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x1

= 22000, x2

 

= 34500, σ1 = 2300, σ2 = 3500.

Средняя зар-

плата для объединенной совокупности:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

=

 

 

 

+

 

 

 

 

 

 

22000 + 34500

= 28250 руб.

 

 

 

 

 

 

 

 

 

 

 

 

x1

x2

=

 

 

 

 

 

 

 

 

x

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

Межгрупповая дисперсия:

 

 

 

 

 

 

 

 

 

(

 

 

)2 + (

 

 

 

)2

 

 

 

(22000 − 28250)2 + (34500 −28250)2

 

 

 

 

x1

x2

 

 

 

 

2

 

x

x

 

 

δ

 

=

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

=

 

 

 

 

 

 

 

=

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

= 39062500

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Средняя дисперсия:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

σ2 + σ2

 

 

23002

+ 35002

 

 

 

 

 

 

 

 

 

 

 

 

 

σ2 =

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

2

=

 

 

 

 

= 8770000 .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

Стандартное отклонение зарплаты по городу:

σ = σ2 + δ2 = 8770000 + 39062500 6916 руб.

Для оценки разброса возможных значений доходов жителей воспользуемся правилом трех сигм: наиболее вероятные возможные значения С.В. попадают в интервал 3σ = 3 6916 = 20748 руб. Таким образом,

(x − 3 σ;x + 3 σ ) = (28250 − 20748;28250 + 20748) =

=(7502;45998).

В данном городе средний доход жителя составляет примерно от 7,5 до 46 тыс. руб.

96

Глава 14. Статистические оценки параметров распределения

При изучении статистической совокупности, для определения вида распределения, необходимо определить параметры распределения. Обозначим произвольный параметр Θ — это может быть математическое ожидание, дисперсия или какой-либо другой параметр генерального

распределения. Произвольная функция от выборочных

(

x1, x2, …, xn

)

может рассматриваться как ста-

значений Θ

 

тистическая оценка Θ, если её значения «близки» к Θ. Смысл «близости» раскрывается в трех определениях.

Определение 1. Статистическая оценка называется

Θ

несмещённой, если при любом допустимом Θ математическое ожидание оценки равно параметру

( )

E Θ = Θ .

Разность между оцениваемым параметром и его оцен-

.

кой называется ошибкой оценки. Математическое ожидание ошибки оценки называется систематической ошибкой. Таким образом, требование несмещённости означает, что оценка не должна иметь систематической ошибки.

То есть, выполняется равенство: ( ) 0

.

=

Θ

Θ

E

Если для некоторого параметра Θ генерального распределения имеется несколько несмещённых оценок, то из них следует выбрать ту, которая характеризуется наименьшим разбросом значений.

Определение 2. Статистическая оценка параметра

Θ

Θ называется эффективной, если при заданном объёме вы-

борки она имеет наименьшую дисперсию.

 

 

 

 

 

 

 

Часто под оценкой параметра Θ понимается после-

довательность

функций:

 

 

(

x1

)

,

 

 

(

x1,x2

)

,

Θ1

= Θ1

 

 

Θ2

= Θ2

 

 

 

 

(

x1,x2,x3

)

 

 

 

 

 

 

 

 

 

 

 

 

Θ3

= Θ3

 

,… ,

 

 

 

 

 

 

 

 

 

 

 

 

 

Определение 3. Оценка

называется состоятель-

 

Θn

ной, если для любого сколь угодно малого числа ε > 0 ве-

роятность

P( Θ − Θn ≥ ε)→ 0

при

n → ∞

.

 

 

является состоятельной, если То есть, оценка Θn

для любой требуемой точности приближенное равенство

97

D(x1 ) = …= D(xn ) = σ2.
Из свойств математического ожидания имеем:
E(x1 ) = …= E(xn ) = a,

можно считать почти достоверным при достаточно

Θ ≈ Θn

большом объёме выборки.

Оценка математического ожидания

Пусть x1,x2,…,xn — выборка из распределения с математическим ожиданием, равным константе a и дисперсией

σ2. Проверим, что выборочное среднее x = x1 + x2 +…+ xn n

является несмещенной, эффективной и состоятельной оценкой a.

Выборочные данные являются случайными величинами, которые независимы и имеют одинаковые характеристики:

 

 

 

x1 + x2

+…+ xn

 

1

 

E(x) = E

=

(E(x1 ) +…+ E(xn )) = a.

 

 

 

 

 

 

n

n

 

 

 

 

 

 

 

 

Таким образом, x несмещенная оценка a.

 

 

 

x1

+ x2

+…+ xn

 

1

 

σ2

 

D(x) = D

=

(D(x1 ) +…+ D(xn )) =

.

 

 

 

 

 

 

 

 

 

 

 

n

2

n

 

 

 

 

 

 

 

 

 

n

 

 

Поэтому,

D(

 

) → 0 когда n → ∞ . Это говорит об эф-

x

фективности оценки.

Кроме того, можно показать, что выборочное среднее x является эффективной оценкой математического ожидания в классе всех линейных несмещенных оценок. Это означает, что x — состоятельная оценка a.

Оценка дисперсии

Пусть x1, x2, …, xn — выборка из распределения с математическим ожиданием a и дисперсией σ2. Для выборочной дисперсии

1 n x x 2 справедлива следующая теорема:

σ2 = n i=1 ( i )

98

2

n −1

 

2

 

 

 

 

 

 

 

Теорема E(σ ) =

 

 

σ .

 

 

 

 

 

 

 

n

 

2

 

 

 

 

 

 

 

 

 

— смещённая оценка

Итак, теорема говорит, что σ

σ2. Несмещённая оценка задается формулой:

2

n

 

2

1

 

n (

 

 

)2

 

 

 

 

s =

 

 

xi x

.

n −1

 

σ =

n −1

 

 

 

 

i=1

 

 

 

 

Такую оценку дисперсии называют исправленной выборочной дисперсией. Она является несмещённой, эффективной и состоятельной оценкой генеральной дисперсии. Однако, стоит заметить, что при большом объёме выборке, выборочная дисперсия и исправленная выборочная дисперсия мало отличаются. Поэтому, при больших объёмах (больше 100) для оценки дисперсии вычисляют обычную выборочную дисперсию.

Оценка вероятности события

Рассмотрим задачу оценивания неизвестной вероятности p в схеме независимых повторных испытаний. Пусть проведено n независимых испытаний, в которых нужное нам событие наблюдалось k раз.

Для вероятности p оценкой является относительная частота появления события: p = nk .

Так как случайная величина k — число появлений события в независимых испытаниях, распределена по биномиальному закону с параметрами n и p, то

E( p) = E nk = n1 E(k) = n1 n p = p.

Мы видим, что оценка является несмещённой. Кроме того, можно показать, что она является эффективной и состоятельной.

Стоит вспомнить, что предел относительной частоты при большом объёме выборке совпадает с вероятностью появления события. На этом основано статистическое определение вероятности.

99

Пример 33

В четырех независимых испытаниях случайная величина X приняла следующие значения: 3, 5, 8, 10. Найдите несмещённую оценку дисперсии D(X).

Решение

Так как все значения С.В. различные, то посчитаем выборочные характеристики по определению:

X = xi = 3 + 5 + 8 +10 = 6,5. n 4

Так как среднее выборочное не является целым, то посчитаем выборочную дисперсию по формуле:

σ2 = xi2 x2 = 9 + 25 + 64 +100 (6,5)2 = 49,5 − 42,25 = 7,25. n 4

Несмещённой оценкой дисперсии является исправленная дисперсия:

s2 = nn−1 σ2 = 43 7,25 = 293 ≈ 9,67.

Заметим, что при малых объёмах выборки исправленная оценка дисперсии существенно больше выборочной дисперсии.

Мы рассмотрели вопрос об оценке неизвестного пара-

метра Θ одним числом . Такую оценку называют точеч-

Θ

ной.

Чтобы дать представление о точности и надежности

оценки Θ , в математической статистике используют понятия доверительных интервалов и доверительной вероятности.

Определение. Доверительный интервал покрывает неизвестный параметр Θ с доверительной вероятностью γ, если выполнено условие:

( )

P Θ − Θ < ε = γ.

Это условие означает, что с вероятностью γ неизвестное значение параметра Θ накроется случайным интерва-

лом

Iγ = (Θ − ε, Θ + ε)

.

 

 

При этом величину ε называют ошибкой оценки .

Θ

100

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]