Добавил:
Upload Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Учебное пособие Теории вероятностей и математическая статистика

.pdf
Скачиваний:
290
Добавлен:
26.03.2015
Размер:
2 Мб
Скачать

Как и в теории вероятностей, для вариационных рядов в математической статистике вводятся аналогичные числовые характеристики, а именно: математическое ожидание, квантиль, медиана, мода, а также характеристика рассеивания – дисперсия, которые получаются на основании выборочных данных.

Выборочным начальным моментом s-го порядка называется сум-

ма вида

k

1

k

 

 

M s xis pi

xis ni .

 

 

 

i 1

n i 1

 

 

В частности, при s = 1 получается выборочная средняя

k

 

 

1

 

k

 

xв M1 xi pi

xi ni

 

 

 

i 1

 

 

n i 1

 

Центральные выборочные моменты определяются для центри-

рованных элементов выборки

xв . Соответствующий выбо-

рочный центральный момент l-го порядка равен

k

 

 

 

 

 

 

ms (xi0 )s pi

 

i 1

 

 

 

 

 

 

В частности, выборочный центральный момент второго порядка

определяет выборочную дисперсию

 

k

 

 

 

 

k

 

Dв 2 m2 (xi0 )2 pi (xi

xв )2 pi

i 1

 

 

 

 

i 1

 

Выборочной модой ̃

называется элемент выборки, имеющий

наибольшую частоту, т. е. абсцисса максимума полигона частот

Аналогично определяются

 

 

выборочная асимметрия

A m / 3

3

,

выборочный эксцесс

 

E m / 4 3 .

 

 

 

 

 

4

 

Выборочная медиана ̃

определяется серединой выборочного

ряда и зависит от чётности объёма выборки:

x

 

 

при n 2k 1,

̃ k 1

 

 

 

 

при n 2k.

(xk xk 1 ) / 2

4.4 Гистограмма

81

Гистограмма представляет собой диаграмму распределения частот, попадающих в выбранные промежутки. Они дают представление о характере распределения выборки, особенно, если объём выборки большой.

Для выборки объёма п гистограмма строится следующим образом.

1) Промежуток (xmax xmin ) выборки разбивается на k равных

частичных промежутков длины h , h

(xmax xmin ) / k .

xi xi xi 1, x0 xmin , xk xmax ,

i 1, 2,...,k.

2)Для каждого i-го интервала определяется число ni элементов выборки, попавших в данный промежуток.

3)Определяя для каждого интервала величины относительных частот wi ni /(nh) и размещая полученные значения на серединах

интервалов, строим зависимость относительных частот wi от xi .

Если соединить полученные точки отрезками прямых линий, то получим полигон частот. Если же на каждой точке построить прямоугольник с основанием h и высотой wi , то получим гистограмму.

При данном способе построения площадь всей гистограммы равна единице, что позволяет сопоставлять такую гистограмму с плотностью вероятностей f(x).

Важным моментом является выбор ширины разрядов h или числа k . Существует несколько способов выбора этих величин. Например,

h / 2,5;

k [(xmax xmin ) / h]

 

 

 

 

или

 

 

 

 

 

 

 

 

 

 

 

 

 

 

k [1 3,322 lg n];

k [1 log

2

n];

k [1,72 3 n];

 

 

 

 

 

 

 

h (xmax xmin ) / k .

 

 

 

 

 

 

В этих выражениях [*] – целая часть числа.

Пример 1. В результате выполнения первых двух этапов получены следующие данные интервального распределения

 

2 –

6

6 – 10

10 – 14

14 – 18

18 – 22

22 – 26

26 - 30

 

4

 

13

17

30

19

11

6

Вычислим числовые характеристики данного распределения и построим его гистограмму.

=

82

2

– 6

4

4

0,04

0,16

0,64

0,01

6

– 10

8

13

0,13

1,04

8,32

0,0325

10 – 14

12

17

0,17

2,04

24,48

0,0425

14 – 18

16

30

0,30

4,80

76,8

0,0750

18 – 22

20

19

0,19

3,80

76

0,0475

22 – 26

24

11

0,11

2,64

63,36

0,0275

26 – 30

28

6

0,06

1,68

47,04

0,015

Здесь во втором столбце указаны середины интервалов, в третьем

– относительная частота; с помощью третьего и четвёртого столбцов

вычисляем выборочные среднее значение ̅ ∑

и

 

 

в

 

дисперсию в

в

, откуда

в

В последнем столбце дана приведённая относительная ча-

стота , с помощью которой мы строим гистограмму. В этом случае общая площадь гистограммы равна единице, что позволяет сопоставлять её с плотностью вероятности генеральной совокупности без масштабирования. Действительно, если мы, используя вычисленные параметры для данной совокупности, построим кривую нормального распределения, то она достаточно хорошо соответствует данной гистограмме (рис. 4.3, второй график построен в Mathcade).

4.5. Статистическая оценка параметров распределения

Точечные оценки и их свойства

Пусть исследуется некоторый статистический признак Х (например, средний размер изготавливаемого изделия или параметр распределений и т. д.), который задаётся рядом измеренных значений

.

Статистической оценкой ˆ параметра теоретического распределения называют его приближённое значение, зависящее от

83

M ( ˆ )

данных выборки ˆ ˆ (x1, x2 , , xn ) . Функцию результатов наблюде-

ния называют статистикой. Так, выборочная функция распределения есть оценка функции распределения F(x), гистограмма – плотно-

сти вероятностей f(x) и т. д. Оценка ˆ является случайной величиной, так как зависит от независимых случайных величин X1, X 2 ,..., X n

. Чем меньше объём выборки, тем больше ошибка оцениваемой величины.

 

 

ˆ

 

Точечной оценкой называют функцию измеренных данных

ˆ ˆ

, x2 , , xn )

 

ˆ

(x1

, приближённо равную значению параметра

ˆ

ˆ

, xn )

(4.1)

(x1, x2 ,

Для того, чтобы такая оценка была «близка» к истинному значению, к ней предъявляется ряд требований: оценка должна обладать свойствами несмещённости, состоятельности и эффективности.

1. Оценка ˆ параметра называется несмещённой, если математическое ожидание оценки равно оцениваемому параметру, т. е.

(4.2)

Это требование особенно важно при малых объёмах n выборки. 2. Оценка ˆ ˆ (x1, x2 , , xn ) называется состоятельной, если

она стремится по вероятности к истинному значению параметра . Иными словами, для любого 0 справедливо соотношение

84

lim P

 

ˆ

 

1.

(4.3)

Со-

 

 

 

n

 

 

 

 

 

 

 

 

 

 

стоятельность означает, что отличие оценки от истинного значения параметра уменьшается с ростом объёма выборки. Точнее, справедлива следующая

 

Теорема: Если при

ˆ

ˆ

то

 

n M ( n ) и D( n ) 0,

ˆ

– состоятельная оценка.

 

 

n

 

 

Действительно, из неравенства Чебышёва для случайной величины ˆ n при любом значении 0 имеем

Pˆ n 1 D( ˆ n ) ,

2

откуда при выполнении условия теоремы следует (4.3).

3. Несмещённая оценка ˆ n параметра называется эффектив-

ной, если она имеет наименьшую дисперсию среди всех возможных несмещённых оценок, т. е. если её дисперсия минимальна.

4.6. Свойства выборочного среднего и выборочной дисперсии

Рассмотрим случайную величину Х, математическое ожидание и дисперсия которой равны соответственно m и D. Пусть в результате измерений получена выборка объёма п : Х = ( x1, x2 , , xn ). Выясним,

насколько верна оценка выборочная оценка xв . В соответствии с отмеченными выше свойствами выборки выборочное среднее xв будем

рассматривать как случайную величину, её значения как независимые одинаково распределённые случайные величины Хi , распределённые также, как и величина Х. Отсюда следует, что

M ( X1 ) M (X 2 )

M (X n ) M (X ) m. Тогда выборочное сред-

 

 

 

1

 

n

 

 

 

 

нее

xв

 

xi будет иметь математическое ожидание

 

 

 

 

 

n i 1

 

 

 

 

 

 

 

 

1

n

 

nm

 

 

M (xв )

M ( Xi

)

m,

(4.4)

 

 

 

 

 

 

n i 1

 

n

 

т. е. xв является несмещённой оценкой. А в соответствие с теоремой,

сформулированной выше, это есть и состоятельная оценка.

Для анализа эффективности выборочного среднего вычислим его дисперсию. Учитывая независимость величин Хi , имеем:

85

1

n

 

 

1

n

 

 

1

n

1

 

D

 

D(xв ) D

 

xi

 

 

 

D xi

 

 

 

D( Xi )

 

 

nD

 

(4.5)

 

n

2

n

2

n

2

n

n i 1

 

 

 

i 1

 

 

 

i 1

 

 

 

Отсюда видно, что дисперсия выборочного среднего xв меньше дис-

персии D случайной величины Х в n раз, где n – объём выборки. В общем случае дисперсия выборочного среднего удовлетворяет со-

отношению

 

 

 

D(x ) M[(x

m)2 ] M[(x )2

] m2

 

 

 

 

в

в

в

 

Выборочная дисперсия определяется по формуле

 

 

 

 

1

n

 

 

 

Dв

в

2

(xi xв )2

 

(4.6)

 

 

 

 

n i 1

Рассмотрим свойства оценки дисперсии, т. е. выясним, является ли Dв состоятельной, несмещённой и эффективной.

Исходя из определения (4.6) имеем:

Dв 1 n (xi2 2xi xв xв 2 ) x2 2xв2 xв2 x2 xв2 . n i 1

Применяя теорему Чебышёва к правой части этого равенства, мы видим, что первое слагаемое сходится по вероятности к М(X2), а второе слагаемое – к m2. Следовательно, выборочная дисперсия сходится по вероятности к дисперсии D случайной величины X:

lim P( Dв D ) 1, т. е Dв – состоятельная оценка случайной ве-

n

личины Х.

Покажем, что выборочная дисперсия Dв является смещённой

оценкой дисперсии D.

Действительно, исходя из формулы (4.6), преобразуем её к следующему виду:

 

 

1

n

 

1

n

Dв

 

[(xi

m) (x m)]2

(xi m)2 (xв m)2 .

 

 

 

 

n i 1

 

n i 1

Вычислим математическое ожидание этой величины

M (Dв ) 1 n M [(xi m)2 ] M[(xв m)2 ]. n i 1

Поскольку случайные величины Xi независимы, то первое слагаемое в этом выражении равно дисперсии:

1

n

 

1

 

M [(xi

m)2 ]

n D D . Второе же слагаемое, согласно фор-

 

 

n i 1

 

n

 

муле (4.5), равно D/n, (отличие его от (4.5) заключается в том, что оно вычисляется для центрированных величин, что, как мы знаем, не

86

меняет дисперсии). В результате формула матожидание дисперсии запишется в виде

M (DB ) D 1 D n 1 D. n n

Следовательно, выборочная дисперсия оказывается смещённой оценкой.

Поэтому вводится исправленная выборочная дисперсия

 

n

 

 

 

 

 

1

 

n

 

s2

 

DB

 

 

(xi xB )2 .

(4.7)

 

 

 

 

 

n 1

 

 

 

n 1 i 1

 

M (s2 )

 

n

 

 

n 1

D D.

 

n

 

 

 

 

 

1

 

n

 

Различие между исходным значением выборочной дисперсии (4.6) и исправленным (4.7) оказывается несущественным при больших значениях п.

Замечание. Для удобства «ручных» расчётов обычно вводится так называемый ложный нуль с, который выбирается в середине выборочных данных. Тогда оценка МО

̅

 

 

∑ (

)

(4.8)

 

 

в

 

 

 

 

При неизвестном среднем несмещённая оценка дисперсии равна

в

 

 

 

 

∑(

̅)

 

∑(

)

 

( ̅ )

 

 

 

 

 

 

 

 

 

 

 

в

 

 

 

 

в

При известном МО несмещённая оценка дисперсии

 

 

в

 

∑ (

̅) .

 

 

 

 

 

 

 

 

 

 

 

 

4.7. Интервальные оценки. Доверительная вероятность

Точечные оценки дают лишь качественное представление о степени близости к истинным значениям ГС. Количественное сравнение можно получить с помощью интервальных оценок. Пусть СВ имеет известный закон распределения. По выборке (x1, x2 ,..., xn ) тре-

буется получить оценку параметра и оценить границы его вероятного расположения на числовой оси.

87

Если получена точечная оценка , то эта оценка тем точней, чем меньше разность ˆ

 

ˆ

 

,

0

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Надёжность оценки может быть охарактеризована вероятно-

стью , с которой выполняется это неравенство:

 

 

 

 

 

 

 

ˆ

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

P

 

 

 

,

(4.8)

которое можно записать также в виде двустороннего неравенства

 

P 1 2 ,

1 , 2 .

 

Вероятность γ называется доверительной вероятностью, а интервал ( ˆ , ˆ ) ( 1, 2 ) доверительным интервалом. Зна-

чения 1, 2 , служащие границами доверительного интервала, явля-

ются случайными величинами и называются интервальной оценкой. Наряду с доверительной вероятностью используется её дополне-

ние до единицы, которое называется уровнем значимости

1

Уровень значимости определяет вероятность нахождения за границами доверительного интервала:

P 1 P 2 . Обычно считают, что эти вероятности равны между собой и составляют α / 2 (Рис.

4.4).

Алгоритм нахождения интервальной оценки состоит из следу-

ющих этапов:

1. Получить точечную оценку искомого параметра.

2. Задать статистику Y ( , ˆ ) , содержащую параметр и его точечную оценку, т.е. задать функцию распределения статистики Fs (x)

точно или приближённо; функция Y ( , ˆ ) непрерывна и строго монотонна.

3. Задать уровень значимости 1 .

88

4. Определить квантили y / 2 и y1 / 2 распределения статистики Y

порядков / 2

и 1 / 2 . Тогда с вероятностью γ = 1- α выполняет-

ся неравенство

ˆ

 

y / 2 Y , y1 / 2 .

 

5. Решая неравенство относительно Θ, найдём границы 1

и 2

доверительного интервала.

 

На практике для доверительной вероятности обычно используются значения γ равные 0,90; 0,95; 0,99.

4.7.1 Интервальная оценка математического ожидания нормального распределения с известной дисперсией

Определим доверительный интервал для математического ожидания нормально распределённой случайной величины Х в предполо-

жении, что её дисперсия известна, а доверительная вероятность равна 1 – α . Согласно описанному выше алгоритму, для математиче-

 

 

 

 

 

 

 

 

 

1

n

ского ожидания возьмём точечную оценку

x

xi . Выборочное

 

 

 

 

 

 

 

 

 

 

n i 1

среднее ̅ в данном случае имеет нормальное распределение

 

 

 

 

 

 

 

 

 

 

 

(

√ ).

 

 

 

 

В качестве статистики возьмём нормированное выборочное

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

среднее U

( X m) n

, имеющее нормированное нормальное рас-

 

 

 

 

 

 

 

 

пределение

(

) независимо от параметра m. Кроме того,

как

функция m непрерывна и монотонна. Следовательно,

 

P u / 2

U u1 / 2 1 ,

(4.9)

 

где u / 2

и

u1 / 2

– квантили нормального распределения (

).

Поскольку распределение симметрично, то эти квантили равны между собой. Благодаря этому соотношение (4.9) можно переписать в виде

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

P(

X m

) 2 0

 

 

 

 

.

(4.10) Последнее

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

равенство позволяет по таблицам определить аргумент

89

 

 

 

 

 

 

u

 

 

u / 2

u

 

n

, откуда находим

 

и, следовательно, довери-

 

 

 

 

 

n

 

 

 

 

 

 

 

тельный интервал X m X .

Заметим, что если попытаться увеличить доверительную вероят-

ность γ, то это приведёт к росту значений u , т. е. точность

n

оценки m будет снижаться. Чтобы сохранить точность оценки, надо увеличить объём выборки. Иными словами, чтобы гарантировать вы-

полнение неравенства

u

с заданной надёжностью, надо взять

 

 

 

 

 

 

 

 

n

 

 

 

 

 

объём выборки, равный

 

 

 

 

 

 

 

u

 

2

 

n

 

 

.

(4.11)

 

 

 

 

 

 

 

4.7.2 Доверительный интервал математического ожидания нормального распределения при неизвестной дисперсии

Рассмотрим выборку, подчинённую нормальному распределению – Xi N (m, ) , и предположим, что дисперсия D неизвестна. Тогда

для выборочного среднего имеем xв N (m, / n) . Используем вместо неизвестной D исправленную выборочную дисперсию s2,

 

1

n

 

 

 

s2

(xi x )2 , и возьмём в качестве статистики величину

 

 

n 1 i 1

 

 

 

 

 

xB m

 

 

 

 

T

n

 

 

s

 

 

 

 

 

 

 

 

Известно, что s2 имеет

- распределение, а СВ Т распределена по

закону Стьюдента

(

) с k = n – 1 степенями свободы, которое

задаётся таблицами. Распределение Стьюдента определяется одним параметром п и не зависит от m и .

Тогда для надёжности, вместо (4.10) имеем

 

 

 

 

 

 

 

 

 

 

 

 

(x

 

m) n

 

t

,

P

 

 

 

B

 

 

 

 

 

 

 

 

 

s

 

 

 

 

 

 

 

 

 

 

 

 

и, определяя по таблицам распределения Стьюдента значение tγ , находим доверительный интервал для m:

90