Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Математическая статистика. Ч.2. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

часть (выборка), отобранная случайно. Эту ошибку часто называют случайной ошибкой репрезентативности. Ее не следует путать с систематической ошибкой репрезентативности, появляющейся в результате нарушения принципа случайности при отборе элементов в выборку.

2.4. Доверительные интервалы для математического ожидания

Построим доверительный интервал для неизвестного математического ожидания нормально распределенной случайной величины.

 

Пусть для генеральной совокупности с неизвестным

математическим ожиданием a и дисперсией D 2

 

получена

выборка объема n .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Для построения

требуемого

 

 

доверительного

интервала

~

~

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

; требуется найти точность .

 

 

 

 

 

 

 

 

 

 

 

 

Известно, что для случайной величины , распределенной по

нормальному закону N (a, ) справедлива формула:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

P(a a ) P

a

 

2Ф

 

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Применительно

к

выборочной средней

 

 

 

хв ,

 

которая

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

распределена по нормальному

закону N a;

 

 

 

 

 

 

 

 

данная

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

формула приобретет вид:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

P xв a xв P

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

xв a

2

 

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Введем обозначение

n t , тогда

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

21

 

 

t

 

a xв

 

t

2 t .

P xв

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

n

 

Число

t

найдем из равенства

2 (t) , воспользовавшись

таблицей значений функции Лапласа. Определив t , найдем :

 

 

t

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

Таким образом,

 

 

 

 

 

 

 

 

 

 

t

 

 

t

 

I xв

 

 

 

; xв

 

 

 

(2.14)

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

n

 

доверительный интервал для оценки математического ожидания, если известна дисперсия D 2

(среднеквадратическое отклонение ) генеральной совокупности

.

Замечание Минимальный объем выборки, который обеспечит заданную

точность с надежностью , находят по формуле: n t 2 2 .

2

Если дисперсия генеральной совокупности не известна, то

можно построить случайную величину

 

 

T

xв

a

,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

s

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

где

x

в

– выборочная средняя,

s s2

– исправленное среднее

квадратическое отклонение, n – объем выборки, которая имеет распределение Стьюдента. Распределение Стьюдента определяется одним параметром n – объемом выборки и не зависит от неизвестных параметров a и ; эта особенность является его большим достоинством. Для данного распределения справедлива формула:

22

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

xв a

 

 

 

t

P

 

 

t

 

2 S (t; n)dt ,

 

 

s

 

 

 

 

 

 

0

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

где S(t;n) – плотность распределения Стьюдента. Число t

можно

найти

по

таблице

t t( ; n)

по заданным значениям

объема выборки n и надежности .

 

Таким образом,

 

 

 

 

 

 

 

 

 

 

 

t s

 

 

 

t s

 

I

xв

 

 

 

 

 

; xв

 

 

 

 

(2.15)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

n

 

доверительный интервал для оценки математического

ожидания, если не известна дисперсия D 2

(среднеквадратическое отклонение ) генеральной совокупностии объем выборки n 30.

Замечание

При n 30 можно вместо распределения Стьюдента пользоваться нормальным распределением. Однако следует помнить, что при малых n такая замена приводит к грубым ошибкам, а именно к неоправданному сужению доверительного интервала, т.е. к повышению точности оценки.

23

Пример 2.3

 

 

 

 

 

 

 

 

 

 

Из генеральной

совокупности

извлечена

выборка

объема

n 10:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Варианта

xi

 

-2

1

 

2

3

 

4

5

Частота

ni

 

2

1

 

2

2

 

2

1

Оценить с надежностью 0,95 математическое ожидание a нормально распределенного признака генеральной совокупности по выборочной средней при помощи доверительного интервала.

Решение

Выборочную среднюю и исправленное среднее квадратическое отклонение найдем соответственно по формулам:

xв ni xi 2 n

s

ni (xi xв )2

 

 

2,4

 

n 1

Границы доверительного интервала найдем по формуле:

xв

t s

 

a xв

t s

 

 

 

 

 

 

 

.

(2.16)

 

 

 

 

 

 

 

n

 

 

 

 

 

 

n

 

Значение t 2,26 найдено по таблице 4 Приложения, по

0,95 и n 10 .

Подставив полученные значения в (2.16) получим искомый доверительный интервал

0,3 a 3,7 ,

покрывающий неизвестное математическое ожидание a с надежностью 0,95

24

2.5. Доверительные интервалы для среднего квадратического отклонения

Пусть генеральная совокупность распределена по нормальному закону. Требуется оценить неизвестное генеральное среднее квадратическое отклонение по исправленному выборочному среднему квадратическому отклонению s .

Доверительный интервал, покрывающий параметр с заданной надежностью (интервальная оценка) имеет вид:

при q 1

s 1 q s 1 q и

(2.17)

при q 1

 

0 s 1 q ,

(2.18)

где q находят по таблице 5 Приложения по заданным n и .

Пример 2.4

 

По данным выборки объема

n 16 из генеральной

совокупности найдено исправленное среднеквадратическое отклонение s 1 нормально распределенного количественного признака. Найти доверительный интервал, покрывающий генеральное среднее квадратическое отклонение с надежностью 0,95.

Решение

По данным 0,95 и n 16 по таблице 5 Приложения найдем q 0,44. Так как q 1, то доверительный интервал

найдем по формуле (2.17):

s 1 q s 1 q .

После подстановки

1 1 0,44 1 1 0,44

получим искомую интервальную оценку генерального среднеквадратического отклонения:

0,56 1,44.

25

3. СТАТИСТИЧЕСКАЯ ПРОВЕРКА СТАТИСТИЧЕСКИХ ГИПОТЕЗ

Прежде, чем перейти к рассмотрению понятия статистической гипотезы, сформулируем принцип практической уверенности,

лежащий в основе применения выводов и рекомендаций с помощью теории вероятностей и математической статистики:

Если вероятность события А в данном испытании очень мала, то при однократном выполнении испытания можно быть уверенным в том, что событие А не произойдет, и в практической деятельности вести себя так, как будто событие А вообще невозможно.

Этот принцип не может быть доказан математически, но он подтверждается всем практическим опытом человеческой деятельности, и мы постоянно им руководствуемся. Например, отправляясь самолетом в другой город, мы не рассчитываем на возможность погибнуть в авиационной катастрофе, хотя некоторая (весьма малая) вероятность такого события все же имеется.

Обратим внимание на то, что принцип практической уверенности о невозможности маловероятных событий сформулирован «при однократном выполнении испытания». Если же произведено много испытаний, в каждом из которых вероятность события А даже очень мала, то существенно повышается вероятность того, что событие А произойдет хотя бы один раз в массе испытаний.

Если вероятность события A равна 1, то вероятность

события B , состоящего в том, что событие A произойдет хотя бы один раз в n независимых испытаниях, равна

P B 1 1 n 1 1 n n,

т.е. вероятность P B увеличилась по сравнению с P A в n раз.

Таким образом, при многократном повторении испытаний мы уже не можем считать маловероятное событие А практически невозможным.

26

3.1. Статистическая гипотеза. Статистический критерий

Одна из часто встречающихся на практике задач, связанных с применением статистических методов, состоит в решении вопроса о том, должно ли на основании данной выборки быть принято или, напротив, отвергнуто некоторое предположение (гипотеза) относительно генеральной совокупности (случайной величины).

Например, новое лекарство испытано на определенном числе людей. Можно ли сделать по данным результатам лечения обоснованный вывод о том, что новое лекарство более эффективно, чем применявшиеся ранее методы лечения? Аналогичный вопрос логично задать, говоря о новом правиле поступления в вуз, о новом методе обучения, о пользе быстрой ходьбы, о преимуществах новой модели автомобиля или технологического процесса и т.д.

Процедура сопоставления высказанного предположения (гипотезы) с выборочными данными называется проверкой гипотез.

Выдвинутая гипотеза может быть правильной или не правильной, поэтому возникает необходимость ее проверки. Поскольку проверку производят статистическими методами, то ее называют статистической проверкой гипотезы.

Задачи статистической проверки гипотез ставятся в следующем виде: относительно некоторой генеральной совокупности

высказывается та или иная гипотеза H . Из этой генеральной совокупности извлекается выборка. Требуется указать правило, при помощи которого можно было бы по выборке решить вопрос о том,

следует ли отклонить гипотезу H или принять ее.

Следует отметить, что статистическими методами гипотезу можно только опровергнуть или не опровергнуть, но не доказать.

Например: для проверки утверждения (гипотеза H ) автора, что «в рукописи нет ошибок», рецензент прочел (изучил) несколько страниц рукописи.

Если он обнаружил хотя бы одну ошибку, то гипотеза H отвергается, в противном случае – не отвергается, говорят, что «результат проверки с гипотезой согласуется».

27

Определение. Статистической гипотезой (или просто

гипотезой) называется всякое предположение о генеральной совокупности, проверяемое по выборке.

Статистические гипотезы делятся на гипотезы о параметрах распределения известного вида (это так называемые параметрические гипотезы) и гипотезы о виде неизвестного распределения (непараметрические гипотезы).

Например, статистическими гипотезами являются: генеральная совокупность распределена по закону Пуассона; дисперсии двух нормальных совокупностей равны между собой.

Гипотеза «Существуют инопланетные формы жизни» не является статистической, поскольку в ней не идет речь ни о виде, ни о параметрах распределения.

Выдвинутую гипотезу называют основной или нулевой и обозначают H0 . Гипотезу, противоречащую гипотезе H0

называют конкурирующей или альтернативной гипотезой и обозначают H1 .

Определение. Простой называется гипотеза, содержащая только одно предположение. Сложной называется гипотеза, которая состоит из конечного или бесконечного числа простых гипотез.

Например, гипотеза H0 , состоящая в том, что математическое ожидание случайной величины равно a0 , т.е. M a0 , является простой. В качестве альтернативной гипотезы можно рассматривать одну из следующих гипотез: H1 : M a0 (сложная гипотеза), H1

: M a0 (сложная), H1 : M a0 (сложная) или H1 : M a1 (простая гипотеза).

Для проверки нулевой гипотезы используют специально подобранную случайную величину, точное или приближенное распределение которой известно.

Определение. Статистическим критерием или просто

критерием называется случайная величина K , которая служит для проверки нулевой гипотезы H0 .

28

Определение. Наблюдаемым значением Kнабл называется значение критерия, вычисленное по выборке.

При проверке гипотезы может быть принято неправильное решение, т.е. могут быть допущены ошибки двух родов.

Ошибка первого рода состоит в том, что отвергается правильная гипотеза.

Ошибка второго рода состоит в том, что принимается неправильная гипотеза.

Последствия ошибок первого и второго рода могут быть различными. Например, если отвергнуть правильное решение «продолжать строительство жилого дома», то эта ошибка первого рода повлечет материальный ущерб; если же принять неправильное решение «продолжать строительство», несмотря на опасность обвала стройки, то эта ошибка второго рода может повлечь гибель людей. Можно привести примеры, когда ошибка первого рода влечет более тяжелые последствия, чем ошибка первого рода.

Определение. Вероятность ошибки 1-го рода называется уровнем значимости критерия и обозначается .

Очевидно, P H1 H0 . Чем меньше , тем меньше

вероятность отклонить верную гипотезу. Допустимую ошибку 1-го рода обычно задают заранее.

В одних случаях считается возможным пренебречь событиями, вероятность которых меньше 0,05 ( 0,05 означает, что в

среднем в 5 случаях из 100 испытаний верная гипотеза будет отвергнута), в других случаях, когда речь идет, например, о разрушении сооружений, гибели судна и т.п., нельзя пренебречь обстоятельствами, которые могут появиться с вероятностью, равной

0,001.

Обычно

для

используются

стандартные

значения:

0,05; 0,01; 0,005; 0,001.

 

 

Вероятность

ошибки 2-го рода

обозначается

, т.е.

P H0

 

H1 .

 

 

 

 

 

 

 

29

Определение. Величина 1 , т.е. вероятность недопущения ошибки 2-го рода (отвергнуть неверную гипотезу H0 , принять

верную H1 ), называется мощностью критерия.

Очевидно, 1 P H1 H1

Чем больше мощность критерия, тем вероятность ошибки 2-го рода меньше, что, конечно, желательно (как и уменьшение ).

Рассматриваемые случаи иллюстрирует следующая таблица.

Гипотеза H0

Отвергается

Принимается

 

ошибка 1-го рода

правильное решение

верна

P H1

 

H0

P H0

 

H0 1

 

 

 

 

 

 

 

 

 

правильное решение

ошибка 2-го рода

неверна

P H1

 

H1 1

P H0

 

H1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Поскольку последствия ошибок 1-го, 2-го рода могут быть совершенно различными, то в одних случаях надо минимизировать

, в другом – . Так, применительно к радиолокации говорят, что

– вероятность пропуска сигнала, – вероятность ложной

тревоги; применительно к производству, к торговле можно сказать, что – риск поставщика (т.е. забраковка по выборке всей партии изделий, удовлетворяющих стандарту), – риск потребителя (т.е.

прием по выборке всей партии изделий, не удовлетворяющей стандарту); применительно к судебной системе, ошибка 1-го рода приводит к оправданию виновного, ошибка 2-го рода – осуждению невиновного.

Отметим, что одновременное уменьшение ошибок 1-го и 2-го рода возможно лишь при увеличении объема выборок. Поэтому обычно при заданном уровне значимости отыскивается критерий с наибольшей мощностью.

3.2. Критическая область

После выбора определенного критерия множество всех его возможных значений разбивают на два непересекающихся

30

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]