Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Математическая статистика и анализ данных. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

Подберем числа 1 и 2 так, чтобы:

 

2

 

 

 

1

 

 

 

 

P

n 1 s

 

 

 

 

 

,

2

2

2

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

1

 

 

 

 

P

n 1 s

 

 

 

 

 

.

2

2

 

 

2

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n 1 s2

 

 

= . По теореме Фишера слу-

Тогда P

2

 

 

1

 

2

 

 

 

 

 

 

 

 

 

чайная величина

n 1 s2

~ 2n 1 . Поэтому решением пред-

 

 

 

 

 

 

 

 

 

2

 

 

 

 

2

 

2

ставленных выше уравнений служат числа 2

=

1

 

 

2

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

и 1

=

2

1 21 2

,

задающие площади

 

1

 

и

 

 

 

 

 

1

 

 

 

 

1

 

 

 

 

2

 

 

 

2

 

 

 

 

2

 

 

2

2

 

 

 

 

 

 

1

 

 

 

 

 

 

 

 

 

 

 

 

 

1

правого «хвоста» графика плотности 2-распре-

 

2

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

деления (рис. 6.5). Итак, доверительный интервал для дисперсии в случае, когда X ~ N(m, 2), имеет следующий вид:

 

 

 

 

 

 

 

 

 

 

 

перевернем

 

 

 

 

 

 

 

 

 

 

 

 

n

1 s2

 

 

 

дробь

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

P

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

(6.8)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n 1

 

s2

 

n 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

s2

,

 

 

 

 

 

 

 

P

 

2

2

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

1

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

где 2

и 2

соответствуют

площадям

 

и

 

1

 

 

право-

2

1

2

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

2

 

го «хвоста» графика плотности 2-распределения с (n – 1) степенями свободы (см. рис. 6.5). Так как функция плотности не интегрируема в элементарных функциях, то для 2- распределения составлены таблицы.

91

Замечание.

1.Важным является тот факт, что доверительный интервал (6.8) для дисперсии не строится из позиции симме-

тричности относительно s2, ввиду чего для нахождения его границ необходимо дважды обращаться к таблице 2-рас-

пределения.

2.Для нахождения необходимого значения 2 в Excel при заданном и числе степеней свободы k необходимо в строку

формул ввести

=ХИ2.ОБР.ПХ(A; k),

где A

 

 

1

для 2, A 1

 

 

1

для 1.

2

2

2

2

 

 

 

 

 

6.4. Доверительный интервал для вероятности успеха в серии независимых испытаний

Пусть имеется серия независимых испытаний Бернулли. Тогда в силу теоремы Муавра – Лапласа число успехов k в n независимых испытаниях с вероятностью p успеха в каждом (q = 1 – p) асимптотически приближается к нормальному закону распределения при n (см. (4.4) и приложение 2), т.е. при n

 

k

 

pq

 

k

p

 

 

n

 

 

 

k N(np, nqp)

 

N p,

 

 

 

 

 

N(0, 1).

 

 

 

 

 

 

n

 

n

 

 

pq

 

 

 

 

 

 

 

 

n

Считая, что nk pˆ служит оценкой вероятности успеха p, можно построить доверительный интервал, исходя из равенства

 

 

 

4.1

 

 

 

 

 

 

 

 

 

P pˆ p pˆ P

 

 

 

 

 

 

 

 

 

 

p pˆ

 

 

 

 

 

 

 

 

.

 

 

 

 

 

 

 

 

 

 

 

 

 

pq

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

92

Зададим

 

эту вероятность P

 

p pˆ

 

 

величиной и

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

t , т.е.

по таблице Лапласа подберем такое t , что

Ф t

 

. Правая часть формулы будет равна при условии,

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

что

 

 

 

t

, откуда

t

 

pq

.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

pq

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Если подставить полученное равенство в первоначальное,

то получим

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

pq

 

 

 

 

 

 

 

pq

 

 

 

 

 

 

 

 

 

P pˆ t

 

 

p pˆ t

 

 

 

= .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

Основная проблема состоит в том, что в нахождении границ интервала используется сам неизвестный параметр p.

Заменим его оценкой pˆ nk :

 

 

 

pˆ 1 pˆ

 

 

 

 

pˆ 1 pˆ

 

 

 

 

P pˆ

t

 

p pˆ

t

 

 

,

(6.9)

n

 

n

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

где pˆ nk .

Формульные итоги раздела сведем в табл. 6.1.

(*1) В Голландии закупили партию тюльпанов в количестве 10 000 штук. После перевозки сделали выборку из 100 штук. Оказалось, что 6 из них повреждены в результате транспортировки. Закупочная цена одного тюльпана – 12 руб. Определить границы возможных убытков

снадежностью 0,95.

1)Для оценки убытков во всей партии необходимо по выборке первоначально оценить долю поврежденных тюльпанов. Построим доверительный интервал для доли поврежденных тюльпанов в результате транспортировки.

93

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Таблица 6.1

 

Формулы для составления доверительных интервалов

 

 

 

Объем

Закон

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Пара-

распредеДругие

 

 

Формула

 

 

 

 

 

 

 

выбор-

 

 

 

 

 

Таблица

метр

ки, n

ления

условия

 

 

интервала

 

 

 

 

 

 

 

 

данных

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n 30

 

 

X t sили

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

Лапласа,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Ф t

 

 

1

 

 

 

 

 

X t

 

 

 

 

 

 

2

 

2

 

 

 

извест-

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

M(X)

 

 

но

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n < 30

Нормаль-

 

 

 

 

 

 

 

 

 

 

 

 

Стьюдента,

 

 

ный

 

 

 

 

 

 

 

 

 

 

 

 

t для 1 ,

 

 

 

 

 

X t

 

s

 

 

 

 

 

 

неиз-

 

 

n

 

 

 

2

 

2

 

 

 

вестно

 

 

 

 

 

 

 

 

 

 

(n – 1) степень

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

свободы

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

2

 

 

n 1

 

2

 

Пирсона,

 

 

 

 

 

n 1 s

 

s

 

 

 

 

 

D(X)

Нормаль-

 

 

 

;

 

 

 

 

(n – 1) степень

ный

 

 

2

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

1

 

 

свободы

 

 

 

 

 

 

2

 

 

 

 

 

2

 

 

 

 

 

 

 

 

Схема

 

 

pˆ t

 

pˆ

1 pˆ

,

 

Лапласа,

 

 

 

незави-

 

 

 

 

p

n 30

симых

 

 

 

 

 

 

 

n

 

 

 

Ф t

 

 

1

 

 

 

 

 

k

 

 

 

 

 

 

 

испыта-

 

 

 

 

 

 

 

 

 

2

2

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

ний

 

 

 

pˆ

n

 

 

 

 

 

 

 

 

Примечание. Так как при n 30 графики нормального закона и Стью-

дента близки, то при решениях задач становится возможным заменять

одну таблицу другой.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

94

Имеем:

1. Так как n велико, то в силу (6.9)

n = 100,

ˆ

pˆ 1 pˆ

 

 

 

 

 

 

k

lp: p t

 

 

, где t находим по табл. Ла-

 

n

pˆ

 

0,06,

 

 

 

 

 

 

n

пласа из условия Ф t

0,475 , t = 1,96.

= 0,95.

2

 

 

 

 

 

 

 

0,06 0,94

 

 

 

2. lp: 0,06 ± 1,96 ·

 

 

 

 

, lp: 0,06 ± 0,05

 

 

 

100

 

 

 

 

 

 

 

 

 

сдоверительной вероятностью = 0,95.

2)Для оценки убытков учтем объем партии и закупочную цену тюльпана:

(0,06 ± 0,05) · 104 · 12 = 7200 ± 6000 (руб.).

Ответ: границы возможных убытков лежат в интервале (1200, 13 200) руб. с доверительной вероятностью 0,95.

Контрольные вопросы

1.Построен доверительный интервал для параметра

сдоверительной вероятностью = 0,8. Дайте этому статистическую интерпретацию.

2.Верно ли, что для построения доверительного интервала для математического ожидания нужны сведения о законе распределения данных генеральной совокупности?

3.Таблица какого(-их) закона(-ов) используется для построения доверительного интервала для математического ожидания?

4.Верно ли, что для построения доверительного интервала для дисперсии нужны сведения о законе распределения данных генеральной совокупности?

5.Таблица какого(-их) закона(-ов) используется для построения доверительного интервала для дисперсии?

6.Для каких из рассмотренных параметров доверительный интервал строится несимметричным относительно его точечной оценки?

7.Как построить доверительный интервал для СКО?

95

8.Сделаны две выборки объемов n1 = 100 и n2 = 1000 из одной однородной совокупности. Для какой выборки можно ожидать интервал шире при заданной доверительной вероятности?

9.По одной выборке построены два доверительных интервала с доверительными вероятностями 1 = 0,99 и 2 = 0,6. Какой из этих интервалов будет шире?

10.Как вариабельность данных влияет на ширину доверительного интервала?

11.Какая теорема лежит в основе вывода доверительного интервала для вероятности успеха в схеме Бернулли?

12.При каком pˆ ширина доверительного интервала для вероятности p в серии независимых испытаний будет максимальной при фиксированном объеме выборки?

13.Приведите пример из жизни, для решения которого необходимо воспользоваться доверительным интервалом для доли произошедших событий.

96

РАЗДЕЛ 7 ПРОВЕРКА ПАРАМЕТРИЧЕСКИХ ГИПОТЕЗ ДЛЯ ОДНОЙ ВЫБОРКИ

Во время экспериментирования начальная гипотеза никогда не доказывается и не устанавливается, но, возможно, не одобряется. Можно сказать, что каждый опыт существует лишь для того, чтобы дать фактам возможность проверить начальную гипотезу.

Р. Фишер, 1935 г.

1.Проверка параметрической гипотезы предполагает, что на практике известен закон распределения. В большинстве случаев он должен быть нормальным.

2.Параметрическая гипотеза для одной выборки предполагает, что есть некий эталон, с которым происходит сравнение выборочных данных. Наиболее часто проверяют гипотезы относительно математического ожидания, дисперсии и вероятности успеха в серии независимых испытаний.

3.Для проверки гипотезы помимо основной выдвигается альтернативная гипотеза, которую мы принимаем в случае, если отвергаем основную. За основную гипотезу чаще всего выбирается простая. Алгоритм проверки единый, но статистика критерия определяется начальными условиями.

4.При любом критерии проверки гипотезы возможны ошибки первого и второго рода (это связано с тем, что проверка гипотез происходит при заданном уровне значимости). Вероятности этих ошибок нужно учитывать при принятии решений и указывать в выводах.

7.1. Вводные формулы

Нам потребуются теоремы из прошлых разделов, которые напомним в начале.

97

Если X1, X2, …, Xn – выборка случайной величины X, имеющей нормальное распределение (для первых трех столбцов), k – число успехов в выборке из n независимых испытаний (для последнего столбца), то

 

 

 

 

 

 

 

 

 

 

2

 

 

 

n 30

 

 

 

 

X m

 

 

X m

 

 

 

 

 

 

 

 

~ N 0;1

 

~ t

n 1 s

2

 

k

 

 

pq

 

 

 

 

 

 

 

 

 

~ n 1

 

 

~ N p;

 

 

 

/ n

 

 

s/ n

n 1

2

 

n

 

 

 

 

 

 

 

 

 

 

 

n

7.2. Основные понятия

Предположим, на фабрике по упаковке чая нам известно, что масса пачки должна составлять 100 г (эталон). Выборка из 25 пачек показала среднюю массу 99 г. Следует ли считать, что разница в 1 г обусловлена случайностью выборки, или эта разница обусловлена нарушением, к примеру, технологического процесса? Ответ на это вопрос может дать проверка соответствующей параметрической гипотезы (при определенных допущениях).

Пусть случайная величина X имеет функцию распределения, тип которой известен, но неизвестно значение параметра (будем записывать F(x, )). Для параметра известно лишь множество его возможных значений (рис. 7.1).

Ĭ

ɦɧɨɠɟɫɬɜɨ ɤɨɬɨɪɨɦɭ ɩɪɢɧɚɞɥɟɠɢɬ 0

H : 0 Ĭ\D

D

H0: 0 D

Рис. 7.1

Определение 1. Параметрической статистической гипотезой H0 называется предположение о том, что истинное значение параметра 0 D против альтернативы H1, что 0 \D.

98

Гипотезу H0 называют основной, гипотезу H1 – альтернативной (или конкурирующей).

Определение 2. Гипотеза называется простой, если она однозначно определяет вероятност-ное распределение; в противном случае гипотеза называется сложной.

(*1) простая гипотеза: = 0; сложная гипотеза: < 0. Основная схема подготовки проверки параметрических

гипотез дана ниже.

1.Проводят n наблюдений случайной величины, получают результаты x1, x2, …, xn.

2.Выдвигаются основная гипотеза H0 и альтернативная H1.

3.Выбирается статистический критерий, рассчитывается соответствующее значение статистики по выборке и критическое значение.

4.Формируется критическая область W0, при попадании выборки в которую основная гипотеза H0 отвергается. Она бывает правосторонней, левосторонней и двусторонней

(рис. 7.2).

W0

 

W0

 

W0

W0

 

 

 

 

 

 

 

 

 

 

ɞɜɭɫɬɨɪɨɧɧɹɹ

 

ɩɪɚɜɨɫɬɨɪɨɧɧɹɹ

 

ɥɟɜɨɫɬɨɪɨɧɧɹɹ

 

 

 

Рис. 7.2. Виды критической области

При любом критерии проверки статистической гипотезы по результатам наблюдений возможны ошибки двух типов:

ошибка первого рода и ошибка второго рода (рис. 7.3).

Ошибка первого рода возникает при отклонении гипотезы H0, когда она верна.

Ошибка второго рода возникает при отклонении гипотезы H1, когда она верна.

(*2) Примером ошибки первого рода при исполнении правосудия будет осуждение невиновного, а ошибка второго рода соответствует оправданию виновного (где H0: подсудимый не виновен, H1: подсудимый виновен).

99

Гипотеза

Принимаем

 

 

H0

H1

 

 

Верна

H0

1 –

 

H1

 

1 –

 

 

 

 

 

Рис. 7.3

Вероятность ошибки первого рода принято обозначать через . Ее часто называют уровнем значимости, который назначается исследователем.

Вероятность ошибки второго рода принято обозначать через .

Для проверки гипотезы можно выбирать разные критерии. Им могут соответствовать разные вероятности и . Естественно, возникает желание выбрать такой критерий, для которого оба типа ошибок имели бы наименьшую вероятность. Но обычно уменьшение одной ошибки влечет увеличение второй. Это ясно демонстрирует иллюстрация при проверке гипотезы H0: M(X) = m0 против альтернативной H1: M(X) = m1 (рис. 7.4).

ȕĮ

í Į í ȕ

m0

m

Рис. 7.4

(*2) продолжение. «Любой скорее оправдает преступника, чем признает виновным невинного» (Аристотель). Смысл этого высказывания состоит в минимизации вероятности ошибки первого рода (тем самым растет).

100

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]