Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
3.3. Методы нахождения оценок 61
(𝛼
) [10; 20] (20; 30] (30; 40] (40; 50] (50; 60] Σ
𝑖−1𝛼𝑖
𝑢
𝑛
𝑖
𝑖
15 25 35 45 55 10 15 40 25 10 100
В данном примере модальным интервалом является (30; 40], так как на этот интервал приходится наибольшая частота 40. Вычислим моду по формуле (3.9)
𝑛𝑀−𝑛
𝑀𝑜 = 𝛼𝑀+ ℎ
= 30 + 10 ·
𝑀
(𝑛𝑀−𝑛
(40−15)+(40−25)
𝑀−1
40−15
𝑀−1
)+(𝑛𝑀−𝑛
= 36,25.
𝑀+1
=
)
3.3 Методы нахождения оценок
3.3.1 Метод моментов
В математической статистике метод моментов — это один из первых общих методов нахождений оценок неизвестных параметров по результатам наблю­дений. Карл Пирсон использовал его при решении задачи аппроксимации эм­пирических распределений с помощью системы распределений Пирсона в 1894 году.
Так как в силу теоремы Гливенко эмпирическая функция распределения
𝐹*(𝑥) близка в равномерной метрике к 𝐹 (𝑥), то естественно предполагать, что выборочные моменты, вычисленные по эмпирической функции распределения, будут близки к соответствующим теоретическим.
Именно на этом и основан метод моментов. Итак, пусть (𝑥1,𝑥2, . . . ,𝑥𝑛) вы­борка объема 𝑛 из генеральной совокупности 𝑋 с функцией распределения 𝐹 (𝑥,𝜃), зависящей от неизвестного параметра 𝜃 ∈ Θ. Выберем некоторую функ- цию 𝑔 (𝑥) такую, чтобы существовал момент
M𝑔 (𝑋) = ℎ (𝜃)
и к тому же, чтобы существовала функция ℎ−1, обратная к функции ℎ (𝜃) в об­ласти Θ. В качестве оценки 𝜃*метода моментов для истинного значения неиз­вестного параметра 𝜃 возьмем решение уравнения
𝑔 (𝑋) = ℎ (𝜃*) , (3.10)
62 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
𝑛
где 𝑔 (𝑋) =
1
𝑛
𝑔 (𝑥𝑖), т. е. в качестве оценки мы выбираем такое число,
𝑖=1
чтобы теоретический момент совпадал с выборочным при данной реализации выборки.
Чаще всего в качестве функции 𝑔 (𝑥) выбирают 𝑔 (𝑥) = 𝑥𝑘, то есть началь­ные теоретические моменты приравниваются к соответствующим выборочным. Понятно, что, если параметр одномерный, то достаточно одного уравнения. Ес­ли же параметр 𝑛–мерный, то необходимо решить систему 𝑛 уравнений.
Пример 3.4. Дана выборка (𝑥1,𝑥2, . . . ,𝑥𝑛) из распределения с плотностью
𝑓 (𝑥) = 𝜃𝑒
−𝜃 𝑥
, 𝑥 > 0, 𝜃 > 0. Найти методом моментов оценку для параметра 𝜃.
Вычислим математическое ожидание
+∞
𝑀 (𝑋) = 𝜃
𝑥𝑒
−𝜃𝑥
𝑑𝑥 = 𝜃−1.
0
Оценку 𝜃*найдем как решение уравнения 𝜃−1=¯𝜉𝑛. Таким образом, оценка
−1
метода моментов в данном случае имеет вид 𝜃*=
В том случае, если корень уравнения 𝜃*= ℎ 𝜃 ∈ Θ, то оценку необходимо откорректировать. Для этого в качестве оценки метода моментов берут ближайшую к ℎ
−1
𝑔 (𝑥)точку из Θ или его замыка-
¯
−1
𝜉
.
𝑛
𝑔 (𝑥)/∈ Θ, в то время как
ния.
Оценки методом моментов определяются неоднозначно. Вообще говоря, вы­бирая различные функции 𝑔 (𝑥), получим разные оценки 𝜃*для неизвестного параметра 𝜃.
Теорема 3.1. Пусть˜𝜃 = ℎ
−1
𝑔 (𝜉)— оценка метода моментов неиз-
вестного параметра, причем функция ℎ−1(𝜃) непрерывна. Тогда 𝜃*состоя-
тельна.
Оценки, получаемые по методу моментов являются:
— состоятельными (при весьма общих предположениях);
— не всегда несмещенными;
— вообще говоря, неэффективными.
На практике оценки, получаемые по методу моментов, часто используются как первое приближение, на основе которого находятся более «хорошие» оцен­ки.
3.3. Методы нахождения оценок 63
Достоинство метода моментов заключается в том, что системы уравнений для нахождения оценок решаются довольно просто. Однако, имеет место про­извол в выборе уравнений для нахождения оценок. Кроме того метод вообще неприменим, когда моментов необходимого порядка не существует.
3.3.2 Метод максимального правдоподобия
Данный метод в частных формах использовался в XIX столетии К. Гаус­сом, хотя к его идее были близки в XVIII веке И. Ламберт и Д. Бернулли. В современном виде метод максимального правдоподобия был предложен в 1912 году Р. Фишером.
Согласно методу максимального правдоподобия в качестве оценок выби­раются те значения параметров, при которых данные результаты наблюдения «наиболее вероятны».
Итак, пусть (𝑥1,𝑥2, . . . ,𝑥𝑛) выборка из генеральной совокупности 𝑋, име­ющей функцию распределения 𝐹 (𝑥,𝜃), которая зависит от неизвестного пара­метра 𝜃 ∈ Θ.
Определение 3.14. Если закон распределения наблюдаемой случайной вели­чины 𝑋 является непрерывным, т.е. существует плотность вероятностей 𝑓 (𝑥,𝜃), то функция
𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = 𝑓 (𝑥1,𝜃) ·𝑓 (𝑥2,𝜃) ·. . . · 𝑓 (𝑥𝑛,𝜃) , (3.11)
рассматриваемая как функция параметра 𝜃, называется функцией правдо- подобия.
Если наблюдаемая случайная величина 𝑋 имеет дискретный закон рас­пределения, задаваемый вероятностями 𝑃 (𝑋 = 𝑦𝑗) = 𝑝 (𝑦𝑗,𝜃), 𝑗 = 1,2, . . ., то функция правдоподобия определяется равенством
𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = 𝑝 (𝑥1,𝜃) ·𝑝 (𝑥2,𝜃) ·. . . · 𝑝 (𝑥𝑛,𝜃) . (3.12)
Определение 3.15. Оценкой максимального правдоподобия 𝜃*неиз- вестного параметра 𝜃 называется то значение 𝜃*, при котором функция правдо­подобия достигает своего максимума, т. е. решение уравнения правдоподобия
𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃*) = max
𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) . (3.13)
𝜃∈Θ
64 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
Решая уравнение правдоподобия (3.13), необходимо отбросить все корни, которые имеют вид 𝜃*≡ 𝑐𝑜𝑛𝑠𝑡, т. е. зависят от выборки (𝑥1,𝑥2, . . . ,𝑥𝑛).
Так как положительная функция достигает своего максимума в той же точ­ке, что и ее логарифм, то на практике для анализа часто используют натураль­ный логарифм функции правдоподобия.
Определение 3.16. Случайную функцию
𝑙 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = ln 𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃)
называют логарифмической функцией правдоподобия.
Оценки максимального правдоподобия являются:
— состоятельными;
— асимтотически эффективными;
— не всегда несмещенными;
— асимптотически нормальными, т.е. при соответствующей нормировке за­кон распределения оценки максимального правдоподобия является нормаль­ным (что очень важно для нахождения вероятностей отклонения их от истин­ных значений параметров).
Однако, уравнения (системы уравнений) для нахождения оценок макси­мального правдоподобия могут решаться довольно сложно.
Пример 3.5. Дана выборка (𝑥1,𝑥2, . . . ,𝑥𝑛) из показательного распределе­ния с плотностью 𝑓 (𝑥) = 𝜃 𝑒
−𝜃 𝑥
, 𝑥 > 0, 𝜃 > 0. Найдем методом максимального
правдоподобия оценку параметра 𝜃.
Итак, функция правдоподобия в данном случае имеет вид: 𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) =
= 𝜃𝑛exp {−𝜃
𝑛
𝑥𝑖}, если все 𝑥𝑖> 0 и 𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = 0 в противном слу-
𝑖=1
чае. Соответственно, ее логарифм равен
𝑙 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = ln 𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = 𝑛 ln 𝜃 − 𝜃
Решим уравнение правдоподобия
𝜕
𝑙 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = 0,
𝜕𝜃
или, после дифференцирования,
𝑛
𝑖=1
𝑥𝑖.
3.4. Доверительные интервалы 65
𝑛
𝑛
−
𝜃
𝑥𝑖= 0.
𝑖=1
Решением последнего уравнения является:
1
𝜃*=
𝑛
Так как 𝜃*∈ Θ = {𝜃 : 𝜃 > 0} и
𝑖=1
𝑛
𝜕𝜃
−1
𝑥
𝑖
2
𝜕
𝑙 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃*) = −
2
= (𝑚
*
)−1.
𝑥
𝑛
< 0, то точка
2
(𝜃*)
𝜃*является точкой максимума функции правдоподобия и, следовательно, 𝜃*=
*
(𝑚
)−1является оценкой максимального правдоподобия.
𝑥
Определение 3.17. Дана выборка (𝑥1,𝑥2, . . . ,𝑥𝑛) из распределения Пуассона
𝑘
𝑃 {𝑋 = 𝑘} =
𝜃
𝑒−𝜃, 𝑘 = 0,1, . . . Найдем методом максимального правдоподобия
𝑘!
оценку параметра 𝜃.
В данном случае функция правдоподобия имеет вид:
𝑛 𝑖=1
𝑖=1
1
,
𝑥𝑖!
𝑥
𝑖
𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = 𝑒
−𝑛𝜃
𝜃
𝑛
логарифмируя ее, получим
𝑙 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) = ln 𝐿 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃) =
𝑛
𝑖=1
𝜕
𝑙 (𝑥1,𝑥2, . . . ,𝑥𝑛,𝜃*) = 0 является:
𝜕𝜃
𝑥𝑖= 𝑚
Решением уравнения правдоподобия
1
𝜃*=
𝑛
𝑛
𝑖=1
*
𝑥
.
𝑥𝑖ln 𝜃 −
𝑛
ln (𝑥𝑖!) −𝑛𝜃.
𝑖=1
Не трудно показать, что 𝜃*доставляет максимум функции правдоподобия.
3.4 Доверительные интервалы
3.4.1 Общие положения
Точечная оценка неизвестного параметра удобна, если вместо последнего нам необходимо использовать некоторое число, но тем не менее она ущербна
66 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
в том смысле, что мы не можем охарактеризовать степень возможной ошибки при замене истинного значения параметра оценкой. Следовательно, нам необ­ходим более тонкий аппарат, используя который мы сможем сделать вывод о вероятности нахождения неизвестного параметра в некоторой области, вернее сказать о вероятности того события, что некоторая область из Θ накроет ис­тинное значение неизвестного параметра. Для этой цели служат доверительные области или в одномерном случае доверительные интервалы. Рассмотрим более точные формулировки.
Пусть 𝑋𝑛= (𝑥1,𝑥2, . . . ,𝑥𝑛) — выборка из генеральной совокупности 𝑋 с функцией распределения 𝐹 (𝑥,𝜃), которая зависит от неизвестного параметра 𝜃, где 𝜃 ∈ Θ.
Предположим, что 𝜃1(𝑥) и 𝜃2(𝑥) две действительные функции со значени­ями в 𝑅1, не зависящие от неизвестных параметров распределения вектора 𝑋, причем 𝜃1(𝑥) < 𝜃2(𝑥), 𝑥 ∈ 𝑅𝑛.
Определение 3.18. Если
𝑃 {𝜃1(𝑋𝑛) < 𝜃 < 𝜃2(𝑋𝑛)} ≥ 𝛾, 𝜃 ∈ Θ,
то случайный интервал (𝜃1(𝑋𝑛) ; 𝜃2(𝑋𝑛)) называется 𝛾–доверительным ин- тервалом, число 𝛾 (0 < 𝛾 < 1) — доверительной вероятностью, 𝜃1(𝑋𝑛),
𝜃2(𝑋𝑛) — нижней и верхней доверительными границами.
Иногда представляют интерес верхние (нижние) доверительные интервалы, в этом случае полагается 𝜃2(𝑥) = +∞ (𝜃1(𝑥) = −∞).
Одним из способов построения доверительных интервалов является метод использования опорной случайной величины.
Пусть имеется выборка (𝑥1,𝑥2, . . . ,𝑥𝑛) из генеральной совокупности 𝑋, рас­пределение которой зависит от неизвестного параметра 𝜃 и ℎ = ℎ (𝑥1,𝑥2, . . . ,𝑥𝑛) — некоторая статистика.
Определение 3.19. Случайная величина 𝑞 (ℎ,𝜃) называется опорной слу- чайной величиной, если ее распределение не зависит от параметра 𝜃.
Если в нашем распоряжении имеется опорная абсолютно непрерывная слу­чайная величина 𝑞 (ℎ,𝜃), то можно воспользоваться следующей процедурой.
1. Для каждого 𝜃 ∈ Θ найдем такие величины˜𝜃1и˜𝜃2, чтобы было выполнено
˜
𝑃
𝜃1< 𝑞 (ℎ,𝜃) <˜𝜃
= 𝛾;
2
3.4. Доверительные интервалы 67
2. Решая неравенство˜𝜃1< 𝑞 (ℎ,𝜃) <˜𝜃 под знаком вероятности относительно
𝜃, получим 𝛾–доверительный интервал.
При заданном доверительном уровне 𝛾 процедура выбора˜𝜃1и˜𝜃2неодно­значна, обычно границы выбираются согласно одному из требований:
— симметричности, то есть˜𝜃1и˜𝜃2выбираются так, чтобы
𝑃
˜
𝜃 (𝜉) ≤˜𝜃
1
= 𝑃
˜
𝜃 (𝜉) ≥˜𝜃
1 −𝛾
=
2
;
2
—˜𝜃1и˜𝜃2выбираются так, чтобы доверительный интервал был наименьшей длины.
3.4.2 Доверительные интервалы для параметров нор-
мального закона
Доверительный интервал для математического ожидания с извест­ной дисперсией. Рассмотрим логику интервального оценивания на приме-
ре построения доверительного интервала для математического ожидания нор­мально распределенной случайной величины с известной дисперсией.
Пусть 𝑋 — нормально распределенная случайная величина с неизвестным математическим ожиданием M (𝑋) = 𝑚𝑥и известной дисперсией D (𝑋) = 𝜎 т. е. 𝑋∼𝑁(𝑚𝑥,𝜎
2
), и имеется выборка значений этой случайной величины
𝑥
2
𝑥
,
(𝑥1,𝑥2, . . . ,𝑥𝑛) объема 𝑛. Требуется найти доверительный интервал для 𝑚𝑥с доверительной вероятностью 𝛾.
Как было сказано в п. 3.2, эмпирическое среднее 𝑚
*
является несмещенной
𝑥
и состоятельной оценкой для истинного математического ожидания 𝑚𝑥гене­ральной совокупности. В силу того, что 𝑚
*
является линейной комбинацией
𝑥
нормальных случайных величин, то оно имеет нормальное распределение, кро­ме того
D (𝑚
*
) = D
𝑥
𝑛
1
𝑖=1
𝑛
𝑥
=
𝑖
𝑛
𝑛
1
2
D (𝑥𝑖) =
𝑖=1
𝑛𝜎
𝑛
2
𝑥
2
=
2
𝜎
𝑥
.
𝑛
Следовательно, центрированная и нормированная статистика
𝑍 =
𝑚𝑥− 𝑚
*
𝑥
(3.14)
𝜎𝑥/√𝑛
68 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
будет иметь нулевое математическое ожидание и единичную дисперсию, т.е. случайная величина 𝑍 имеет стандартное нормальное распределение.
Выберем 𝑍 в качестве опорной случайной величины и пусть 𝑧
(1+𝛾)/2
— кван­тиль стандартного нормального распределения уровня (1 + 𝛾) /2, тогда в силу четности плотности этого распределения, справедливо соотношение
𝑃−𝑧
1+𝛾
< 𝑍 < 𝑧
2
1+𝛾
= 𝛾 . (3.15)
2
Подставляя в (3.15) выражение для 𝑧 из (3.14), окончательно получаем
𝑃−𝑧
1+𝛾
2
𝑚𝑥− 𝑚
<
𝜎𝑥/√𝑛
*
𝑥
< 𝑧
1+𝛾
2
= 𝛾. (3.16)
Решив неравенство под знаком вероятности в (3.16) относительно 𝑚𝑥, по-
лучим 𝛾-доверительный интервал
𝑃𝑚
*
𝑥
− 𝑧
1+𝛾
2
𝜎
𝑥
√
< 𝑚𝑥< 𝑚
𝑛
*
𝑥
+ 𝑧
1+𝛾
2
𝜎
√
𝑥
= 𝛾. (3.17)
𝑛
Пример 3.6. Генеральная совокупность 𝑋 распределена нормально с дис-
персией 𝜎
2
= 0,36. Из нее извлечена следующая выборка объема 𝑛 = 36:
𝑥
4,90; 5,63; 5,04; 4,71; 4,53; 4,46; 4,59; 5,25; 5,31; 3,99; 4,57; 5,25; 5,40; 5,73; 4,71; 5,51; 5,04; 5,55; 5,84; 3,88; 6,43; 4,48; 5,99; 4,67; 5,56; 5,59; 5,25; 3,69; 5,23; 5,22; 5,16; 4,88; 5,35; 5,14; 4,35; 4,11.
Построить доверительный интервал для математического ожидания 𝑚𝑥с
доверительной вероятностью 𝛾 = 0,9 и 𝛾 = 0,95, сравнить их длины.
По формуле (3.1) вычислим эмпирическое среднее
𝑛
𝑚
*
𝑥
= 𝜈
1
*
=
1
𝑛
𝑥𝑖≈ 5,028.
𝑖=1
Для 𝛾 = 0,9 по таблице П.1 стандартного нормального распределения най-
дем квантиль 𝑧
(1+𝛾)/2
= 𝑧
(1+0,9)/2
= 𝑧
0,95
согласно (3.17), справедливо соотношение:
0,6
𝑚𝑥∈5,028 −1,645
√
36
= 1,645. Тогда с вероятностью 0,9,
0,6
; 5,028 −1,645
√
.
36
3.4. Доверительные интервалы 69
После простых арифметических вычислений окончательно получаем
0,9-доверительный интервал:
𝑚𝑥∈ (4,8635; 5,1925) .
Длина которого равна Δ1= 5,1925 −4,8635 = 0,329. Аналогично, для 𝛾 = 0,95 по таблице П.1 стандартного нормального рас-
пределения найдем квантиль 𝑧
(1+𝛾)/2
= 𝑧
(1+0,95)/2
= 𝑧
= 1,96. Тогда с веро-
0,975
ятностью 0,95, согласно (3.17), справедливо соотношение:
𝑚𝑥∈5,028 −1,96
0,6
√
; 5,028 −1,96
36
0,6
√
.
36
После простых арифметических вычислений окончательно получаем
0,95-доверительный интервал:
𝑚𝑥∈ (4,832; 5,224) .
Длина которого равна Δ2= 5,224 −4,832 = 0,392. Как видно, с ростом доверительной вероятности увеличивается и длина ин-
тервала. Поэтому при выборе 𝛾 необходим разумный компромисс.
Доверительный интервал для математического ожидания при неиз­вестной дисперсии. Постановка задачи и ход рассуждений при построении
доверительного интервала аналогичны случаю известной дисперсии, рассмот­ренному в предыдущем пункте. В качестве опорной случайной величины рас­смотрим статистику
*
𝑥
𝑛 −1
. (3.18)
𝑇 =
𝑚𝑥− 𝑚
√
𝑆
𝑥
Которая получается из (3.14) заменой неизвестного теоретического среднего квадратичного отклонения 𝜎𝑥его исправленной оценкой 𝑆𝑥при соответствую­щей нормировке. Статистика 𝑇 будет иметь распределение Стьюдента с (𝑛 −1) степенями свободы.
Таким образом, справедливо равенство
= 𝛾,
P−𝑡
1+𝛾
(𝑛 −1) <
2
*
𝑚
− 𝑚
𝑥
𝑥
𝑆𝑥/√𝑛 −1
< 𝑡
1+𝛾
2
(𝑛 −1)
70 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
здесь 𝑡
(1+𝛾)/2
(𝑛 −1) — квантиль 𝑡-распределения с 𝑛−1 степенью свободы уров-
ня (1 + 𝛾) /2. Откуда получаем 𝛾-доверительный интервал
P𝑚
𝑆
√
𝑛 −1
𝑥
1+𝛾
𝑡
(𝑛 −1) < 𝑎 < 𝑚
2
*
𝑥
*
−
𝑥
+
√
𝑛 −1
𝑆
𝑥
1+𝛾
𝑡
(𝑛 −1)= 𝛾. (3.19)
2
При больших 𝑛 (практически при 𝑛 ≥ 30) распределение Стьюдента при­ближается к стандартному нормальному распределению, поэтому в этом случае
𝑡
(1+𝛾)/2
(𝑛 −1) ≈ 𝑧
(1+𝛾)/2
.
Пример 3.7. В условии примера 3.6 дисперсия генеральной совокупности неизвестна. Построить доверительный интервал для математического ожида­ния 𝑚𝑥с доверительной вероятностью 𝛾 = 0,9.
По формуле (3.4) вычислим несмещенную дисперсию
𝑛
=
1
𝑛 −1
𝑖=1
(𝑥𝑖− 𝑚
*
)2≈ 0,378.
𝑥
𝑆
2
𝑥
Для 𝛾 = 0,9 по таблице распределения Стьюдента с 𝑛 − 1 = 36 − 1 = 35 степенями свободы найдем квантиль 𝑡
(1+𝛾)/2
(𝑛 −1) = 𝑡
(35) = 1,690. Тогда
0,95
согласно (3.20), справедливо соотношение:
= 0,9.
35
P5,03 −1,69
√
0,378
√
< 𝑎 < 5,03 + 1,69
35
√
0,378
√
Окончательно получаем 0,9-доверительный интервал
4,8548 < 𝑚𝑥< 5,2012.
Доверительный интервал для дисперсии при неизвестном математи­ческом ожидании. Для нахождения доверительного интервала для неиз-
вестной дисперсии нормально распределенной случайной величины в качестве опорной рассмотрим статистику
𝜒2=
(𝑛 −1) 𝑆
𝜎
2
𝑥
2
𝑥
,
которая имеет 𝜒2–распределение с 𝑛 −1 степенью свободы.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]