Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Теория вероятностей и математическая статистика. Учебное пособие-1

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
51
3.1.4. Распределения Пирсона, Стьюдента и Фишера
Развитие математической статистики как науки связано с деятельностью группы ученых, участвовавших в начале ХХ века в работе лондонского журнала «Биометрика». Его редактором был Карл Пирсон; свои статистические исследования здесь публиковали и английский биолог Рональд Фишер, и ирландский аналитик Уильям Госсет. Госсет работал в известной пивоваренной компании Гиннесс и по требованию компании из­за «коммерческой тайны» свои статьи печатал под псевдонимом Стьюдент (всю жизнь он учился – как «вечный» студент). В последующих подразделах будут использоваться три классических распределения, связанных с именами этих трех ученых, стоявших у истоков математической статистики. Опишем эти распределения в данном пункте.
Распределение Пирсона или χ2 распределение определяется как сумма квадратов независимых нормальных распределений. Пусть Х1, Х2,…, Хk – последовательность независимых нормально распределенных случайных величин с параметрами а=0 и σ=1. Тогда будем говорить, что случайная
величина Z, определяемая соотношением Z =𝑋
+ 𝑋
+ ⋯ +𝑋
распределение с k степенями свободы: Z ⁓χ2(k).
График плотности χ2 распределения с k степенями свободы имеет следующий вид:
, имеет χ2
В прил. В приведена таблица квантилий q=q(γ,k) для распределения χ2(k). Для квантиля q=q(γ,k) порядка γ в таблице выполнено соотношение P(Z<q)= γ, где случайная величина Z имеет распределение χ2(k).
52
Определим распределение Стьюдента. Пусть есть независимые случайные величины U и Z; случайная величина U распределена нормально с параметрами а=0 и σ=1; случайная величина Z имеет χ2 распределение с k степенями свободы. Тогда будем говорить, что случайная величина V,
определяемая соотношением 𝑉 =
степенями свободы: V⁓St(k).
График плотности распределения Стьюдента с k степенями свободы имеет следующий вид:
В прил. Г приведена таблица квантилей t=t(γ,k) для распределения Стьюдента St(k). Для квантиля t=t(γ,k) порядка γ в таблице выполнено
соотношение P(𝑉<t)= γ, где случайная величина V имеет распределение St(k).
Определим распределение Фишера. Пусть есть независимые случайные величины Х1 и Х2 распределенные по χ2 с k1 и k2 степенями свободы соответственно. Тогда будем говорить, что случайная величина U,
определяемая соотношением 𝑈 =
степенями свободы: U⁓Fi(k1, k2).
График плотности распределения Фишера с (k1, k2) степенями свободы имеет следующий вид:
имеет распределение Стьюдента с k
Х 
имеет распределение Фишера с (k1, k2)
Х

53
В прил. Д приведена таблица квантилей t=t(γ, k1, k2) порядка γ для распределения Фишера Fi(k1, k2). Для квантиля t=t(γ, k1, k2) в таблице выполнено соотношение P(U<t)= γ, где случайная величина U имеет распределение Fi(k1, k2).
3.2. Точечное оценивание характеристик генеральной совокупности
Прежде чем решать общую задачу оценки распределения генеральной совокупности на основании выборочных данных рассмотрим в этом подразделе задачу оценивания характеристик генеральной совокупности.
3.2.1. Выборочные оценки математического ожидания и дисперсии генеральной совокупности. Свойства точечных оценок
Основными характеристиками случайной величины являются математическое ожидание и дисперсия. Для оценки математического ожидания и дисперсии генеральной совокупности используем метод «подстановки»: вместо числовых характеристик генеральной совокупности будем «подставлять» числовые характеристики выборочного распределения
Х*, введенного в прошлом подразделе. Обозначим математическое ожидание
генеральной совокупности через a, а дисперсию – через σ2. Оценки будем обозначать через добавление звездочки в верхнем регистре. Получаем:
a*=MX
*
=𝑥, (σ
2
)*=DX*=DВ.
Насколько «хорошо» полученные оценки описывают поведение генеральной совокупности? Для ответа на этот вопрос введем три свойства статистических оценок: несмещенность, состоятельность и эффективность.
Оценка θ* параметра θ называется несмещенной, если ее математическое
54
ожидание равно оцениваемому параметру: Мθ*=θ. В противном случае оценка называется смещенной.
Здесь выборка понимается как многомерная случайная величина (Х1, Х2,…, Хn), при этом MXi = a, DXi = σ2.
Приведем примеры.
Пример 3.4. Выборочное среднее 𝑥 является несмещенной оценкой
математического ожидания генеральной совокупности. Действительно:
М(𝑥)=𝑀 󰇡
∑

Пример 3.5. Выборочная дисперсия DВ является смещенной оценкой дисперсии:
Смещение оценки здесь равно 󰇡−
дисперсии вводится исправленная выборочная дисперсия:
𝑠=
Оценка θ
∗
параметра θ называется состоятельной, если для любого
наперед заданного числа ε>0 вероятность 𝑃
стремится к 1. Это означает, что при достаточно больших n можно с
вероятностью, близкой к 1,т. е. почти наверное, утверждать, что оценка θ
отличается от оцениваемого параметра θ меньше чем на ε.
Проверить состоятельность оценки, используя определение, сложно. Обычно пользуются достаточными условиями состоятельности оценки. Сформулируем эти условия в виде теоремы.
Теорема 3.1 (достаточные условия состоятельности оценки). Если
∗
θ
является несмещенной оценкой θ и 𝐷θ
состоятельной.
Приведем пример.
Пример 3.6. Оценка 𝑥 является состоятельной оценкой математического
ожидания генеральной совокупности. Проверим это. Выборочное среднее
является несмещенной оценкой математического ожидания: М(𝑥)=𝑎.
Проверим второе условие теоремы: 𝐷𝜃
выборочного среднего:
𝑋
󰇢 =

∑
𝑀𝑋

М(DВ) = σ2 –
󰇢. В качестве несмещенной оценки

∑ (
𝐷в=
=
(𝑎 + ⋯ + 𝑎)=
.
𝑥− 𝑥

{
|
∗
󰇒
→
∗
󰇒
→
∙ 𝑛𝑎=𝑎.
)
.
∗
θ
− θ|<ε} при 𝑛→∞
0, то оценка 𝜃
∗
является
0. Найдем дисперсию
∗
55
50
50
50
1,19.
49501
n
D(𝑥)=𝐷 󰇡
∑
𝑋

󰇢 =
∑
𝐷𝑋

=
(𝜎+ ⋯ + 𝜎
)
=
∙ 𝑛𝜎=
Таким образом, при увеличении объема выборки n дисперсия
выборочного среднего будет стремится к нулю: D(𝑥)=
Следовательно, достаточные условия состоятельности оценки выполнены и,
значит, выборочное среднее 𝑥 является состоятельной оценкой
математического ожидания генеральной совокупности.
Еще одна характеристика статистических оценок – эффективность.
Оценка θ
∗
эффективнее оценки θ
∗
, если ее дисперсия меньше. Оценка с
минимальной дисперсией называется эффективной.
Проиллюстрируем оценивание характеристик генеральной совокупности на примере 3.2 из п. 3.1.3. Найдем методом подстановки оценку для математического ожидания числа сравнений при сортировке массива из 100 чисел:
327
*
1
=12)8+147+136+11(5
96+98+78+55
=
хМХ
Таким образом, получаем несмещенную оценку в 6,54 сравнений, что согласуется с известным результатом из теории информации:
log2100 ≈ 6,64.
Найдем методом подстановки оценку для дисперсии числа сравнений при сортировке массива из 100 чисел:
2
1
2222*
70
106929
768686468275
50
­2500
327
- 12)8+147+136+11(5
ВDDХ
 
50
=
 
1,17.1,168442,7716-3,944=
Таким образом, получаем смещенную оценку дисперсии в 1,17 сравнений. Несмещенной оценкой будет соответственно исправленная выборочная дисперсия:
n
2
s
D
В
1,1684
Заметим, что выборочное среднее лучше оценивает математическое ожидание генеральной совокупности в случае симметричного
󰇒
0.
→
.54,6
.
56
распределения данных и хуже в случае «скошенных» выборочных распределений. Приведем известный «модельный» пример. Пусть на уроке в первом классе находится 20 учеников и одна учительница. Возраст каждого ученика 7 лет, а возраст учительницы – 70 лет. Тогда средний возраст равен (20*7+70)/21 = 10 лет. Однако в классе нет ни одного человека с таким возрастом. Конечно, в этом примере можно говорить о неоднородности данных, однако такой результат возможен и при более сложных несимметричных данных. В таком случае для оценки математического ожидания лучше использовать медиану или моду.
Медианой называется такое число xm, что в выборке одинаковое количество значений меньших и больших xm. Если в выборке нечетное число
значений, то x
х
называется число, которое в выборке встречается чаще всего. В
moda
равно 𝑥
m
, а если четное – то за xm берется
󰇣
󰇤
примере с классом мода равна медиане и равна 7 лет, что совпадает с большинством элементов выборки.
3.2.2. Оценка параметров генеральной совокупности. Метод моментов
После предварительной обработки данных на основе гистограммы полигона частот распределение генеральной совокупности можно отнести к одному из семейств стандартных распределений (в подразделе 2.5 рассматривались некоторые из таких распределений: биномиальное, нормальное и др.). Тогда возникает задача оценки параметров, задающих семейство распределений, к которому было отнесено распределение генеральной совокупности. Есть разные методы получения оценок параметров: метод максимального правдоподобия, метод моментов и др. Остановимся на методе моментов.
Если распределение определяется одним параметром, то для его отыскания приравнивают математическое ожидание генеральной совокупности к математическому ожиданию выборочного распределения; если двумя – то приравнивают математическое ожидание и дисперсию генеральной совокупности к математическому ожиданию и дисперсии выборочного распределения Х*. Соответственно получаются одно или два уравнения относительно одного или двух параметров. Из этих уравнений метода моментов находятся статистические оценки для параметров распределения генеральной совокупности.
Проиллюстрируем этот метод на модификациях примеров из п. 3.1.3.

. Модой
57
Пример 3.7 (модификация примера 3.1). Пусть известно, что число переданных пакетов по каналу связи за один час имеет распределение Пуассона (см. полигон частот в п. 3.1.3). Имеется выборка из данных о почасовой передаче пакетов за 70 ч. Результаты сведены в следующем статистическом ряду:
хi 0 1 2 3 4 5 7
n
10 25 15 10 6 3 1
i
Найдем оценку параметра µ распределения Пуассона числа переданных пакетов по заданной выборке методом моментов.
Распределение Пуассона описывается с помощью одного параметра, поэтому используем одно уравнение моментов:
МХ=МХ*.
Математическое ожидание распределения Пуассона равно µ (см. п. 2.5.3.), а математическое ожидание выборочного распределения Х* –
выборочное среднее 𝑥. Получаем
*
µ
=𝑥=
Таким образом, в среднем за час передается два сообщения. С другой стороны можно говорить, что число переданных пакетов по каналу связи за один час имеет распределение Пуассона с параметром µ = 2.
Пример. 3.8 (модификация примера 3.2). Пусть известно, что количество необходимых сравнений при сортировке массива из 100 чисел имеет равномерное распределение (смотри полигон частот в пункте 3.1.3). Данные о сортировке 50 массивов имеют вид:
Найдем оценку параметров a и b равномерного распределения количества сравнений при сортировке массива из 100 чисел по заданной выборке методом моментов.
Равномерное распределение описывается с помощью двух параметров, поэтому используем два уравнения моментов:
(
0 ∙ 10 + 1 ∙ 25 + 2 ∙15 + 3 ∙ 10 + 4 ∙ 6 +5 ∙ 3 + 7 ∙ 1)=




=
≈ 2 .

хi 5 6 7 8 ni 11 13 14 12
58
МХ=МХ*,
DХ=DХ*.
Математическое ожидание равномерного распределения равно
(
)
дисперсия – и дисперсия выборочного распределения Х

(см. п. 2.5.4.); с другой стороны математическое ожидание

*
– выборочное среднее 𝑥 и

, а
выборочная дисперсия равны соответственно 6,54 и 1,1684 (см. п. 3.2.1).
Получаем следующую систему уравнений:
𝑎 + 𝑏
= 6,54 ,
2
(
𝑏 − 𝑎
12
)
=1,1684 .
Или (учитывая округления)
𝑎 + 𝑏=13,08 ,
𝑏 − 𝑎=12,97 .
Тогда получаем оценки a*= 0,055 и b*= 13,025. Таким образом, количество необходимых сравнений при сортировке массива из 100 чисел имеет равномерное распределение на отрезке (0,055; 13,025).
Пример. 3.9 (модификация примера 3.3). Пусть известно, что число ошибок при передаче 100 пакетов из нулей и единиц на сервер распределено нормально. При этом данные собраны в виде следующего интервального ряда:
[хi-х
] [0–2) [2–4) [4–6) [6–8) [8–10) [10–12) [12–14) [14–16]
i+1
ni 1 2 6 11 20 30 20 10
Найдем оценку параметров a и b нормального распределения количества ошибок при передачи пакетов информации по заданной выборке методом моментов.
Нормальное распределение описывается с помощью двух параметров, поэтому используем два уравнения моментов:
МХ=МХ*,
DХ=DХ*.
Математическое ожидание нормального распределения равно a, а дисперсия – σ2 (см. п. 2.5.5.).
С другой стороны математическое ожидание и дисперсия выборочного распределения Х
*
– выборочное среднее 𝑥 и выборочная дисперсия. Для их
59
нахождения перейдем от интервального ряда к статистическому (за варианты взяты середины соответствующих интервалов как в пункте 3.1.3)
хi 1 3 5 7 9 11 13 15 ni 1 2 6 11 20 30 20 10
Получаем
1
𝑥=
(
1 ∙ 1 + 3 ∙ 2 + 5∙ 6 + 7 ∙ 11 + 9 ∙ 20 +11 ∙ 30 + 13 ∙ 20 + 15∙ 10
100
=10,34
)
D
В
1
100
2
8,96.8,9644=10,34-
22222222
- 10)15+2013+3011+209+117+65+23+1(1
Заметим, что выборочная дисперсия DВ является смещенной оценкой дисперсии генеральной совокупности. Найдем несмещенную оценку –
исправленную дисперсию: 𝑠=
10,34 и σ
*
39,06
. Таким образом, количество ошибок при передачи

∙ 𝐷В≈ 9,06 . Тогда получаем оценки a

*
=
пакетов информации имеет нормальное распределение с параметрами 10,34 и 3.
3.3. Интервальное оценивание параметров генеральной совокупности.
3.3.1. Надежность. Доверительные интервалы
В предыдущем подразделе рассматривалась задача оценивания числовых характеристик генеральной совокупности и задача оценивания ее параметров. При этом в качестве оценки параметра (или числовой характеристики) θ выступало одно число – оценка θ*, построенная как функция от выборочных данных: θ*=f(x1,x2,…,xn). В этом подразделе в качестве оценки θ предлагается интервал, концы которого определяются
выборочными данными: 𝜃
Пусть θ оцениваемый параметр, θ* – его точечная оценка, полученная по выборке. Пусть δ>0 – некоторое число. Если выполняется неравенство
*
, т. е.
∗
=f1(x1,x2,…,x
*
, что можно записать в виде
∗
), 𝜃
=f2(x1,x2,…,xn).
n
**
,
60
то говорят, что интервал
невозможно указать оценку θ*, чтобы событие достоверным, поэтому мы будем говорить о вероятности этого события.
Число δ называют точностью оценки θ*.
Надежностью (доверительной вероятностью) оценки θ* параметра θ для заданного δ>0 называют вероятность γ того, что интервал
покроет параметр θ, т. е.
Заметим, что после того, как по данным выборки вычислена оценка θ*,
*
событие
становится или достоверным, или невозможным, т. к.
покрывает параметр θ. Однако
**,
*
было
***
PP
.
**,
интервал неизвестен. Поэтому мы называем надежностью γ уже вычисленной оценки
θ* вероятность того, что интервал произвольной выборки, покроет θ. Если мы сделаем много выборок объема
n и для каждой из них построим интервал выборок, чьи интервалы покроют θ, равна γ.
Доверительным интервалом называют найденный по данным выборки интервал
надежностью γ.
Конечно, нельзя категорически утверждать, что найденный доверительный интервал покрывает параметр θ. Но в этом можно быть уверенным на 95% при γ=0,95, на 99% при γ=0,99 и т.д. Это означает, что если сделать много выборок, для 95% из них (если, например, γ=0,95) вычисленные доверительные интервалы действительно покроют θ.
3.3.2. Доверительный интервал для математического ожидания
нормально распределенной генеральной совокупности при известном σ
или покрывает θ, или нет. Но параметр θ нам
**,
, найденный для
**,
, то доля тех
**,
, который покрывает параметр θ с заданной
**,
Пусть случайная величина Х распределена нормально с параметрами а и σ, причем σ известно. Построим доверительный интервал, покрывающий неизвестный параметр а с заданной надежностью γ. Выборочное среднее как
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]