Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
2.4. Графические представления выборки 51
Площадь гистограммы частот равна 𝑛, а гистограммы частостей равна 1. По сути гистограмма частостей является графиком эмпирической плотности распределения.
Для интервального вариационного ряда можно построить полигон, если его преобразовать в дискретный ряд. В этом случае интервалы заменяют их сере­динными значениями ˜𝑥𝑖и ставят в соответствие интервальные частоты (ча­стости). Полигон получим, соединив отрезками середины верхних оснований прямоугольников гистограммы.
Пример 2.6. По интервальному вариационному ряду примера 2.3 построим гистограмму и полигон частот (см. рис. 2.3).
0.14
0.14
0.12
0.12
0.1
0.1
0.08
0.08
0.06
0.06
0.04
0.04
Приведенная частость
0.02
0.02
0
0
206.8 210.05 213.3 216.55 219.8 223.05 226.3
Напряжение в сети
Рис. 2.3 – Гистограмма и полигон частостей из примера 2.6
Вершинами полигона являются середины верхних оснований прямоуголь­ников гистограммы.
Убедимся, что площадь гистограммы равна 1.
𝑆 = 0,6 (0,045 + 0,038 + 0,122 + 0,064 + 0,026 + 0,013) = 0,9996 ≈ 1
52 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
Контрольные вопросы
1. Что изучает математическая статистика?
2. Каковы основные задачи математической статистики?
3. Что называют генеральной совокупностью?
4. Что называют выборочной совокупностью?
5. Что означает репрезентативность выборки?
6. Какие условия должны быть выполнены для того, чтобы выборка была
репрезентативной?
7. Какие способы получения выборки вы знаете?
8. Что такое простой вариационный ряд?
9. Что такое дискретный вариационный ряд?
10. Что такое интервальный вариационный ряд?
11. Какие формулы, определяющие количество интервалов разбиения, вы
знаете?
12. Как построить эмпирическую функцию распределения вероятностей?
13. В чем суть теоремы Гливенко–Кантелли?
14. Что такое полигон частот?
15. Что такое гистограмма частот?
16. Как построить эмпирическую плотность распределения вероятностей?
Глава 3
СТАТИСТИЧЕСКИЕ
ОЦЕНКИ
3.1 Точечные оценки параметров
Как уже отмечалось, задача оценивания неизвестного параметра вероят­ностного распределения является важной задачей математической статистики. С этой проблемой сталкиваются на практике, когда априори, из общетеоре­тических или интуитивных соображений, известно, что выборка извлечена из генеральной совокупности, принадлежащей определенному параметрическому семейству распределений. При этом приходится неизвестное значение парамет­ра заменять наилучшим в том или ином смысле числовым значением. При ре­шении этой задачи, естественно, возникают вопросы:
— что значит наилучшее?
— как его найти?
Итак, начнем по порядку, задача оценивания неизвестного параметра 𝜃 ∈ Θ состоит в нахождении приближенных формул
𝜃 ≈ 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) ,
здесь 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) — функция на выборочном пространстве значений слу­чайной величины 𝑋 со значениями во множестве Θ.
Функция 𝜃*= 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) выборки (𝑥1,𝑥2, . . . ,𝑥𝑛) называется стати- стикой. Статистика — есть функция от эмпирических данных, но не как от параметра 𝜃, статистика предназначена именно для оценивания параметра, по­этому ее еще называют оценкой параметра 𝜃.
53
54 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
Определение 3.1. Статистика 𝜃*= 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) называется несмещен- ной оценкой параметра 𝜃, если для любого 𝜃 ∈ Θ справедливо
M (𝜃*) = 𝜃.
Несмещенность — это свойство оценок при фиксированном 𝑛. Оно означает, что при систематическом использовании оценки отсутствует ошибка в среднем.
Иногда, когда надо подчеркнуть, что оценка 𝜃*получена по выборке
(𝑥1,𝑥2, . . . ,𝑥𝑛) объема 𝑛 ее обозначают 𝜃
*
.
𝑛
Определение 3.2. Статистика 𝜃
*
𝑛
= 𝜃
*
(𝑥1,𝑥2, . . . ,𝑥𝑛) называется состоя-
𝑛
тельной оценкой параметра 𝜃, если для любого 𝜃 ∈ Θ 𝜃*сходится по ве- роятности к 𝜃 при неограниченном росте 𝑛, т. е.
lim
𝑛→∞
P (|𝜃*− 𝜃
*
| > 𝜀) = 0
𝑛
для любого 𝜀 > 0.
Свойство состоятельности является асимптотическим свойством и означает, что семейство оценок 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) приближается, в смысле сходимости по вероятности, к оцениваемому параметру при увеличении количества наблюде­ний.
Определение 3.3. Статистика 𝜃*= 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) называется асимпто- тически несмещенной оценкой параметра 𝜃, если для любого 𝜃 ∈ Θ
*
M (𝜃
) → 𝜃 при 𝑛 → ∞.
𝑛
Определение 3.4. Несмещенная оценка называется эффективной, если она имеет наименьшую дисперсию среди всех возможных несмещенных оценок, вы­численных по выборкам одного объема.
3.2 Выборочные числовые характеристики
Пусть дана выборка (𝑥1,𝑥2, . . . ,𝑥𝑛) из генеральной совокупности c функ­цией распределения 𝐹 (𝑥). По аналогии с теоретическими моментами, которые вычисляются по 𝐹 (𝑥), можно определить моменты по эмпирической функции распределения 𝐹*(𝑥).
3.2. Выборочные числовые характеристики 55
В математической статистике рассматриваются следующие выборочные мо­менты.
Определение 3.5. Выборочным (эмпирическим) начальным момен­том порядка 𝑘 называется числовая характеристика, определяемая формулой
⎧ ⎪
⎪
⎪
⎪
⎪
⎪
⎨
*
𝜈
=
𝑘
⎪
⎪
⎪
⎪
⎪
⎪
⎩
𝑛
1
𝑛
1
𝑛
1
𝑛
𝑖=1
𝑟
𝑖=1
𝑚
𝑖=1
𝑥
𝑥
˜𝑥
𝑘
,
𝑖
𝑘
𝑛𝑖=
𝑖
𝑘
𝑛𝑖=
𝑖
𝑟
𝑖=1
𝑚
𝑖=1
𝑥𝑖𝑝
˜𝑥𝑖𝑝
*
,
𝑖
*
.
𝑖
(3.1)
В этой формуле первая строка соответствует простому вариационному ряду, вторая — сгруппированному, третья — интервальному.
Определение 3.6. Выборочным (эмпирическим) центральным мо­ментом порядка 𝑘 называется числовая характеристика определяемая фор-
мулой
𝜇
⎧ ⎪
⎪
⎪
⎪
⎪
⎪
⎨
*
=
𝑘
⎪
⎪
⎪
⎪
⎪
⎪
⎩
1
𝑛
1
𝑛
1
𝑛
𝑛
𝑖=1
𝑟
𝑖=1
𝑚
𝑖=1
(𝑥𝑖− 𝜈
(𝑥𝑖− 𝜈
(˜𝑥𝑖− 𝜈
*
)𝑘,
1
*
)𝑘𝑛𝑖=
1
*
)𝑘𝑛𝑖=
1
𝑟
𝑖=1
𝑚
𝑖=1
(𝑥𝑖− 𝜈
(˜𝑥𝑖− 𝜈
*
)𝑘𝑝
1
*
)𝑘𝑝
1
*
,
𝑖
*
.
𝑖
(3.2)
Формулы связи между центральными и начальными выборочными момен­тами сходны с формулами для их теоретических аналогов, т. е.
𝜇
𝜇
*
2
*
4
= 𝜈
= 𝜈
*
− (𝜈
2
*
− 4𝜈
4
*
)2, 𝜇
1
*
*
𝜈
3
1
+ 6𝜈
*
3
= 𝜈
*
(𝜈
2
*
− 3𝜈
3
*
)2− 3 (𝜈
1
*
2
*
𝜈
1
*
1
+ 2 (𝜈
)4.
*
1
)3,
Отметим, что некоторые из этих эмпирических моментов носят собственные имена ввиду частых применений в статистике.
Определение 3.7. Первый начальный эмпирический момент 𝜈
*
1
= 𝑚
называется выборочным средним.
Определение 3.8. Второй центральный эмпирический момент 𝜇 зывается выборочной дисперсией, а корень квадратный из 𝐷 средним квадратическим отклонением 𝜎
*
=𝐷
𝑥
*
.
𝑥
*
= 𝐷
2
*
называется
𝑥
(3.3)
*
𝑥
*
𝑥
= ¯𝑥
на-
56 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
Найдём математическое ожидание и дисперсию оценки 𝑚
*
, с учетом того,
𝑥
что все 𝑥𝑖, 𝑖 = 1,𝑛 независимы и имеют такое же распределение, как и гене­ральная совокупность 𝑋.
т. е. 𝑚
𝑛
1
𝑖=1
M (𝑚
*
является несмещённой оценкой истинного математического ожида-
𝑥
*
) = M
𝑥
𝑛
𝑥
=
𝑖
1
𝑛
𝑛
𝑖=1
M (𝑥𝑖) =
1
𝑛𝑚𝑥= 𝑚𝑥,
𝑛
ния 𝑚𝑥.
D (𝑚
*
) = D
𝑥
1
𝑛
𝑖=1
𝑛
𝑥
=
𝑖
𝑛
𝑛
1
2
D (𝑥𝑖) =
𝑖=1
𝑛
1
2
𝑛𝜎
𝑥
2
=
2
𝜎
𝑥
.
𝑛
Из последнего равенства, в силу неравенства Чебышева, следует, что
*
| > 𝜀) = 0.
𝑥
Таким образом, 𝑚
lim
P (|𝑚𝑥− 𝑚
𝑛→∞
*
является состоятельной оценкой 𝑚𝑥.
𝑥
Аналогично, для эмпирической дисперсии можно показать, что
M (D
*
𝑥
) =
𝑛 −1
𝑛
2
𝜎
.
𝑥
Это означает, что выборочная дисперсия является смещенной оценкой дис­персии 𝜎
2
генеральной совокупности. Хотя остается асимптотически несмещен-
𝑥
ной, т. к.
lim
𝑛→∞
M (D
*
) = lim
𝑥
𝑛→∞
𝑛 −1
𝑛
2
𝜎
𝑥
= 𝜎
2
.
𝑥
Тем не менее, при малом объёме выборки смещение оказывается существен­ным. Для его устранения вводится поправочный коэффициент, при умножении
*
D
на который, получается новая оценка теоретической дисперсии, но уже без
𝑥
смещения. Эта оценка обозначается обычно через 𝑆
2
.
𝑥
Определение 3.9. Несмещенная выборочная дисперсия определяется формулой
𝑆
𝑛
1
(𝑥𝑖− 𝑚
𝑖=1
*
)2. (3.4)
𝑥
=
𝑛
𝑛 −1
𝐷
*
=
𝑥
𝑛 −1
2
𝑥
3.2. Выборочные числовые характеристики 57
Определение 3.10. Величина 𝑆𝑥=𝑆
2
называется исправленным сред-
𝑥
ним квадратическим отклонением.
Определение 3.11. Выборочным коэффициентом вариации называет- ся отношение выборочного среднего квадратического отклонения к выборочно­му среднему, выраженное в процентах:
*
𝜎
V*=
𝑥
· 100%. (3.5)
*
𝑚
𝑥
Выборочный коэффициент вариации — универсальная характеристика, ко­торая служит для сравнения вариаций различных признаков. Но этот коэф­фициент используют не только для сравнительной оценки вариации, но и как характеристику однородности совокупности. Совокупность считается однород­ной, если коэффициент вариации не превышает 33%.
Определение 3.12. Выборочным коэффициентом асимметрии назы- вается число As*, определяемое формулой:
*
𝜇
As*=
3
(𝜎𝑥)
. (3.6)
3
Выборочный коэффициент асимметрии служит для характеристики асим­метрии полигона вариационного ряда. Если полигон асимметричен, то одна из ветвей его, начиная с вершины, имеет более пологий «спуск», чем другая. Если
As*< 0, то более пологий «спуск» полигона наблюдается слева; если 𝐴𝑠*> 0 — справа. В первом случае асимметрию называют левосторонней, а во втором —
правосторонней.
Определение 3.13. Выборочным коэффициентом эксцесса называется число Ex*, определяемое формулой:
*
𝜇
(𝜎𝑥)
4
− 3. (3.7)
4
Ex*=
Выборочный коэффициент эксцесса служит для сравнения на «крутость» выборочного распределения с нормальным распределением.
Если Ex*< 0, то гистограмма выборки имеет более пологую вершину по сравнению с нормальной кривой; если Ex*> 0, то гистограмма имеет более крутой вид.
58 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
Пример 3.1. Проведено 30 серий по 24 броска игральной кости, и в каждой серии отмечалось число выпадений грани с шестью очками. Получены следую­щие результаты: 4, 2, 5, 6, 1, 4, 3, 7, 4, 4, 2, 3, 3, 5, 6, 4, 5, 3, 2, 4, 5, 1, 8, 3, 4, 4, 5, 2, 4, 6.
Найти выборочное среднее, выборочную дисперсию и среднее квадратиче­ское отклонение, коэффициент вариации, несмещенную выборочную диспер­сию, исправленное среднее квадратическое отклонение, выборочный коэффи­циент асимметрии и коэффициент эксцесса.
Запишем дискретный статистический ряд и дополним его вспомогательной таблицей
𝑥
𝑖
𝑛𝑖𝑥𝑖𝑛𝑖𝑥𝑖− 𝑚
*
(𝑥𝑖− 𝑚
𝑥
*
)2𝑛𝑖(𝑥𝑖− 𝑚
𝑥
*
)3𝑛𝑖(𝑥𝑖− 𝑚
𝑥
*
)4𝑛
𝑥
𝑖
1 2 3 4 5 6 7 1 2 2 -2,97 17,642 -52,397 155,619 2 4 4 -1,97 15,524 -30,582 60,247 3 5 5 -0,97 4,705 -4,564 4,427 4 9 9 0,03 0,008 0,000 0,000 5 5 5 1,03 5,305 5,464 5,628 6 3 3 2,03 12,363 25,097 50,947 7 1 1 3,03 9,181 27,818 84,289 8 1 1 4,03 16,241 65,451 263,768
Сумма 30 119 80,969 36,287 624,925
Среднее 3,97 2,699 1,210 20,831
С помощью сумм, записанных в предпоследней таблицы, находим выбороч­ные моменты (последняя строка):
𝑚
1. 𝑚
2. 𝜇
3. 𝜇
4. 𝜇
*
2
*
3
*
4
*
𝑥
= 𝜈
=
=
=
1
*
=
1
𝑛
𝑚
1
𝑛
1
𝑛
1
𝑛
(𝑥𝑖− 𝑚𝑥)2𝑛𝑖=
𝑖=1 𝑚
(𝑥𝑖− 𝑚𝑥)3𝑛𝑖=
𝑖=1 𝑚
(𝑥𝑖− 𝑚𝑥)4𝑛𝑖=
𝑖=1
𝑖=1
𝑥𝑖𝑛𝑖=
119
≈ 3,97, столбец 3;
30
80,969
36,287
624,925
≈ 2,699, столбец 5;
30
≈ 1.210, столбец 6;
30
≈ 20,831, столбец 7.
30
Следовательно,
— выборочное математическое ожидание равно 𝑚
— выборочная дисперсия равна 𝐷
*
𝑥
= 𝜇
*
≈ 2,699;
2
*
𝑥
= 𝜈
*
≈ 3,97;
1
3.2. Выборочные числовые характеристики 59
— вычислим среднее квадратическое отклонение 𝜎
*
=
𝑥
*
𝐷
≈√2,699 ≈
𝑥
1,643;
*
𝜎
— коэффициент вариации равен V =
— вычислим несмещенную дисперсию 𝑆
— исправленное среднее квадратическое отклонение 𝑆𝑥=𝑆
𝑥
· 100% ≈ 68%;
𝑚
𝑥
=
𝑛
𝑛−1
𝐷
2
𝑥
*
≈ 2,792;
𝑥
2
≈√2,792 ≈
𝑥
1,671;
*
— выборочный коэффициент асимметрии 𝐴𝑠*=
(𝜎
𝜇
3
3
*
)
𝑥
=
1,210
1,671
= 0,259, т. е.
3
у выборки есть небольшая правая асимметрия;
— выборочный коэффициент эксцесса
*
𝐸𝑘*=
(𝜎
𝜇
4
*
)
𝑥
− 3 =
4
20,831
1,671
− 3 = −0,328,
4
т. е. гистограмма выборки имеет более пологую вершину по сравнению с нор­мальной кривой.
Выборочной медианой называют значение Me*, которое разбивает вари- ационный ряд выборки на две равные части.
Выборочная медиана не обязательно должна совпадать с конкретным зна­чением какой-либо варианты выборки.
Если по выборке 𝑋𝑛= (𝑥1,𝑥2, . . . 𝑥𝑛) построен вариационный 𝑋
𝑥
(1),𝑥(2)
а) Me*= 𝑥
б) Me*=
, . . . 𝑥
, то выборочная медиана находится таким образом:
(𝑛)
((𝑛+1)/2)
𝑥
(𝑛/2)+𝑥(𝑛/2+1)
, если 𝑛 нечетно;
2
, если 𝑛 четно.
(𝑛)
=
Для определения медианы в дискретном ряду находят какое значение вари­анты приходится на 𝑛/2, т. е. варианты, накопленная частота которой впервые превышает 𝑛/2.
При вычислении медианы интервального статистического ряда сначала определяют медианный интервал, в пределах которого находится медиана, а затем — значение медианы по формуле:
Me*= 𝛼𝑀+ ℎ
𝑛/2 −𝜈
𝑀
𝑛
𝑀
𝑀−1
. (3.8)
где
𝛼𝑀— нижняя граница медианного интервала;
ℎ𝑀— величина медианного интервала;
60 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
𝑛𝑀— частота медианного интервала;
𝜈
— накопленная частота интервала, предшествующего медианному;
𝑀−1
Пример 3.2. Вычислить медиану выборки, представленную интервальным статистическим рядом
(𝛼
) [10; 20] (20; 30] (30; 40] (40; 50] (50; 60] Σ
𝑖−1𝛼𝑖
𝑢
𝑛
𝑖
𝑖
𝜈
𝑖
15 25 35 45 55 10 15 40 25 10 100 10 25 65 90 100
В этом примере медианный интервал это — (30; 40], так как в нем для на­копленной частоты выполнено неравенство 25 <
100
< 65. Далее, используя
2
формулу (3.8),
Me*= 𝛼𝑀+ ℎ
𝑛/2 −𝜈
𝑀
𝑛
𝑀
𝑀−1
= 30 + 10 ·
50 −25
65
= 33
11
.
13
Выборочная мода Mo*— это значение, которое наиболее часто встречается в
выборке, т. е. значение с наибольшей частотой. Если все варианты встречаются одинаково часто, то говорят, что выборка моды не имеет. Если наибольшая ча­стота соответствует двум вариантам, то выборку называют бимодальной. При вычислении моды для интервального вариационного ряда необходимо сначала определить модальный интервал (по максимальной частоте), а затем — значе­ние моды по формуле:
Mo*= 𝛼𝑀+ ℎ
𝑀
(𝑛𝑀− 𝑛
𝑛𝑀− 𝑛
𝑀−1
𝑀−1
) + (𝑛𝑀− 𝑛
𝑀+1
, (3.9)
)
где
𝛼𝑀— нижняя граница модального интервала;
ℎ𝑀— величина модального интервала;
𝑛𝑀— частота модального интервала;
𝑛
𝑛
— частота интервала, который предшествует модальному;
𝑀−1
— частота интервала, который следует за модальным.
𝑀+1
Пример 3.3. Вычислить моду выборки, представленную интервальным статистическим рядом
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]