Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Специальные разделы высшей математики. Теория вероятностей и математическая статистика для инженера-исследователя. Учебное пособие
.pdf
2.4. Графические представления выборки 51
Площадь гистограммы частот равна 𝑛, а гистограммы частостей равна 1.
По сути гистограмма частостей является графиком эмпирической плотности
распределения.
Для интервального вариационного ряда можно построить полигон, если его
преобразовать в дискретный ряд. В этом случае интервалы заменяют их серединными значениями ˜𝑥𝑖и ставят в соответствие интервальные частоты (частости). Полигон получим, соединив отрезками середины верхних оснований
прямоугольников гистограммы.
Пример 2.6. По интервальному вариационному ряду примера 2.3 построим
гистограмму и полигон частот (см. рис. 2.3).
0.14
0.14
0.12
0.12
0.1
0.1
0.08
0.08
0.06
0.06
0.04
0.04
Приведенная частость
0.02
0.02
0
0
206.8 210.05 213.3 216.55 219.8 223.05 226.3
Напряжение в сети
Рис. 2.3 – Гистограмма и полигон частостей из примера 2.6
Вершинами полигона являются середины верхних оснований прямоугольников гистограммы.
Убедимся, что площадь гистограммы равна 1.
𝑆 = 0,6 (0,045 + 0,038 + 0,122 + 0,064 + 0,026 + 0,013) = 0,9996 ≈ 1

52 Глава 2. ОСНОВЫ ВЫБОРОЧНОГО МЕТОДА
Контрольные вопросы
1. Что изучает математическая статистика?
2. Каковы основные задачи математической статистики?
3. Что называют генеральной совокупностью?
4. Что называют выборочной совокупностью?
5. Что означает репрезентативность выборки?
6. Какие условия должны быть выполнены для того, чтобы выборка была
репрезентативной?
7. Какие способы получения выборки вы знаете?
8. Что такое простой вариационный ряд?
9. Что такое дискретный вариационный ряд?
10. Что такое интервальный вариационный ряд?
11. Какие формулы, определяющие количество интервалов разбиения, вы
знаете?
12. Как построить эмпирическую функцию распределения вероятностей?
13. В чем суть теоремы Гливенко–Кантелли?
14. Что такое полигон частот?
15. Что такое гистограмма частот?
16. Как построить эмпирическую плотность распределения вероятностей?

Глава 3
СТАТИСТИЧЕСКИЕ
ОЦЕНКИ
3.1 Точечные оценки параметров
Как уже отмечалось, задача оценивания неизвестного параметра вероятностного распределения является важной задачей математической статистики.
С этой проблемой сталкиваются на практике, когда априори, из общетеоретических или интуитивных соображений, известно, что выборка извлечена из
генеральной совокупности, принадлежащей определенному параметрическому
семейству распределений. При этом приходится неизвестное значение параметра заменять наилучшим в том или ином смысле числовым значением. При решении этой задачи, естественно, возникают вопросы:
— что значит наилучшее?
— как его найти?
Итак, начнем по порядку, задача оценивания неизвестного параметра 𝜃 ∈ Θ
состоит в нахождении приближенных формул
𝜃 ≈ 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) ,
здесь 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) — функция на выборочном пространстве значений случайной величины 𝑋 со значениями во множестве Θ.
Функция 𝜃*= 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) выборки (𝑥1,𝑥2, . . . ,𝑥𝑛) называется стати-
стикой. Статистика — есть функция от эмпирических данных, но не как от
параметра 𝜃, статистика предназначена именно для оценивания параметра, поэтому ее еще называют оценкой параметра 𝜃.
53

54 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
Определение 3.1. Статистика 𝜃*= 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) называется несмещен-
ной оценкой параметра 𝜃, если для любого 𝜃 ∈ Θ справедливо
M (𝜃*) = 𝜃.
Несмещенность — это свойство оценок при фиксированном 𝑛. Оно означает,
что при систематическом использовании оценки отсутствует ошибка в среднем.
Иногда, когда надо подчеркнуть, что оценка 𝜃*получена по выборке
(𝑥1,𝑥2, . . . ,𝑥𝑛) объема 𝑛 ее обозначают 𝜃
*
.
𝑛
Определение 3.2. Статистика 𝜃
*
𝑛
= 𝜃
*
(𝑥1,𝑥2, . . . ,𝑥𝑛) называется состоя-
𝑛
тельной оценкой параметра 𝜃, если для любого 𝜃 ∈ Θ 𝜃*сходится по ве-
роятности к 𝜃 при неограниченном росте 𝑛, т. е.
lim
𝑛→∞
P (|𝜃*− 𝜃
*
| > 𝜀) = 0
𝑛
для любого 𝜀 > 0.
Свойство состоятельности является асимптотическим свойством и означает,
что семейство оценок 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) приближается, в смысле сходимости по
вероятности, к оцениваемому параметру при увеличении количества наблюдений.
Определение 3.3. Статистика 𝜃*= 𝜃*(𝑥1,𝑥2, . . . ,𝑥𝑛) называется асимпто-
тически несмещенной оценкой параметра 𝜃, если для любого 𝜃 ∈ Θ
*
M (𝜃
) → 𝜃 при 𝑛 → ∞.
𝑛
Определение 3.4. Несмещенная оценка называется эффективной, если она
имеет наименьшую дисперсию среди всех возможных несмещенных оценок, вычисленных по выборкам одного объема.
3.2 Выборочные числовые характеристики
Пусть дана выборка (𝑥1,𝑥2, . . . ,𝑥𝑛) из генеральной совокупности c функцией распределения 𝐹 (𝑥). По аналогии с теоретическими моментами, которые
вычисляются по 𝐹 (𝑥), можно определить моменты по эмпирической функции
распределения 𝐹*(𝑥).

3.2. Выборочные числовые характеристики 55
В математической статистике рассматриваются следующие выборочные моменты.
Определение 3.5. Выборочным (эмпирическим) начальным моментом порядка 𝑘 называется числовая характеристика, определяемая формулой
⎧
⎪
⎪
⎪
⎪
⎪
⎪
⎨
*
𝜈
=
𝑘
⎪
⎪
⎪
⎪
⎪
⎪
⎩
𝑛
1
𝑛
1
𝑛
1
𝑛
𝑖=1
𝑟
𝑖=1
𝑚
𝑖=1
𝑥
𝑥
˜𝑥
𝑘
,
𝑖
𝑘
𝑛𝑖=
𝑖
𝑘
𝑛𝑖=
𝑖
𝑟
𝑖=1
𝑚
𝑖=1
𝑥𝑖𝑝
˜𝑥𝑖𝑝
*
,
𝑖
*
.
𝑖
(3.1)
В этой формуле первая строка соответствует простому вариационному ряду,
вторая — сгруппированному, третья — интервальному.
Определение 3.6. Выборочным (эмпирическим) центральным моментом порядка 𝑘 называется числовая характеристика определяемая фор-
мулой
𝜇
⎧
⎪
⎪
⎪
⎪
⎪
⎪
⎨
*
=
𝑘
⎪
⎪
⎪
⎪
⎪
⎪
⎩
1
𝑛
1
𝑛
1
𝑛
𝑛
𝑖=1
𝑟
𝑖=1
𝑚
𝑖=1
(𝑥𝑖− 𝜈
(𝑥𝑖− 𝜈
(˜𝑥𝑖− 𝜈
*
)𝑘,
1
*
)𝑘𝑛𝑖=
1
*
)𝑘𝑛𝑖=
1
𝑟
𝑖=1
𝑚
𝑖=1
(𝑥𝑖− 𝜈
(˜𝑥𝑖− 𝜈
*
)𝑘𝑝
1
*
)𝑘𝑝
1
*
,
𝑖
*
.
𝑖
(3.2)
Формулы связи между центральными и начальными выборочными моментами сходны с формулами для их теоретических аналогов, т. е.
𝜇
𝜇
*
2
*
4
= 𝜈
= 𝜈
*
− (𝜈
2
*
− 4𝜈
4
*
)2, 𝜇
1
*
*
𝜈
3
1
+ 6𝜈
*
3
= 𝜈
*
(𝜈
2
*
− 3𝜈
3
*
)2− 3 (𝜈
1
*
2
*
𝜈
1
*
1
+ 2 (𝜈
)4.
*
1
)3,
Отметим, что некоторые из этих эмпирических моментов носят собственные
имена ввиду частых применений в статистике.
Определение 3.7. Первый начальный эмпирический момент 𝜈
*
1
= 𝑚
называется выборочным средним.
Определение 3.8. Второй центральный эмпирический момент 𝜇
зывается выборочной дисперсией, а корень квадратный из 𝐷
средним квадратическим отклонением 𝜎
*
=𝐷
𝑥
*
.
𝑥
*
= 𝐷
2
*
называется
𝑥
(3.3)
*
𝑥
*
𝑥
= ¯𝑥
на-

56 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
Найдём математическое ожидание и дисперсию оценки 𝑚
*
, с учетом того,
𝑥
что все 𝑥𝑖, 𝑖 = 1,𝑛 независимы и имеют такое же распределение, как и генеральная совокупность 𝑋.
т. е. 𝑚
𝑛
1
𝑖=1
M (𝑚
*
является несмещённой оценкой истинного математического ожида-
𝑥
*
) = M
𝑥
𝑛
𝑥
=
𝑖
1
𝑛
𝑛
𝑖=1
M (𝑥𝑖) =
1
𝑛𝑚𝑥= 𝑚𝑥,
𝑛
ния 𝑚𝑥.
D (𝑚
*
) = D
𝑥
1
𝑛
𝑖=1
𝑛
𝑥
=
𝑖
𝑛
𝑛
1
2
D (𝑥𝑖) =
𝑖=1
𝑛
1
2
𝑛𝜎
𝑥
2
=
2
𝜎
𝑥
.
𝑛
Из последнего равенства, в силу неравенства Чебышева, следует, что
*
| > 𝜀) = 0.
𝑥
Таким образом, 𝑚
lim
P (|𝑚𝑥− 𝑚
𝑛→∞
*
является состоятельной оценкой 𝑚𝑥.
𝑥
Аналогично, для эмпирической дисперсии можно показать, что
M (D
*
𝑥
) =
𝑛 −1
𝑛
2
𝜎
.
𝑥
Это означает, что выборочная дисперсия является смещенной оценкой дисперсии 𝜎
2
генеральной совокупности. Хотя остается асимптотически несмещен-
𝑥
ной, т. к.
lim
𝑛→∞
M (D
*
) = lim
𝑥
𝑛→∞
𝑛 −1
𝑛
2
𝜎
𝑥
= 𝜎
2
.
𝑥
Тем не менее, при малом объёме выборки смещение оказывается существенным. Для его устранения вводится поправочный коэффициент, при умножении
*
D
на который, получается новая оценка теоретической дисперсии, но уже без
𝑥
смещения. Эта оценка обозначается обычно через 𝑆
2
.
𝑥
Определение 3.9. Несмещенная выборочная дисперсия определяется
формулой
𝑆
𝑛
1
(𝑥𝑖− 𝑚
𝑖=1
*
)2. (3.4)
𝑥
=
𝑛
𝑛 −1
𝐷
*
=
𝑥
𝑛 −1
2
𝑥

3.2. Выборочные числовые характеристики 57
Определение 3.10. Величина 𝑆𝑥=𝑆
2
называется исправленным сред-
𝑥
ним квадратическим отклонением.
Определение 3.11. Выборочным коэффициентом вариации называет-
ся отношение выборочного среднего квадратического отклонения к выборочному среднему, выраженное в процентах:
*
𝜎
V*=
𝑥
· 100%. (3.5)
*
𝑚
𝑥
Выборочный коэффициент вариации — универсальная характеристика, которая служит для сравнения вариаций различных признаков. Но этот коэффициент используют не только для сравнительной оценки вариации, но и как
характеристику однородности совокупности. Совокупность считается однородной, если коэффициент вариации не превышает 33%.
Определение 3.12. Выборочным коэффициентом асимметрии назы-
вается число As*, определяемое формулой:
*
𝜇
As*=
3
(𝜎𝑥)
. (3.6)
3
Выборочный коэффициент асимметрии служит для характеристики асимметрии полигона вариационного ряда. Если полигон асимметричен, то одна из
ветвей его, начиная с вершины, имеет более пологий «спуск», чем другая. Если
As*< 0, то более пологий «спуск» полигона наблюдается слева; если 𝐴𝑠*> 0 —
справа. В первом случае асимметрию называют левосторонней, а во втором —
правосторонней.
Определение 3.13. Выборочным коэффициентом эксцесса называется
число Ex*, определяемое формулой:
*
𝜇
(𝜎𝑥)
4
− 3. (3.7)
4
Ex*=
Выборочный коэффициент эксцесса служит для сравнения на «крутость»
выборочного распределения с нормальным распределением.
Если Ex*< 0, то гистограмма выборки имеет более пологую вершину по
сравнению с нормальной кривой; если Ex*> 0, то гистограмма имеет более
крутой вид.

58 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
Пример 3.1. Проведено 30 серий по 24 броска игральной кости, и в каждой
серии отмечалось число выпадений грани с шестью очками. Получены следующие результаты: 4, 2, 5, 6, 1, 4, 3, 7, 4, 4, 2, 3, 3, 5, 6, 4, 5, 3, 2, 4, 5, 1, 8, 3, 4, 4,
5, 2, 4, 6.
Найти выборочное среднее, выборочную дисперсию и среднее квадратическое отклонение, коэффициент вариации, несмещенную выборочную дисперсию, исправленное среднее квадратическое отклонение, выборочный коэффициент асимметрии и коэффициент эксцесса.
Запишем дискретный статистический ряд и дополним его вспомогательной
таблицей
𝑥
𝑖
𝑛𝑖𝑥𝑖𝑛𝑖𝑥𝑖− 𝑚
*
(𝑥𝑖− 𝑚
𝑥
*
)2𝑛𝑖(𝑥𝑖− 𝑚
𝑥
*
)3𝑛𝑖(𝑥𝑖− 𝑚
𝑥
*
)4𝑛
𝑥
𝑖
1 2 3 4 5 6 7
1 2 2 -2,97 17,642 -52,397 155,619
2 4 4 -1,97 15,524 -30,582 60,247
3 5 5 -0,97 4,705 -4,564 4,427
4 9 9 0,03 0,008 0,000 0,000
5 5 5 1,03 5,305 5,464 5,628
6 3 3 2,03 12,363 25,097 50,947
7 1 1 3,03 9,181 27,818 84,289
8 1 1 4,03 16,241 65,451 263,768
Сумма 30 119 80,969 36,287 624,925
Среднее 3,97 2,699 1,210 20,831
С помощью сумм, записанных в предпоследней таблицы, находим выборочные моменты (последняя строка):
𝑚
1. 𝑚
2. 𝜇
3. 𝜇
4. 𝜇
*
2
*
3
*
4
*
𝑥
= 𝜈
=
=
=
1
*
=
1
𝑛
𝑚
1
𝑛
1
𝑛
1
𝑛
(𝑥𝑖− 𝑚𝑥)2𝑛𝑖=
𝑖=1
𝑚
(𝑥𝑖− 𝑚𝑥)3𝑛𝑖=
𝑖=1
𝑚
(𝑥𝑖− 𝑚𝑥)4𝑛𝑖=
𝑖=1
𝑖=1
𝑥𝑖𝑛𝑖=
119
≈ 3,97, столбец 3;
30
80,969
36,287
624,925
≈ 2,699, столбец 5;
30
≈ 1.210, столбец 6;
30
≈ 20,831, столбец 7.
30
Следовательно,
— выборочное математическое ожидание равно 𝑚
— выборочная дисперсия равна 𝐷
*
𝑥
= 𝜇
*
≈ 2,699;
2
*
𝑥
= 𝜈
*
≈ 3,97;
1

3.2. Выборочные числовые характеристики 59
— вычислим среднее квадратическое отклонение 𝜎
*
=
𝑥
*
𝐷
≈√2,699 ≈
𝑥
1,643;
*
𝜎
— коэффициент вариации равен V =
— вычислим несмещенную дисперсию 𝑆
— исправленное среднее квадратическое отклонение 𝑆𝑥=𝑆
𝑥
· 100% ≈ 68%;
𝑚
𝑥
=
𝑛
𝑛−1
𝐷
2
𝑥
*
≈ 2,792;
𝑥
2
≈√2,792 ≈
𝑥
1,671;
*
— выборочный коэффициент асимметрии 𝐴𝑠*=
(𝜎
𝜇
3
3
*
)
𝑥
=
1,210
1,671
= 0,259, т. е.
3
у выборки есть небольшая правая асимметрия;
— выборочный коэффициент эксцесса
*
𝐸𝑘*=
(𝜎
𝜇
4
*
)
𝑥
− 3 =
4
20,831
1,671
− 3 = −0,328,
4
т. е. гистограмма выборки имеет более пологую вершину по сравнению с нормальной кривой.
Выборочной медианой называют значение Me*, которое разбивает вари-
ационный ряд выборки на две равные части.
Выборочная медиана не обязательно должна совпадать с конкретным значением какой-либо варианты выборки.
Если по выборке 𝑋𝑛= (𝑥1,𝑥2, . . . 𝑥𝑛) построен вариационный 𝑋
𝑥
(1),𝑥(2)
а) Me*= 𝑥
б) Me*=
, . . . 𝑥
, то выборочная медиана находится таким образом:
(𝑛)
((𝑛+1)/2)
𝑥
(𝑛/2)+𝑥(𝑛/2+1)
, если 𝑛 нечетно;
2
, если 𝑛 четно.
(𝑛)
=
Для определения медианы в дискретном ряду находят какое значение варианты приходится на 𝑛/2, т. е. варианты, накопленная частота которой впервые
превышает 𝑛/2.
При вычислении медианы интервального статистического ряда сначала
определяют медианный интервал, в пределах которого находится медиана, а
затем — значение медианы по формуле:
Me*= 𝛼𝑀+ ℎ
𝑛/2 −𝜈
𝑀
𝑛
𝑀
𝑀−1
. (3.8)
где
𝛼𝑀— нижняя граница медианного интервала;
ℎ𝑀— величина медианного интервала;

60 Глава 3. СТАТИСТИЧЕСКИЕ ОЦЕНКИ
𝑛𝑀— частота медианного интервала;
𝜈
— накопленная частота интервала, предшествующего медианному;
𝑀−1
Пример 3.2. Вычислить медиану выборки, представленную интервальным
статистическим рядом
(𝛼
) [10; 20] (20; 30] (30; 40] (40; 50] (50; 60] Σ
𝑖−1𝛼𝑖
𝑢
𝑛
𝑖
𝑖
𝜈
𝑖
15 25 35 45 55
10 15 40 25 10 100
10 25 65 90 100
В этом примере медианный интервал это — (30; 40], так как в нем для накопленной частоты выполнено неравенство 25 <
100
< 65. Далее, используя
2
формулу (3.8),
Me*= 𝛼𝑀+ ℎ
𝑛/2 −𝜈
𝑀
𝑛
𝑀
𝑀−1
= 30 + 10 ·
50 −25
65
= 33
11
.
13
Выборочная мода Mo*— это значение, которое наиболее часто встречается в
выборке, т. е. значение с наибольшей частотой. Если все варианты встречаются
одинаково часто, то говорят, что выборка моды не имеет. Если наибольшая частота соответствует двум вариантам, то выборку называют бимодальной. При
вычислении моды для интервального вариационного ряда необходимо сначала
определить модальный интервал (по максимальной частоте), а затем — значение моды по формуле:
Mo*= 𝛼𝑀+ ℎ
𝑀
(𝑛𝑀− 𝑛
𝑛𝑀− 𝑛
𝑀−1
𝑀−1
) + (𝑛𝑀− 𝑛
𝑀+1
, (3.9)
)
где
𝛼𝑀— нижняя граница модального интервала;
ℎ𝑀— величина модального интервала;
𝑛𝑀— частота модального интервала;
𝑛
𝑛
— частота интервала, который предшествует модальному;
𝑀−1
— частота интервала, который следует за модальным.
𝑀+1
Пример 3.3. Вычислить моду выборки, представленную интервальным
статистическим рядом
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
