Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Введение в теорию вероятностей и математическую статистику. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
06.09.2026
Размер:
2 Мб
Скачать
Глава 3
Введение в математическую статистику
3.1. Основные понятия
3.1.1. Рассматриваемые задачи
Как наука с оформившейся тематикой и методами исследования математическая статистика возникла только в ХХ веке. Термин «ста­тистика» происходит от латинского слова «статус» (status) – состояние. Первоначально, в XVIII веке, когда статистика начала оформляться в научную дисциплину, термин статистика связывался с системой опи­сания фактов, характеризующих состояние государства. В настоящее время статистика включает определенное содержание. Можно сказать, что статистика состоит из следующих трех разделов:
сбор статистических сведений, т. е. сведений, характеризующих
отдельные единицы каких-либо массовых совокупностей;
статистическое исследование полученных данных, заключающе-
еся в выяснении тех закономерностей, которые могут быть установле­ны на основе данных массового наблюдения;
разработка приемов статистического наблюдения и анализа ста-
тистических данных.
Последний раздел собственно и составляет содержание
тической статистики
исследования реального явления служит набор результатов наблюде­ний над ним или же результатов специально поставленных испытаний. Укажем ряд задач, решаемых в процессе такого исследования. Именно эти задачи будут рассмотрены в последующих разделах.
1. Оценка значения неизвестной вероятности случайного события.
в себя и большее и в то же время более
матема-
. Исходным материалом для статистического
71
2. Определение неизвестных параметров распределения. Часто об-
x
x
x
x
щетеоретические соображения позволяют сделать достаточно опреде­ленные заключения о типе функции распределения интересующей нас случайной величины. Так, например, теорема Ляпунова дает возмож­ность считать, что в определенных случаях функция распределения должна быть нормальной. При этом определение неизвестной функции распределения сводится к определению по результатам
наблюдений
только неизвестных значений параметров и . Общая задача ставится так: случайная величина имеет функцию распределения определен­ного вида, зависящую от k параметров, значения которых неизвестны. На основании последовательных наблюдений величины
нужно
найти их значения.
3. Определение неизвестной функции распределения. Обычно за-
дача ставится так: в результате n независимых испытаний над случай­ной величиной получены следующие ее значения:
, , ...,
xx
12
n
Требуется определить, хотя бы и приближенно, функцию распределе­ния F(x) величины .
4. Проверка статистических гипотез. Задача ставится так: известно,
что функция распределения случайной величины есть F(x); спраши­вается, совместимы ли наблюдаемые значения с гипотезой, состоящей в том, что действительно имеет распределение F(x)? В частности,
вид функции распределения не вызывает сомнений и в проверке
если нуждаются только значения некоторых параметров, характеризующих это распределение, то в задаче спрашивается: не опровергают ли ре­зультаты наблюдений ту гипотезу, что параметры распределения име­ют предположенные значения? Это задача проверки
зы.
Если гипотеза состоит в том, что параметры принимают не точно
определенные значения, а какие-то из некоторых множеств, то это
потеза сложная
.
простой гипоте-
ги-
5. Оценка зависимости. Производится последовательность наблю-
дений сразу двух случайных величин и . Результаты наблюдений даны следующими парами значений:
(, ),
y
11
(, ),
y
,( , )
y
nn
Требуется выяснить наличие функциональной или корреляционной связи между и .
Заметим, что перечисленными задачами далеко не исчерпываются основные проблемы математической статистики. Совершенно новые
.
.
72
задачи перед математической статистикой ставит промышленная и
x
научная практика. В частности, само планирование испытаний являет­ся одной из основных задач математической статистики.
3.1.2. Выборка и генеральная совокупность
Генеральная совокупность (англ. population) – совокупность всех
объектов, относительно которых предполагается делать выводы при изучении конкретной проблемы. Генеральная совокупность состоит из всех объектов, которые подлежат изучению. Состав генеральной сово­купности зависит от целей исследования. Часто она задается путем введения нескольких критериев, определяющих объект исследования. В рамках предлагаемого пособия генеральной совокупностью является случайная величина. объектом исследования для математической статистики.
Выборка, или выборочная совокупностьмножество объектов
(событий, образцов), выбранных с помощью определенной процедуры
из генеральной совокупности для участия в исследовании. В нашем случае элементы выборки – это единичные реализации случайной ве­личины. Рассмотрение проблем, связанных с получением выборки, не входит в данное пособие. Предполагается, что выборка уже имеется. При этом ее свойства позволяют дать следующее
случайной выборкой объема n (или просто выборкой), случайный
вем вектор
, , ...,
xx
12
независимых случайных величин с одинаковой функцией распреде­ления.
Важнейшей характеристикой любой выборки является
тативность
– соответствие свойств выборки свойствам генеральной совокупности в целом. Репрезентативность определяет, насколько воз­можно обобщать результаты исследования с привлечением определен­ной выборки на всю генеральную совокупность, из которой она была взята. Кроме того, репрезентативность можно определить как свойство выборочной совокупности представлять параметры генеральной сово­купности, значимые с точки зрения задач исследования. для выборок из случайной величины основным критерием репрезента­тивности является объем (т. е. количество элементов в выборке): чем больше объем выборки, тем выше ее репрезентативность.
Именно случайные величины являются исходным
определение. Назо-
, компоненты которого являются реализацией
n
репрезен-
Отметим, что
73
Выборка случайной величины, по сути, представляет собой набор
x
x
чисел, который можно описать определенным образом. Выделяют две группы характеристик выборки. Характеристики первой группы опре­деляют ее положение. К ним относятся следующие.
Выборочное среднее – одна из наиболее часто используемых оце-
нок математического ожидания распределения, основанная на выборке
n
из него:
1
x
n
. Выборочное среднеенесмещенная, сильно со-
i
1
i
стоятельная, асимптотически нормальная оценка математического ожидания. Выборочное среднее из нормальной выборки – эффективная оценка ее среднего. (Свойства точечных оценок, о которых здесь упо­минается, будут рассмотрены в разделе 3.2.)
Выборочная мода – значение, которое наибольшее количество раз
встречается в выборке. Часто моду находят по гистограмме.
Выборочная медиана
срединное значение вариационного ряда
(упорядоченной выборки) случайных величин. Она равна срединному
случайному числу нию двух последовательных срединных чисел
xx
(1)2med n
, если n нечетно, и среднему значе-
xxx
()2
med n n
/2 1 /2
если n четно. Выборочная медиана является устойчивой оценкой цен­тра распределения и часто более предпочтительна, чем среднее значе­ние выборки, особенно при вычислениях вручную. Выборочная меди­ана часто используется в процедурах сглаживания экспериментальных данных.
Выборочное среднее геометрическое. Средним геометрическим
нескольких положительных вещественных чисел называется такое число, которым можно заменить каждое из этих чисел так, чтобы их
n
произведение не изменилось:
n
Gi
. Так же, как и любое другое
x
1
i
среднее значение, среднее геометрическое лежит между минимумом и максимумом из всех чисел. Среднее геометрическое всегда меньше арифметического среднего, кроме случая, когда все взятые числа рав­ны между собой; тогда их среднее геометрическое равно их же ариф­метическому среднему.
,
74
n
x
M
x
x
Выборочное среднее гармоническое:
nx
1
1
. Неравенство
i
1
i
о средних утверждает, что среднее гармоническое чисел не превосхо­дит их среднего арифметического и среднего геометрического. В ста­тистике среднее гармоническое применяется в случае, когда наблюде­ния, для которых требуется получить среднее арифметическое, заданы обратными значениями, например, когда от измеренных частот следу­ет перейти к длинам волн.
Вторая группа
характеристик связана с разбросом выборки.
Размах выборки – разность между последним и первым членами
вариационного ряда.
Выборочное среднее абсолютное отклонение (MAD – mean
n
absolute deviation):
1
AD x m x
. Здесь
n
1
i

i
()mx
одно из сред-
них значений выборки, определенных выше; это может быть среднее арифметическое, но чаще всего в качестве среднего значения берется медиана. Выбор среднего значения
()mx
сильно влияет на среднее от-
клонение.
Выборочная дисперсия – это оценка теоретической дисперсии
распределения на основе выборки. Различают смещенную и несме­щенную (исправленную) выборочные дисперсии. Первую из них обычно называют просто выборочной дисперсией. Эти оценки даются следующими формулами.
n
1
22
Выборочная дисперсия:
 .
ni
n
i
Несмещенная (исправленная) дисперсия:
Связь между этими величинами:
x
()
1
1
22

n
n
22

n
.
n
1
n
().
i
1
1
i
x
Определение смещенных и несмещенных оценок дано в раз-
деле 3.2.2.
75
Контрольные вопросы к разделу 3.1
1. Дайте объяснение термину статистика.
Из каких разделов состоит статистика? К какому из них отно-
2.
сится математическая статистика?
Что является предметом математической статистики?
3.
Какие задачи решаются в рамках математической статистики?
4.
Что такое генеральная совокупность?
5.
Может ли случайная величина являться генеральной совокуп-
6.
ностью?
Что такое выборка?
7.
Может ли выборка совпадать с генеральной совокупностью?
8.
Что представляет собой выборка случайной величины?
9.
Является ли сама выборка случайной величины случайной ве-
10.
личиной?
Что такое центр выборки? Какими величинами он оценивается?
11.
Чем характеризуется разброс выборки?
12.
3.2. Точечные оценки
3.2.1. Статистики и оценки
В дальнейшем все подлежащие определению параметры: вероятно­сти событий; числовые характеристики и распределения случайных величин будем называть обозначать их через , а их значения, найденные по выборкам, полу­ченным в результате опытов, – случайной выборки, которая не зависит от неизвестных статистиче­ских характеристик, называется быть как скалярными, так и векторными.
Статистика S (скалярная или векторная) называется для характеристики , если знание значений любых других статистик не дает никакой дополнительной информации о сверх той, которая содержится в S. Если достаточная статистика существует, то она не может быть определена однозначно. Никакая статистика не может со­держать больше информации о , чем результаты опыта. Только доста­точная статистика и результаты опытов.
содержит такое же количество информации о , как
статистическими характеристиками и
оценками. Любая функция элементов
статистикой. Статистики могут
достаточной
76
Порядковые статистики, или вариационный ряд, – это упорядо-
x
ченная по возрастанию выборка. Перенумеруем элементы выборки таким образом, чтобы было
называется
ранга
k/n) исходной выборки.
Оценкой (точечной) статистической характеристики назы-
вается статистика, реализация которой, полученная в результате опы­тов, принимается за неизвестное истинное значение параметра .
В дальнейшем точечная оценка будет обозначаться как оценка – это функция выборки, элементы которой случайные величи­ны, она также является случайной величиной.
k-й порядковой статистикой (иногда статистикой
xx

12 n
. Случайная величина
ˆ
. Поскольку
k
3.2.2. Свойства точечных оценок
Оценка статистической характеристики называется состоятель-
, если она сходится по вероятности к при неограниченном увели-
ной
чении числа опытов n. Последовательность случайных величин называется ли при любом
оценка характеристики была состоятельной, достаточно, чтобы ее математическое ожидание стремилось к , а ее дисперсия стремилась к нулю при неограниченном увеличении числа опытов. Это можно пока­зать, используя неравенство Чебышёва (2.68).
Оценка
щенной
опытов n. В противном случае она называется
ˆ
{}M  называется
к нулю при
щенной
Одну и ту же статистическую характеристику можно оценивать разными способами, при этом будут получаться различные оценки. Качество оценки часто характеризуют математическим ожиданием квадрата модуля отклонения оценки от оцениваемой характеристики –
средним квадратом ошибки:
оценивается скалярная действительная характеристика , тогда
сходящейся по вероятности к случайной величине , ес-
P
0
имеет место
ˆ
статистической характеристики называется несме-
, если ее математическое ожидание равнопри любом числе
смещением оценки. Если смещение стремится
n 
.
, то оценка называется асимптотически несме-
  
n
ˆ
||M

0
смещенной. Разность
2
. Будем считать, что
при
n 
n
. Чтобы
77
x
x
f

() {}{} ( {})MMMMMM       

22
ˆˆˆˆ ˆˆ
2
ˆˆ ˆ ˆ
Если оценка несмещенная, то два последних члена в уравнении (3.1) равны нулю, и выражение принимает вид
Таким образом, в случае несмещенной оценки ошибки представляет собой ее дисперсию, если характеристика скалярная. Если же она векторная, то есть сумма дисперсий коорди-
нат оценки данной характеристики, при данном числе опытов n, как и всякое мно­жество неотрицательных чисел, имеет точную нижнюю грань:
inf | |M
  . Естественно стремление пользоваться такими
0
оценками, для которых средний квадрат ошибки равен зок к нему. Для нахождения таких оценок во многих случаях оказыва-
ется полезным понятие достаточной статистики (см. раздел 3.2.1).
Пусть оценка определяется следующей статистикой вектором
этой оценки в общем случае зависит от оцениваемого параметра :
Здесь ки и распределения неизвестной статистической характеристики . За-
метим, что для несмещенной оценки по определению ()m
Продифференцируем уравнение (3.3) по :
ˆ
(, )
x

2{}{} {}MMM MM     

2
ˆˆˆˆ
() {} {}MMMD  
ˆ
. Множество чисел , соответствующих всем оценкам
2
ˆ
обозначена случайная выборка. Математическое ожидание
ˆ
{} () () (, ) ()MMx xfxdxm
  
совместная функция плотности распределения выбор-

 

2
2
. (3.1)
. (3.2)
ˆ
средний квадрат
либо бли-
0
ˆ
, где
()
. (3.3)
.
(, )
fx


78

() ()
mxdx
ln ( , ) ln ( , )

  
() (, )
xfxdxM

fx fx
 
ˆ

. (3.4)
Точно так же дифференцируем формулу (, ) 1
f


ln ( , )
fx
(, )
fx


 
Из формул (3.4) и (3.5) следует выражение
 
ˆ
() ()
Напомним, что мы рассматриваем скалярные действительные ста­тистические характеристики , оценки которых являются скалярными случайными величинам. Для произвольных случайных величин и имеет место следующее свойство:
Возводя в квадрат равенство (3.6) и используя неравенство (3.7), полу­чаем
Mm
 

2
() ( )
mM M
 


dx f x dx
ln ( , )
2
ˆ
fx

ln ( , )
fx

2
  
M
 

{} {}{}MMM
  


(, )
0
. (3.5)
22
  
ln ( , )
fx





xdx

. (3.6)
. (3.7)
:
2
 
. (3.8)
Используя выражение дисперсии (2.27) и учитывая (3.5), перепи­шем (3.8) в виде
ln ( , )
  
2
 
() ( )
Для несмещенной оценки () 1m ние (3.2) из (3.9), получаем
mM D

DD


ˆ
{}

 
2
ˆ
 , и тогда, учитывая выраже-
ln ( , )
fx




79
fx



1
. (3.9)
. (3.10)
Выражение (3.10) определяет нижнюю грань (не обязательно точ-
x
M
ную) дисперсии несмещенной оценки. Никакая несмещенная оценка не может иметь меньшую дисперсию, чем правая часть выражения (3.10). Оценка, для которой в (3.10) имеет место знак равенства, называется
эффективной. Любая эффективная оценка является несмещенной.
Эффективная оценка существует тогда и только тогда, когда функция
где коэффициент пропорциональности с может зависеть от , но не от
fx fx
в правой части (3.10) называют статистической оценки при n независимых испытаниях и обозначают как
Крамера–Рао
имеет максимальную информацию Фишера среди других статистик.
ln ( , )fx
.
Поскольку элементы выборки предполагаются независимыми, то
(, ) ( , )

i
. Само же выражение (3.10) иногда называют неравенством
()
I
n
представима в виде
ln ( , )
fx


n
и
ln ( , ) ln ( , )
fx fx
i
1
. Отметим, что достаточная статистика характеристики

ˆ
() ()
ccx
  
n

1
i
информацией Фишера для данной


i
, (3.11)
. Тогда знаменатель
3.2.3. Оценка статистических характеристик методом моментов
Общим методом нахождения оценок параметров распределений является параметров из уравнений, получаемых приравниванием оценок момен­тов теоретическим значениям соответствующих начальных моментов (см. раздел 2.2.1), зависящим от неизвестных параметров. В случае скалярной наблюдаемой случайной величины r-мерный параметр обычно определяют из уравнений
метод моментов. Он основан на определении неизвестных
n
1
k
  
(, , , ) , 1,2, ,
kri
. (3.12)
12
xk r
n
i
1
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]