Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Введение в теорию вероятностей и математическую статистику. Учебное пособие
.pdf
Глава 3
Введение в математическую статистику
3.1. Основные понятия
3.1.1. Рассматриваемые задачи
Как наука с оформившейся тематикой и методами исследования
математическая статистика возникла только в ХХ веке. Термин «статистика» происходит от латинского слова «статус» (status) – состояние.
Первоначально, в XVIII веке, когда статистика начала оформляться в
научную дисциплину, термин статистика связывался с системой описания фактов, характеризующих состояние государства. В настоящее
время статистика включает
определенное содержание. Можно сказать, что статистика состоит из
следующих трех разделов:
сбор статистических сведений, т. е. сведений, характеризующих
отдельные единицы каких-либо массовых совокупностей;
статистическое исследование полученных данных, заключающе-
еся в выяснении тех закономерностей, которые могут быть установлены на основе данных массового наблюдения;
разработка приемов статистического наблюдения и анализа ста-
тистических данных.
Последний раздел собственно и составляет содержание
тической статистики
исследования реального явления служит набор результатов наблюдений над ним или же результатов специально поставленных испытаний.
Укажем ряд задач, решаемых в процессе такого исследования. Именно
эти задачи будут рассмотрены в последующих разделах.
1. Оценка значения неизвестной вероятности случайного события.
в себя и большее и в то же время более
матема-
. Исходным материалом для статистического
71

2. Определение неизвестных параметров распределения. Часто об-
x
x
x
x
щетеоретические соображения позволяют сделать достаточно определенные заключения о типе функции распределения интересующей нас
случайной величины. Так, например, теорема Ляпунова дает возможность считать, что в определенных случаях функция распределения
должна быть нормальной. При этом определение неизвестной функции
распределения сводится к определению по результатам
наблюдений
только неизвестных значений параметров и . Общая задача ставится
так: случайная величина имеет функцию распределения определенного вида, зависящую от k параметров, значения которых неизвестны.
На основании последовательных наблюдений величины
нужно
найти их значения.
3. Определение неизвестной функции распределения. Обычно за-
дача ставится так: в результате n независимых испытаний над случайной величиной получены следующие ее значения:
, , ...,
xx
12
n
Требуется определить, хотя бы и приближенно, функцию распределения F(x) величины .
4. Проверка статистических гипотез. Задача ставится так: известно,
что функция распределения случайной величины есть F(x); спрашивается, совместимы ли наблюдаемые значения с гипотезой, состоящей
в том, что действительно имеет распределение F(x)? В частности,
вид функции распределения не вызывает сомнений и в проверке
если
нуждаются только значения некоторых параметров, характеризующих
это распределение, то в задаче спрашивается: не опровергают ли результаты наблюдений ту гипотезу, что параметры распределения имеют предположенные значения? Это задача проверки
зы.
Если гипотеза состоит в том, что параметры принимают не точно
определенные значения, а какие-то из некоторых множеств, то это
потеза сложная
.
простой гипоте-
ги-
5. Оценка зависимости. Производится последовательность наблю-
дений сразу двух случайных величин и . Результаты наблюдений
даны следующими парами значений:
(, ),
y
11
(, ),
y
,( , )
y
nn
Требуется выяснить наличие функциональной или корреляционной
связи между и .
Заметим, что перечисленными задачами далеко не исчерпываются
основные проблемы математической статистики. Совершенно новые
.
.
72

задачи перед математической статистикой ставит промышленная и
x
научная практика. В частности, само планирование испытаний является одной из основных задач математической статистики.
3.1.2. Выборка и генеральная совокупность
Генеральная совокупность (англ. population) – совокупность всех
объектов, относительно которых предполагается делать выводы при
изучении конкретной проблемы. Генеральная совокупность состоит из
всех объектов, которые подлежат изучению. Состав генеральной совокупности зависит от целей исследования. Часто она задается путем
введения нескольких критериев, определяющих объект исследования.
В рамках предлагаемого пособия генеральной совокупностью является
случайная величина.
объектом исследования для математической статистики.
Выборка, или выборочная совокупность – множество объектов
(событий, образцов), выбранных с помощью определенной процедуры
из генеральной совокупности для участия в исследовании. В нашем
случае элементы выборки – это единичные реализации случайной величины. Рассмотрение проблем, связанных с получением выборки, не
входит в данное пособие. Предполагается, что выборка уже имеется.
При этом ее свойства позволяют дать следующее
случайной выборкой объема n (или просто выборкой), случайный
вем
вектор
, , ...,
xx
12
независимых случайных величин с одинаковой функцией распределения.
Важнейшей характеристикой любой выборки является
тативность
– соответствие свойств выборки свойствам генеральной
совокупности в целом. Репрезентативность определяет, насколько возможно обобщать результаты исследования с привлечением определенной выборки на всю генеральную совокупность, из которой она была
взята. Кроме того, репрезентативность можно определить как свойство
выборочной совокупности представлять параметры генеральной совокупности, значимые с точки зрения задач исследования.
для выборок из случайной величины основным критерием репрезентативности является объем (т. е. количество элементов в выборке): чем
больше объем выборки, тем выше ее репрезентативность.
Именно случайные величины являются исходным
определение. Назо-
, компоненты которого являются реализацией
n
репрезен-
Отметим, что
73

Выборка случайной величины, по сути, представляет собой набор
x
x
чисел, который можно описать определенным образом. Выделяют две
группы характеристик выборки. Характеристики первой группы определяют ее положение. К ним относятся следующие.
Выборочное среднее – одна из наиболее часто используемых оце-
нок математического ожидания распределения, основанная на выборке
n
из него:
1
x
n
. Выборочное среднее – несмещенная, сильно со-
i
1
i
стоятельная, асимптотически нормальная оценка математического
ожидания. Выборочное среднее из нормальной выборки – эффективная
оценка ее среднего. (Свойства точечных оценок, о которых здесь упоминается, будут рассмотрены в разделе 3.2.)
Выборочная мода – значение, которое наибольшее количество раз
встречается в выборке. Часто моду находят по гистограмме.
Выборочная медиана
– срединное значение вариационного ряда
(упорядоченной выборки) случайных величин. Она равна срединному
случайному числу
нию двух последовательных срединных чисел
xx
(1)2med n
, если n нечетно, и среднему значе-
xxx
()2
med n n
/2 1 /2
если n четно. Выборочная медиана является устойчивой оценкой центра распределения и часто более предпочтительна, чем среднее значение выборки, особенно при вычислениях вручную. Выборочная медиана часто используется в процедурах сглаживания экспериментальных
данных.
Выборочное среднее геометрическое. Средним геометрическим
нескольких положительных вещественных чисел называется такое
число, которым можно заменить каждое из этих чисел так, чтобы их
n
произведение не изменилось:
n
Gi
. Так же, как и любое другое
x
1
i
среднее значение, среднее геометрическое лежит между минимумом и
максимумом из всех чисел. Среднее геометрическое всегда меньше
арифметического среднего, кроме случая, когда все взятые числа равны между собой; тогда их среднее геометрическое равно их же арифметическому среднему.
,
74

n
x
M
x
x
Выборочное среднее гармоническое:
nx
1
1
. Неравенство
i
1
i
о средних утверждает, что среднее гармоническое чисел не превосходит их среднего арифметического и среднего геометрического. В статистике среднее гармоническое применяется в случае, когда наблюдения, для которых требуется получить среднее арифметическое, заданы
обратными значениями, например, когда от измеренных частот следует перейти к длинам волн.
Вторая группа
характеристик связана с разбросом выборки.
Размах выборки – разность между последним и первым членами
вариационного ряда.
Выборочное среднее абсолютное отклонение (MAD – mean
n
absolute deviation):
1
AD x m x
. Здесь
n
1
i
i
()mx
– одно из сред-
них значений выборки, определенных выше; это может быть среднее
арифметическое, но чаще всего в качестве среднего значения берется
медиана. Выбор среднего значения
()mx
сильно влияет на среднее от-
клонение.
Выборочная дисперсия – это оценка теоретической дисперсии
распределения на основе выборки. Различают смещенную и несмещенную (исправленную) выборочные дисперсии. Первую из них
обычно называют просто выборочной дисперсией. Эти оценки даются
следующими формулами.
n
1
22
Выборочная дисперсия:
.
ni
n
i
Несмещенная (исправленная) дисперсия:
Связь между этими величинами:
x
()
1
1
22
n
n
22
n
.
n
1
n
().
i
1
1
i
x
Определение смещенных и несмещенных оценок дано в раз-
деле 3.2.2.
75

Контрольные вопросы к разделу 3.1
1. Дайте объяснение термину статистика.
Из каких разделов состоит статистика? К какому из них отно-
2.
сится математическая статистика?
Что является предметом математической статистики?
3.
Какие задачи решаются в рамках математической статистики?
4.
Что такое генеральная совокупность?
5.
Может ли случайная величина являться генеральной совокуп-
6.
ностью?
Что такое выборка?
7.
Может ли выборка совпадать с генеральной совокупностью?
8.
Что представляет собой выборка случайной величины?
9.
Является ли сама выборка случайной величины случайной ве-
10.
личиной?
Что такое центр выборки? Какими величинами он оценивается?
11.
Чем характеризуется разброс выборки?
12.
3.2. Точечные оценки
3.2.1. Статистики и оценки
В дальнейшем все подлежащие определению параметры: вероятности событий; числовые характеристики и распределения случайных
величин будем называть
обозначать их через , а их значения, найденные по выборкам, полученным в результате опытов, –
случайной выборки, которая не зависит от неизвестных статистических характеристик, называется
быть как скалярными, так и векторными.
Статистика S (скалярная или векторная) называется
для характеристики , если знание значений любых других статистик
не дает никакой дополнительной информации о сверх той, которая
содержится в S. Если достаточная статистика существует, то она не
может быть определена однозначно. Никакая статистика не может содержать больше информации о , чем результаты опыта. Только достаточная статистика
и результаты опытов.
содержит такое же количество информации о , как
статистическими характеристиками и
оценками. Любая функция элементов
статистикой. Статистики могут
достаточной
76

Порядковые статистики, или вариационный ряд, – это упорядо-
x
ченная по возрастанию выборка. Перенумеруем элементы выборки
таким образом, чтобы было
называется
ранга
k/n) исходной выборки.
Оценкой (точечной) статистической характеристики назы-
вается статистика, реализация которой, полученная в результате опытов, принимается за неизвестное истинное значение параметра .
В дальнейшем точечная оценка будет обозначаться как
оценка – это функция выборки, элементы которой случайные величины, она также является случайной величиной.
k-й порядковой статистикой (иногда статистикой
xx
12 n
. Случайная величина
ˆ
. Поскольку
k
3.2.2. Свойства точечных оценок
Оценка статистической характеристики называется состоятель-
, если она сходится по вероятности к при неограниченном увели-
ной
чении числа опытов n. Последовательность случайных величин
называется
ли при любом
оценка характеристики была состоятельной, достаточно, чтобы ее
математическое ожидание стремилось к , а ее дисперсия стремилась к
нулю при неограниченном увеличении числа опытов. Это можно показать, используя неравенство Чебышёва (2.68).
Оценка
щенной
опытов n. В противном случае она называется
ˆ
{}M называется
к нулю при
щенной
Одну и ту же статистическую характеристику можно оценивать
разными способами, при этом будут получаться различные оценки.
Качество оценки часто характеризуют математическим ожиданием
квадрата модуля отклонения оценки от оцениваемой характеристики –
средним квадратом ошибки:
оценивается скалярная действительная характеристика , тогда
сходящейся по вероятности к случайной величине , ес-
P
0
имеет место
ˆ
статистической характеристики называется несме-
, если ее математическое ожидание равно при любом числе
смещением оценки. Если смещение стремится
n
.
, то оценка называется асимптотически несме-
n
ˆ
||M
0
смещенной. Разность
2
. Будем считать, что
при
n
n
. Чтобы
77

x
x
f
() {}{} ( {})MMMMMM
22
ˆˆˆˆ ˆˆ
2
ˆˆ ˆ ˆ
Если оценка несмещенная, то два последних члена в уравнении (3.1)
равны нулю, и выражение принимает вид
Таким образом, в случае несмещенной оценки
ошибки представляет собой ее дисперсию, если характеристика
скалярная. Если же она векторная, то есть сумма дисперсий коорди-
нат оценки
данной характеристики, при данном числе опытов n, как и всякое множество неотрицательных чисел, имеет точную нижнюю грань:
inf | |M
. Естественно стремление пользоваться такими
0
оценками, для которых средний квадрат ошибки равен
зок к нему. Для нахождения таких оценок во многих случаях оказыва-
ется полезным понятие достаточной статистики (см. раздел 3.2.1).
Пусть оценка определяется следующей статистикой
вектором
этой оценки в общем случае зависит от оцениваемого параметра :
Здесь
ки и распределения неизвестной статистической характеристики . За-
метим, что для несмещенной оценки по определению ()m
Продифференцируем уравнение (3.3) по :
ˆ
(, )
x
2{}{} {}MMM MM
2
ˆˆˆˆ
() {} {}MMMD
ˆ
. Множество чисел , соответствующих всем оценкам
2
ˆ
обозначена случайная выборка. Математическое ожидание
ˆ
{} () () (, ) ()MMx xfxdxm
– совместная функция плотности распределения выбор-
2
2
. (3.1)
. (3.2)
ˆ
средний квадрат
либо бли-
0
ˆ
, где
()
. (3.3)
.
(, )
fx
78
() ()
mxdx
ln ( , ) ln ( , )
() (, )
xfxdxM
fx fx
ˆ
. (3.4)

Точно так же дифференцируем формулу (, ) 1
f
ln ( , )
fx
(, )
fx
Из формул (3.4) и (3.5) следует выражение
ˆ
() ()
Напомним, что мы рассматриваем скалярные действительные статистические характеристики , оценки которых являются скалярными
случайными величинам. Для произвольных случайных величин и
имеет место следующее свойство:
Возводя в квадрат равенство (3.6) и используя неравенство (3.7), получаем
Mm
2
() ( )
mM M
dx f x dx
ln ( , )
2
ˆ
fx
ln ( , )
fx
2
M
{} {}{}MMM
(, )
0
. (3.5)
22
ln ( , )
fx
xdx
. (3.6)
. (3.7)
:
2
. (3.8)
Используя выражение дисперсии (2.27) и учитывая (3.5), перепишем (3.8) в виде
ln ( , )
2
() ( )
Для несмещенной оценки () 1m
ние (3.2) из (3.9), получаем
mM D
DD
ˆ
{}
2
ˆ
, и тогда, учитывая выраже-
ln ( , )
fx
79
fx
1
. (3.9)
. (3.10)

Выражение (3.10) определяет нижнюю грань (не обязательно точ-
x
M
ную) дисперсии несмещенной оценки. Никакая несмещенная оценка не
может иметь меньшую дисперсию, чем правая часть выражения (3.10).
Оценка, для которой в (3.10) имеет место знак равенства, называется
эффективной. Любая эффективная оценка является несмещенной.
Эффективная оценка существует тогда и только тогда, когда функция
где коэффициент пропорциональности с может зависеть от , но
не от
fx fx
в правой части (3.10) называют
статистической оценки при n независимых испытаниях и обозначают
как
Крамера–Рао
имеет максимальную информацию Фишера среди других статистик.
ln ( , )fx
.
Поскольку элементы выборки предполагаются независимыми, то
(, ) ( , )
i
. Само же выражение (3.10) иногда называют неравенством
()
I
n
представима в виде
ln ( , )
fx
n
и
ln ( , ) ln ( , )
fx fx
i
1
. Отметим, что достаточная статистика характеристики
ˆ
() ()
ccx
n
1
i
информацией Фишера для данной
i
, (3.11)
. Тогда знаменатель
3.2.3. Оценка статистических характеристик
методом моментов
Общим методом нахождения оценок параметров распределений
является
параметров из уравнений, получаемых приравниванием оценок моментов теоретическим значениям соответствующих начальных моментов
(см. раздел 2.2.1), зависящим от неизвестных параметров. В случае
скалярной наблюдаемой случайной величины r-мерный параметр
обычно определяют из уравнений
метод моментов. Он основан на определении неизвестных
n
1
k
(, , , ) , 1,2, ,
kri
. (3.12)
12
xk r
n
i
1
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
