Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Прикладная математическая статистика. Учебное пособие
.pdf
11
i
w
m
i
…
∈
x x
n
<
ρ
Подсчитав число студентов
)(in
, попавших в каждый из полученных промежутков,
получим интервальный статистический ряд:
*
x
i
153 159 165 171 177 183
Рост [150;156) [156,162) [162,168) [168,174) [174,180) [180,186)
Частота 4 5 6 7 5 3
Относительная
частота
h
i
0.13 0.17 0.2 0.23 0.17 0.1
0.022 0.028 0.033 0.038 0.028 0.017
►
В качестве оценки кривой плотности непрерывного распределения используется
гистограмма частот
опирающихся на частичные интервалы (см. рисунок). Высота
полагается равной плотности частоты
равна
x
ωρ
=∆⋅
- относительной частоте.
iii
Эмпирической функцией распределения
называется функция, при каждом
- ступенчатая фигура, состоящая из
ρ
. Соответственно площадь каждого прямоугольника
i
, полученной по выборке },,,{
Rx
равная:
*
F x
( )
n
количество
=
i
.
прямоугольников,
-го прямоугольника
21 n
xxx
,
)(*xF
есть ступенчатая функция. Эмпирическая функция распределения является оценкой
n
ρ
3
ρ
2
ρ
1
~
x
~
x
0
1
Рис 2. Гистограмма частот.
теоретической функции распределения (рис 2.3).
ω
~
x
2
3
~
x mx~ x
3

12
*
n
→ ∞
( )
F x
( )
F x
( ) ( )
F x F x
i
m X x
∑
2 2
D x X x X
2
s x X
k k
m X x
∑
k
x X
*
x
( )/ 2, 2 ( )
x x x если n m четно
ξ
(
)
1/ 2
ξ =
p
ξ
p
ξ
F p
ξ =
p
ξ
sup{ : ( ) }
x F x p
ξ = ≤
p
ξ
( )
F p
F
1
x
1
2
x
x
Рис 3. Эмпирическая функция распределения.
Теорема [1]. При
3
x
4
выборочное распределение
x
x
m
*
стремится к исходному
распределению
почти наверное (с вероятностью 1)
*
1.2. Числовые характеристики выборки
В качестве числовых характеристик выборки
n
1.
Выборочное среднее:
= =
2. Выборочная дисперсия
3. Несмещенная выборочная дисперсия
1
.
n
1
i
=
n n
1 1
= − = −
( )
∑ ∑
n n
i i
i i
1 1
= =
2
2
= −
n
Выборочные начальные и центральные моменты
4.
n
= =
k
Выборочная медиана
5.
*
x x если n m нечетно
= = −
*
= + =
Напомним, что медианой
1
,
n
1
i
=
– это среднее значение вариационного ряда
, 2 1 ( )
m
1
m m
+
непрерывного распределения F называется решение
→
. .
п н
.◄
используются:
n
1
( )
∑
−
1
µ = −
k
i
i
1
=
n
1
( )
∑
n
1
i
=
.
.
.
уравнения
F
Более общим понятием является понятие квантили
которого
( )
p
. Так что медиана есть квантиль порядка 1/2. Если F имеет точки
разрыва (дискретную компоненту), то это понятие теряет смысл. Поэтому в общем случае
мы будем пользоваться следующим определением.
Квантилью
p
порядка p распределения F называется число
Как функция от p квантиль
порядка p. Это число
есть не что иное, как функция
, для
1
−

13
p
x
, [ ] 1
= = +
i i
m x
= ω
∑
i i
= − ω
k i i
m x
= ω
k i i
µ = − ω
6. Выборочная квантиль
x x l np
p l
порядка p равна
.
По статистическому ряду значения первых четырех величин могут быть найдены по
формулам:
m
i
1
=
m
∑
i
=
m
,
k
,
1
( )
∑
i
=
1
m
∑
1
i
=
( )
−=
mxD
x m
2
,
ω
ii
k
.
2
s x m
n
m
n
( )
∑
1
−
i
=
1
2
,
Выборочные характеристики являются приближенными значениями соответствующих
числовых характеристик случайной величины ξ.
Вопросы для самопроверки
1.
Понятие выборки и формы ее записи.
2. Что такое вариационный ряд?
3. Что такое статистический ряд абсолютных частот?
4. Что такое статистический ряд относительных частот?
5. Что такое статистический ряд накопленных частот?.
6. Что такое группированный статистический ряд?
7. Что такое полигон частот, гистограмма?
4. Что такое эмпирическая функция распределения?
5. Числовые характеристики выборки.

14
, ,...,
θ θ θ
k
( , , ,..., )
θ θ θ
k
, ,...,
n
x x x
( , ,..., )
n
x x x
* * *
, ,...,
k
θ θ θ
, ,...,
n
x x x
( , ,..., )
n
x x x
*
θ
n
θ = θ
n
θ < θ
*
θ
>
ε
∞
→
n
(
)
ε
Тема 2. Точечные оценки параметров распределений
вероятностей
2.1. Точечные и интервальные оценки
В реальной жизни практически никогда не бывает так, чтобы исследователь располагал
точным знанием закона распределения вероятностей наблюдаемых случайных величин. Ему
в общем случае неизвестны как сам закон распределения вероятностей, так и его параметры.
В распоряжении исследователя имеется лишь совокупность результатов наблюдений, и.
основываясь только на них, он должен сделать выводы о параметрах распределения, если
вид закона распределения вероятностей ему известен. Если же нет, то и сам закон
распределения вероятностей ему придется выбирать на основании выборочных результатов
наблюдений. Здесь мы рассмотрим методы оценки параметров
заранее определенных по форме, распределений вероятностей случайных величин
F x
1 2
от выборочных значений
. Всякая оценка неизвестного параметра θ по выборке является функцией
1 2
, т.е.
*
θ
1 2
. Числовые характеристики
1 2
различных,
1 2
Различают два вида оценок параметров
, полученные по выборкам, называют статистическими оценками параметров.
точечные и интервальные.
Предположим,
оценке подлежит параметр θ некоторого распределения вероятностей по выборочным
данным
1 2
выборочным данным является некоторый функционал
некоторой случайной величины X.
Точечной оценкой параметра θ по
*
θ = ϕ
1 2
, позволяющий
получить наилучшую оценку в принятых критериях.
В качестве критериев, характеризующих пригодность оценки параметра распределения,
используются такие ее свойства, как
достаточность.
Оценка
объема выборки
параметра θ называется
математическое ожидание оценки равно оцениваемому параметру, т.е.
несмещенность, состоятельность, эффективность
*
M( )
несмещенной
. (2.1)
, если для любого фиксированного
и
Поясним смысл этого равенства следующим примером. Имеются два алгоритма
вычисления оценок для параметра θ. Значения оценок, построенных первым алгоритмом по
различным выборкам объема
использованием второго алгоритма – на рис 2.1
а
рис 2.1,
оценками рис 2.1
совпадает с θ, и, естественно, такие оценки предпочтительнее по сравнению с
,б
, которые концентрируются слева от значения θ и для которых *M( )
генеральной совокупности, приведены на рис 2.1,а, а с
,б
. Видим, что среднее значение оценок на
,
т.е. эти оценки являются смещенными.
Оценка
т.е. для любого
Поясним смысл этого предельного соотношения. Пусть
число. Тогда (2.2) означает, что чем больше число наблюдений n, тем больше уверенность
(вероятность) в незначительном отклонении
что «хорошая оценка» должна быть состоятельной, иначе эта оценка не имеет практического
называется
состоятельной
0
при
, если
p
*
n
θθ
→
,
*
P
n
1→<−
εθθ
. (2.2)
– очень малое положительное
*
θ
от неизвестного параметра θ. Очевидно,
n

15
θ
>
θ
θ
θ
θ
смысла, так как увеличение объема исходной информации не будет приближать нас к
«истинному» значению
.
Предположим, что имеются две состоятельные и несмещенные оценки
)*(
1
n
11
)*(
2
ϕθϕθ
==
nn
12
)x...,,x();x...,,x(
(2.3)
n
одного и того же параметра θ. Как из двух этих оценок выбрать лучшую? Каждая из них
является случайной величиной, и мы не можем предсказать индивидуальное значение оценки
в каждом частном случае. Однако, рассматривая в качестве меры концентрации
распределения оценки
*
θ
около значения параметра θ величину
n
M
теперь точно охарактеризовать сравнительную эффективность оценок
2*
)(
θθ
−
n
, мы можем
)1*(
θ
и
n
)2*(
θ
. В
n
качестве меры эффективности принимается отношение
a)
θ
*
n
б)
θ
*
n
Рис. 2.1. К определению несмещенной оценки
a)
θ
*
n
б)
θ
*
n
Рис. 2.2. К определению эффективной оценки
2)1*(
)(
−
θθ
n
n
. (2.4)
2)2(*
)(
θθ
−
)1*(
θ
. В случае несмещенных
n
Если значение 1
оценок
e
)(*
1
n
, то оценка
)*(
2
)(M,)(M
=
e
θ
n
θθθθ
==
и поэтому
M
M
)2*(
более эффективна, чем

16
*
θ
*
θ
*
θ
*
н
a
*
в
a
α
< θ < = α
α
*
н
a
*
в
a
* *
[ , ]
н в
a a
l a a const
1
α →
n
→ ∞
α
< θ < = α
′
θ < = α
′′
θ > = α
1
′ ′′
α + α = − α
2
− α
2
+ α
2
+ α
< = α
θ > = α
(1 )
q
= − α
)1*(
D
e
=
D
)(
θ
n
)2(*
)(
θ
n
, (2.5)
*
D
θ
где )(
– дисперсия оценки
n
Таким образом, несмещенная оценка
эффективной
наименьшей дисперсией
, если она среди всех других несмещенных оценок того же параметра обладает
.
Приведенная на рис 2.2,а оценка
*
θ
.
n
*
θ
параметра θ называется
n
несмещенной
является более эффективной по сравнению с
оценкой, значения которой нанесены на рис 2.2,б (почему?).
Оценка
называется достаточной, если оценка
извлекает максимальную
информацию из выборки.
Под интервальной оценкой параметра θ понимается интервал, границы которого
и
являются функционалами от выборочных значений случайной величины, и который с
заданной вероятностью
Вероятность
соответственно
называется
нижней и верхней доверительными границами.
доверительным, интервалом.
содержит оцениваемый параметр:
доверительной вероятностью,
Если длина доверительного интервала
то для состоятельных и несмещенных оценок
объеме выборки n,
будет тем больше, чем больше l.
Различают два вида интервальных оценок:
а оценки
Интервал
( )
при
одно- и двусторонние.
. При фиксированном
* *
{ }
P a a
н в
и
называется
α = − =
* *
в н
При
двусторонней
–
оценке задаются обе границы доверительного интервала, так что
.
,
* *
{ }
P a a
н в
где
называется
и
. Если
α = α =
симметричным.
{ }
P a
′ ′′
Для него справедливы соотношения
*
н
;
{ }
P a
*
в
,
1
, то двусторонний доверительный интервал
P a
θ < =
{ }
1
*
в
и
P a a
> =
{ }
1
*
н
.
При односторонних доверительных интервалах границы интервалов задаются так,
чтобы
*
в
или
Этим термином обозначается вероятность появления
Величина
называется
{ }
P a a
— дополнение .доверительной вероятности до единицы
уровнем значимости.
события, которую исследователь связывает с
{ }
P a
неслучайным (значимым) событием.
*
н
Очевидно, что двусторонний интервал для симметричных распределений аналогичен
одностороннему при удвоенном уровне значимости.
Наиболее существенной характеристикой оценки параметра распределения
является ее
эффективность.
Именно эта характеристика обычно используется для
сравнения методов оценки параметров распределения между собой. Как правило,
эффективность оценки сравнивается с эффективностью оценки параметра
распределения методом максимального правдоподобия (т.е. с наиболее эффективной
оценкой). Легко видеть, что применение менее эффективных оценок (требующих, как

17
( , ,..., )
n
X x x x
=
F
θ
k
R
( , ) ( ,..., ; ,..., )
k n
L x L x x
θ = θ θ
f x если x непрерывная величина
p x если x дискретная величина
( ,..., )
k
θ θ θ
(
)
( ,..., ) arg max ( , )
L x
( , ) ( ,..., ; ,..., )
k n
L x L x x
θ = θ θ
, ,...,
k
θ θ θ
(
)
0
=
правило, меньшего объема, вычислений) может быть скомпенсировано
соответствующим увеличением объема выборки.
Поясним практический смысл процедуры оценки параметров распределения
вероятностей. Так как само распределение наблюдаемых случайных величин является
для исследователя той совокупностью данных, которой он располагает относительно
наблюдаемого процесса, то и параметры распределения позволяют судить об основных
чертах этого процесса. Например, когда мы спрашиваем, какова долговечность
прибора, мы по сути, ставим задачу оценки среднего значения (или математического
ожидания) наблюдаемого распределения показателей долговечности. Если нас
интересует, насколько стабилен наблюдаемый технологический процесс, то ответ на
этот вопрос требует оценки разброса (рассеяния) наблюдаемых случайных величии,
характеризующих качество технологического процесса.
2.2. Вычисление точечных оценок
Для нахождения вида функции оценивания того или иного параметра используют один из
следующих методов:
метод максимального правдоподобия;
1)
2) метод моментов;
3) оценивание с помощью метода наименьших квадратов
2.2.1. Оценка параметров методом максимального правдоподобия
Наибольшее распространение получил метод максимального правдоподобия. Суть
метода состоит в следующем. Пусть
распределения
Функцией правдоподобия
n
∏
j
=
( , )
L x
θ =
n
∏
=
j
В качестве оценки параметров
которых функция правдоподобия принимает максимальное значение, т.е.
* * *
θ = θθ θ=
1
, зависящего от неизвестного параметра
1 1
( , ,..., ),
θ θ
1
1
1
j k
( , ,..., ),
θ θ
1
j k
k
* * *
=
1
θ
. Если функция
1 2
примем значения этих параметров, при
– независимая выборка из
θ = θ θ θ ∈Θ ⊂
называют функцию
( , ,..., )
1 2
k
1 1
.
является дифференцируемой по переменным
удовлетворяют системе уравнений:
или
L
∂ Θ
∂Θ
1 2
, оценки параметров

18
0, 1,2,..., .
i k
θ θ
(
)
Θ
(
)
Θ
Θ
(
)
Θ
(
)
Θ
(
)
0
=
(
)
ˆ
Θ
Θ
(
)
Θ
∞
→
n
Θ
ΘΘΘ
ΘΘΘ
ˆ ˆ ˆ
, ...
n
Θ Θ Θ
(
)
0,
0,
0.
=
=
=
A
pAp=)
(
=
(
)
=
=
(
)
=
( ,..., ; )
dL x
Так как функции
1
L
и
k
= =
θ
d
i
ln L
достигают максимума при одном и том же
(2.6)
значении
максимум функции
правдоподобия записывают в виде
трансцендентное уравнение, которое может иметь несколько решений. Задача в этом случае
состоит в нахождении того решения, которое соответствует абсолютному максимуму
функции правдоподобия. Если существует несмещенная эффективная оценка
уравнение правдоподобия в этом случае имеет единственное решение равное
относительно вида функции
Эта оценка асимптотически несмещенная и эффективная. Кроме того, при
распределение оценки максимального правдоподобия – асимптотически нормальное со
средним
правдоподобия надо:
xf
правдоподобия
2.2.2. Примеры применения метода максимума правдоподобия
(функция логарифм монотонная), то вместо отыскания максимума
ln L
или
Уравнение правдоподобия представляет в общем случае нелинейное или
Можно доказать, что при некоторых не очень ограничительных предположениях
и дисперсией
1) Решить уравнение правдоподобия.
2) Отобрать то решение, которое соответствует абсолютному максимуму функции
правдоподобия.
Если оценке подлежат несколько параметров
)...,;(
21
Пример 2.1. Оценка вероятности по частоте. Рассмотрим события
. Проведено n испытаний, в результате которых событие A появилось x раз.
n
=
∑
i
=
0
x
i
1
x
i
, то оценки
n
xx
i
1
, если A,
, если A,
. Часто это бывает значительно проще. Поэтому уравнение
ln
L
∂ Θ
∂Θ
xf
∑
1
=nk
;xf
оценка максимального правдоподобия состоятельна.
V
. Таким образом, для нахождения оценки максимального
min
1 2
0
Ap
Ap
1
определяются решением системы уравнений
∂ Θ Θ Θ
ln , ...
∂ Θ Θ Θ
ln , ...
.........
ln , ...
∂ Θ Θ Θ
k
Θ∂
L
1 2
∂Θ
L
( )
1 2
∂Θ
L
( )
1 2
∂Θ
;ln
Θ∂
0
=
.
...,
распределения
n
21
n
1
n
2
n
n
(2.7)
L
ищут
то
.
. Вероятность

19
x
n
−
()(
)
()()(
)
L p C x p n x p
= + + − −
(
)
0
= − =
n
A
()(
)
−
()(
)
−
()()()(
)
L p C C x x p n n x x p
= + + + + − − −
(
)
−−+−+
∂
p
(1) (2 )
x x
∑ ∑
(
)
2
L a n x a
= − πσ − −
(
)
0
= − =
i
a x
∑
Выборка объемом n дала по условию x единиц и
нулей. Вероятность такого
сочетания нулей и единиц согласно биномиальной формуле равна
xn
xx
21
nn
−= 1,...,,
−
ppCxxxP
.
Логарифм функционала правдоподобия имеет вид
ln ln ln ln 1
x
n
и
∂
ln
L p
∂ −
p p p
−
x n x
1
Решая его относительно p, найдем правдоподобную оценку
n
x
∑
i
==1
i
p
.
Можно показать, что эта оценка является состоятельной (теорема Бернулли),
несмещенной и эффективной. ►
Пример 2.2. В двух сериях по
n
и
n
1
испытаний было
2
x
и
x
1
появлений события
2
, соответственно. Вероятность появления события A в каждой серии одинаковы. Найти
€
p
оценку
. Вероятности появления A в двух сериях равны
xx
11
1
1
n
1
n
22
−=
xx
22
1
−=
xn
ppCxP
11
xn
ppCxP
22
Логарифм функции правдоподобия равен
x x
ln ln ln ln 1
1 2
n n
1 2
1 2 1 2 1 2
и
ln
pL
x
=
∂
p
Решая его относительно
n n
1 2
+
i i
i i
1 1
= =
ˆ
=
p
+
n n
1 2
p
xx
.►
1
−
найдем правдоподобную оценку
Пример 2.3. Оценка математического ожидания гауссовой СВ по выборке
1
В данном случае
( )
;
axf
i
2
xxnn
212121
0
=
p
21
2
ax
.
2
2
exp
−
i
−=
2
σσπ
Функционал правдоподобия имеет вид:
n
1
L a
ln ln 2
= −
( )
2
( ) ( )
ln
L a
∂
Тогда
∂ σ
n
1
ˆ
=
n
. ►
1
i
=
Пример 2.4.
n
exp
∏
π
1
i
=
1
a
2
Оценка параметра a пуассоновской СВ по выборке
1
2
σ
n
( )
∑
=
i
1
x a
−
( )
i
σ
2
n
∑
2
i
1
=
x a
i
, а его логарифм равен
2
.
i
, а оценка равна
xxx ...,
.
n
21
xxx ...,
.
n

20
(
)
! !... !
i
x
∑
ln ln ln ! !... !
L a na a x x x x
a
a
i
x
n
∑
(
)
=
0
Θ=Θ
(1)
ˆ
Θ
(2 )
ˆ
Θ
ln ln 0
Θ + Θ−Θ Θ =
(1)
(1)
Θ
Θ ≈ − Θ = − Θ = − Θ
(
)
Θ
В данном случае
x
i
( ) ( )
;;
axXPaxp
ii
exp
===
aa
−
!
x
i
Составим функцию правдоподобия
n
1
i
L a
exp
=
( )
x x x
1 2
−
( )
na a
=
n
Функционал правдоподобия
n
= − + ⋅ −
( ) ( )
( )
и
ln
∂
aL
x
∑
i n
i
=
1
n
x
∑
1
=
i
n
1 2
i
0
=+−=
.
∂
Оценка максимального правдоподобия
n
1
i
=
ˆ
a
=
.
2.2.3. Приближенное решение уравнения правдоподобия
Как правило, точное решение уравнения правдоподобия получить не удается. В
общем случае для получения решения можно использовать метод последовательных
приближений. Запишем исходное уравнение подобия:
ln0L∂ Θ
(2.8)
∂Θ
Разложим производную логарифма функции правдоподобия в ряд Тейлора,
ограничившись в этом разложении первыми двумя членами:
2
∂ ∂ ∂
ln ln lnL L L
∂Θ ∂Θ ∂Θ
Θ ≈ Θ + Θ − Θ Θ
( ) ( ) ( ) ( )
Θ=Θ
0
0
2
(2.9)
Примем в качестве первого приближения решение уравнения правдоподобия какую-
нибудь грубую оценку
Из (2) найдем для второго приближения
∂ ∂
∂Θ ∂Θ
параметра Θ. Это может быть, например, выборочное среднее.
как корня уравнения
2
(1)
L L
( )
Θ=Θ
(1)
ˆ
ˆ
( )
( )
2
Θ=Θ
(2.10)
(1)
ˆ
Из этого уравнения найдем:
∂
ln
Θ
∂Θ
(2 ) (1)
ˆ ˆ
Θ = Θ −
2
Заменим
∂
∂Θ
2 2 2
∂ ∂ ∂
ln ln ln
L m L m L I
( ) ( ) ( ) ( )
2 2
∂Θ ∂Θ ∂Θ
Здесь
I
n
∂
∂Θ
ln L
( )
2
- информация содержащаяся в выборке по Р.А. Фишеру. Тогда из (2.11)
( )
ˆ
Θ=Θ
2
lnLL
Θ
( )
2
его средним значением
(2.11)
ˆ
Θ=Θ
1
2
n
найдем
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
