Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Парадоксы в теории вероятностей и математической статистике

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
2. ПАРАДОКС ОЦЕНОК МАТЕМАТИЧЕСКОГО ОЖИДАНИЯ 101
Тогда EX∗− θ2<k,ноEX θ2= k. Следовательно, оценка X дей- ствительно не является допустимой. Оценка X
переводит вектор X ближе к началу координат, а так как начало координат можно выбрать произвольно, то оценка
Q +1
(k 2)σ
X Q
также лучше, чем
X,прилюбомQ. Таким образом, оценка Джеймса –
Стейна зависит от выбора начала координат Q,втожевремя
2
2
X Q)
(
X от Q не
зависит. (Можно показать, что оценка
X
2
2
;0X
луч-
X =max1
даже несколько лучше, чем X
(k 2)
.)
Теперь попытаемся эвристически объяснить, почему оценка X
ше, чем
X. Рассмотрим в совокупности выборки в k независимых задачах оценки параметров. Разброс скалярных элементов выборки определяется частично (общим) стандартным отклонением σ каждого из k распределений, частично (вообще говоря) неравными математическими ожиданиями θ
.Хо-
i
тя эти неизвестные математические ожидания могут быть очень разными, разброс общей выборки может указывать на то, что значения θ
различа-
i
ются не сильно. Например, в случае, когда σ =1и приблизительно 16 % наблюдений превосходит 1, а 16 % наблюдений меньше 1, естественно считать, что все математические ожидания θ если X
=0,8, то обычная оценка i-гo параметра даст 0,8, в то же время
i
близки к нулю. В этом случае
i
согласно более «рациональной» концепции Джеймса – Стейна, математиче­ское ожидание θ
близко к нулю. Хотя такое объяснение может убедить нас
i
в «рациональности» оценок, предложенных Джеймсом и Стейном, однако их метод все же представляется странным, когда мы имеем дело с задача­ми, между которыми вряд ли существует какая-либо связь, например, когда нужно оценить математические ожидания (нормально распределенных) вы­соты тела, скорости света и цены продукта.
г) Замечания
(i) Следующее неравенство, принадлежащее Крамеру и Рао, дает по­лезную информацию, касающуюся обоих парадоксов. Пусть f (x, θ) —сов­местная плотность (зависящая от параметра θ) элементов выборки X
i
,
102 ГЛАВА II
i =1, 2, ..., n ипустьB(θ) обозначает смещение E(θn− θ) оценкиθ
n
от параметра θ. Тогда неравенство Крамера –Рао утверждает, что при вы­полнении некоторых условий регулярности справедливо соотношение
θ)2 B(θ)2+
E(θ
n
где B
(θ) — производная функции B(θ) и
I(θ)=E
d
2
1+B
ln f(Xi,θ)
2
nI(θ)
(θ)
2
,
есть информация Фишера. Следовательно, скорость сходимости E(θn−θ) к нулю не может быть быстрее, чем 1/n. Однако в примере, рассмотрен- ном в первом парадоксе (равномерное распределение, B(θ)=0ипоэтому
θ)2= D2(θn)), скорость сходимости составляет 1/n2. Противоречия
E(θ
n
здесь нет, так как пример представляет собой типичный случай, когда усло­вия регулярности, которые упоминались выше, не выполнены. (Например, достаточным было бы следующее условие регулярности: множество чи­сел x, для которых функция f (x, θ) положительна, не зависит от θ.) Теперь относительно второго парадокса. Из неравенства Крамера –Рао вытекает, что если разрешено использовать смещенные оценки, т. е. мы отказываемся
от условия B(θ) 0, и если производная B
(θ) отрицательна, то E(θ θ)
может убывать значительно быстрее, чем дисперсия несмещенной оценки с минимальной дисперсией.
(ii) Пусть X
обозначает выборочную медиану, т. е. X= X
и X
1
<X
< ... < X
2
=(X
X
обозначают упорядоченную выборку
n/2
n
+ X
n/2+1
)2
(n+1)/2
для нечетных n и
2
2
для четных n. Если выборка взята из нормального распределения, то
2
D
(X)
т. е. эффективность оценки X от эффективности
1
Эффективность оценкиθ пропорциональна D−2(θ).—Прим. перев.
X1. Однако ситуация изменится, если мы немного «рас-
2
2(X
D
π
составляет (асимптотически) всего лишь 63%
) 0,63 D2(X),
2. ПАРАДОКС ОЦЕНОК МАТЕМАТИЧЕСКОГО ОЖИДАНИЯ 103
строим» нормальное распределение: рассмотрим случайную величину, ко­торая является смесью двух нормальных распределений, а именно, 91% сос­тавляет нормальное распределение со средним θ и дисперсией 1 и 9 % — нормальное распределение с тем же средним θ и дисперсией 9. В этом
случае медиана X
является для θ оценкой лучшей, чем X.
(iii) Следующий парадокс допустимой оценки принадлежит С.Масани. Пусть X ожиданиями m
— две независимые случайные величины с математическими
1,X2
, m2. Масани строит два примера (один с биномиальным
1
распределением, другой — с нормальным), в которых оценка, зависящая только от X рим только биномиальный случай. Пусть X
, является допустимой при оценивании m1. Здесь мы рассмот-
2
, ..., Xm— независимые
1,X2
случайные величины, имеющие биномиальные распределения с параметра-
, pi. Можно доказать, что линейная оценка
ми n
i
m
P
1(X1,X2
, ..., Xm)=
aiXi/ni+ c
i=1
является допустимой оценкой параметра p терь L(p
и
или a
,p)=(p1− p)2тогда и только тогда, когда или
1
< 1, 0 c  1
0 a
1
m
0
=1и a2= a3= ... = am= c =0. Полагая a1=0, получаем
1
ai+ c 1, 0
i=2
большой класс допустимых оценок параметра p
при квадратичной функции по-
1
m
ai+ c 1,
i=1
, не зависящих от X1.
1
(iv) Оптимальная инвариантная оценка (оценка Питмена (Pitman)) нор­мальной плотности не является нормально распределенной, когда все па­раметры неизвестны. Если известно, что дисперсия равна, скажем, 1,то оценка Питмена нормально распределена, но ее дисперсия есть (n 1)/n, что всегда меньше 1.
д) Литература
Efron В. «Biased versus unbiased estimation», Advances in Math., 16, 259–277 (1975).
James W., Stein C. «Estimation with quadratic loss», Proc. 4th Berkeley Symp. on Math. Statist, and Prob., 1, 361–380. Univ. California Press, Berkeley (1961).
104 ГЛАВА II
Kagan A. M., Linnik Yu. V., Rao C. R. «On a characterization on the normal low based on a property of the sample average», Sankhya, Ser. A, 27, 3–4, 405–406 (1965).
Masani S. M. «A paradox in admissibility», Annals of Statist., 5, 544–546 (1977).
Stein C. «Inadmissibility of the usual estimator for the mean of a multivariate normal distribution», Proc. 3rd Berkeley Symp. on Math. Statist, and Prob., 1, 197–206, Univ. California Press, Berkeley (1956).
Tukey J. W. «A survey of sampling from contaminated distributions», Contrib. to Prob. and Statist., (Ed. I.Olkin) 448–485, Standford Univ. Press (1960).
Zacks S. The Theory of Statistical Inference, Wiley, New York (1971). [Имеется перевод: Закс Ш. Теория статистических выводов. — М.: Мир, 1975.]
3. Парадокс оценок дисперсии
а) История парадокса
Важнейшей характеристикой случайных величин и их распределе­ний, наряду с математическим ожиданием, является дисперсия. Оце­ним неизвестную дисперсию D
X
, ..., Xn(где X1,X2, ..., Xnявляются независимыми наблюде-
1,X2
ниями, имеющими то же распределение, что и X). При известном матема- тическом ожидании E оценка
D
2
случайной величины X по выборке
n
1
2
=
0
n
(Xi− E)
i=1
2
— несмещенная. Ситуация меняется, когда E неизвестно и (в предыдущую формулу) вместо E ставится его несмещенная оценка
n
1
2
D
=
n
(Xi− X)
i=1
X. Тогда оценка
2
уже не является несмещенной. Поскольку несмещенность (со времен Гаус­са) была одним из необходимых свойств, которыми должна обладать хо-
2
рошая оценка,D
изменяют так, чтобы получить несмещенную оценку. (Некоторые параметры вообще не имеют несмещенных оценок. В этих слу­чаях ограничиваются требованием асимптотической несмещенности,т.е.
E(θn)=θ для всех θ ∈ Θ. Это требование дляD2выполнено.) Наря-
lim
n→∞
ду со свойством несмещенности постепенно возникли и другие требования, которым должна удовлетворять хорошая оценка. Парадокс возникает тогда,
3. ПАРАДОКС ОЦЕНОК ДИСПЕРСИИ 105
когда различные требования к качеству оценок не приводят к одной и той же оценке.
б) Парадокс
УмножаяD
2
на множитель Бесселя n/(n 1), получаем величину
n
=
1
n − 1
(Xi− X)2,
i=1
D
2
являющуюся несмещенной оценкой дисперсии.
Предположим, что случайная величина X нормально распределена
(с неизвестными математическим ожиданием и дисперсией), и нам нужны
2,D2
минимаксные оценки (см. замечания в I/12) с функцией потерь L(D
2
=(D
жимD
D2)D4.ТогдаD2надо изменить следующим образом: умно-
2
на n/(n +1) и получим минимаксную оценку
n
1
n +1
(Xi− X)2.
i=1
)=
(Ее риск равен 2/(n +1).) Итак, принцип минимакса и несмещенность приводят к различным оценкам.
в) Объяснение парадокса
n
Сумма
тическое ожидание E, вообще говоря, не равно величине к ней). Следовательно, оценкаD
ние, больше, чемD
(Xi− a)2минимальна только при a = X. Однако матема-
i=1
X (лишь близко
2
, показывающая действительное отклоне-
2
. Вот почему необходима поправка Бесселя. С другой
0
стороны, нет причин, по которым минимаксная или допустимая оценки должны быть несмещенными. (В II/2 мы уже видели, что оценка Джеймса – Стейна для математического ожидания лучше, чем обычная несмещенная оценка
X.) Поскольку несмещенная и минимаксная оценки дисперсии нор­мального распределения не совпадают, в каждой конкретной задаче нужно решать, какую оценку предпочесть. К счастью, даже при малых значени­ях n различие между двумя оценками невелико. (Однако в других проблемах разница может быть существенной.)
106 ГЛАВА II
г) Замечания
Как ни удивительно, но можно показать, что указанная выше минимак­сная оценка не является допустимой. (См. статью Стейна или книгу Закса.) С другой стороны, если математическое ожидание нормального распреде­ления известно, то оценка
n
1
n +2
(Xi− E)
i=1
2
является не только минимаксной (с риском 2/(n +2)), но и допустимой при указанной выше функции потерь. (См. книгу Закса.)
д) Литература
Stein С. «Inadmissibility of the usual estimate for the variance of a normal distribution with unknown mean», Annals Inst. Statist. Math., 16, 155–160 (1964).
Zacks S. The Theory of Statistical Inference, Wiley, New York– London –Sydney – Toronto (1971). [Имеется перевод: Закс Ш. Теория статистических выводов. — М.: Мир, 1975.]
4. Парадокс метода наименьших квадратов
а) История парадокса
Из-за неизбежных ошибок измерений часто кажется, что теоретиче­ские формулы и эмпирические данные противоречат друг другу. В начале прошлого века Лежандр, Гаусс и Лаплас предложили эффективный метод, позволяющий уменьшить влияние ошибок измерений. (Например, Лежандр разработал и применил его в 1805 г. для нахождения орбит комет.) Осно­воположниками этой теории были Галилей (1632), Ламберт (1760), Эйлер (1778) и другие. Новый прием, названный методом наименьших квадра­тов, детально исследован Гауссом в его работе «Теория движения небесных тел» (1809). Именно Гаусс указал также на вероятностный характер этого метода. (Хотя Лежандр обвинял Гаусса в плагиате, он не мог представить для этого достаточных оснований. Гаусс претендовал на приоритет лишь в использовании метода, а не его публикации.) Лаплас опубликовал свой основной труд по теории вероятностей в 1812 г., посвятив его «великому Наполеону». На протяжении всей четвертой главы его книги излагается
4. ПАРАДОКС МЕТОДА НАИМЕНЬШИХ КВАДРАТОВ 107
исчисление ошибок. С того времени метод наименьших квадратов развил­ся в новый раздел математики. Возможности метода порой переоценивают и часто используют тогда, когда другие методы были бы более подходящи­ми. На эту проблему обращал внимание еще Коши (Comptes Rendus, 1853) во время «дебатов» с Бьенеме (в ходе диспута Коши использовал плотность
2
вероятности 1/(π(1 + x
), названную позднее его именем, хотя он и не был
первым ученым, применившим «плотность Коши»).
б) Парадокс
Пусть ae
b|xμ|
— плотность распределения наших наблюдений, под­верженных случайным ошибкам измерений. Постоянные a и b известны, а μ нужно оценить. Проведем независимые наблюдения X
1,X2
, ..., Xn.
По методу наименьших квадратов μ, следует оценить величиной μ которая минимизирует сумму
(X
μ)2+(X2− μ)2+ ...+(Xn− μ)2.
1
Легко посчитать, что эта сумма принимает наименьшее значение, когда μ есть среднее арифметическое результатов наблюдений
μ =(X
Однако если нам нужна оценка
+ X2+ ...+ Xn)n.
1
μ, для которой максимальна вероятность
(точнее, плотность вероятности) того, что n наблюдений будут именно
X
, ..., Xn,т.е.μ максимизирует функцию
1,X2
b|X1−μ|+...+|Xn−μ|
n
a
e
или, что эквивалентно,
μ минимизирует
|X
− μ| + |X2− μ| + ...+ |Xn− μ|,
1
то мы приходим к противоречию, так как сумма квадратов и сумма абсо­лютных величин не достигают минимума при одном и том же значении μ, т. е. оценки μ и
μ различны. Какая из них лучше?
в) Объяснение парадокса
Если ошибки измерения нормально распределены (т. е. если их плот-
ность вероятности имеет вид ae
b(xμ)
2
), то указанного выше противоречия
108 ГЛАВА II
не будет, так как μ максимизирует
b(X1−μ)2+...+(Xn−μ)
n
a
e
2
.
В методе наименьших квадратов Гаусс исходил из предположения о нор­мальном распределении ошибок, что встречается на практике чаще всего. Однако, когда известно, что распределение ошибок отлично от нормально­го, использование метода наименьших квадратов не всегда выгодно. В ука­занном выше парадоксе применение оценки
μ более оправдано (см. также
предыдущий раздел).
Используя стандартные понятия математической статистики, пара­докс можно кратко сформулировать следующим образом: оценка по ме­тоду наименьших квадратов не всегда совпадает с оценкой максимально­го правдоподобия (об оценках максимального правдоподобия см. разд. 8). Действительно, если f (x) — положительная плотность, полунепрерывная снизу в точке x =0; f (x θ) — плотность распределения измерений
+ X2+ ...+ Xn)n есть оценка максимального правдоподобия па-
и (X
1
раметра θ для n =2, 3,тоf(x) является плотностью нормального рас- пределения с нулевым средним. Это — закон Гаусса об ошибках, который можно доказать следующим образом: если предположить для простоты,
что существует производная f
при θ
т. е. (обозначая Δ
X,то
= Xi− X) из равенства
i
n
, и произведение
n
f
(X
X)=0,
i
f
i=1
n
Δi=0 вытекает
i=1
i=1
что возможно при n =2, 3 (если отношение f
f
когда
(x)=cx;откудаследует,чтоf = de
f
n
f(Xi−θ) максимально
i=1
f
)=0,
i
f
/f измеримо) только тогда,
2
cx
,гдеc и d —положи-
тельные числа (в противном случае функция f не была бы плотностью). Таким образом, оценка параметра сдвига по методу наименьших квадратов совпадает с оценкой максимального правдоподобия только для нормальных распределений.
г) Замечание
5. ПАРАДОКСЫ КОРРЕЛЯЦИИ 109
Арифметическое среднее μ =
X и медиана μ являются одними из немногих «простых» оценок максимального правдоподобия параметра сдвига μ,имеющихвид
n
1
X
где X i =1, 2, ..., n,
L =
i=1
 ...  X
2
n
ai=1. В статье, которая готовится к публикации, мы
i=1
есть упорядоченная выборка и ai 0,
n
aiX
,
i
(с З.Буцоличем) доказываем, что если L отлично от арифметического сред­него
X,тонеболеедвухaiмогут быть отличны от 0. Если два коэффици-
ента a
отличны от нуля, то это либо aan, и в этом случае элементы вы-
i
борки равномерно распределены на некотором интервале, либо ненулевыми
и a
являются два соседних коэффициента a является лишь один из коэффициентов a
i
i
когда элементы выборки имеют показательное распределение, тогда a
(L = X
).
1
. Возможно, что ненулевым
i+1
, например, когда L — медиана или
=1
1
д) Литература
Berkson J. «Estimation by least squares and by maximum likelihood», Proc.
3rd Berkeley Symp. on Math. Statist, and Prob., 1, 1–11 (1956).
Bloomfield P.B., Steiger W. L. Applications of Least Absolute Deviations,
Biskh¨auser Verlag, Basel-Boston-Stuttgart (1983).
Harter H. L. «The Method of least squares and some alternatives», Part. I–V. Internat.
Statist. Rev. (1974–1975).
Линник Ю. В. Метод наименьших квадратов и основы математико-статистиче-
ской теории обработки наблюдений, изд. 2-е. — М.: Физматгиз, 1962.
Sheynin О. В. «С.F. Gauss and the theory of errors», Archive for History of Exact
Sciences, 19, 21–72 (1979).
Stigler S.M. «Cauchy and the witch of Agnesi», Biomelrika, 61, 375–380 (1974).
5. Парадоксы корреляции
а) История парадокса
К последней трети прошлого века некоторые науки (например, моле-
кулярная физика) достигли такого уровня развития, что стало необходимым
110 ГЛАВА II
использование в них теории вероятностей и математической статистики. В 1859 г. книга Дарвина произвела революцию в биологии, и вскоре после этого двоюродный брат Дарвина Фрэнсис Гальтон заложил основы генети- ки человека. (Исследования Менделя по генетике были заново «открыты» лишь на рубеже веков; слово «генетика» употребляется только с 1905 г., но результаты Гальтона привлекли всеобщее внимание уже в прошлом веке.) Гальтон и его ученики (особенно Карл Пирсон) ввели такие важные понятия, как корреляция и регрессия, которые стали основными понятиями в теории вероятностей и математической статистике (а также в связанных с ними науках). Вес и рост человека, естественно, тесно связаны между собой, но они не определяют друг друга однозначно. Корреляция выражает эту связь одним числом, абсолютная величина которого не превосходит 1. Для двух случайных величин X и Y корреляция определяется следующим образом. Пусть E
и Dx, EDyобозначают математическое ожидание и стандарт-
x
ное отклонение X и Y соответственно. Тогда коэффициент корреляции (или кратко: корреляция) для X и Y определяется формулой
r = r(X, Y )=
E(X E
)(Y Ey)
x
DxD
y
.
Абсолютное значение корреляции максимально (т.е. равно 1), когда меж­ду X и Y существует линейная зависимость, т. е. Y = aX + b (где a =0). Если X и Y независимы (и их дисперсии конечны), то их корреляция рав­на 0, другими словами, они некоррелированы. В математической статисти­ке оценкой для корреляции r, как правило, является выборочный коэффи­циент корреляции, который строится по независимой выборке (X
(X
), ..., (Xn,Yn) следующим образом:
2,Y2
r =
n
(Xi− X)(Yi− Y )
i=1
n
(Xi− X)
i=1
2
i=1
n
(Yi− Y )
.
2
1,Y1
),
В ряде случаев r хорошо характеризует связь между X и Y ,ноуженарубе­же веков вычислялись зависимости, лишенные смысла; например, корреля­ция между числом гнезд аистов и числом младенцев. Понятие корреляции постепенно мистифицировалось, и некоторые «внутренние» (вообще гово­ря, случайные) связи стали считать существующими, если была велика кор­реляция (т. е. близка по абсолютной величине к 1). Вот почему возникли со­вершенно абсурдные результаты, и это чуть не дискредитировало всю стати­стику. Как правило, игнорировался тот факт, что большая корреляция для X
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]