Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Парадоксы в теории вероятностей и математической статистике

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
5. ПАРАДОКСЫ КОРРЕЛЯЦИИ 111
и Y может быть результатом влияния какой-то третьей величины. Например, в Англии и Уэльсе заметили, что с увеличением числа радиослушателей возрастало число сумасшедших и умственно отсталых людей. Однако такая интерпретация совершенно ошибочна, так как нельзя психически заболеть оттого, что слушаешь радио. Дело лишь в том, что с течением времени рас­тет и число радиослушателей, и число случаев психических заболеваний, но между ними нет никакой причинной зависимости. К сожалению, неверные толкования не всегда столь очевидны, например в технических или экономи­ческих приложениях. Сравнение вероисповедания и роста людей дает еще один пример надуманной зависимости, согласно которой при движении от Шотландии к Сицилии доля католиков в населении постепенно возрастает и в то же время средний рост людей убывает. Однако какая-либо причин­ная связь здесь совершенно невозможна. (В фашистской расовой теории еще более нелепые идеи провозглашались здравыми и даже научными.) Рассмотрим лишь некоторые из существующих парадоксов корреляции.
б) Парадоксы
(i) Пусть случайная величина X равномерно распределена на интерва­ле (1, 1) и Y = |X |. Очевидно, что между X и Y существует тесная связь, однако их корреляция r(X, Y )=0. (Корреляция для X и Y = |X| всегда равна 0, когда X — случайная величина с конечной дисперсией и симмет­ричным относительно 0 распределением.)
(ii) Пусть величины X те в n различных моментов времени и Y
, ..., Xnобозначают температуру в комна-
1,X2
, ..., Yn—количествотоплива,
1,Y2
использованное для обогрева в те же моменты времени (точнее, за данный промежуток времени; например, в течение часа до рассматриваемого мо­мента). Логично считать, что, чем больше топлива использовано, тем теплее будет в комнате. Это означает, что корреляция для X и Y строго положи­тельна. Однако корреляция может оказаться отрицательной, что можно было бы интерпретировать так: чем больше топим, тем холоднее становится.
(iii) Пусть случайный вектор (X, Y ) распределен нормально, т. е. его плотность имеет вид
f(x, y)=
2πDxD
y
1
1 r
exp
2
2r(X − E
2(1 r2)
1
)(Y Ey)
x
DxD

y
X E
D
x
+
x
2
Y E
D
y
2
y
.
112 ГЛАВА II
где Ex, Dx, EDy— математические ожидания и дисперсии величин X и Y r — их корреляция. Предположим, что абсолютная величина корре­ляции строго меньше 1. При неизвестной корреляции r мы можем оценить ее через r, используя n элементов выборки. Если E лесообразно в формуле для r заменить Таким путем получим новую оценку формации (а именно, знание величин E что дисперсия у
r меньше, чем у r.ОднакоА. Стюарт вычислил, что
X и Y соответственно на Exи Ey.
r.Посколькуr использует больше ин-
и Ey), можно было бы ожидать,
x
и Eyизвестны, то це-
x
D
2
(f)=
1
(1 r
n
2)2
, тогда как D2(r)=
1
(1 + r
n
2
);
таким образом, последняя дисперсия больше.
в) Объяснение парадоксов
(i) Если X и Y независимы, то r(X, Y )=0, но обратное утвержде- ние неверно. Некоррелированные случайные величины могут быть сильно зависимы, как в указанном выше примере, когда Y = |X |. Поэтому «некор­релированность» не следует понимать как независимость. С другой сторо­ны, можно доказать, что если X и Y некоррелированы и x
<Y <y2, то, каковы бы ни были числа x1<x2и y1<y2, величины X
y
1
<X<x2,
1
и Y независимы.
(ii) Нельзя забывать о влиянии температуры вне комнаты!
Корреляции часто получаются совершенно невероятными, потому что вычисляемый коэффициент корреляции для двух случайных величин ис­кажается третьей «извне влияющей величиной». Как раз для того, чтобы избежать этих помех, было введено понятие частной корреляции. Если кор- реляция для X и Y вычисляется только после того, как влияние величины Z ликвидировано, то результат перестает быть парадоксальным. Пусть r
, r
12
13
и r23обозначают корреляции r(X, Y ), r(X, Z) и r(Y, Z) соответственно. Тогда частная корреляция для X и Y без влияния Z равняется
r
r13r
12
(1 r
2
)(1 r
13
23
.
2
)
23
В частном случае, когда r падает с корреляцией r
= r23=0, частная корреляция для X и Y сов-
13
.Когдаr12, r13, r23неизвестны, их можно оценить
12
по выборке аналогично тому, как это происходило для r.Спомощьюэтих оценок получим оценку коэффициента частной корреляции.
5. ПАРАДОКСЫ КОРРЕЛЯЦИИ 113
Рис. 9. Рассмотрим случайные величины X, Y и Z как векторы. Тогда корреляция для случайных величин X и Y равна косинусу угла между векторами X и Y ,аих частная корреляция — косинусу угла между проекциями этих векторов на плоскость, перпендикулярную к вектору Z.
(iii) Парадокс Стюарта можно рассматривать с разных точек зрения. Главное заключается в том, что r и для r,т.е.тождестваE(r) r и E(
r не являются несмещенными оценками
r) r неверны, поэтому нецелесо-
образно считать лучшей ту оценку, у которой дисперсия меньше. В то же время, обе оценки r и
r смещены несильно (они являются асимптотиче­ски несмещенными), следовательно, для объяснения парадокса требуется дополнительный анализ. (См. замечания ниже и статью Стюарта.)
г) Замечания
(i) Смещение оценки r (в случае двумерного нормального распределе-
ния) равно
2
1
где o(n
E(r r)=
1
) обозначает выражение, которое, будучи умноженным на n,все
r
n
+ o(n
1
),
же сходится к 0. Таким образом, смещение достаточно быстро стремит­ся к 0 (при увеличении объема выборки n). С другой стороны, интерес­но отметить, что arcsin r есть несмещенная оценка для arcsinr,иес- ли Eg(r)= Eg(r)для некоторой функции g, не зависящей от n,
114 ГЛАВА II
то g(r)=a · arcsin r + b,гдеa, b — произвольные постоянные. В 1958 г. И. Олкин и Дж. Пратт доказали, что если оценка коэффициента корреля­ции r явным образом зависит от n, то можно указать несмещенную оценку для r, а именно
r
= rF
n − 2
1
1
,
,
2
2
2
, 1 − r
2
,
где F — гипергеометрическая функция, определяемая формулой
F (x, a, b, c)=1+
a(a +1)...(a + k 1)b(b +1)...(b + k 1)
k=1
k!c(c +1)...(c + k 1)
k
,
x
где a, b, c (c =0, −1, −2, ...) являются параметрами. А среди несмещен- ных оценок уже следует предпочесть те, у которых дисперсия минимальна.
Можно показать, что оценка r
не только является несмещенной, но и имеет наименьшую дисперсию. Однако для практических применений оценка r достаточно сложна, поэтому рекомендуется использовать ее аппроксима-
цию r1+
2(n 4)
1 r
2
.
(ii) Следующий факт не является парадоксом, тем не менее удивитель­но, что при выборе наугад m чисел из множества 1, 2, ...,nвыборка без возвращения, т.е. число равновозможных исходов равно

n
m
коэффици­ент корреляции для наименьшего и наибольшего среди выбранных чисел равен 1/m, т. е. он не зависит от n (m =1, 2, ..., n 1). Более того, ес- ли X
, ..., Xmобозначают возрастающую последовательность из m
1,X2
выбранных значений, то
r(X
i,Xj
)=
i(m +1j) j(m +1i)
,
что также не зависит от n.
[Следующий результат принадлежит Т. Мори. Возьмем выборку с воз-
вращением объема n из множества 1, 2, ..., m+1иобозначимчерезY
i
число элементов выборки, величина которых не больше, чем i.Тогда r(Y Если Z
)=r(Xi,Xj).] Другой задачей похожего типа является следующая.
i,Yj
Z2 ...  Zmесть возрастающая последовательность незави-
1
симых равномерно распределенных случайных величин («упорядоченная выборка»), то r(Z менить любым другим распределением, для которого r(Z
)=r(Xi,Xj); если равномерное распределение за-
i,Zj
) существует,
i,Zj
5. ПАРАДОКСЫ КОРРЕЛЯЦИИ 115
то r(Zi,Zj) r(Xi,Xj), т. е. указанное свойство является экстремальным свойством равномерных распределений (см. статью Мори, Секея). В дей­ствительности можно доказать больше. Пусть максимальная корреляция для двух случайных величин U и V определяется как sup
rf(U ),g(V ),
f, g
где f и g пробегают множество интегрируемых в квадрате действительных функций от U и V соответственно:
max corr (U, V )=sup
rf(U ),g(V ).
f, g
Используя это обозначение, можно доказать, что
max corr (Z
)=r(Xi,Xj).
i,Zj
Равенство следует из того факта, что max corr (U, V )=r(U, V ),когда регрессия U на V (определение регрессии см. в следующем разделе) и ре­грессия V на U линейны (и не равны тождественно-постоянной). Это как раз тот случай, когда коэффициент корреляции является хорошей мерой близости.
(iii) Для случайных величин, имеющих полиномиальное распреде­ление, корреляция координат всегда отрицательна: для i-ой и j-ой ком­понент она равна отрицательному значению корня квадратного из
pj)/[(1 pi)(1 pj)]. В случае рулетки мы имеем триномиальную
(p
i
случайную величину, для которой вероятности выигрыша как красного, так и черного цветов есть r = b =18/36. В этом случае корреляция чис- ла запусков шарика, закончившихся выигрышем красного цвета, и числа запусков, при которых выигрыш выпал на черный цвет, приблизительно равна 0,9. Если число запусков N случайно, то коэффициент корреляции равен rb[D(N ) E(N )] и легко может оказаться положительным. В слу­чае, когда N имеет распределение Пуассона, он равен 0. (Подробности см. в книге J.Pitman: Probability, Springer, 1993.)
(iv) Коррелированные случайные величины не всегда являются избы­точными, см. Hamilton D. The American Statistician, 41, 1987, pp. 129–132. См. также The Amer. Statist. 47, 1993, рр. 256–258.
д) Литература
Kendal M.G., Stuart A. The Advanced Theory of Statistics, Vol. 2, Griffin, London,
1961. [Имеется перевод: Кендалл М.Дж., Стьюарт А. Статистические выводы и свя­зи. — М.: Наука, 1973.]
116 ГЛАВА II
Mori Т.F., Sz´ekely G. J. «An extremal property of rectangular distributions», Statistics and Probability Letters, 3, 107–109 (1985).
Olkin I., Pratt J. W. «Unbiased estimation of certain correlation coefficients», Annals of Math. Statist., 29, 201–211 (1958).
Stuart A. «A paradox in statistical estimation», Biometrika, 42, 527–529 (1955).
6. Парадоксы регрессии
а) История парадоксов
Рис. 10. Линия регрессии Гальтона.
Коэффициент корреляции описывает зависимость между двумя случай­ными величинами одним числом, а регрессия выражает эту зависимость в виде функционального соотношения и поэтому дает более полную ин­формацию. Например, регрессией является средний вес тела человека как функция от его роста. Понятие «регрессии» ввел Гальтон, который в конце
6. ПАРАДОКСЫ РЕГРЕССИИ 117
прошлого века сравнивал рост родителей с ростом их детей. Он обнару­жил, что рост детей у высоких (или низких) родителей обычно выше (или ниже) среднего, но не совпадает с ростом родителей. Линия, показыва­ющая, в какой мере рост (и другие характеристики, к которым мы позже вернемся) регрессируют (возобновляются) в среднем в последующих по­колениях, была названа Гальтоном линией регрессии. Позднее регрессией стали называть любую функциональную зависимость между случайными величинами. Вначале регрессионный анализ применялся в биологии и важ­нейшим научным журналом, в котором освещалась эта тема, был журнал «Биометрика» («Biometrika»), выходящий с октября 1901 г. Между 1920 и 1930 гг. большое значение приобрело использование регрессионного ана­лиза в экономике и возникла новая область науки: эконометрика (термин, принадлежащий Р. Фришу (1926), которому позднее была присуждена Нобе- левская премия) — со своим журналом «Эконометрика» («Econometrika»), впервые вышедшим в 1933 г. От изучения частных регрессионных задач исследователи постепенно перешли к регрессионному анализу структуры, присущей глобальным экономическим системам (Дж.Кейнс, Я.Тинберген и другие, например Р. Кле й н, которому в 1980 г. присуждена Нобелевская премия по экономике). Журнал «Технометрика» («Technpmetrics») публику- ется с 1959 г. и в основном посвящен техническим приложениям. Регресси­онный анализ величины X, определяемой по другой величине Y ,когдаX измерить трудно, а Y — достаточно легко, весьма важен. В настоящее вре­мя регрессионный анализ используется практически во всех областях на­уки, что само по себе неплохо, но, к сожалению, регрессионный анализ иногда является одним из главных средств для достижения «громких на­учных успехов», для проведения небрежных исследований и замазывания (научных) проблем. Регрессия никогда не подменяет научных концепций и теоретических обоснований, хотя и облегчает их поиск.
б) Парадоксы
Предположим, что зависимость двух величин выражается функцией следующего вида: y = f(x; a где неизвестны только параметры a
, ..., am), (например, y = a1x + a2),
1,a2
, ..., am(а тип функции изве-
1,a2
стен, например линейный, квадратичный и т.д.). Если мы можем изме­рить значения y только со случайными ошибками наблюдений, т.е. вме-
= f(xi; a1,a2, ..., am) мы наблюдаем значения Yi, подверженные
сто y
i
ошибкам, то, согласно методу наименьших квадратов, оценки неизвестных
118 ГЛАВА II
параметров aiминимизируют сумму квадратов
n
(i) Если f (x)=e рует сумму
f (xi; a1,a2, ..., am)
Y
i
i=1
ax
, то оценка параметра a соответственно минимизи-
n
i=1
(Yi− e
ax
i
)2.
2
.
В этом случае задача вычисления регрессионной кривой f обычно упроща­ется, если вычислить логарифм от обоих членов разности, стоящих в скоб­ках, и минимизировать величину
n
(ln Yi− axi)2,
i=1
что нетрудно сделать, находя минимум квадратичного многочлена. Однако эти два подхода к минимизации дают разные оценки. Какой выход из этой парадоксальной ситуации?
(ii) Предположим, что тип функции f можно выбрать различными спо-
—этомногочлен,аf2— экспоненциальная функция.
1
Кажется естественным предпочесть тот тип, для которого указанная выше сумма квадратов меньше (при оптимальном выборе параметров). Хотя это­му принципу часто следуют на практике, обычно он не оправдан (иногда следует установить хотя бы теоретическую возможность такого выбора).
(iii) Пусть y = ax есть теоретическая линия регрессии и Y где ε
(i =1, 2, ..., n) являются независимыми нормально распределен-
i
ными ошибками с математическим ожиданием 0 и дисперсией D
= axi+ εi,
1
2
(εi)=cy
(c — известная постоянная). Теперь предположим, что наблюдения идеально согласуются с линией регрессии, т. е. Y
n
= a0xiдля некоторого a
i
(Yi− a0xi)2=0.
i=1
Тогда оценкой параметра a по методу наименьших квадратов будет a
,но,
0
как ни парадоксально, она не является «лучшей» оценкой (в смысле макси­мального правдоподобия, определение см. в парадоксе 8).
6. ПАРАДОКСЫ РЕГРЕССИИ 119
в) Объяснение парадоксов
(i) Методу наименьших квадратов, несомненно, отвечает первая сумма, однако полезно разобраться не только в букве, но и в духе метода наимень­ших квадратов, сутью которого является минимизация суммарного влияния ошибок. Эта цель может быть достигнута путем минимизации суммы квад­ратов
n
i=1
h(Y
) hf(xi; a1,a2, ..., am)
i

2
,
где h(x) — монотонно возрастающая функция (например, h(x)=lnx). Хороший выбор h «линеаризует» задачу, т.е. делает выражение для
hf(x
; a1,a2, ..., am)линейной функцией от неизвестных парамет-
i
ров a
(в этом случае легко находятся оптимальные значения для ai). Если
i
мы хотим определить неизвестные параметры, следуя духу метода наимень­ших квадратов, то, очевидно, лучше выбрать второй способ. Однако иногда нужно минимизировать все же исходную сумму, например, когда известно, что результатом ошибок являются финансовые потери, пропорциональные этой сумме, хотя такая возможность совершенно нетипична.
(ii) Первая часть вопроса очень проста: сумма квадратов может оказать­ся меньше для f то сумма квадратов становится меньше при выборе f
,чемдляf2, но если взять чуть больше элементов выборки,
1
. Математическая ста-
2
тистика старается избегать подобных неустойчивых ситуаций. Существует несколько методов принятия решений, которые применимы в ряде случа­ев и указывают выбор с заданной надежностью, например 99 % (т.е. ес­ли функция f выбор f
1
отвергнута, то вероятность того, что правильным являлся
1
, равна 1 %). В книге Плакетта обсуждается, например, метод, позволяющий определить правильную степень регрессионного многочле­на (в случае независимых нормально распределенных ошибок наблюде­ний). К сожалению, многие из типичных задач по выбору вида регрессии невозможно решить должным образом. Например, правило Вебера –Фехне- ра утверждает, что между раздражителем и ощущением существует лога­рифмическая зависимость, в частности между объемом и интенсивностью звука или между частотой и высотой звука. В настоящее время это правило теоретически и практически рассматривается лишь как первое приближе­ние, потому что кажется, что ближе к истине является степенная зависи­мость. (В действительности, проблема сложнее, поскольку ощущение гром­кости зависит не только от интенсивности, но и от частоты и спектра звука, а также от продолжительности эксперимента.)
120 ГЛАВА II
(iii) Оценка a = a0не подходит, так как тогда оценка для D2(εi) равня­лась бы нулю, что противоречит условию D будет оценка (максимального правдоподобия)
2
(εi)=cy. Более оправданной

1+4c2− 1(2c2)a0.
г) Замечания
(i) Очень типичной, в частности в фармакологии и при изучении рын­ка сбыта, является логит-пробит-альтернатива. В соответствии с методом наименьших квадратов в логит-анализе с данными согласуется функция
Y = e
a1+a2x
(1 + e
a1+a2x
),
минимизирующая сумму
n
i=1
Y
i
1 Y
a1− a2x
i
ln
2
.
i
[Здесь преобразование, которое линеаризует задачу, дается функцией
h(x)=lnx/(1 − x).] В пробит-анализе с данными согласуется функ-
ция нормального распределения (при соответствующем выборе парамет­ров). Формы кривых этих двух типов могут быть очень похожи, поэтому не всегда легко решить, какую из них следует выбрать; в этом случае большую помощь может оказать теоретическое обоснование модели.
(ii) С увеличением числа параметров регрессии мы, очевидно, получим лучшее согласие наблюденных значений с моделью, однако при этом воз­растут дисперсии оценок параметров, так что оценки станут менее устой­чивыми и менее надежными.
(iii) «Парадокс двух регрессий» см. в статье Калмана (1982). В этой статье (вышедшей вслед за пионерскими работами Гини (1921) и Фриша (1934)) предполагается, что у обеих величин есть случайные (аддитивные) ошибки: X = x + x и Y = y + y (x, y являются ошибками или «шу- мом»). Предполагая, что y = ax, можно дать «беспристрастную» оценку параметра a лишь в виде отрезка a
a a2. Здесь одним из кон-
1
цов отрезка является классический коэффициент регрессии (когда ищут регрессию y по x), а другим концом — обратный коэффициент регрес­сии (когда ищут регрессию x по y).Выборлюбогоизконцовотрезкаa или a2в качестве оценки означает, что предполагается отсутствие шума у регрессионной переменной. (Таким путем разрешается «парадокс двух регрессий».)
1
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]