Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Парадоксы в теории вероятностей и математической статистике
.pdf
5. ПАРАДОКСЫ КОРРЕЛЯЦИИ 111
и Y может быть результатом влияния какой-то третьей величины. Например,
в Англии и Уэльсе заметили, что с увеличением числа радиослушателей
возрастало число сумасшедших и умственно отсталых людей. Однако такая
интерпретация совершенно ошибочна, так как нельзя психически заболеть
оттого, что слушаешь радио. Дело лишь в том, что с течением времени растет и число радиослушателей, и число случаев психических заболеваний, но
между ними нет никакой причинной зависимости. К сожалению, неверные
толкования не всегда столь очевидны, например в технических или экономических приложениях. Сравнение вероисповедания и роста людей дает еще
один пример надуманной зависимости, согласно которой при движении от
Шотландии к Сицилии доля католиков в населении постепенно возрастает
и в то же время средний рост людей убывает. Однако какая-либо причинная связь здесь совершенно невозможна. (В фашистской расовой теории
еще более нелепые идеи провозглашались здравыми и даже научными.)
Рассмотрим лишь некоторые из существующих парадоксов корреляции.
б) Парадоксы
(i) Пусть случайная величина X равномерно распределена на интервале (−1, 1) и Y = |X |. Очевидно, что между X и Y существует тесная связь,
однако их корреляция r(X, Y )=0. (Корреляция для X и Y = |X| всегда
равна 0, когда X — случайная величина с конечной дисперсией и симметричным относительно 0 распределением.)
(ii) Пусть величины X
те в n различных моментов времени и Y
, ..., Xnобозначают температуру в комна-
1,X2
, ..., Yn—количествотоплива,
1,Y2
использованное для обогрева в те же моменты времени (точнее, за данный
промежуток времени; например, в течение часа до рассматриваемого момента). Логично считать, что, чем больше топлива использовано, тем теплее
будет в комнате. Это означает, что корреляция для X и Y строго положительна. Однако корреляция может оказаться отрицательной, что можно было
бы интерпретировать так: чем больше топим, тем холоднее становится.
(iii) Пусть случайный вектор (X, Y ) распределен нормально, т. е. его
плотность имеет вид
f(x, y)=
2πDxD
y
1
√
1 − r
exp
2
2r(X − E
−
2(1 − r2)
1
)(Y − Ey)
x
DxD
y
X −E
D
x
+
x
2
−
Y − E
D
y
2
y
.

112 ГЛАВА II
где Ex, Dx, Eyи Dy— математические ожидания и дисперсии величин X
и Y ,аr — их корреляция. Предположим, что абсолютная величина корреляции строго меньше 1. При неизвестной корреляции r мы можем оценить
ее через r, используя n элементов выборки. Если E
лесообразно в формуле для r заменить
Таким путем получим новую оценку
формации (а именно, знание величин E
что дисперсия у
r меньше, чем у r.ОднакоА. Стюарт вычислил, что
X и Y соответственно на Exи Ey.
r.Посколькуr использует больше ин-
и Ey), можно было бы ожидать,
x
и Eyизвестны, то це-
x
D
2
(f)=
1
(1 − r
n
2)2
, тогда как D2(r)=
1
(1 + r
n
2
);
таким образом, последняя дисперсия больше.
в) Объяснение парадоксов
(i) Если X и Y независимы, то r(X, Y )=0, но обратное утвержде-
ние неверно. Некоррелированные случайные величины могут быть сильно
зависимы, как в указанном выше примере, когда Y = |X |. Поэтому «некоррелированность» не следует понимать как независимость. С другой стороны, можно доказать, что если X и Y некоррелированы и x
<Y <y2, то, каковы бы ни были числа x1<x2и y1<y2, величины X
y
1
<X<x2,
1
и Y независимы.
(ii) Нельзя забывать о влиянии температуры вне комнаты!
Корреляции часто получаются совершенно невероятными, потому что
вычисляемый коэффициент корреляции для двух случайных величин искажается третьей «извне влияющей величиной». Как раз для того, чтобы
избежать этих помех, было введено понятие частной корреляции. Если кор-
реляция для X и Y вычисляется только после того, как влияние величины Z
ликвидировано, то результат перестает быть парадоксальным. Пусть r
, r
12
13
и r23обозначают корреляции r(X, Y ), r(X, Z) и r(Y, Z) соответственно.
Тогда частная корреляция для X и Y без влияния Z равняется
r
− r13r
12
(1 − r
2
)(1 − r
13
23
.
2
)
23
В частном случае, когда r
падает с корреляцией r
= r23=0, частная корреляция для X и Y сов-
13
.Когдаr12, r13, r23неизвестны, их можно оценить
12
по выборке аналогично тому, как это происходило для r.Спомощьюэтих
оценок получим оценку коэффициента частной корреляции.

5. ПАРАДОКСЫ КОРРЕЛЯЦИИ 113
Рис. 9. Рассмотрим случайные величины X, Y и Z как векторы. Тогда корреляция
для случайных величин X и Y равна косинусу угла между векторами X и Y ,аих
частная корреляция — косинусу угла между проекциями этих векторов на плоскость,
перпендикулярную к вектору Z.
(iii) Парадокс Стюарта можно рассматривать с разных точек зрения.
Главное заключается в том, что r и
для r,т.е.тождестваE(r) ≡ r и E(
r не являются несмещенными оценками
r) ≡ r неверны, поэтому нецелесо-
образно считать лучшей ту оценку, у которой дисперсия меньше. В то же
время, обе оценки r и
r смещены несильно (они являются асимптотически несмещенными), следовательно, для объяснения парадокса требуется
дополнительный анализ. (См. замечания ниже и статью Стюарта.)
г) Замечания
(i) Смещение оценки r (в случае двумерного нормального распределе-
ния) равно
2
− 1
где o(n
E(r −r)=
−1
) обозначает выражение, которое, будучи умноженным на n,все
r
n
+ o(n
−1
),
же сходится к 0. Таким образом, смещение достаточно быстро стремится к 0 (при увеличении объема выборки n). С другой стороны, интересно отметить, что arcsin r есть несмещенная оценка для arcsinr,иес-
ли Eg(r)= Eg(r)для некоторой функции g, не зависящей от n,

114 ГЛАВА II
то g(r)=a · arcsin r + b,гдеa, b — произвольные постоянные. В 1958 г.
И. Олкин и Дж. Пратт доказали, что если оценка коэффициента корреляции r явным образом зависит от n, то можно указать несмещенную оценку
для r, а именно
r
∗
= rF
n − 2
1
1
,
,
2
2
2
, 1 − r
2
,
где F — гипергеометрическая функция, определяемая формулой
∞
F (x, a, b, c)=1+
a(a +1)...(a + k −1)b(b +1)...(b + k −1)
k=1
k!c(c +1)...(c + k − 1)
k
,
x
где a, b, c (c =0, −1, −2, ...) являются параметрами. А среди несмещен-
ных оценок уже следует предпочесть те, у которых дисперсия минимальна.
∗
Можно показать, что оценка r
не только является несмещенной, но и имеет
наименьшую дисперсию. Однако для практических применений оценка r
достаточно сложна, поэтому рекомендуется использовать ее аппроксима-
цию r1+
2(n − 4)
1 − r
2
.
(ii) Следующий факт не является парадоксом, тем не менее удивительно, что при выборе наугад m чисел из множества 1, 2, ...,nвыборка без
возвращения, т.е. число равновозможных исходов равно
n
m
коэффициент корреляции для наименьшего и наибольшего среди выбранных чисел
равен 1/m, т. е. он не зависит от n (m =1, 2, ..., n − 1). Более того, ес-
ли X
, ..., Xmобозначают возрастающую последовательность из m
1,X2
выбранных значений, то
r(X
i,Xj
)=
i(m +1− j)
j(m +1−i)
,
∗
что также не зависит от n.
[Следующий результат принадлежит Т. Мори. Возьмем выборку с воз-
вращением объема n из множества 1, 2, ..., m+1иобозначимчерезY
i
число элементов выборки, величина которых не больше, чем i.Тогда
r(Y
Если Z
)=r(Xi,Xj).] Другой задачей похожего типа является следующая.
i,Yj
Z2 ... Zmесть возрастающая последовательность незави-
1
симых равномерно распределенных случайных величин («упорядоченная
выборка»), то r(Z
менить любым другим распределением, для которого r(Z
)=r(Xi,Xj); если равномерное распределение за-
i,Zj
) существует,
i,Zj

5. ПАРАДОКСЫ КОРРЕЛЯЦИИ 115
то r(Zi,Zj) r(Xi,Xj), т. е. указанное свойство является экстремальным
свойством равномерных распределений (см. статью Мори, Секея). В действительности можно доказать больше. Пусть максимальная корреляция
для двух случайных величин U и V определяется как sup
rf(U ),g(V ),
f, g
где f и g пробегают множество интегрируемых в квадрате действительных
функций от U и V соответственно:
max corr (U, V )=sup
rf(U ),g(V ).
f, g
Используя это обозначение, можно доказать, что
max corr (Z
)=r(Xi,Xj).
i,Zj
Равенство следует из того факта, что max corr (U, V )=r(U, V ),когда
регрессия U на V (определение регрессии см. в следующем разделе) и регрессия V на U линейны (и не равны тождественно-постоянной). Это как
раз тот случай, когда коэффициент корреляции является хорошей мерой
близости.
(iii) Для случайных величин, имеющих полиномиальное распределение, корреляция координат всегда отрицательна: для i-ой и j-ой компонент она равна отрицательному значению корня квадратного из
− pj)/[(1 − pi)(1 − pj)]. В случае рулетки мы имеем триномиальную
(p
i
случайную величину, для которой вероятности выигрыша как красного, так
и черного цветов есть r = b =18/36. В этом случае корреляция чис-
ла запусков шарика, закончившихся выигрышем красного цвета, и числа
запусков, при которых выигрыш выпал на черный цвет, приблизительно
равна −0,9. Если число запусков N случайно, то коэффициент корреляции
равен rb[D(N ) − E(N )] и легко может оказаться положительным. В случае, когда N имеет распределение Пуассона, он равен 0. (Подробности см.
в книге J.Pitman: Probability, Springer, 1993.)
(iv) Коррелированные случайные величины не всегда являются избыточными, см. Hamilton D. The American Statistician, 41, 1987, pp. 129–132.
См. также The Amer. Statist. 47, 1993, рр. 256–258.
д) Литература
Kendal M.G., Stuart A. The Advanced Theory of Statistics, Vol. 2, Griffin, London,
1961. [Имеется перевод: Кендалл М.Дж., Стьюарт А. Статистические выводы и связи. — М.: Наука, 1973.]

116 ГЛАВА II
Mori Т.F., Sz´ekely G. J. «An extremal property of rectangular distributions»,
Statistics and Probability Letters, 3, 107–109 (1985).
Olkin I., Pratt J. W. «Unbiased estimation of certain correlation coefficients», Annals
of Math. Statist., 29, 201–211 (1958).
Stuart A. «A paradox in statistical estimation», Biometrika, 42, 527–529 (1955).
6. Парадоксы регрессии
а) История парадоксов
Рис. 10. Линия регрессии Гальтона.
Коэффициент корреляции описывает зависимость между двумя случайными величинами одним числом, а регрессия выражает эту зависимость
в виде функционального соотношения и поэтому дает более полную информацию. Например, регрессией является средний вес тела человека как
функция от его роста. Понятие «регрессии» ввел Гальтон, который в конце

6. ПАРАДОКСЫ РЕГРЕССИИ 117
прошлого века сравнивал рост родителей с ростом их детей. Он обнаружил, что рост детей у высоких (или низких) родителей обычно выше (или
ниже) среднего, но не совпадает с ростом родителей. Линия, показывающая, в какой мере рост (и другие характеристики, к которым мы позже
вернемся) регрессируют (возобновляются) в среднем в последующих поколениях, была названа Гальтоном линией регрессии. Позднее регрессией
стали называть любую функциональную зависимость между случайными
величинами. Вначале регрессионный анализ применялся в биологии и важнейшим научным журналом, в котором освещалась эта тема, был журнал
«Биометрика» («Biometrika»), выходящий с октября 1901 г. Между 1920
и 1930 гг. большое значение приобрело использование регрессионного анализа в экономике и возникла новая область науки: эконометрика (термин,
принадлежащий Р. Фришу (1926), которому позднее была присуждена Нобе-
левская премия) — со своим журналом «Эконометрика» («Econometrika»),
впервые вышедшим в 1933 г. От изучения частных регрессионных задач
исследователи постепенно перешли к регрессионному анализу структуры,
присущей глобальным экономическим системам (Дж.Кейнс, Я.Тинберген
и другие, например Р. Кле й н, которому в 1980 г. присуждена Нобелевская
премия по экономике). Журнал «Технометрика» («Technpmetrics») публику-
ется с 1959 г. и в основном посвящен техническим приложениям. Регрессионный анализ величины X, определяемой по другой величине Y ,когдаX
измерить трудно, а Y — достаточно легко, весьма важен. В настоящее время регрессионный анализ используется практически во всех областях науки, что само по себе неплохо, но, к сожалению, регрессионный анализ
иногда является одним из главных средств для достижения «громких научных успехов», для проведения небрежных исследований и замазывания
(научных) проблем. Регрессия никогда не подменяет научных концепций
и теоретических обоснований, хотя и облегчает их поиск.
б) Парадоксы
Предположим, что зависимость двух величин выражается функцией
следующего вида: y = f(x; a
где неизвестны только параметры a
, ..., am), (например, y = a1x + a2),
1,a2
, ..., am(а тип функции изве-
1,a2
стен, например линейный, квадратичный и т.д.). Если мы можем измерить значения y только со случайными ошибками наблюдений, т.е. вме-
= f(xi; a1,a2, ..., am) мы наблюдаем значения Yi, подверженные
сто y
i
ошибкам, то, согласно методу наименьших квадратов, оценки неизвестных

118 ГЛАВА II
параметров aiминимизируют сумму квадратов
n
(i) Если f (x)=e
рует сумму
− f (xi; a1,a2, ..., am)
Y
i
i=1
ax
, то оценка параметра a соответственно минимизи-
n
i=1
(Yi− e
ax
i
)2.
2
.
В этом случае задача вычисления регрессионной кривой f обычно упрощается, если вычислить логарифм от обоих членов разности, стоящих в скобках, и минимизировать величину
n
(ln Yi− axi)2,
i=1
что нетрудно сделать, находя минимум квадратичного многочлена. Однако
эти два подхода к минимизации дают разные оценки. Какой выход из этой
парадоксальной ситуации?
(ii) Предположим, что тип функции f можно выбрать различными спо-
—этомногочлен,аf2— экспоненциальная функция.
1
Кажется естественным предпочесть тот тип, для которого указанная выше
сумма квадратов меньше (при оптимальном выборе параметров). Хотя этому принципу часто следуют на практике, обычно он не оправдан (иногда
следует установить хотя бы теоретическую возможность такого выбора).
(iii) Пусть y = ax есть теоретическая линия регрессии и Y
где ε
(i =1, 2, ..., n) являются независимыми нормально распределен-
i
ными ошибками с математическим ожиданием 0 и дисперсией D
= axi+ εi,
1
2
(εi)=cy
(c — известная постоянная). Теперь предположим, что наблюдения идеально
согласуются с линией регрессии, т. е. Y
n
= a0xiдля некоторого a0и
i
(Yi− a0xi)2=0.
i=1
Тогда оценкой параметра a по методу наименьших квадратов будет a
,но,
0
как ни парадоксально, она не является «лучшей» оценкой (в смысле максимального правдоподобия, определение см. в парадоксе 8).

6. ПАРАДОКСЫ РЕГРЕССИИ 119
в) Объяснение парадоксов
(i) Методу наименьших квадратов, несомненно, отвечает первая сумма,
однако полезно разобраться не только в букве, но и в духе метода наименьших квадратов, сутью которого является минимизация суммарного влияния
ошибок. Эта цель может быть достигнута путем минимизации суммы квадратов
n
i=1
h(Y
) − hf(xi; a1,a2, ..., am)
i
2
,
где h(x) — монотонно возрастающая функция (например, h(x)=lnx).
Хороший выбор h «линеаризует» задачу, т.е. делает выражение для
hf(x
; a1,a2, ..., am)линейной функцией от неизвестных парамет-
i
ров a
(в этом случае легко находятся оптимальные значения для ai). Если
i
мы хотим определить неизвестные параметры, следуя духу метода наименьших квадратов, то, очевидно, лучше выбрать второй способ. Однако иногда
нужно минимизировать все же исходную сумму, например, когда известно,
что результатом ошибок являются финансовые потери, пропорциональные
этой сумме, хотя такая возможность совершенно нетипична.
(ii) Первая часть вопроса очень проста: сумма квадратов может оказаться меньше для f
то сумма квадратов становится меньше при выборе f
,чемдляf2, но если взять чуть больше элементов выборки,
1
. Математическая ста-
2
тистика старается избегать подобных неустойчивых ситуаций. Существует
несколько методов принятия решений, которые применимы в ряде случаев и указывают выбор с заданной надежностью, например 99 % (т.е. если функция f
выбор f
1
отвергнута, то вероятность того, что правильным являлся
1
, равна 1 %). В книге Плакетта обсуждается, например, метод,
позволяющий определить правильную степень регрессионного многочлена (в случае независимых нормально распределенных ошибок наблюдений). К сожалению, многие из типичных задач по выбору вида регрессии
невозможно решить должным образом. Например, правило Вебера –Фехне-
ра утверждает, что между раздражителем и ощущением существует логарифмическая зависимость, в частности между объемом и интенсивностью
звука или между частотой и высотой звука. В настоящее время это правило
теоретически и практически рассматривается лишь как первое приближение, потому что кажется, что ближе к истине является степенная зависимость. (В действительности, проблема сложнее, поскольку ощущение громкости зависит не только от интенсивности, но и от частоты и спектра звука,
а также от продолжительности эксперимента.)

120 ГЛАВА II
(iii) Оценка a = a0не подходит, так как тогда оценка для D2(εi) равнялась бы нулю, что противоречит условию D
будет оценка (максимального правдоподобия)
2
(εi)=cy. Более оправданной
√
1+4c2− 1(2c2)a0.
г) Замечания
(i) Очень типичной, в частности в фармакологии и при изучении рынка сбыта, является логит-пробит-альтернатива. В соответствии с методом
наименьших квадратов в логит-анализе с данными согласуется функция
Y = e
a1+a2x
(1 + e
a1+a2x
),
минимизирующая сумму
n
i=1
Y
i
1 − Y
− a1− a2x
i
ln
2
.
i
[Здесь преобразование, которое линеаризует задачу, дается функцией
h(x)=lnx/(1 − x).] В пробит-анализе с данными согласуется функ-
ция нормального распределения (при соответствующем выборе параметров). Формы кривых этих двух типов могут быть очень похожи, поэтому не
всегда легко решить, какую из них следует выбрать; в этом случае большую
помощь может оказать теоретическое обоснование модели.
(ii) С увеличением числа параметров регрессии мы, очевидно, получим
лучшее согласие наблюденных значений с моделью, однако при этом возрастут дисперсии оценок параметров, так что оценки станут менее устойчивыми и менее надежными.
(iii) «Парадокс двух регрессий» см. в статье Калмана (1982). В этой
статье (вышедшей вслед за пионерскими работами Гини (1921) и Фриша
(1934)) предполагается, что у обеих величин есть случайные (аддитивные)
ошибки: X = x + x и Y = y + y (x, y являются ошибками или «шу-
мом»). Предполагая, что y = ax, можно дать «беспристрастную» оценку
параметра a лишь в виде отрезка a
a a2. Здесь одним из кон-
1
цов отрезка является классический коэффициент регрессии (когда ищут
регрессию y по x), а другим концом — обратный коэффициент регрессии (когда ищут регрессию x по y).Выборлюбогоизконцовотрезкаa
или a2в качестве оценки означает, что предполагается отсутствие шума
у регрессионной переменной. (Таким путем разрешается «парадокс двух
регрессий».)
1
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
