Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Эконометрика. Парный регрессионный анализ. Практикум
.pdf
Выборочный коэффициент парной корреляции облада-
|
|
[0; 0,3)
Отсутствует
[0,3; 0,7)
Слабая
[0,7; 1)
Сильная
ет следующими свойствами:
1. –1 ≤ r
2. Если величина |r
x,y
≤ 1.
| близка к 1, то это свидетельствует о
x,y
близости зависимости между переменными X и Y к линейной.
3. Близость коэффициента корреляции r
к нулю гово-
x,y
рит о слабой линейной зависимости между переменными X
и Y. Однако в этом случае неверно делать вывод об отсутствии вообще какой-либо зависимости между переменными
X и Y. Между ними может быть тесная, даже функциональная, но нелинейная зависимость.
Если r
= 0, то говорят, что переменные X и Y не корре-
x,y
лированны, в противном случае — коррелированны. Если
> 0 — положительно коррелированны; если r
r
x,y
< 0 —
x,y
отрицательно коррелированны.
При исследовании тесноты линейной связи между переменными можно воспользоваться нестрогим критерием,
приведенным в табл. 2.4.
Таблица 2.4
r
x,y
Линейная зависимость
Критерий Стьюдента проверки значимости коэффициента корреляции. Известно, что выборочный коэффици-
ент корреляции r
ского коэффициента корреляции
— теоретические среднеквадратические (стандартные)
σ
Y
является точечной оценкой теоретиче-
x,y
(,)
=
. Здесь σX и
отклонения переменных X и Y соответственно, cov(X, Y) —
ковариация между переменными X и Y. Предположим, что
51

выполнены условия (I
1
26,6
707,56
2
27,2
739,84
3
19,4
376,36
4
22,5
506,25
5
22,5
506,25
6
24,1
580,81
7
20,7
428,49
8
20,1
404,01
9
28,3
800,89
10
30
900
: ρxy = 0 (коэффициент корреляции незначимо отлича-
за H
1
ется от нуля) при альтернативе H
)–(I4). Проверяется основная гипоте-
1
: ρxy ≠ 0 (коэффициент
2
корреляции значимо отличается от нуля). При верной ос-
новной гипотезе статистика
ние Стьюдента
T(n – 2). Поэтому можно поступить следую-
=
имеет распределе-
щим образом. По заданному уровню значимости α найти
квантиль t
(n – 2) распределения T(n – 2) и использовать
1–α/2
следующий критерий:
(
σ
, … , , , … ,
, |
=
, |
)
|
<
|
/
/
( 2),
( 2).
П
ример 2.5. Исследовать тесноту линейной связи меж-
ду располагаемым доходом и объемом потребления на
уровне значимости α = 0,05 по данным примера 2.1.
Решение. Вычислим выборочный коэффициент парной
корреляции между располагаемым доходом и объемом потребления. Напомним, что в примере 2.1 были рассчитаны:
= 26,72, = 23,827, = 647,471,
Вычислим
:
= 13,896.
52

11
25,4
645,16
12
19,1
364,81
13
22
484
14
23,2
538,24
15
26,3
691,69
Σ
400,8
8674,36
=
8674,36 = 578,291.
Тогда
= 578,291 23,827
По формуле (2.17)
:
= 10,581.
647,471 26,72 23,827
,
=
13,896 10,581
= 0,892.
Воспользуемся нестрогим критерием, приведенным в
табл. 2.4: значение 0,892 ∈ [0,7; 1), следовательно, между
располагаемым доходом и объемом потребления существует сильная линейная зависимость.
Воспользуемся критерием Стьюдента. Проверяется основная гипотеза H
Вычислим статистику t
: ρxy = 0 при альтернативе H2: ρxy ≠ 0.
1
:
r
,
=
,
= 7,137.
Проверяем условие |tr| < t
|
7,137
|
,/
(
15 2)=
1–α/2
(n – 2):
,
(13)
= 2,1604.
Следовательно, δ(X1, …, X15, Y1, …, Y15) = H2. Коэффициент
корреляции значимо отличается от нуля, делаем вывод о
наличии сильной линейной зависимости между располагаемым доходом и объемом потребления.
Дисперсионный анализ. Пусть имеется выборка из n
пар наблюдений над показателями X и Y: (X
(X
, Yn). Рассматривается линейная регрессионная модель
n
, Y1), (X2, Y2), …,
1
53

∗
Y = aX + b +ε, выборочное уравнение регрессии y
= a
∗
+ b
где a* и b* — МНК-оценки параметров a и b.
Коэффициентом детерминации называется величина
2
R
, определяемая по формуле:
= 1
, (2.18)
где ei — регрессионные остатки.
Основное дисперсионное тождество. Вариация (сумма
квадратов отклонений от средних) зависимой переменной
раскладывается на вариацию, обусловленную линейным
воздействием независимой переменной (т. е. уравнением
регрессии), и вариацию, обусловленную случайным возмущением, т. е. имеет место разложение
∗
,
)
)
)
+ (
; = (
=
.
)
(
В
ведем обозначения:
= (
= (
З
амечание 1. В некоторых источниках используется от-
= (
).
)
;
личные от введенных обозначений, а именно
(
)
; = (
=
М
ы надеемся, что читателя это не запутает.
)
=
Замечание 2. В силу справедливости основного диспер-
сионного тождества, коэффициент детерминации R
записать в виде:
(
)
.
)
(
=
.
2
можно
54

Замечание 3. Величина коэффициента детерминации R
показывает долю вариации (изменения) переменной Y,
«объясненную» или обусловленную уравнением регрессии.
Остальная часть вариации переменной Y «объясняется»
(обусловливается) случайными причинами.
Замечание 4. Коэффициент детерминации нужен для
оценки качества построенной модели. Для парной линейной
регрессионной модели коэффициент детерминации может
принимать значения только из отрезка [0, 1].
2
Чем ближе значение R
к 1, тем лучшим качеством обла-
дает построенное уравнение регрессии.
Пример 2.6. Вычислить коэффициент детерминации
для уравнения (2.10).
Решение. Воспользуемся формулой (2.18):
= 1
= 1
,
,
= 0,797.
Таким образом, 79,7 % вариации (изменения) переменной Y объяснено уравнением регрессии. Случайными причинами объясняется 20,3 % вариации переменной Y.
Замечание 5. Проводить оценку качества построенной
модели можно также и с помощью относительной ошибки
аппроксимации, которая рассчитывается по формуле
100 %. (2.19)
=
Чем меньше относительная ошибка аппроксимации, тем
лучшим качеством обладает построенная модель. Существенным недостатком относительной ошибки аппроксимации является чувствительность к параллельному переносу данных. Поэтому на практике при оценке качества построенной модели лучше опираться на коэффициент детерминации.
2
55

Пример 2.7. Вычислить относительную ошибку аппрок-
1
26,6
25,836
0,029
2
27,2
26,615
0,022
3
19,4
20,151
0,039
4
22,5
21,163
0,059
5
22,5
22,176
0,014
6
24,1
23,188
0,038
7
20,7
19,839
0,042
8
20,1
20,462
0,018
9
28,3
27,549
0,027
10
30
28,095
0,064
11
25,4
28,562
0,124
12
19,1
21,864
0,145
13
22
22,098
0,004
14
23,2
24,979
0,077
15
26,3
24,824
0,056
Σ
400,8
357,4
0,757
симации для уравнения (2.10).
Решение. Воспользуемся формулой (2.19). Для этого про-
ведем вспомогательные вычисления:
Тогда по формуле (2.19):
0,757 100 % = 5,044 %.
=
Критерий Фишера проверки адекватности постро-
енной модели. Предположим, что выполнены условия (I
). Проверяется основная гипотеза H1: a = 0 (данная гипо-
(I
4
теза свидетельствует в пользу неадекватности построенной
модели) при альтернативе H
: a ≠ 0 (данная гипотеза свиде-
2
тельствует в пользу адекватности построенной модели).
При верной основной гипотезе F-статистика (статистика
Фишера)
56
)–
1

()
=
(2.20)
имеет распределение Фишера с 1-й и (n – 2) степенями сво-
боды. Поэтому можно поступить следующим образом. По заданному уровню значимости α найти квантиль F
(1, n – 2)
1–α
распределения Фишера F(1, n – 2) и использовать следующий
критерий:
(
, …, , , …,
, <
=
,
)
(1, 2),
(1, 2).
Пример 2.8. Проверить адекватность модели (2.10) на
уровне значимости α = 0,05.
Решение. Проверяем основную гипотезу H
альтернативе H
: a ≠ 0. По формуле (2.20) вычислим стати-
2
: a = 0 при
1
стику Фишера (значение коэффициента детерминации R
вычислено в примере 2.6):
,()
=
(,)
= 50,93.
По таблице квантилей распределения Фишера определяем
(
1; 2)=
,
(
1; 15 2)=
(
1; 13)= 4,667.
,
Выполнено
(
= 50,93
Поэтому δ(X
, …, X15, Y1, …, Y15) = H2. На уровне значимости
1
1; 13)= 4,667,
,
α = 0,05 линейную модель признаем адекватной.
2
57

2.7. Проверка выполнения условий Гаусса–Маркова
Пусть имеется выборка из n пар наблюдений над показателями X и Y: (X
линейная регрессионная модель Y = aX + b + ε. По данным
наблюдениям найдено выборочное уравнение регрессии
∗
∗
y
= a
∗
+ b
, где a* и b* — МНК-оценки параметров a и b, рас-
считаны регрессионные остатки e
Отметим, что все основные утверждения регрессионного анализа основываются на предположении о том, что
справедливы условия Гаусса–Маркова (условия (I
Поэтому проверка гипотез о выполнении этих условий является одной из ключевых задач регрессионного анализа.
Условие (I
вводится для упрощения выкладок. Действительно, если в
линейной эконометрической модели Y = aX + b + ε случайное
возмущение ε таково, что его математическое ожидание
Eε ≠ 0, то эту модель можно переписать следующим образом:
Y = aX + (b + Eε) + (ε – Eε) = aX + + ,
где
= b + Eε — неизвестный параметр модели (как и параметр b);
= — случайное возмущение модели нулевым математиче-
ским ожиданием.
Таким образом, получаем снова линейную модель с неизвестными параметрами, но с нулевым математическим
ожиданием случайного возмущения модели.
Выполнение условий (I
помощью определенных критериев и тестов. Проверка
условия (I
) о нормальности распределения случайных воз-
4
мущений может быть осуществлена с помощью критерия χ
Пирсона или критерия Жарка–Бера. Для проверки выполнения остальных условий можно использовать следующие
критерии.
, Y1), (X2, Y2), …, (Xn, Yn). Рассматривается
1
.
i
)–(I4)).
1
) не является ограничением для модели и
1
)–(I4) необходимо проверять с
2
2
58

Тест ранговой корреляции Спирмена. Проверяется
основная гипотеза H
тернативе H
: {модель гетероскедастична}. Введем в рас-
2
: {модель гомоскедастична} при аль-
1
смотрение ранговый коэффициент корреляции Спирмена
, определяемый по формуле
)
|
, (2.21)
= 1 6
(
(
)
(|
)
где функция rang определяет порядковый номер элемента в
упорядоченной совокупности. При верной основной гипоте-
зе статистика
ление Стьюдента с (
=
(
n – 2) степенями свободы. По заданному
уровню значимости α определяем квантиль t
имеет приближенно распреде-
)
1–α/2
(n – 2) рас-
пределения T(n – 2), и критерий имеет вид:
(
, … , , , …,
, || <
=
, ||
)
/
/
( 2),
( 2).
ример 2.9. Проверить гипотезу о гомоскедастичности
П
линейной модели для зависимости объема потребления от
располагаемого дохода с использованием критерия Спирмена по данным примера 2.1 на уровне значимости α = 0,05.
Решение. Проверяется основная гипотеза H
гомоскедастична} при альтернативе H
: {модель гетеро-
2
: {модель
1
скедастична}. Вычислим ранговый коэффициент корреляции Спирмена по формуле (2.21). Для этого определим ран-
и |ei|, которые представлены в табл. 2.5 (ранжирование
ги
проводилось в порядке возрастания значений соответствующей переменной).
Обозначим d
Значения e
= rang(Xi) – rang(|ei|).
i
вычислены в табл. 2.3.
i
59

|
|
rang(Xi)
rang(|ei|)
di
1
29,3
0,764
11 7 4
16
2
30,3
0,585
12 4 8
64 3 22
0,751 2 6
–4
16
4
23,3
1,337 4 10
–6
36
5
24,6
0,324 7 2 5 25
6
25,9
0,912 8 9
–1
1
7
21,6
0,861 1 8
–7
49
8
22,4
0,362 3 3 0 0 9 31,5
0,751
13 5 8
64
10
32,2
1,905
14
13 1 1
11
32,8
3,162
15
15 0 0
12
24,2
2,764 5 14
–9
81
13
24,5
0,098 6 1 5 25
14
28,2
1,779
10
12
–2
4
15
28
1,476 9 11
–2
4 Σ – – – – –
386
Тогда по формуле (2.21):
= 1
Статистика t равна
2
=
1 (
=
)
(
= 0,311.
)
0,311 15 2
1 0,311
= 1,179.
Таблица 2.5
При α = 0,05:
По
этому δ(X
||
= |1
|
= 1
,179
=
, …, X15, Y1, …, Y15) = H1. На уровне значимости
1
,
,179 <
(13)
,/
= 2,1604.
(
15 2
)
=
α = 0,05 линейную модель признаем гомоскедастичной.
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
