Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Эконометрика. Построение и анализ модели линейной регрессии. Ч. 1. Учебно-методическое пособие в 2-х частях
.pdf
Предположения 1-4 называются условия Гаусса-
i
e
n
...,,,
21
Маркова.
Проверить указанные предположения априорно
обычно не представляется возможным, и свойства
ошибки модели можно установить, только анализируя
свойства фактических ошибок
, рассчитанных после
построения модели регрессии.
Теорема Гаусса-Маркова: если выполнены
условия 1-4, то МНК-оценки параметров уравнения регрессии обладают следующими свойствами:
– состоятельность (при увеличении числа
наблюдений дисперсия оценок параметров стремится
к нулю и надежность оценок возрастает);
– несмещенность (математическое ожидание
оценок каждого параметра, полученных по различным
выборкам, равно истинному значению этого параметра);
– эффективность (МНК-оценки имеют
наименьшую дисперсию по сравнению с другими оцен-
ками данного параметра, линейными относительно y).
То есть, «оценки МНК являются наилучшими
линейными несмещенными, по-английски BLUE («best
linear unbiased estimate»). Если не выполняется хотя бы
одно из условий 1-4, модель признается неадекватной.
Рассмотрим подробнее перечисленные предпо-
сылки и методы их проверки.
Случайность отклонений
Основная гипотеза: отклонения
от
линии регрессии случайны при альтернативной гипотезе: отклонения не случайны. Вывод делается на основе
анализа значений e – отклонений модели от данных выборки.
Существуют различные статистические критерии
проверки гипотезы о неслучайности: например: крите-
61

рий серий, основанный на медиане выборки, критерий
)(xe
)(ye
е
y
е
y
e
y
y
y
«восходящих» и «нисходящих» серий и другие.
Одним из проявлений неслучайности отклонений
является систематическое смещение среднего значе-
ния. Для предварительного анализа надо построить график зависимости
или
. Если остатки располо-
жены вдоль оси абсцисс в горизонтальной полосе (рис.
10а), смещения среднего значения нет.
а) б) в)
Рисунок 10 – Зависимость остатков
от модельных значений
Причиной систематического смещения остатков
в случае б) может быть неверно выбранная форма модели регрессии. Например, была выбрана линейная модель, а надо было выбрать полином или экспоненту.
Вместо построения нелинейной модели можно разбить
выборку на две части и для каждой части построить отдельное линейное уравнение. Существуют критерии
(например, критерий Г. Чоу) для проверки гипотезы об
однородности выборки в регрессионном смысле, другими словами, можно ли рассматривать одну модель или
лучше две отдельные, разбив выборку на две части.
Рисунок в) иллюстрирует случай, когда поведе-
ние остатков также носит не случайный характер: малым значениям
соответствуют в основном положи-
тельные отклонения, а большим значениям – отрицательные. Причиной могут быть резко выделяющиеся
62

наблюдения, т. е. точки, у которых значение y далеко
x
е
y
e
y
отстоит от основной массы. Если такие точки распола-
гаются в начале или в конце ряда, ранжированного по
, они изменяют угол наклона, т. е. коэффициент a, а
если в середине ряда, то значение a может не измениться, но изменится b. Выделяющиеся наблюдения нужно
проанализировать, и, если возможно, исключить из рассмотрения. Вместо исключения наблюдений можно добавить в модель фактор, вызвавший такое резкое откло-
нение.
Гомоскедастичность отклонений
Встречается неслучайность отклонений, выражающаяся в непостоянной ширине полосы, в которой
находятся отклонения. Постоянство дисперсии отклоне-
ний (дисперсия отклонений одинакова для любого набора значений факторов из набора X) называют го-
москедастичностью (рис. 11а). Непостоянство диспер-
сии отклонений называется гетероскедастичность (рис.
11б).
а) б)
Рисунок 11 – Гомоскедастичность и
гетероскедастичность
63

Гетероскедастичность делает невозможным
n
i
i
ex
d
nn
r
1
2
3
,
6
1
d
2
,
,
1
2
ex
ex
r
n
rt
определение доверительного интервала для истинных
значений коэффициентов регрессии, а также построение
доверительных границ для прогноза (рассмотрено в теме
«Прогнозирование по уравнению регрессии»).
Для проверки гипотезы о гомоскедастичности
используют тесты: ранговой корреляции Спирмена,
Голдфельда-Квандта, Уайта, Глейзера и др.
Тест ранговой корреляции Спирмена
1. Для рядов x и |e| находят ранги. |e| – абсолют-
ное значение (модуль); ранг – порядковый номер в соот-
ветствующем ранжированном ряду. При совпадении
значений присваивается одинаковый ранг – среднее из
тех мест, которые эти значения должны занимать в ранжированном ряду. Сумма рангов должна равняться сумме порядковых номеров.
2. Между двумя наборами рангов вычисляют ко-
эффициент ранговой корреляции по формуле
Здесь
– разность между рангами x и |e|.
. (3.18)
3. Проверяют значимость коэффициента ранговой
корреляции по критерию Стьюдента аналогично формуле (1.4).
(3.19)
Для устранения гетероскедастичности существуют специальные методы построения модели регрессии,
например, обобщенный метод наименьших квадратов,
но лучшее средство – включить в модель регрессии дополнительные факторы.
64

Попарная независимость отклонений
i
i
e
i
e
1ii
ee
1ii
ee
(отсутствие автокорреляции)
Определенная закономерность в поведении отклонений может явиться следствием либо нелинейного
характера связи двух переменных в генеральной сово-
купности, либо воздействием какого-то фактора, не
включенного в уравнение регрессии. Величина такого
неучтенного фактора может менять свою динамику
в рассматриваемый период, отклоняясь в достаточно
длительные промежутки времени в одну или другую
сторону от линии регрессии.
Для оценки неслучайности отклонений нужно
ввести количественную меру. Неизвестные отклонения
для генеральной совокупности
заменяются их анало-
гами для выборки
. Для них обычно проверяется не-
коррелированность (являющаяся необходимым, но недостаточным атрибутом независимости) соседних вели-
чин
. Соседними считаются соседние по времени для
временных рядов или по возрастанию переменной x для
перекрестных данных.
При положительной автокорреляции остатков
, на графике остатков видны длинные волны.
Причиной может быть неверно смоделированная форма
связи либо неучтенная сезонность. При отрицательной
автокорреляции
, и график остатков похож на
пилу. Отрицательная автокорреляция встречается в эко-
номическом анализе редко, хотя существуют временные
ряды с колебаниями вверх-вниз или с сезонностью зималето, когда данные регистрируются только два раза
в год. Надо иметь в виду, что при подсчете сравнивают-
ся только соседние значения, в то время как циклы из-
65

менения экономических переменных могут быть более
n
i
i
n
i
ii
e
n
ee
n
DW
1
2
2
2
1
1
)(
1
1
H0 отверга-
ется (поло-
жительная
автокорре-
ляция)
Область не-
определен-
ности крите-
рия
H0 принимает-
ся (отсутствие
автокорреля-
ции)
Область
неопреде-
ленности
критерия
H0 отвер-
гается (от-
рицатель-
ная авто-
корреля-
ция)
длительными, чем одна единица времени.
Для тестирования автокорреляции применяются
анализ автокорреляционной функции критерий Дарби-
на-Уотсона критерий Аббе, тест серий (БреушаГодфри), Q-тест Льюинга-Бокса и другие.
Критерий Дарбина-Уотсона основан на приме-
нении статистики DW:
. (3.20)
Величина DW изменяется от 0 (отрицательная ав-
токорреляция) до 4 (положительная автокорреляция).
Необходимым (но недостаточным) условием случайности отклонений от линии регрессии является близость
статистики Дарбина-Уотсона к 2.
По таблице критических точек распределения
Дарбина-Уотсона находят два пороговых значения (два
другие вычисляют).
Вывод по гипотезе делается в соответствии с по-
паданием в одну из областей (рис. 2).
0 ............ d
н
d
в
4-dв 4-dн 4
Рисунок 12 – Критические точки распределения
Дарбина-Уотсона
66

Нормальный закон распределения
i
i
e
ni
u
2
12
У нормального закона распределения совпадают
три характеристики центра группирования: математическое ожидание, мода и медиана. Если значения
рас-
пределены нормально, то значение 0 должно быть не
только средним значением остатков, но и наиболее часто встречающимся. Кроме того, распределение остат-
ков должно быть симметрично относительно нуля.
Чтобы убедиться, что выборочные данные извлечены из нормально распределенной генеральной совокупности, можно использовать простой графический
прием. Данные (в нашем случае отклонения) упорядочивают по возрастанию и присваивают им номера (ран-
ги). На диаграмме строят точки с координатами:
по
оси абсцисс и
по оси ординат. Здесь i – номер
в упорядоченной последовательности, n – объем выборки, u – обратная функция стандартного нормального
распределения. В зависимости от того, насколько хорошо эти точки «ложатся» на прямую линию, можно судить о нормальности распределения выборки.
Метод весьма неточный и применяется для малых выборок. При достаточно большом объеме выборки
можно проверить гипотезу о нормальном распределении
по асимметрии и эксцессу или применить другие критерии, например, хи-квадрат, Романовского, Колмогорова.
Пример проверки предпосылок регрессионного
анализа
Для примера используем построенную выше по
данным таблицы 2 модель парной линейной регрессии.
Расчет остатков (отклонений) e – см. таб. 9.
67

1) представим остатки в виде точечной диа-
-1
0
1
2
10 12 14 16 18 20 22 24
x
e
)(xe
d
i
x
e
|e|
ранг(x)
ранг(|e|)
d
1
11,06
0,43
0,43 1 3
-2
2
13,83
-1,29
1,29 2 10
-8
3
18,26
-0,36
0,36 5 1
4
4
16,3
0,74
0,74 3 5
-2
5
17,9
0,50
0,50 4 4
0
граммы
На рисунке 13 представлена зависимость остатков
от x.
Рисунок 13 – Графическое представление остатков
Судя по рисунку 13, можно сделать предположе-
ние, что зависимости
нет.
2) проверка гомоскедастичности отклонений
Применим тест ранговой корреляции Спирмена.
Модуль (абсолютное значение) можно найти с помощью
функции ABS.
Для рядов x и |e| находим ранги с помощью
функции РАНГ. d – разность между рангами x и |e|.
Сумму квадратов значений
можно получить с помо-
щью функции СУММКВ.
Таблица 11 – Расчетные данные для теста Спирмена
68

Продолжение таблицы 11
6
22,48
-0,37
0,37
10 2 8
7
23,28
1,02
1,02
11 8 3
8
21,42
0,86
0,86 8 6
2
9
21,25
-0,97
0,97 7 7
0
10
20,42
1,26
1,26 6 9
-3
11
22,19
-1,81
1,81 9 11
-2
178
1111
6
1
6
1
3
1
2
3
,
ni
i
ex
d
nn
r
22
,
,
19,01
211
19,0
1
2
ex
ex
r
n
rt
0
H
x
Вычисляем коэффициент ранговой корреляции
по формуле (3.18).
= 0,19.
Проверяем значимость коэффициента ранговой
корреляции по критерию Стьюдента
= 0,58.
Границы области H0 – интервал (-2,26; 2,26).
Поскольку значение 0,58 попало в интервал
(-2,26; 2,26), гипотезу
(о гомоскедастичности 0 при-
нимаем.
Вывод: дисперсия остатков постоянна (не зави-
сит от
).
3) попарная независимость отклонений
Применим тест Дарбина-Уотсона. Данные упоря-
дочены по месяцам, потому дополнительной сортировки
по x не требуют. Представим ряд остатков на рисунке
14.
69

-1
0
1
0 2 4 6 8 10 12
i
e
i
i
e
1ii
ee
1
0,43 2
-1,29
-1,72
3
-0,36
0,93
4
0,74
1,10
5
0,50
-0,24
6
-0,37
-0,87
7
1,02
1,39
8
0,86
-0,16
9
-0,97
-1,84
10
1,26
2,23
11
-1,81
-3,07
Сумма квадратов
10,4971
25,5546
1110,4971
105546,25
1
)(
1
1
1
2
2
2
1
n
i
i
n
i
ii
e
n
ee
n
DW
Рисунок 14 – Графическое представление остатков
Можно сделать предположение, что остатки по-
парно независимы: на рисунке 14 нет ни длинных, ни
коротких волн.
Представим расчетные данные в таблице 12.
Таблица 12. – Расчетные данные для теста ДарбинаУотсона
Статистику Дарбина-Уотсона DW: находим по
формуле (3.20):
= 2.678.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
