Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Эконометрика. Опорный конспект лекций для бакалавров очной и заочной форм обучения направлений подготовки «Экономика», «Бизнес-информатика».pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
1 Мб
Скачать

Лекция 7 Тема: Проверка предпосылок к построению модели регрессии

Рассмотрены предпосылки метода наименьших квадратов (условия Гаусса-Маркова), свойства подученных МНК = оценок. Дано описание некоторых методов проверки свойств остаточной компоненты.

Основные вопросы:

1.Предпосылки (предположения) к построению уравнения линейной регрессии. Свойства МНК-оценок.

2.Гомоскедастичность отклонений.

3.Попарная независимость отклонений (отсутствие автокорреляции).

Основные понятия:

Классическая нормальная регрессионная модель – линейная регрессионная модель, удовлетворяющая условиям Гаусса-Маркова.

Свойство гомоскедастичности: дисперсия остатков постоянна. Гетероскедастичность – нарушение свойства гомоскедастичности, непостоянство

дисперсии отклонений.

Введение

В общем виде эконометрическую модель можно представить в виде: y = f (X , A)+ ε,

где y – наблюдаемое значение зависимой переменной, f (X , A) – объясненная часть

зависимой переменной, которая зависит от значений объясняющих переменных X (факторов или независимых переменных), ε – случайная составляющая зависимой

переменной (ошибки, остатки, отклонения, возмущения), A – вектор параметров модели. Основным методом оценки параметров модели является МНК.

Далее рассмотрим предположения относительно случайной составляющей, которые называются предпосылками к построению модели регрессии. Следует иметь в виду, что априори (до эксперимента) проверить выполнение этих предпосылок, как правило, невозможно. Проверку выполняют, получив остаточную компоненту временного ряда, то есть фактическую ошибку модели. Проверка осуществляется с использованием ряда специальных статистических критериев.

1. Предпосылки (предположения)к построению уравнения линейной регрессии. Свойства МНК-оценок

1.При заданных значениях xi на переменную y не оказывают влияние никакие другие систематически действующие факторы, и величина εi является случайной.

2.Математическое ожидание εi равно нулю.

3.Свойство гомоскедастичности: дисперсия εi постоянна (одинакова для различных

i). Для перекрестных данных при переходе от одного объекта наблюдения к другому, а для временных рядов в различные моменты времени неучтенные факторы оказывают одинаковое влияние.

4. Значения εi попарно не коррелированы, или, более сильно, попарно независимы

между собой в вероятностном смысле (отсутствие автокорреляции отклонений). Проверяется обычно для временных рядов. Здесь i – номер в упорядоченной последовательности значений x.

5. Значения εi распределены нормально, т. к. представляют суммарный эффект от

большого числа незначительных некоррелированных влияющих факторов.

6. Число наблюдений больше числа неизвестных параметров уравнения регрессии.

35

Выполнение условия шесть необходимо для решения системы уравнений МНК и особенно актуально для множественной регрессии; выполнение условия пять необходимо для проверки статистической значимости сделанных оценок и определения доверительных интервалов для коэффициентов регрессии и интервального прогноза.

При выполнении перечисленных условий модель называется классической

нормальной регрессионной моделью.

Условия 1-4 называются условия Гаусса-Маркова.

Теорема Гаусса-Маркова: если выполнены условия 1-4, то МНК-оценки параметров уравнения регрессии обладают следующими свойствами:

состоятельность: при увеличении числа наблюдений дисперсия оценок параметров стремится к нулю и надежность оценок возрастает;

несмещенность: математическое ожидание оценок каждого параметра, полученных по различным выборкам, равно истинному значению этого параметра;

эффективность:

МНК-оценки имеют наименьшую дисперсию по сравнению

с другими оценками данного параметра, линейными относительно y.

То есть, «оценки

МНК являются наилучшими линейными несмещенными, по-

английски BLUE («best linear unbiased estimate»). Если не выполняется хотя бы одно из названных условий, модель признается неадекватной.

Случайность отклонений

Основная гипотеза: отклонения ε1, ε2 , ...,εn от линии регрессии случайны.

Альтернативная гипотеза: отклонения не случайны. Вывод делается на основе анализа значений e – отклонений модели от данных выборки.

Существуют различные статистические критерии проверки гипотезы о неслучайности: например, критерий серий, основанный на медиане выборки, критерий «восходящих» и «нисходящих» серий и другие.

Одним из проявлений неслучайности отклонений является систематическое смещение среднего значения. Для предварительного анализа надо построить график зависимости

e(y). Если остатки расположены вдоль оси абсцисс в горизонтальной полосе (Рисунок 7.1а), то смещения среднего значения нет.

е

е

e

 

 

y

 

y

 

 

 

y

а) б) в)

Рисунок 7.1 – Зависимость остатков от теоретических значений y .

Причиной систематического смещения остатков в случае б) может быть неверно выбранная форма модели регрессии. Например, была выбрана линейная модель, а надо было выбрать полином или экспоненту. Вместо построения нелинейной модели можно разбить выборку на две части и для каждой части построить отдельное линейное уравнение. Существуют критерии (например, критерий Г. Чоу) для проверки гипотезы об однородности выборки в регрессионном смысле, другими словами, лучше рассматривать одну модель или две отдельные, разбив выборку на две части.

36

Рисунок 7.1в) иллюстрирует случай, когда поведение остатков также носит не случайный характер: малым значениям y соответствует в основном положительные

отклонения, а большим значениям – отрицательные. Причиной могут быть резко выделяющиеся наблюдения, т. е. точки, у которых значение y далеко отстоит от основной массы.

Если такие точки располагаются в начале или в конце ранжированного по x ряда, они изменяют угол наклона, т. е. коэффициент a, а если в середине ряда, то значение a может не измениться, но изменится свободный член b. Выделяющиеся наблюдения нужно проанализировать, и, если возможно, исключить из рассмотрения. Вместо исключения наблюдений можно добавить в модель фактор, вызвавший такое резкое отклонение. Можно также попробовать сделать данные более однородными, перейдя от абсолютных единиц измерения факторов к относительным.

Выводы

При выполнении условий Гаусса-Маркова оценки МНК являются наилучшими линейными несмещенными, по-английски BLUE («best linear unbiased estimate»).

2. Гомоскедастичность отклонений

Встречается неслучайность отклонений, выражающаяся в непостоянной ширине полосы, в которой находятся отклонения. Постоянство дисперсии отклонений называют гомоскедастичностью (дисперсия отклонений одинакова для любого набора значений факторов из набора X, рис. 7.2а). Непостоянство дисперсии отклонений называется

гетероскедастичность (рис. 7.2б).

е

e

y

а)

б)

Рисунок 7.2 – Гомоскедастичность и гетероскедастичность отклонений

Гомоскедастичность – обязательное условие эффективности оценок параметров модели регрессии, полученных обычным МНК. При гетероскедастичности оценки МНК неэффективны.

Кроме того, сделанные оценки среднеквадратичных ошибок коэффициентов регрессии будут неверны. Вполне вероятно, что среднеквадратичных ошибки будут занижены, а следовательно, t -статистика – завышена, и будет получено неправильное представление о точности оценки коэффициентов регрессии.

Гетероскедастичность делает невозможным определение доверительного интервала для истинных значений коэффициентов регрессии, а также построение доверительных границ для прогноза (будет рассмотрено в лекции «Прогнозирование по уравнению регрессии»).

Для проверки гипотезы о гомоскедастичности используют различные тесты: ранговой корреляции Спирмена, Голдфельда-Квандта, Уайта, Глейзера и др.

В условиях непостоянства дисперсии следует применять другие методы оценки коэффициентов регрессии, например, обобщенный метод наименьших квадратов, но лучшее средство – включить в модель регрессии дополнительные факторы.

37

Тест ранговой корреляции Спирмена

Ранг – порядковый номер в упорядоченной последовательности. Алгоритм применения теста:

1) Для рядов x и |e| находят ранги (порядковые номера в соответствующем ранжированном ряду). Если в рассматриваемых рядах есть совпадающие значения, то каждому из этих значений присваивается одинаковый ранг – среднее из тех мест, которые они должны занимать в ранжированном ряду. Проверка: сумма рангов равна сумме порядковых номеров.

2) Между двумя наборами рангов вычисляют коэффициент ранговой корреляции по

 

 

 

 

 

 

 

 

 

 

 

6

 

 

 

n

формуле rx,

 

e

 

=1

 

 

 

 

di2 (здесь d - разность между рангами x и |e|)

 

 

n

3

n

 

 

 

 

 

 

 

 

 

 

 

i =1

3) Проверяют значимость коэффициента ранговой корреляции по критерию

Стьюдента.

 

 

 

 

 

 

 

 

 

 

 

 

t = rx,

 

e

 

 

 

n 2

 

 

.

 

 

 

1r

2

 

 

 

 

 

 

 

 

 

 

 

e

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x,

 

 

 

 

Выводы

Гомоскедастичность – обязательное условие эффективности оценок параметров модели регрессии, полученных обычным МНК. При гетероскедастичности остатков оценки МНК неэффективны

Существуют специальные методы оценки параметров модели регрессии, например, обобщенный метод наименьших квадратов.

3. Попарная независимость отклонений (отсутствие автокорреляции)

Определенная закономерность в поведении отклонений может явиться следствием либо нелинейного характера связи двух переменных в генеральной совокупности, либо воздействием какого-то фактора, не включенного в уравнение регрессии. Величина неучтенного фактора может менять свою динамику, отклоняясь в достаточно длительные промежутки времени в одну или другую сторону от линии регрессии.

Для оценки неслучайности отклонений нужно ввести количественную меру. Неизвестные отклонения для генеральной совокупности εi заменяются их аналогами для

выборки ei . Для них обычно проверяется некоррелированность (являющаяся необходимым, но недостаточным атрибутом независимости) соседних величин ei . Соседними считаются

соседние по времени для временных рядов или по возрастанию переменной x для перекрестных данных. Для этих величин можно рассчитать либо коэффициент корреляции (автокорреляции первого порядка), либо статистику Дарбина – Уотсона DW:

 

 

1

 

n

 

 

 

 

 

 

 

(ei ei 1)2

 

 

 

n 1

 

DW =

 

i =2

 

 

.

(7.1)

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

1

 

 

 

 

 

 

 

 

 

ei2

 

 

 

 

 

 

 

 

n

 

 

 

 

 

 

 

 

i =1

 

 

 

 

 

 

 

 

 

 

 

 

 

Величина DW изменяется от 0 для случая

ei = ei1

(положительная автокорреляция

остатков) до 4 для случая ei = −ei1 (отрицательная автокорреляция). Последняя встречается

в экономическом анализе редко, хотя может быть, например, во временных рядах с интервалом времени в полгода с колебаниями вверх-вниз.

Если характер отклонений случаен, то можно предположить, что примерно в половине случаев знаки соседних отклонений совпадают, а в половине случаев – различны.

38

И если абсолютные значения отклонений примерно совпадают, можно считать, что в половине случаев ei = ei1 , в другой половине ei = −ei1 . При этом DW = 2.

Таким образом, близость статистики Дарбина-Уотсона к двум является необходимым условием случайного отклонения от линии регрессии, но недостаточным, поскольку при расчете сравниваются только соседние значения, в то время как циклы изменения экономических переменных могут быть более длительными, чем одна единица времени.

По таблице критических точек распределения Дарбина-Уотсона находят два пороговых значения dH и dB (два другие вычисляют). Вывод по гипотезе делается в соответствии с попаданием в одну из областей.

H0 отвергается

 

Область

 

H0 принимается

 

 

Область

H0 отвергается

(положительная

неопределенности

 

(отсутствие

 

неопределенности

(отрицательная

автокорреляция)

 

критерия

 

автокорреляции)

 

 

критерия

автокорреляция)

0

dH

dB

2

4-dB

4-dH

4

Кроме критерия Дарбина-Уотсона, применяются также критерий Аббе, тест серий (Бреуша-Годфри), Q-тест Льюинга-Бокса, основанный на анализе автокорреляционной

ичастной автокорреляционной функции.

Влюбом случае стоит посмотреть на график поведения отклонений, и либо поискать нелинейную формулу, либо включить не учтенные до этого факторы, уточнить период применения расчетов или разбить его на части.

Существуют также специальные приемы, уменьшающие автокорреляцию остатков: авторегрессионное преобразование, метод скользящих средних и другие.

Выводы

Условие отсутствия автокорреляции часто нарушается во временных рядах.

Для перекрестных данных положительная авкорреляция обычно говорит о неверно выбранной форме модели регрессии.

Заключение

Проверка условий Гаусса-Маркова осуществляется по данным выборки после построения модели регрессии с использованием ряда специальных статистических критериев. Совпадение свойств необъясненных остатков с перечисленными выше предпосылками обеспечивает хорошие прогнозные свойства модели.

Поскольку наблюдаемые значения экономических показателей формируются под воздействием большого числа факторов, трудно добиться высокого качества модели парной линейной регрессии, включающей только один фактор. Значительно улучшить качество модели регрессии, в том числе свойства остатков, можно при построении многофакторной модели.

Вопросы для закрепления материала

1.Перечислите предпосылки к построению уравнения регрессии (условия ГауссаМаркова).

2.Что такое гомоскедастичность остатков?

3.Что такое автокорреляция?

4.Для чего нужна проверка гипотезы о нормальном законе распределения?

5.До или после построения модели регрессии делается проверка предпосылок?

6.Теорема Гаусса-Маркова.

39

Лекция 8 Тема: Прогноз по модели парной линейной регрессии.

Проверка гипотезы о нормальном законе распределения

Рассмотрена теория построения точечного и интервального прогнозирования по модели парной линейной регрессии.

Основные вопросы:

1.Рекомендации к применению уравнения регрессии для прогноза.

2.Формулы точечного и интервального прогноза по модели парной линейной регрессии.

3.Графический метод проверки гипотезы о нормальном законе распределения.

Основные понятия:

Относительная ошибка модели – отношение стандартной (средней квадратической) ошибки регрессии к среднему значению зависимой переменной y .

Точечный прогноз – прогноз, полученный подстановкой в функцию регрессии ожидаемого значения фактора.

Интервальный прогноз – прогноз, которым указывается не единственное значение прогнозируемого показателя, а интервал, содержащего точную величину для прогнозного значения с заданной вероятностью.

Введение Наиболее часто регрессионную модель используют в двух целях:

1.Исследователя интересует качественный анализ модели – вид уравнения регрессии

изначения коэффициентов.

2.Уравнение регрессии необходимо для прогноза значений зависимой переменной

при заданном значении независимой переменной x p . Если значение x p не выходит за

границы диапазона имеющихся значений x , прогноз называют интерполяцией, если выходит – экстраполяцией. Часто делают «прогноз вперед», т. е. задают x p больше, чем

максимальное значение x в имеющейся выборке.

1. Рекомендации к применению уравнения регрессии для прогноза Считается, что ожидаемое значение x p не должно выступать (вправо за максимум

или влево за минимум) дальше, чем на 1/3 размаха значенийX , которые использовались при построении модели регрессии.

Критерием прогнозных качеств оцененной регрессионной модели может служить так называемая относительная ошибка модели V = Sye – отношение стандартной (средней квадратической) ошибки регрессии к среднему значению зависимой переменной y . Для

 

 

 

 

n

 

 

S

 

парной регрессии Se =

 

, где S = ei2 ; ei = yi yi .

n 2

 

 

 

i =1

Значение V обычно выражается в процентах.

Выводы

Если величина V мала и отсутствует автокорреляция остатков (т. е. систематичность отклонений зависимой переменной от линии регрессии), то прогнозные качества модели высоки. Для практического применения рекомендуется V <20%.

40

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]