Эконометрика. Учебное пособие
.pdf
1. Линейная модель множественной регрессии
2)выделите область пустых ячеек 5 2 (5 строк, 2 столбца) для вывода результатов регрессионной статистики или область 1 2 для получения только оценок коэффициентов регрессии;
3)активизируйте Мастер функций любым из способов: а) в главном меню выберите Вставка/Функция; б) на панели инструментов Стандарт-
ная щелкните по кнопке Вставка функции;
4)в окне Категория выберите Статистические, в окне Функция – ЛИНЕЙН. Щелкните по кнопке ОК;
5)заполните аргументы функции:
Известные_значения_у – диапазон, содержащий данные результативного признака;
Известные_значения_х – диапазон, содержащий данные факторов независимого признака;
Константа – логическое значение, которое указывает на наличие или отсутствие свободного члена в уравнении; если Константа = 1, то свободный член рассчитывается обычным образом; если Константа = 0, то свободный член равен 0;
Статистика – логическое значение, которое указывает, выводить дополнительную информацию по регрессионному анализу или нет. Если Статистика = 1, то дополнительная информация выводится; если Статистика = 0, то выводятся только оценки параметров уравнения.
Щелкните по кнопке ОК; 6) в левой верхней ячейке выделенной области появится первый эле-
мент итоговой таблицы. Чтобы раскрыть всю таблицу, нажмите клавишу
<F2>, а затем – комбинацию клавиш <CTRL> + <SHIFT> + <ENTER>.
В выделенной области представляется регрессионная статистика:
Значение коэффициента a |
Значение коэффициента b |
Среднеквадратическое отклонение a |
Среднеквадратическое отклонение b |
Коэффициент детерминации R2 |
Среднеквадратическое отклонение y |
F-статистика |
Число степеней свободы |
Регрессионная сумма квадратов |
Остаточная сумма квадратов |
Полученные данные регрессионной статистики в Excel позволяют оценить качество уравнения в целом. С их помощью можно установить степень влияния независимых величин на зависимую переменную. Таким образом, основываясь на главных факторах, можно прогнозировать и планировать развитие приоритетных направлений, принимать управленческие решения.
1.3.2. Многофакторная регрессия
Построение линейной многофакторной модели производится с помощью инструментов пакета анализа данных Корреляция и Регрессия.
21
Эконометрика
Корреляция используется для расчета матрицы парных коэффициентов корреляции. С помощью Регрессии, помимо результатов регрессионной статистики, дисперсионного анализа и доверительных интервалов, можно получить остатки и графики подбора линии регрессии, остатков и нормальной вероятности. Порядок действий следующий:
1)проверьте доступ к пакету анализа. В главном меню последовательно выберите Сервис/Надстройки. Установите флажок Пакет анализа;
2)введите исходные данные или откройте существующий файл, содержащий анализируемые данные;
3)в главном меню выберите пункты Сервис/Анализ данных/Кор-
реляция;
4) заполните диалоговое окно входных данных и параметров вывода: Входной интервал – диапазон, содержащий анализируемые данные
(все столбцы или строки); Группирование – по столбцам или по строкам;
Метки – флажок, который указывает, содержит ли первая строка названия столбцов или нет;
Выходной интервал – достаточно указать левую верхнюю ячейку диапазона;
5)представьте результаты вычислений в виде матрицы парных коэффициентов корреляции, анализ которых позволяет выполнить первый этап процесса моделирования;
6)в главном меню выберите пункты Сервис/Анализ данных/Рег-
рессия;
7)заполните диалоговое окно входных данных и параметров вывода, как в п. 4, только интервал для результативного признака Y и для факторов Х надо задавать отдельно (причем входной интервал Х должен включать все столбцы, содержащие значения факторных признаков).
В результате получаем регрессионную статистику, таблицу дисперсионного анализа и таблицу коэффициентов модели, в которой первая
строка (Y-пересечение) соответствует коэффициенту а0, а следующие строки описывают коэффициенты регрессии аi.
1.4.Линейные регрессионные модели
сгетероскедастичными и автокоррелированными остатками
При исследовании остатков i должно проверяться наличие следующих пяти предпосылок МНК:
1)случайный характер остатков;
2)нулевая средняя величина остатков, не зависящая от хi;
22
1. Линейная модель множественной регрессии
3)гомоскедастичность – дисперсия каждого отклонения i одинакова для всех значений хi;
4)отсутствие автокорреляции остатков – значения остатков i распределены независимо друг от друга;
5)подчинение остатков нормальному распределению.
Если распределение случайных остатков i не соответствует некоторым предпосылкам МНК, то следует корректировать модель.
При нарушении первых двух предпосылок необходимо либо применять другую функцию, либо вводить дополнительную информацию и заново строить уравнение регрессии.
Пятая предпосылка (о нормальном распределении остатков) позволяет проводить проверку параметров регрессии и корреляции с помощью критериев t, F. Однако и при нарушении пятой предпосылки МНК оценки регрессии обладают достаточной состоятельностью.
Совершенно необходимым для получения по МНК состоятельных оценок параметров регрессии является соблюдение третьей и четвертой предпосылок.
Если не соблюдается гомоскедастичность, то имеет место гетероскедастичность. Наличие гетероскедастичности может привести к смещенности оценок коэффициентов регрессии, а также к уменьшению их эффективности. В этом случае рекомендуется применять обобщенный метод наименьших квадратов, который заключается в том, что при минимизации суммы квадратов отклонений (5) отдельные ее слагаемые взвешиваются: наблюдениям с большей дисперсией придается пропорционально меньший вес. Чтобы убедиться в гетероскедастичности остатков и, следовательно, в необходимости использования обобщенного МНК, обычно не ограничиваются визуальной проверкой гетероскедастичности, а проводят ее эмпирическое подтверждение, в частности используют метод Гольдфельда – Квандта. Проиллюстрируем его на примере табл. 7, в которой отражена зависимость поступления налогов в бюджет yi, млн руб., от численности работающих хi , тыс. чел.
По выборочным данным строим уравнение регрессии:
ŷх = –4,565 + 1,178х.
Теоретические значения ŷх и отклонения от них фактических значений i приведены в столбцах 4 и 5 табл. 7. Очевидно, что остаточные вели-
чины i обнаруживают тенденцию к росту по мере увеличения х и у. Этот вывод подтверждается и по критерию Гольдфельда – Квандта. Для его применения необходимо выполнить следующие шаги:
● упорядочить n наблюдений по мере возрастания переменной х (выполнено);
23
Эконометрика
● исключить из рассмотрения k центральных наблюдений (рекомендовано при n = 60 принимать k = 16, при n = 30 k = 8, при n = 20 k = 4),
вданном случае исключаем строки 9–12;
●разделить совокупность на две группы (по ń = (n – k):2 = 8 наблюдений, соответственно, с малыми и большими значениями фактора х) и определить по каждой из групп уравнения регрессии (результаты представлены в табл. 8.);
●найти остаточные суммы квадратов для первой (S1) и второй (S2) групп и их отношение R = S2 : S1. Чем больше величина R превышает табличное значение F-критерия с (ń – 2) степенями свободы (см. прил. 1, табл. П1.1), тем больше нарушена предпосылка о равенстве дисперсий остаточных величин, т. е. наблюдается гетероскедастичность остатков.
|
|
|
|
Таблица 7 |
|
|
|
|
|
№ п/п |
хi |
yi |
ŷх |
i |
1 |
2 |
3 |
4 |
5 |
1 |
3 |
4,4 |
–1,0 |
5,4 |
2 |
6 |
8,1 |
2,5 |
5,6 |
3 |
8 |
12,9 |
4,9 |
8,0 |
4 |
18 |
20,8 |
16,6 |
4,2 |
5 |
20 |
15,5 |
19,0 |
–3,5 |
6 |
23 |
28,8 |
22,5 |
6,3 |
7 |
39 |
37,5 |
41,4 |
–3,9 |
8 |
49 |
48,7 |
53,2 |
–4,5 |
9 |
60 |
68,6 |
66,1 |
2,5 |
10 |
74 |
104,6 |
82,6 |
22,0 |
11 |
79 |
90,5 |
88,5 |
2,0 |
12 |
95 |
88,3 |
107,4 |
–19,1 |
13 |
106 |
132,4 |
120,4 |
12,0 |
14 |
112 |
122,0 |
127,4 |
–5,4 |
15 |
115 |
99,1 |
131,0 |
–31,9 |
16 |
125 |
114,2 |
142,7 |
–28,5 |
17 |
132 |
150,6 |
151,0 |
–0,4 |
18 |
149 |
156,1 |
171,0 |
–14,9 |
19 |
157 |
209,5 |
180,5 |
29,0 |
20 |
282 |
342,9 |
327,8 |
15,1 |
Итого |
1 652 |
1 855,5 |
1 855,5 |
0,0 |
Величина R = 2 638,4 : 68,34 = 38,6 существенно превышает табличное значение F-критерия 4,28 при 5%-м и 8,47 при 1%-м уровне значимости для числа степеней свободы 8 – 2 = 6, подтверждая тем самым наличие гетероскедастичности.
Нарушается четвертая предпосылка МНК: автокорреляция остатков означает наличие корреляции между остатками текущих и предыдущих
24
1. Линейная модель множественной регрессии
(последующих) наблюдений. Коэффициент корреляции r i j между i и j,
где i – остатки текущих наблюдений, j – остатки предыдущих наблюдений (например, j = i – 1) определяется по обычной формуле линейного коэффициента корреляции (2).
|
|
|
|
|
|
Таблица 8 |
|
|
|
|
|
|
|
№ п/п |
хi |
yi |
ŷх |
i |
|
i2 |
|
Уравнение |
регрессии: ŷх = |
2,978 + 0,921х, |
сумма S1 = 68,34 |
|
|
1 |
3 |
4,4 |
5,7 |
–1,3 |
|
1,69 |
2 |
6 |
8,1 |
8,5 |
–0,4 |
|
0,16 |
3 |
8 |
12,9 |
10,3 |
2,6 |
|
6,76 |
4 |
18 |
20,8 |
19,6 |
1,2 |
|
1,44 |
5 |
20 |
15,5 |
21,4 |
–5,9 |
|
34,81 |
6 |
23 |
28,8 |
24,2 |
4,6 |
|
21,16 |
7 |
39 |
37,5 |
38,9 |
–1,4 |
|
1,96 |
8 |
49 |
48,7 |
48,1 |
0,6 |
|
0,36 |
|
Уравнение |
регрессии: ŷх = |
31,142 + 1,338х, |
сумма S2 = 2 638,4 |
|
|
13 |
106 |
132,4 |
110,7 |
21,7 |
|
470,89 |
14 |
112 |
122,0 |
118,7 |
3,3 |
|
10,89 |
15 |
115 |
99,1 |
122,7 |
–23,6 |
|
556,96 |
16 |
125 |
114,2 |
136,1 |
–21,9 |
|
479,61 |
17 |
132 |
150,6 |
145,4 |
5,2 |
|
27,04 |
18 |
149 |
156,1 |
168,2 |
–12,1 |
|
146,41 |
19 |
157 |
209,5 |
178,9 |
30,6 |
|
936,36 |
20 |
282 |
342,9 |
346,1 |
–3,2 |
|
10,24 |
Для подсчета автокорреляции необходимо наблюдения упорядочить по значению фактора х (как в предыдущем примере) и составить ряды с текущими и предыдущими остатками. Рассмотрим расчет коэффициента корреляции между i и j, взяв в качестве примера данные из табл. 7 и перенеся их в табл. 9 (n = 19).
|
|
|
Таблица 9 |
|
|
|
|
№ п/п |
i |
j |
i j |
1 |
5,6 |
5,4 |
30,24 |
2 |
8,0 |
5,6 |
44,8 |
3 |
4,2 |
8,0 |
33,6 |
4 |
–3,5 |
4,2 |
–14,7 |
5 |
6,3 |
–3,5 |
–22,05 |
6 |
–3,9 |
6,3 |
–24,57 |
7 |
–4,5 |
–3,9 |
17,55 |
8 |
2,5 |
–4,5 |
–11,25 |
9 |
22,0 |
2,5 |
55 |
10 |
2,0 |
22,0 |
44 |
25
Эконометрика
|
|
|
Окончание табл. 9 |
|
|
|
|
№ п/п |
i |
j |
i j |
11 |
–19,1 |
2,0 |
–38,2 |
12 |
12,0 |
–19,1 |
–229,2 |
13 |
–5,4 |
12,0 |
–64,8 |
14 |
–31,9 |
–5,4 |
172,26 |
15 |
–28,5 |
–31,9 |
909,15 |
16 |
–0,4 |
–28,5 |
11,4 |
17 |
–14,9 |
–0,4 |
5,96 |
18 |
29,0 |
–14,9 |
–432,1 |
19 |
15,1 |
29,0 |
435 |
Итого |
–5,3998 |
–15,1031 |
922,09 |
Среднее |
–0,2842 |
–0,7949 |
48,5311 |
Тогда σε = 15,1347, σε = 14,7663 и в соответствии с формулой (2) r i j = (48,5311 – (–0,2842)(–0,7949))/15,1347/14,7663 = 0,2161,
что при 17 степенях свободы явно незначимо и демонстрирует отсутствие автокорреляции остатков.
Автокорреляция остатков может быть вызвана несколькими причинами, имеющими различную природу. Во-первых, иногда она связана с исходными данными и обусловлена наличием ошибок измерения в значениях результативного признака. Во-вторых, причину нужно искать в формулировке модели, которая может не включать существенный фактор, влияние которого отражается в остатках, вследствие чего они оказываются автокоррелированными. Очень часто этим фактором является фактор времени, поэтому проблема автокорреляции остатков весьма актуальна при исследовании динамических рядов, что будет рассмотрено в соответствующей главе.
1.5. Обобщенный метод наименьших квадратов. Прогнозирование
При нарушении гомоскедастичности и наличии автокорреляции ошибок рекомендуется традиционный метод наименьших квадратов заменять обобщенным методом. Он применяется к преобразованным данным и позволяет получать оценки, которые не только обладают свойством несмещенности, но и имеют меньшие выборочные дисперсии.
Суть метода заключается в том, что подбираются коэффициенты Ki, такие, что σ ε = σ2∙Ki, где σ ε – дисперсия ошибки при i-м значении фактора; σ2 – постоянная дисперсия ошибки при соблюдении предпосылки
26
1. Линейная модель множественной регрессии
о гомоскедастичности остатков; Ki – коэффициент пропорциональности, меняющийся с изменением величины фактора.
Уравнение парной регрессии при этом принимает вид
уi / |
|
= 0 / |
|
+ 1хi / |
|
+ ε . |
|
|
|
По отношению к обычной регрессии уравнение с новыми преобразованными переменными представляет собой взвешенную регрессию,
в которой переменные у и х взяты с весами 1/ |
|
. Аналогичный подход |
|
применяют и для множественной регрессии, уравнение с преобразованными переменными принимает вид
y / |
|
= 0 / |
|
+ 1х1 / |
|
+ 2х2 / |
|
+…+ mхm / |
|
+ . (14) |
|
|
|
|
|
Параметры такой модели зависят от концепции, принятой для коэффициента пропорциональности K. В эконометрических исследованиях до-
вольно часто выдвигается гипотеза, что остатки i пропорциональны значениям фактора. Пусть, например, у – издержки производства, х1 – объем продукции, х2 – основные производственные фонды, х3 – численность работников, тогда уравнение у = 0 + 1х1 + 2х2 + 3х3 + является моделью издержек производства с объемными факторами. Предполагая, что σ ε
пропорциональна квадрату численности работников (т. е. √ = х3), получим в качестве результативного признака затраты на одного работника (у/х3), а в качестве факторов – производительность труда (х1/х3) и фондовооруженность труда (у/х3). Соответственно, трансформированная модель примет вид
у/х3 = 3 + 1х1/х3 + 2х2/х3 + ,
где найденные параметры 3, 1, 2 численно не совпадают с аналогичными параметрами предыдущей модели. Кроме того, коэффициенты регрессии меняют экономическое содержание: из показателей силы связи, характеризующих среднее изменение издержек производства с изменением абсолютного значения соответствующего фактора на единицу, они превращаются в показатели, фиксирующие среднее изменение затрат на работника в зависимости от изменения производительности труда на единицу и в зависимости от изменения фондовооруженности труда на единицу.
Если же предположить, что в первоначальной модели дисперсия остатков пропорциональна квадрату объема продукции, получаем уравнение регрессии
у/х1 = 1 + 2х2/х1 + 3х3/х1 + ,
где у/х1 – затраты на единицу продукции; х2/х1 – фондоемкость продукции; х3/х1 – трудоемкость продукции.
27
Эконометрика
Переход к относительным величинам существенно снижает вариацию фактора и, соответственно, уменьшает дисперсию ошибки.
Теперь рассмотрим, как в эконометрике используется метод прогно-
зирования.
Основная цель получения уравнения регрессии – это использование модели для анализа и прогноза поведения изучаемого экономического явления.
Прогноз осуществляется подстановкой значения фактора х в полученную формулу регрессии. Доверительный интервал для прогностического
значения у(х) = 0 + 1х определяется по формуле
yˆ |
(x) tpσˆ |
1 |
|
(x x)2 |
y(x) yˆ |
(x) tpσˆ |
1 |
|
(x x)2 |
, |
(15) |
n |
n |
n |
n |
||||||||
|
|
|
(xi x)2 |
|
|
|
(xi x)2 |
||||
|
|
|
|
i 1 |
|
|
|
|
i 1 |
|
|
где tp – критическая граница распределения Стьюдента с (n – 2) степенями свободы, соответствующая уровню значимости р.
Используем полученное в примере 1 уравнение регрессии для прогноза объема товарооборота. Пусть намечается открытие магазина с численностью работников х = 140 чел., тогда достаточно обоснованный объем товарооборота следует установить по уравнению ŷ(х) = –0,974 + + 0,019 24 140 = 1,72 млрд руб.
Для получения доверительного интервала воспользуемся выраже-
нием (15).
Выберем уровень значимости 5 %. Число степеней свободы у нас 8 – 2 = 6, тогда по таблице распределения Стьюдента (см. прил. 1, табл. П1.2) находим
t0,05(6) = 2,447, |
= |
0,008 = 0,089, |
||
0,089 |
1 8 140 |
113 |
4356 |
= 0,039, |
1,72 – 2,447 0,039 < y(x) < 1,72 + 2,447 0,039, или 1,65 < y(x) < 1,815.
Следовательно, с вероятностью 95 % истинные значения объемов товарооборота будут лежать в пределах от 1,650 до 1,815 млрд руб.
28
2. Нелинейные модели регрессии
2.НЕЛИНЕЙНЫЕ МОДЕЛИ РЕГРЕССИИ
Вэтой главе будут рассмотрены различные виды и особенности построения нелинейных моделей регрессии.
2.1.Мультипликативные модели регрессии
Уравнение (13) называют аддитивным, тогда как уравнение вида
y = 0х1 1х2 2 · … · хm m |
(16) |
называется мультипликативным. Логарифмируя выражение (16), приходим опять к линейному уравнению регрессии. Пусть, например, требуется оце-
нить параметры производственной функции Кобба – Дугласа Y = AK L . Логарифмируя обе части, получаем
ln Y = ln A + ln K + ln L. |
(17) |
Полученная формула линейна относительно логарифмов выпуска Y, капитала K и труда L, и она может быть оценена как множественная линейная регрессия.
В частном случае, когда + = 1, осуществляется преобразование
Y/L = A(K/L) ln (Y/L) = ln A + ln(K/L). |
(18) |
Далее оценивается парная линейная регрессия логарифма производительности труда Y/L от логарифма капиталовооруженности K/L. Если зависимость оценивается по данным временных рядов, то часть тренда зависимой переменной может объясняться действующими во времени факторами, например, в производственной функции Кобба – Дугласа нейтральный технический прогресс учитывают с помощью множителя е t:
Y = AK L е t ln Y = ln A + ln K + ln L + t. |
(19) |
Таким образом, опять приходим к модели линейной регрессии.
2.2. Гиперболическая и полиномиальная регрессии
Для определения криволинейной функции регрессии по расположению точек на диаграмме рассеяния делают заключение о примерном виде этой функции, при этом необходимо учитывать особенности конкретной
29
Эконометрика
экономической задачи, в рамках которой анализируется взаимосвязь признаков.
Гиперболическая регрессия имеет вид
y = b + а/х. |
(20) |
Выполнив замену 1/х = z, получаем линейную регрессию у = b + аz, параметры которой на компьютере можно вычислить с помощью функции
ЛИНЕЙН.
Полиномиальная регрессия имеет вид |
|
y = 0 + 1х + 2х2 +…+ mхm. |
(21) |
Выполнив замену zi = xi , получим уравнение линейной регрессии: y = α0 + α1z + α2z2 +…+ αmzm .
Например, глядя на рис. 1 (см. пример 2), можно предположить, что имеет место параболическая регрессия второго порядка, т. е. следует искать уравнение регрессии вида
= 0 + 1х + 2х2,
где 0, 1, 2 – неизвестные коэффициенты.
Пользуясь методом наименьших квадратов, получаем систему линейных уравнений относительно неизвестных параметров:
|
|
|
|
|
|
|
|
a |
|
|
|
a |
|
|
|
|
|
|||||
х4 |
a |
х3 |
х2 |
ух2 |
, |
|||||||||||||||||
|
2 |
1 |
0 |
|
|
|
|
|
|
|||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
х3a2 х2a1 хa0 |
ух, |
(22) |
|||||||||||||||||||
|
|
|||||||||||||||||||||
|
|
|
|
|
|
a a |
|
. |
|
|||||||||||||
|
|
|
х2 |
a |
|
|
|
|||||||||||||||
|
|
|
х |
у |
|
|||||||||||||||||
|
|
|
|
|
|
2 |
|
|
|
|
|
1 0 |
|
|
|
|
|
|
||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||||
П р и м е р 5. По данным корреляционной табл. 2 построить параболическую функцию регрессии.
Подставив данные в систему уравнений (22), получаем
286 000a2 11 160a1 |
460a0 8 100, |
|
|
11 160a2 460a1 20,4a0 354, |
|
|
||
|
460a2 20,4a1 |
a0 17,4. |
|
||
Решив эту систему, найдем 2 = 0,055, 1 = –2,26, 0 = 38,2. Искомое параболическое уравнение регрессии принимает вид
= 0,055х2 – 2,26х + 38,2 (см. рис. 1, пунктирная линия).
Легко убедиться, что условные средние, вычисленные по данному уравнению, незначительно отличаются от условных средних корреляционной таблицы:
30
