Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Эконометрика. Опорный конспект лекций для бакалавров очной и заочной форм обучения направлений подготовки «Экономика», «Бизнес-информатика».pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
1 Мб
Скачать

Выводы

Мультиколлинеарность усложняет процесс построения модели множественной регрессии. Надо либо применять специальные методы, либо исключать часть факторов.

3. Отбор факторов для построения модели регрессии. Частная корреляция

Проблема выбора «оптимальных» факторов обычно решается на основе содержательного и количественного (статистического) анализа тенденций рассматриваемых процессов.

На этапе содержательного анализа обычно решается задача установления самого факта наличия взаимосвязей между явлениями. В ходе содержательного анализа явление рассматривается на качественном уровне, однако при построении модели в качестве исходной информации используются наборы показателей, которые выражают эти явления, их свойства и тенденции в виде количественных характеристик. Поэтому желательно, чтобы такое «выражение» было в некотором смысле как можно более «точным». Задача решается количественно методами корреляционного анализа.

Значительно усложняет проблему отбора факторов явление ложной корреляции, которое характеризуется достаточно высокими по абсолютной величине значениями коэффициентов парной корреляции у процессов, с содержательной точки зрения между собой никак не связанных. Ложная корреляция часто бывает во временных рядах, когда тенденции рассматриваемых процессов совпали случайно, при отсутствии между ними логически обоснованной взаимосвязи.

Отбор факторов на основе корреляционного анализа выполняется так. Если для неко-

торой пары факторов X ( j), X (k) хотя бы одно из двух неравенств (10.3) не выполняется, то в уравнение включается только один из них. Выбирается либо тот фактор, связь которого с Y более тесная, либо тот фактор, связь которого с Y более очевидна экономически.

В качестве показателя связи при отборе факторов можно рассматривать коэффициент парной корреляции или частный коэффициент корреляции.

Частный коэффициент корреляции измеряет степень тесноты линейной связи между

двумя переменными (например,

X ( j)

и X (k )) при фиксированных значениях других (всех

или части) переменных.

 

 

 

c jk

 

 

 

rjk. N

= −

 

 

 

 

 

 

 

 

 

c jj ckk

,

(10.4)

 

 

 

 

где N – набор «фиксированных» переменных;

 

 

 

c jk – элемент с индексами j, k обратной матрицы C =W 1.

Матрица W составляется

из

коэффициентов парной

корреляции переменных

X (i) , X (k) и переменных, входящих в набор N.

 

 

X (m) – одним из набора

Частный коэффициент корреляции между Y и фактором

X=(X(1), X(2), …, X(m)) при «фиксированных» значениях остальных m–1 факторов можно получить по формуле (10.4), приняв j = 0, или с использованием коэффициента детерминации по формуле (10.5):

 

 

 

R2

R2

 

 

r

=

 

m

m 1

.

(10.5)

 

 

0m.1,2,...m 1

 

 

1 R2

 

 

 

 

 

m 1

 

Если частный коэффициент корреляции двух признаков меньше, чем коэффициент их парной корреляции, то можно сказать, что взаимосвязь этих признаков в значительной мере имеет место благодаря прочим факторам. Если же при фиксации прочих факторов степень взаимосвязи двух признаков возрастает, то это означает, что прочие факторы «маскировали» истинную взаимозависимость двух случайных величин.

53

Для проверки гипотезы о равенстве нулю частного коэффициента корреляции

в генеральной совокупности используется t-статистика критерия Стьюдента t = r n 2 .

1 r 2

Значение n надо заменить на nk, где k – число «фиксированных» переменных. Эта же замена выполняется при нахождении критических точек распределения Стьюдента. Факторы, для которых принята гипотеза о равенстве нулю частных коэффициентов корреляции с Y, из набора X исключают (рекомендуется исключать по одному).

Применяется также пошаговая процедура добавления новых переменных. На первом шаге строят модель парной регрессии, выбирая переменную X, имеющую наибольший коэффициент корреляции с Y, а затем добавляют факторы по одному до тех пор, пока будет расти скорректированный коэффициент детерминации.

Выводы

В качестве показателя связи между Y и одним из набора X при отборе факторов можно рассматривать коэффициент парной корреляции или частный коэффициент корреляции. При наличии мультиколлинеарности эти показатели могут сильно различаться, потому предпочтение отдается частному коэффициенту корреляции.

Заключение

 

Можно выделить два основных подхода к отбору факторов.

 

Первый предполагает априорное (до построения модели) исследование

характера

и силы взаимосвязей между рассматриваемыми переменными, по результатам

которого

в модель включаются факторы, наиболее значимые по своему «непосредственному» влиянию на зависимую переменную y. И, наоборот, из модели исключаются факторы, которые либо малозначимы с точки зрения силы своего влияния, либо их сильное влияние на y можно трактовать как усиленное взаимосвязями с другими переменными из набора X.

Второй подход к отбору независимых факторов можно назвать апостериорным: он предполагает первоначально включить в модель все отобранные на этапе содержательного анализа факторы. Уточнение их состава в этом случае производится на основе анализа характеристик качества построенной модели, в том числе показателей, выражающих силу влияния каждого из факторов на зависимую переменную y.

Какая бы процедура отбора факторов ни использовалась, она не гарантирует оптимального набора факторов, гарантирующих максимальное значение коэффициента детерминации, однако проведенный корреляционный анализ оказывается очень полезным этапом перед построением модели регрессии. Если же построение модели множественной регрессии было выполнено без предварительного корреляционного анализа, часть коэффициентов модели могут оказаться статистически незначимыми, и тогда корреляционный анализ следует выполнить уже для понимания причин низкого качества построенного уравнения.

Вопросы для закрепления материала:

1.Что показывает коэффициент детерминации?

2.Как проверяется гипотеза о статистической значимости коэффициента детерминации?

3.Что такое мультиколлинеарность?

4.Почему построению уравнения множественной регрессии обычно предшествует процедура отбора факторов?

5.Что измеряет частный коэффициент корреляции?

54

Лекция 11 Тема: Множественная (многофакторная) линейная модель. Оценка параметров модели.

Анализ общего качества модели и значимости коэффициентов Основные вопросы:

1.Общий вид модели множественной линейной регрессии. Экономический смысл коэффициентов.

2.Система уравнений МНК для множественной линейной регрессии.

3.Анализ общего качества модели и значимости коэффициентов.

Основные понятия:

Уравнение множественной регрессии описывает совокупное влияние изменения множества объясняющих переменных на результативный признак.

Каждый коэффициент регрессии αk показывает, на сколько единиц в среднем изме-

нится y при увеличении значения фактора X(k) на одну единицу измерения, если значения остальных факторов сохранятся на постоянном уровне.

Коэффициент детерминации R2 показывает, какую долю вариации (дисперсии) Y можно объяснить с помощью модели регрессии.

Стандартизованные коэффициенты регрессии (бета-коэффициенты) показывают,

на сколько единиц стандартного отклонения изменится в среднем значение y, если значение

x(k) увеличится на величину своего стандартного отклонения при неизменных значениях остальных факторов.

Дельта-коэффициенты показывают, какую долю вносит каждый фактор в коэффициент детерминации.

Коэффициенты средней эластичности показывают, на сколько процентов среднего

значения изменится в среднем значение y, если значение x(k) увеличится на 1% среднего значения этого фактора при неизменных значениях остальных факторов.

Введение

Изменение экономических показателей происходит, как правило, вследствие изменения большого числа факторов. Задача исследования совокупного влияния нескольких объясняющих переменных на результативный признак Y решается с помощью множественного регрессионного анализа. Начинается анализ с построения уравнения множественной линейной регрессии.

1. Общий вид модели множественной линейной регрессии. Экономический смысл коэффициентов

Набор факторов X = (X(1), X(2), …, X(m)) включает m объясняющих переменных. Для заданного набора значений x(1), x(2), …, x(m) уравнение множественной линейной регрессии для генеральной совокупности имеет вид:

y = α1x(1) +α2 x(2) +...+αm x(m) + β +ε .

(11.1)

Уравнение множественной регрессии описывает совокупное влияние изменения множества объясняющих переменных на результативный признак.

Каждый коэффициент регрессии αk , k=1, 2, …, m показывает, на сколько единиц

в среднем изменится y при увеличении значения фактора X(k) на одну единицу измерения, если значения остальных факторов сохранятся на постоянном уровне.

Уравнение множественной регрессии, полученное по имеющейся выборке, содержащей n наблюдений переменных X и Y:

y = a x(1) + a

2

x(2) +...+ a

m

x(m) + b + e .

(11.2)

1

 

 

 

 

 

55

 

 

 

Полученные по уравнению регрессии значения

y = a x(1) + a

2

x(2) +...+ a

m

x(m) + b .

(11.3)

1

 

 

 

Пример

По данным 14 предприятий построено уравнение регрессии:

y = 7,04+ 0,544x1,

где y – производительность труда, т/ч; x1 – коэффициент механизации работ, %.

Смысл коэффициента регрессии: при увеличении уровня механизации работ на 1% производительность труда увеличивается в среднем на 0,544 т/ч.

Если учесть также x2 – средний стаж работников предприятий, лет, получим урав-

нение:

y =1,74 + 0,526x1 + 0,159x2.

Смысл коэффициентов регрессии: если уровень механизации работ увеличивается на 1% при неизменном среднем стаже работников, то производительность труда увеличивается в среднем на 0,526 т/ч. Если средний стаж работников увеличивается на 1 год при неизменном уровне механизации, то производительность труда увеличивается в среднем на

0,159 т/ч.

Коэффициенты при x1 в первом и втором уравнениях немного различаются. Объясняется это тем, что переменная x2, очевидно, коррелирует с x1, то есть коэффициент механизации и средний стаж работников немного связаны между собой.

Выводы

Чем меньше связаны между собой факторы из набора X, тем меньше изменяются коэффициенты регрессии при добавлении или исключении факторов (изменяется только свободный член).

При анализе экономического смысла коэффициентов регрессии следует обратить внимание на знаки и численные значения коэффициентов.

2. Система уравнений МНК для множественной линейной регрессии

Чтобы формально можно было на основе данных выборки, содержащей n наблюдений переменных X и Y, найти параметры a1, a2 , ..., am , b модели (11.2), необходимо выпол-

нение условия n > m + 1. Разность n m 1 называется число степеней свободы. Чем больше степеней свободы, тем больше статистическая надежность оценок параметров модели. Рекомендуемое требование: число наблюдений должно в пять раз превышать число факторов.

Основным методом определения параметров модели (11.2) является метод наименьших квадратов (МНК). По этому методу значения a1, a2 , ..., am , b находят так, чтобы

n

Qe = ei2 – сумма квадратов отклонений модели от исходных данных была минимальна.

i 1

Значения ei вычисляют для каждого наблюдения как разность заданных значений y

и модельных значений y , рассчитанных по формуле (11.3) при подстановке в нее заданных значений x(1), x(2), …, x(m).

Остатки (отклонения, или ошибки модели) ei = yi yi , (i =1, 2, ..., n ).

Qe рассматривается как функция неизвестных параметров модели a1, a2 , ..., am , b. Критерий МНК для множественной регрессии имеет вид:

n

n

(yi (a1xi(1) +a2 xi(2) +...+am xi(m) +b))2 min

 

Qe (a1, a2 , ..., am , b) = ei2

=

(11.4)

i 1

i =1

 

 

 

 

56

 

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]