Последствия неправильной спецификации модели
Введение
На практике, выбирая спецификацию модели, мы заранее не можем знать, какие из переменных выбрать для объяснения зависимой переменной. Мы можем лишь, исходя из некоторых соображений, построить спецификацию модели предположительно. Что произойдет, если в модель не будет включена переменная, которая должна быть там? Или в модели окажется «лишняя» переменная?
- Если в модели отсутствует значимая переменная, то оценки коэффициентов регрессии, вообще говоря, хотя и не всегда, оказываются смещенными. Стандартные ошибки коэффициентов и соответствующие t-статистики в целом становятся некорректными.
- Если в модель включена незначимая переменная, то оценки коэффициентов регрессии будут несмещенными, однако, вообще говоря (хотя и не всегда), - неэффективными. Стандартные ошибки будут в целом корректны, но из-за неэффективности регрессионных оценок они будут излишне большими.
Влияние невключения значимой переменной
Предположим, переменная y линейно зависит от двух переменных x1 и x2, т.е.
однако, посчитав переменную x2 незначимой, исследователь строит модель:
Оценивая
эту модель, получает регрессию
,
где
.
Проверим оценку b1 на несмещенность:
Оценка
величины не будет смещенной, если ее
математическое ожидание совпадает со
значением этой величины, т.е. если
.
В
предположениях теоремы Гаусса-Маркова
.
Значит,
Следовательно,
оценка b1
смещена на величину
если
переменные x1
и x2
коррелируют между собой.
Смещенности
оценки можно дать объяснение:
переменная x1
непосредственно влияет на y. Кроме того,
т.к. переменные x1
и x2
коррелированы, то x1
некоторым образом имитирует поведение
переменной x2.
Смещение, которое наблюдается у оценки
b1
в формуле (2.2), и есть коэффициент имитации
переменной x1
поведение переменной x2.
Т.е. коэффициент имитации равен
.
Этого
смещения не будет лишь в одном случае
– ковариация переменных x1
и x2
равна нулю, т.е.
.
Все вышеприведенные теоретические выкладки наиболее удачно демонстрируются экспериментом по методу Монте-Карло, который используется в следующем примере:
В
приведенном выше примере мы получаем,
что при невключении в модель переменной
A, т.е. при
,
коэффициент
сильно
смещается.
Как выяснено выше, при оценке коэффициента в среднем мы получим значение
а
оценка b2
в среднем должна быть смещена на
.
Т.е. значение оценки b2
будет занижено. Следовательно, будет
занижено влияние образования S на
величину среднечасовой заработок Y.
Аналогично,
смещение происходит и при невключении
в модель переменной S, т.е. при
.
В этом случае смещение
.
Очевидно, что результаты оценивания как правильной модели, так и неполных моделей зависят от значений, которые принимает случайный член u, и было бы несправедливо придавать большой вес одному эксперименту, даже если он дает предсказуемые результаты.
В таблице приведены результаты 10-ти таких экспериментов:
Из
таблицы видно, что при спецификациях,
в которых отсутствуют значимые переменные,
оценки b1
и b2
разбросаны около своих средних значений
.
В то время как коэффициенты в правильно
специфицированной модели разбросаны
около своих истинных значений, равных
0,36 и 0,74 соответственно.
Применимость статистических тестов
Самым серьезным следствием невключения переменной, которая на самом деле является значимой является то, что формулы для стандартных ошибок коэффициентов и тестовые статистики, вообще говоря, становятся неприменимыми. Это, разумеется, означает, что, основываясь на полученных результатах оценки регрессии, в принципе нельзя заниматься проверкой каких-либо гипотез.
Влияние включения в модель "лишней" переменной
Допустим, что истинная модель представляется в виде:
а вы считаете, что ею является
и рассчитываете
оценку величины b1, используя
формулу для модели с двумя объясняющими
переменными вместо выражения
.
В целом проблемы
смещения здесь нет, даже если b1
будет рассчитана неправильно. Величина
E(b1) остается равной
,
но в общем оценка будет неэффективной.
Она будет более неустойчивой, в смысле
наличия большей дисперсии относительно
,
чем при правильном вычислении. Это
проиллюстрировано на рис 3.
Это можно легко объяснить интуитивно. Истинная модель может быть записана в виде:
Таким образом, если
вы строите регрессионную зависимость
y от x1 и x2, то b1 будет
являться несмещенной оценкой величины
,
а b2 будет несмещенной оценкой
нуля (при выполнении условий Гаусса-Маркова).
Практически вы обнаруживаете для себя,
что
равно
нулю. Если бы вы заранее поняли, что
равно
нулю, то могли бы использовать эту
информацию для исключения x2 и
применить парную регрессию, которая в
данном случае является более эффективной.
Утрата эффективности в связи со включением x2 в случае, когда она не должна была быть включена, зависит от корреляции между x1 и x2. Сравните дисперсии величины b1 при построении парной и множественной регрессии:
Дисперсия в общем окажется большей при множественной регрессии, и разница будет тем большей, чем ближе коэффициент корреляции к единице или –1. Единственным исключением в связи с проблемой утраты эффективности является вариант, когда коэффициент корреляции точно равен нулю. В этом случае оценка b1 для множественной регрессии совпадет с оценкой для парной регрессии.
В выводе о несмещенности есть одно исключение, которое необходимо иметь ввиду. Если величина x2 коррелирует с u, то коэффициенты регрессии будут в конечном счете смещенными. Если модель записать как уравнение (2.3), то это будет означать, что не выполняется условие Гаусса-Маркова о гомоскедастичности.
