- •Лекция 1 Тема: Предмет эконометрики. Методология эконометрического исследования
- •1. История эконометрики
- •2. Понятие эконометрического исследования
- •3. Общий вид эконометрической модели; этапы построения модели
- •Лекция 2 Тема: Парная корреляция
- •1. Задачи и предпосылки корреляционного анализа
- •2. Функциональная, корреляционная, статистическая связи. Виды и формы корреляционной связи
- •3. Коэффициент парной корреляции: определение, оценка по выборке
- •2. Использование закона распределения для выражения числовых характеристик случайной величины
- •3. Выборочный метод. Точечные и интервальные оценки
- •1. Случайная величина. Закон распределения случайной величины
- •1. Статистическая гипотеза. Ошибки в принятии решения по гипотезе
- •2. Алгоритм проверки статистической гипотезы
- •4. Доверительный интервал для коэффициента корреляции в генеральной совокупности
- •1. Модель парной линейной регрессии. Причины существования случайного члена уравнения регрессии
- •2. Метод наименьших квадратов. Преимущества и недостатки метода
- •3. Оценка параметров модели парной линейной регрессии по методу наименьших квадратов
- •Лекция 6 Тема: Анализ показателей точности модели парной линейной регрессии
- •1. Показатель общего качества модели регрессии – коэффициент детерминации
- •2. Оценка дисперсии параметров модели регрессии
- •Лекция 7 Тема: Проверка предпосылок к построению модели регрессии
- •2. Гомоскедастичность отклонений
- •3. Попарная независимость отклонений (отсутствие автокорреляции)
- •2. Формулы точечного и интервального прогноза по модели парной линейной регрессии
- •3. Графический метод проверки гипотезы о нормальном законе распределения
- •Лекция 9 Тема: Модели нелинейной регрессии
- •1. Примеры нелинейных эконометрических моделей
- •3. Выбор между линейной и нелинейной моделью
- •Лекция 10 Тема: Множественный корреляционный анализ
- •1. Множественная корреляция. Коэффициент детерминации
- •2. Мультиколлинеарность
- •3. Отбор факторов для построения модели регрессии. Частная корреляция
- •1. Общий вид модели множественной линейной регрессии. Экономический смысл коэффициентов
- •2. Система уравнений МНК для множественной линейной регрессии
- •3. Анализ общего качества модели и значимости коэффициентов
- •2. Лаговые переменные
- •3. Прогноз по уравнению множественной линейной регрессии
- •1. Временной ряд и его элементы
- •2. Цели анализа временных рядов. Этапы построения модели
- •3. Декомпозиция временного ряда
- •1. Глазомерный метод
- •2. Механические методы выравнивания
- •1. Понятие и задачи аналитического выравнивания временного ряда
- •2. Выбор модели по методу характеристик прироста
- •3. Методы оценивания параметров модели временного ряда
- •1. Понятие сезонной компоненты. Индексы сезонности
- •2. Алгоритмы построения тренд-сезонной модели
- •3. Моделирование сезонных колебаний
- •Лекция 17 Тема: Прогнозирование временных рядов
- •1. Точечный прогноз. Свойства остаточной компоненты
- •2. Интервальный прогноз
- •3. Верификация прогноза
- •Лекция 18 Тема: Модели стационарных временных рядов
- •1. Модели авторегрессии
- •2. Модель авторегрессии – скользящего среднего
- •3. Модель авторегрессии – проинтегрированного скользящего среднего
- •Лекция 19 Тема: Системы одновременных уравнений
- •1. Виды одновременных уравнений
- •2. Методы оценки систем одновременных уравнений
- •3. Проблема идентифицируемости системы одновременных уравнений
Лекция 6 Тема: Анализ показателей точности модели парной линейной регрессии
Получены формулы основных показателей точности модели регрессии: коэффициент детерминации, средняя квадратическая (стандартная) ошибка модели регрессии, средние квадратические ошибки параметров модели. Рассмотрены процедуры получения статистических выводов о коэффициенте регрессии: проверка гипотезы о статистической незначимости и определение доверительного интервала.
Основные вопросы:
1.Показатель общего качества модели регрессии – коэффициент детерминации.
2.Оценка дисперсии параметров модели регрессии.
3. Проверка гипотезы о статистической значимости коэффициента регрессии. Доверительный интервал для истинного значения коэффициента регрессии.
Основные понятия:
Коэффициент детерминации показывает, какую долю вариации (рассеивания) зависимой переменной y можно объяснить с помощью уравнения регрессии (объяснить
вариацией влияющего фактора x ).
Доверительный интервал для истинного значения коэффициента регрессии –
интервал, в котором с заданной доверительной вероятностью, близкой к 1, находится неизвестное истинное значение коэффициента регрессии.
Введение
После того как найдено уравнение линейной регрессии y = a x + b , проводится
оценка значимости как уравнения в целом, так и его параметров a и b . Поскольку уравнение регрессии получено по данным выборки (часто небольшого объема n ), результаты непосредственно относятся только к этой выборке.
Надежность получаемых оценок параметров уравнения регрессии зависит от дисперсии случайных отклонений εi в генеральной совокупности, но поскольку по данным
выборки эти отклонения оценены быть не могут, они заменяются на ei = yi − yi – отклонения значений yi от полученной линии регрессии. i – номер наблюдения, i =1...n .
1. Показатель общего качества модели регрессии – коэффициент детерминации
Центральное место в анализе модели занимает разложение общей суммы квадратов отклонений переменной у от среднего значения у на две части – «объясненную» и «необъясненную». Общая сумма квадратов отклонений индивидуальных значений y от
среднего значения y (называемая также вариацией) вызвана влиянием множества причин.
Условно разделим всю совокупность причин на две группы: изучаемый фактор x и прочие факторы.
Для модели регрессии со свободным членом справедливо равенство:
n |
n |
n |
(yi − yi )2 . |
|
∑(yi − y)2 |
= ∑(yi − y)2 + ∑ |
(6.1) |
||
i =1 |
i =1 |
i −1 |
|
|
Общая |
Сумма |
|
Остаточная |
|
сумма |
квадратов |
|
(необъясненная) |
|
квадратов |
= отклонений, |
+ |
сумма |
|
отклонений |
объясненная |
|
квадратов |
|
от среднего |
регрессией |
|
|
|
Формулу (6.1) называют правило сложения дисперсий.
30
n |
(yi − y)2 ; |
n |
(yi − y)2 ; |
n |
(yi − yi )2 , |
Введя обозначения: Q = ∑ |
QR = ∑ |
Qe = ∑ |
|||
i =1 |
|
i =1 |
|
i −1 |
|
формулу (6.1) записывают в виде: |
|
|
|
|
|
Q = QR +Qe .
Если фактор x не оказывает влияния на результат, то линия регрессии на графике параллельна оси Ох и уравнение имеет вид: y = y . Тогда вся вариация (вся дисперсия)
результативного признака обусловлена воздействием прочих факторов, и общая сумма квадратов отклонений совпадет с остаточной суммой квадратов: Q = Qe . Если же прочие
факторы не влияют на результат, то связь y с x функциональная, Q = QR и остаточная
сумма квадратов равна нулю.
Точность модели регрессии и ее пригодность для прогноза зависит от того, какая часть общей вариации признака y приходится на объясненную вариацию.
|
R2 = |
QR |
, |
|
(6.2) |
|
|
|
|
||||
|
|
Q |
|
|||
или |
R2 =1− |
Qe |
. |
(6.3) |
||
|
||||||
|
|
|
Q |
|
||
R2 |
– коэффициент детерминации (читается R-квадрат). |
|
||||
R2 |
показывает, какую долю вариации (рассеивания) y |
можно объяснить вариацией |
||||
x . Значение R2 [0;1). Обычно R2 выражают в процентах.
Формулу (6.2) можно применять только для модели со свободным членом, формула (6.3) более универсальна и применяется для любых моделей регрессии.
Самостоятельную важность показатель R2 приобретает лишь в случае множественной линейной регрессии. Для парной линейной регрессии коэффициент детерминации равен
квадрату коэффициента парной корреляции: R2 = r 2 .
Очевидно, что если сумма квадратов отклонений, обусловленная регрессией, существенно больше остаточной суммы квадратов, то фактор х оказывает существенное воздействие на результат, и уравнение регрессии статистически значимо. Коэффициент детерминации при этом будет приближаться к единице.
Выводы
Правило сложения дисперсий: общая сумма квадратов отклонений зависимой переменной от среднего распадается на сумму квадратов, обусловленную регрессией, и остаточную сумму квадратов, обусловленную влиянием неучтенных факторов.
Коэффициент детерминации показывает, какую долю вариации (рассеивания) зависимой переменной y можно объяснить с помощью уравнения регрессии.
Для парной линейной регрессии коэффициент детерминации равен квадрату коэффициента парной корреляции.
2. Оценка дисперсии параметров модели регрессии
Каждая сумма квадратов отклонений в формуле ( 6.1) связана с числом степеней свободы независимого варьирования признака. Число степеней свободы (df – degrees of freedom) связано с числом единиц совокупности n и с числом определяемых по ней параметров модели.
Разделив каждую сумму квадратов в формуле (6.1) на соответствующее ей число степеней свободы, получим средние квадраты отклонений, или, что то же самое, дисперсии в расчете на одну степень свободы.
31
Таблица 6.1 – Дисперсии в расчете на одну степень свободы
|
Формула |
|
|
Название показателя |
|
Примечание |
||
D |
= D* (Y ) = |
∑(y − y)2 |
|
Общая дисперсия |
|
Из n вычитается 1 для свойства |
||
общ |
|
|
n −1 |
|
|
|
|
несмещенности |
|
|
|
|
|
|
|
|
|
|
|
∑ |
|
2 |
|
|
|
|
Dобъясн = |
( y − y) |
|
Объясненная дисперсия |
|
1 – число факторов |
|||
|
1 |
|
|
|
||||
|
|
|
|
|
|
|
|
|
D |
= S 2 = ∑( y − y)2 |
|
Остаточная |
|
|
|||
|
|
|
|
|
|
|
|
|
ост |
e |
|
n − 2 |
|
|
(необъясненная) |
|
2 – число параметров модели |
|
|
|
|
|
дисперсия |
|
|
|
|
|
|
|
|
|
|
|
|
|
Существует формула |
для расчета коэффициента |
детерминации через дисперсии |
|||||
(с учетом числа степеней свободы). Результат называется нормированный или скорректированный R-квадрат:
|
|
|
|
|
|
2 =1− |
Dост |
|
|
|
|
|
|
|
|
|
|
|
||
|
|
|
|
|
R |
. |
|
|
|
|
|
|
|
|
|
(6.4) |
||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||
|
|
|
|
|
|
|
|
D |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
общ |
|
|
|
|
|
|
|
|
|
|||
Корень из остаточной дисперсии Se = |
|
|
называется средняя квадратическая |
|||||||||||||||||
Dост |
||||||||||||||||||||
(стандартная) |
ошибка |
модели |
регрессии. |
Вместо обозначения Se |
используются |
|||||||||||||||
обозначения S y |
и Sey , |
а также название средняя квадратическая (стандартная) |
ошибка |
|||||||||||||||||
оценки y . |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
a и b |
|
|
|
Для парной регрессии оценки дисперсии |
параметров |
|
модели |
можно |
||||||||||||||||
определить по формулам: |
|
|
|
|
|
|
|
|
|
|
|
|
∑xi2 |
|
|
∑xi2 |
|
|||
2 |
|
Se2 |
|
Se2 |
|
|
|
|
2 |
|
|
Se2 |
|
|
|
.(6.5). |
||||
D(a) = Sa = |
|
|
= |
|
|
; |
D(b) = |
Sb = |
|
|
|
|
|
= |
D(a) |
|
|
|||
∑(xi − x)2 |
n D(x) |
|
∑(xi − x)2 |
n |
n |
|||||||||||||||
Знаменатель величины D(a) тем больше, чем шире диапазон значений x, на котором оценивалась регрессия и чем больше n – число наблюдений. И в одном, и в другом случае изменение значения y в некоторых точках даст меньшее изменение наклона линии
регрессии. Величина D(b) пропорциональна D(a): чем сильнее меняется наклон прямой, тем больше отклонится точка пересечения прямой с осью Оy. Кроме того, D(b) тем больше, чем больше среднее значение x2.
Корень из дисперсии параметра называется среднеквадратичная ошибка параметра:
Sa = 
D(a) ; Sb = 
D(b) .
Выводы
Из формул (6.5) следует вывод: оценки параметров регрессии будут более достоверны (дисперсия параметров будет меньше), если:
1.Собрано больше данных (больше объём выборки n).
2.Больше разброс значений независимой переменной x.
3.Численные значения x не слишком велики. Например, если фактор – время, то лучше записывать год не 2019, а 19.
3. Проверка гипотезы о статистической значимости коэффициент а регрессии. Доверительный интервал для истинного значения коэффициента регрессии
Выдвигаем гипотезу о статистически незначимом отличии от нуля коэффициента регрессии в генеральной совокупности H0 : α = 0; H1 : α ≠ 0. Верность гипотезы H0 означает, что у прямой y = a x + b нет наклона, и наилучшая линия регрессии – прямая, параллельная оси абсцисс: y = y . Значимость свободного члена обычно не проверяют.
Для проверки гипотезы используется критерий Стьюдента. В его основе лежит утверждение:
32
«Случайная величина
t = a −α |
(6.6) |
Sa |
|
подчиняется распределению Стьюдента с числом степеней свободы n − 2 ».
Если справедлива гипотеза H0 , то в формуле (6.6) полагаем α =0, и формула приобретает вид:
t = |
a |
. |
(6.7) |
|
|||
|
Sa |
|
|
Таким образом, значимость коэффициента a можно оценить по тому, во сколько раз значение коэффициента превосходит свою среднеквадратичную ошибку.
Проверка значимости коэффициента парной линейной регрессии эквивалентна проверке значимости коэффициента корреляции X и Y (получается одно и то же значение t и,
соответственно, один и тот же вывод по гипотезе H0 ).
Если гипотезу H0 отвергли, то оценка коэффициента регрессии является статис-
тически значимой. Тогда из формулы (6.6) можно найти границы доверительного интервала для истинного значения коэффициента регрессии, то есть, интервала, в кото-
ром с заданной доверительной вероятностью p находится неизвестное истинное значение коэффициента регрессии α
α (a ± ∆(a)), или: α (a −∆(a); a + ∆(a)), |
(6.8) |
где ∆(a) = Sa tкр(1− p; n −2),
Sa – среднеквадратичная ошибка коэффициента a ,
tкр – критическая точка распределения Стьюдента для значения α =1− p и числа
степеней свободы n-2 (не путать: символом α обозначен и коэффициент регрессии в генеральной совокупности, и α =1− p – вероятность того, что истинное значение коэффициента
регрессии находится за пределами найденного интервала). Обычно задают p = 0,95, что соответствует вероятности ошибки α = 0,05. С увеличением доверительной вероятности ширина доверительного интервала для коэффициента регрессии увеличивается.
Если применить формулу (6.5) в случае справедливости гипотезы H0 :α = 0, то
значение 0 будет входить в границы полученного интервала. Таким образом, можно совместить процедуру проверки гипотезы с нахождением доверительного интервала для
коэффициента регрессии: если полученный интервал (ak − ∆(ak ); ak + ∆(ak )) «накрывает» значение 0, гипотезу H0 следует принять.
Выводы
Из формулы (6.7) следует вывод: оценка коэффициента регрессии может оказаться незначимой, если:
а) наклон прямой линии регрессии мал, и тогда мало значение a ;
б) разброс точек вокруг линии регрессии слишком большой, и тогда у коэффициента регрессии слишком большая ошибка Sa .
Заключение Общее качество модели регрессии определяется коэффициентом детерминации. Он
показывает, какую долю вариации y можно объяснить вариацией x . Значение R2 [0;1).
Для парной линейной регрессии коэффициент детерминации равен квадрату коэффициента парной корреляции.
Результаты проверки гипотез о равенстве нулю коэффициента корреляции и коэффициента парной линейной регрессии совпадают.
33
Получение уравнения регрессии следует сопроводить проверкой гипотезы о равенстве нулю коэффициента регрессии (его статистической незначимости) и расчетом доверительного интервала для истинного значения коэффициента регрессии. Если коэффициент регрессии статистически незначим, то считаем, что в генеральной совокупности линия регрессии не имеет наклона, и наилучшее уравнение y = y .
С увеличением доверительной вероятности ширина доверительного интервала для коэффициента регрессии увеличивается, с увеличением объема выборки уменьшается.
Вопросы для закрепления материала:
1.Правило сложения дисперсий.
2.Что показывает коэффициент детерминации?
3.От чего зависит дисперсия коэффициента регрессии?
4.Критерий Стьюдента для проверки гипотезы о равенстве нулю коэффициента регрессии.
5.Как найти доверительный интервал для истинного значения коэффициента регрессии?
34
