Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Эконометрика. Опорный конспект лекций для бакалавров очной и заочной форм обучения направлений подготовки «Экономика», «Бизнес-информатика».pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
1 Мб
Скачать

Лекция 6 Тема: Анализ показателей точности модели парной линейной регрессии

Получены формулы основных показателей точности модели регрессии: коэффициент детерминации, средняя квадратическая (стандартная) ошибка модели регрессии, средние квадратические ошибки параметров модели. Рассмотрены процедуры получения статистических выводов о коэффициенте регрессии: проверка гипотезы о статистической незначимости и определение доверительного интервала.

Основные вопросы:

1.Показатель общего качества модели регрессии – коэффициент детерминации.

2.Оценка дисперсии параметров модели регрессии.

3. Проверка гипотезы о статистической значимости коэффициента регрессии. Доверительный интервал для истинного значения коэффициента регрессии.

Основные понятия:

Коэффициент детерминации показывает, какую долю вариации (рассеивания) зависимой переменной y можно объяснить с помощью уравнения регрессии (объяснить

вариацией влияющего фактора x ).

Доверительный интервал для истинного значения коэффициента регрессии

интервал, в котором с заданной доверительной вероятностью, близкой к 1, находится неизвестное истинное значение коэффициента регрессии.

Введение

После того как найдено уравнение линейной регрессии y = a x + b , проводится

оценка значимости как уравнения в целом, так и его параметров a и b . Поскольку уравнение регрессии получено по данным выборки (часто небольшого объема n ), результаты непосредственно относятся только к этой выборке.

Надежность получаемых оценок параметров уравнения регрессии зависит от дисперсии случайных отклонений εi в генеральной совокупности, но поскольку по данным

выборки эти отклонения оценены быть не могут, они заменяются на ei = yi yi – отклонения значений yi от полученной линии регрессии. i – номер наблюдения, i =1...n .

1. Показатель общего качества модели регрессии – коэффициент детерминации

Центральное место в анализе модели занимает разложение общей суммы квадратов отклонений переменной у от среднего значения у на две части – «объясненную» и «необъясненную». Общая сумма квадратов отклонений индивидуальных значений y от

среднего значения y (называемая также вариацией) вызвана влиянием множества причин.

Условно разделим всю совокупность причин на две группы: изучаемый фактор x и прочие факторы.

Для модели регрессии со свободным членом справедливо равенство:

n

n

n

(yi yi )2 .

 

(yi y)2

= (yi y)2 +

(6.1)

i =1

i =1

i 1

 

 

Общая

Сумма

 

Остаточная

 

сумма

квадратов

 

(необъясненная)

 

квадратов

= отклонений,

+

сумма

 

отклонений

объясненная

 

квадратов

 

от среднего

регрессией

 

 

 

Формулу (6.1) называют правило сложения дисперсий.

30

n

(yi y)2 ;

n

(yi y)2 ;

n

(yi yi )2 ,

Введя обозначения: Q =

QR =

Qe =

i =1

 

i =1

 

i 1

 

формулу (6.1) записывают в виде:

 

 

 

 

 

Q = QR +Qe .

Если фактор x не оказывает влияния на результат, то линия регрессии на графике параллельна оси Ох и уравнение имеет вид: y = y . Тогда вся вариация (вся дисперсия)

результативного признака обусловлена воздействием прочих факторов, и общая сумма квадратов отклонений совпадет с остаточной суммой квадратов: Q = Qe . Если же прочие

факторы не влияют на результат, то связь y с x функциональная, Q = QR и остаточная

сумма квадратов равна нулю.

Точность модели регрессии и ее пригодность для прогноза зависит от того, какая часть общей вариации признака y приходится на объясненную вариацию.

 

R2 =

QR

,

 

(6.2)

 

 

 

 

 

Q

 

или

R2 =1

Qe

.

(6.3)

 

 

 

 

Q

 

R2

– коэффициент детерминации (читается R-квадрат).

 

R2

показывает, какую долю вариации (рассеивания) y

можно объяснить вариацией

x . Значение R2 [0;1). Обычно R2 выражают в процентах.

Формулу (6.2) можно применять только для модели со свободным членом, формула (6.3) более универсальна и применяется для любых моделей регрессии.

Самостоятельную важность показатель R2 приобретает лишь в случае множественной линейной регрессии. Для парной линейной регрессии коэффициент детерминации равен

квадрату коэффициента парной корреляции: R2 = r 2 .

Очевидно, что если сумма квадратов отклонений, обусловленная регрессией, существенно больше остаточной суммы квадратов, то фактор х оказывает существенное воздействие на результат, и уравнение регрессии статистически значимо. Коэффициент детерминации при этом будет приближаться к единице.

Выводы

Правило сложения дисперсий: общая сумма квадратов отклонений зависимой переменной от среднего распадается на сумму квадратов, обусловленную регрессией, и остаточную сумму квадратов, обусловленную влиянием неучтенных факторов.

Коэффициент детерминации показывает, какую долю вариации (рассеивания) зависимой переменной y можно объяснить с помощью уравнения регрессии.

Для парной линейной регрессии коэффициент детерминации равен квадрату коэффициента парной корреляции.

2. Оценка дисперсии параметров модели регрессии

Каждая сумма квадратов отклонений в формуле ( 6.1) связана с числом степеней свободы независимого варьирования признака. Число степеней свободы (df – degrees of freedom) связано с числом единиц совокупности n и с числом определяемых по ней параметров модели.

Разделив каждую сумму квадратов в формуле (6.1) на соответствующее ей число степеней свободы, получим средние квадраты отклонений, или, что то же самое, дисперсии в расчете на одну степень свободы.

31

Таблица 6.1 – Дисперсии в расчете на одну степень свободы

 

Формула

 

 

Название показателя

 

Примечание

D

= D* (Y ) =

(y y)2

 

Общая дисперсия

 

Из n вычитается 1 для свойства

общ

 

 

n 1

 

 

 

 

несмещенности

 

 

 

 

 

 

 

 

 

 

 

2

 

 

 

 

Dобъясн =

( y y)

 

Объясненная дисперсия

 

1 – число факторов

 

1

 

 

 

 

 

 

 

 

 

 

 

D

= S 2 = ( y y)2

 

Остаточная

 

 

 

 

 

 

 

 

 

 

 

ост

e

 

n 2

 

 

(необъясненная)

 

2 – число параметров модели

 

 

 

 

 

дисперсия

 

 

 

 

 

 

 

 

 

 

 

Существует формула

для расчета коэффициента

детерминации через дисперсии

(с учетом числа степеней свободы). Результат называется нормированный или скорректированный R-квадрат:

 

 

 

 

 

 

2 =1

Dост

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

R

.

 

 

 

 

 

 

 

 

 

(6.4)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

D

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

общ

 

 

 

 

 

 

 

 

 

Корень из остаточной дисперсии Se =

 

 

называется средняя квадратическая

Dост

(стандартная)

ошибка

модели

регрессии.

Вместо обозначения Se

используются

обозначения S y

и Sey ,

а также название средняя квадратическая (стандартная)

ошибка

оценки y .

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

a и b

 

 

Для парной регрессии оценки дисперсии

параметров

 

модели

можно

определить по формулам:

 

 

 

 

 

 

 

 

 

 

 

 

xi2

 

 

xi2

 

2

 

Se2

 

Se2

 

 

 

 

2

 

 

Se2

 

 

 

.(6.5).

D(a) = Sa =

 

 

=

 

 

;

D(b) =

Sb =

 

 

 

 

 

=

D(a)

 

 

(xi x)2

n D(x)

 

(xi x)2

n

n

Знаменатель величины D(a) тем больше, чем шире диапазон значений x, на котором оценивалась регрессия и чем больше n – число наблюдений. И в одном, и в другом случае изменение значения y в некоторых точках даст меньшее изменение наклона линии

регрессии. Величина D(b) пропорциональна D(a): чем сильнее меняется наклон прямой, тем больше отклонится точка пересечения прямой с осью Оy. Кроме того, D(b) тем больше, чем больше среднее значение x2.

Корень из дисперсии параметра называется среднеквадратичная ошибка параметра:

Sa = D(a) ; Sb = D(b) .

Выводы

Из формул (6.5) следует вывод: оценки параметров регрессии будут более достоверны (дисперсия параметров будет меньше), если:

1.Собрано больше данных (больше объём выборки n).

2.Больше разброс значений независимой переменной x.

3.Численные значения x не слишком велики. Например, если фактор – время, то лучше записывать год не 2019, а 19.

3. Проверка гипотезы о статистической значимости коэффициент а регрессии. Доверительный интервал для истинного значения коэффициента регрессии

Выдвигаем гипотезу о статистически незначимом отличии от нуля коэффициента регрессии в генеральной совокупности H0 : α = 0; H1 : α 0. Верность гипотезы H0 означает, что у прямой y = a x + b нет наклона, и наилучшая линия регрессии – прямая, параллельная оси абсцисс: y = y . Значимость свободного члена обычно не проверяют.

Для проверки гипотезы используется критерий Стьюдента. В его основе лежит утверждение:

32

«Случайная величина

t = a α

(6.6)

Sa

 

подчиняется распределению Стьюдента с числом степеней свободы n 2 ».

Если справедлива гипотеза H0 , то в формуле (6.6) полагаем α =0, и формула приобретает вид:

t =

a

.

(6.7)

 

 

Sa

 

Таким образом, значимость коэффициента a можно оценить по тому, во сколько раз значение коэффициента превосходит свою среднеквадратичную ошибку.

Проверка значимости коэффициента парной линейной регрессии эквивалентна проверке значимости коэффициента корреляции X и Y (получается одно и то же значение t и,

соответственно, один и тот же вывод по гипотезе H0 ).

Если гипотезу H0 отвергли, то оценка коэффициента регрессии является статис-

тически значимой. Тогда из формулы (6.6) можно найти границы доверительного интервала для истинного значения коэффициента регрессии, то есть, интервала, в кото-

ром с заданной доверительной вероятностью p находится неизвестное истинное значение коэффициента регрессии α

α (a ± ∆(a)), или: α (a −∆(a); a + ∆(a)),

(6.8)

где (a) = Sa tкр(1p; n 2),

Sa – среднеквадратичная ошибка коэффициента a ,

tкр – критическая точка распределения Стьюдента для значения α =1p и числа

степеней свободы n-2 (не путать: символом α обозначен и коэффициент регрессии в генеральной совокупности, и α =1p – вероятность того, что истинное значение коэффициента

регрессии находится за пределами найденного интервала). Обычно задают p = 0,95, что соответствует вероятности ошибки α = 0,05. С увеличением доверительной вероятности ширина доверительного интервала для коэффициента регрессии увеличивается.

Если применить формулу (6.5) в случае справедливости гипотезы H0 :α = 0, то

значение 0 будет входить в границы полученного интервала. Таким образом, можно совместить процедуру проверки гипотезы с нахождением доверительного интервала для

коэффициента регрессии: если полученный интервал (ak − ∆(ak ); ak + ∆(ak )) «накрывает» значение 0, гипотезу H0 следует принять.

Выводы

Из формулы (6.7) следует вывод: оценка коэффициента регрессии может оказаться незначимой, если:

а) наклон прямой линии регрессии мал, и тогда мало значение a ;

б) разброс точек вокруг линии регрессии слишком большой, и тогда у коэффициента регрессии слишком большая ошибка Sa .

Заключение Общее качество модели регрессии определяется коэффициентом детерминации. Он

показывает, какую долю вариации y можно объяснить вариацией x . Значение R2 [0;1).

Для парной линейной регрессии коэффициент детерминации равен квадрату коэффициента парной корреляции.

Результаты проверки гипотез о равенстве нулю коэффициента корреляции и коэффициента парной линейной регрессии совпадают.

33

Получение уравнения регрессии следует сопроводить проверкой гипотезы о равенстве нулю коэффициента регрессии (его статистической незначимости) и расчетом доверительного интервала для истинного значения коэффициента регрессии. Если коэффициент регрессии статистически незначим, то считаем, что в генеральной совокупности линия регрессии не имеет наклона, и наилучшее уравнение y = y .

С увеличением доверительной вероятности ширина доверительного интервала для коэффициента регрессии увеличивается, с увеличением объема выборки уменьшается.

Вопросы для закрепления материала:

1.Правило сложения дисперсий.

2.Что показывает коэффициент детерминации?

3.От чего зависит дисперсия коэффициента регрессии?

4.Критерий Стьюдента для проверки гипотезы о равенстве нулю коэффициента регрессии.

5.Как найти доверительный интервал для истинного значения коэффициента регрессии?

34

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]