Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Эконометрика. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
1 Мб
Скачать

1. Линейная модель множественной регрессии

П р и м е р 1. Исследовать зависимость розничного товарооборота, млрд руб., магазинов от среднесписочного числа работников. В табл. 1 в столбцах 2 и 3 приведены значения, соответственно, объемов розничного товарооборота у и среднесписочного числа работников х, а в следующих столбцах – значения необходимых расчетных величин.

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

Таблица 1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

№ п/п

 

у

х

(х х )2

( y

 

)2

х2

ху

ŷ

ε

 

ε2

 

y

1

 

2

 

3

4

 

5

 

 

6

7

8

9

 

10

1

 

0,5

 

73

1 600

0,49

5 329

36,5

0,43

0,07

 

0,0049

2

 

0,7

 

85

784

0,25

7 225

59,5

0,661

0,039

 

0,0015

3

 

0,9

 

102

121

0,09

10 404

91,8

0,998

–0,098

 

0,0096

4

 

1,1

 

115

4

 

0,01

13 225

126,5

1,239

–0,139

 

0,0193

5

 

1,4

 

122

81

0,04

14 884

170,8

1,373

0,027

 

0,0007

6

 

1,4

 

126

169

0,04

15 876

176,4

1,45

–0,05

 

0,0025

7

 

1,7

 

134

441

0,25

17 956

227,8

1,604

0,096

 

0,0092

8

 

1,9

 

147

1 156

0,49

21 609

279,3

1,854

0,046

 

0,0021

Сумма

 

9,6

 

904

4 356

1,66

106 508

1 168,6

9,592

0,001

 

0,0479

Среднее

1,2

 

113

544,5

0,2075

13 313,5

146,075

1,199

0,0001

 

0,0060

В соответствии с выражением (6)

 

 

 

 

 

 

 

 

х у)/(

 

– ( х)2) = (146,075 – 113 1,2)/544,5 = 0,019 24;

1

= (

 

х2

ху

0 = (( х2 ) ух ху)/( х2 – ( х)2) = (13 313,5 1,2 – 113 146,075)/544,5 = = –0,974.

Таким образом, получено уравнение регрессии

ŷ = –0,974 + 0,019 24х.

Коэффициент регрессии 1 = 0,019 24 показывает, что увеличение среднесписочной численности на одного человека приводит к повышению объема товарооборота в среднем на 19,24 млн руб. Это своего рода эмпирический норматив приростной эффективности использования работников данной группы магазинов. Если увеличение численности на одного работника приводит к меньшему росту объема товарооборота, то прием его на работу необоснован.

Выборочный коэффициент корреляции можно определить, используя равенство (7):

ryx = 0,019 24 544,5⁄0,2075 = 0,9856,

что свидетельствует о наличии тесной линейной связи между численностью работников и розничным товарооборотом.

11

Эконометрика

Встолбцах 8 и 10 табл. 1 вычислены выровненные значения эмпирической функции регрессии и квадраты их отклонений от наблюденных значений.

Всоответствии с выражением (8) получаем оценку дисперсии случайной составляющей:

2

1

2

 

 

 

 

n

 

σˆ

 

 

i 1 εi

= 0,0479/6 = 0,008.

n 2

Согласно формуле (9) значение коэффициента детерминации

R2 = 1 – Š2/S2 = 1 – 0,0479/1,66 = 0,971

показывает, что 97,1 % общей вариабельности розничного товарооборота объясняется изменениями числа работников, в то время как на все остальные факторы приходится лишь 2,9 % вариабельности.

Найденные отклонения фактических значений от выровненных (столбец 9) позволяют провести сравнительный анализ работы различных магазинов. Прежде всего необходимо обратить внимание на магазины с отрицательным отклонением (3, 4, 6). Особенно велико отклонение у 4-го магазина. Нужно внимательно обследовать эти магазины и установить причины отклонений. Это может быть расположение магазина в стороне от основных потоков покупателей, плохое обслуживание, неудовлетворительный кадровый состав и т. п. Здесь, по-видимому, имеются резервы в организации труда работников. Напротив, в магазинах 1, 2, 5, 7 и 8 работники используются эффективнее статистического «норматива», но может оказаться, что эти магазины объективно находятся в лучших условиях.

Обозначим Sx = i (xi x)2 , тогда дисперсия параметра 1 вычисля-

ется по формуле D( 1) = σ2/ Sx.

Значимость оцененного коэффициента регрессии 1 может быть проверена с помощью анализа его отношения к своему стандартному отклонению:

t = α

 

.

(10)

α

Эта величина имеет распределение Стьюдента с (n – 2) степенями свободы и называется t-статистикой (см. прил. 1, табл. П1.2). Можно использовать следующее грубое правило для оценки значимости коэффициента линейной регрессии:

если t < 1, то он не может быть признан значимым, поскольку доверительная вероятность здесь составляет менее 0,7;

если 1 < t < 2, то сделанная оценка может рассматриваться как более или менее значимая (доверительная вероятность здесь примерно от

0,70 до 0,95);

12

1. Линейная модель множественной регрессии

если 2 < t < 3, то это свидетельствует о весьма значимой связи (доверительная вероятность от 0,95 до 0,99);

если t > 3, то это есть практически стопроцентное свидетельство ее наличия.

Сформулированными правилами можно надежно пользоваться при

n 10.

При большом размере выборки повторяющиеся пары наблюдений группируются в виде корреляционной таблицы. Если nyx – количество наблюдений одинаковых пар (х, у), то для вычисления коэффициента корре-

 

 

 

 

 

 

xi yi

 

 

ляции в формуле (2) необходимо брать xy

.

 

 

 

n

 

 

 

 

 

 

 

 

 

 

 

Для оценки тесноты любой корреляционной связи вводится корре-

ляционное отношение Y к Х как корень квадратный из

 

R

2

=1-

å(yˆi - yi )2

 

,

 

(11)

 

å( yi - y)2

 

 

 

 

 

 

 

 

 

где y – вычисленное значение признака; yi

 

– фактическое значение при-

знака Y; y – общее среднее признака Y.

Чем ближе корреляционное отношение к единице, тем теснее связь между признаками, однако, оно не задает вида этой связи и не позволяет судить о степени близости наблюдений к какой-либо кривой.

П р и м е р 2. Пусть имеется распределение 50 га пахотной земли по количеству внесенных удобрений х (центнеров на 1 га) и по урожайности у (центнеров с 1 га), приведенное в табл. 2. В этой таблице, например, число 4, стоящее в 1-й строке 2-го столбца, показывает, что на 4 га из 50 было внесено по 10 ц удобрений и при этом получена урожайность по 15 ц с 1 га. Найти уравнение прямой линии регрессии y на x, коэффициент корреляции и корреляционное отношение по данным корреляционной табл. 2.

 

 

 

 

 

 

Таблица 2

 

 

 

 

 

 

 

 

 

у

 

 

x

 

 

 

10

20

30

ny

 

 

 

 

 

15

4

28

6

38

 

25

6

6

12

 

 

nх

10

28

12

n = 50

 

 

 

 

21

15

20

 

 

 

 

 

 

 

Вычислим сначала все средние и дисперсии: y = (38 15 + 12 25)/50 = 17,4,

13

Эконометрика

x= (10 10 + 28 20 + 12 30)/50 = 20,4,

х2 = (10 100 + 28 400 + 12 900)/50 = 460,

xy = (4 10 15 + 28 20 15 + 6 30 15 + 6 10 25 + 6 30 25)/50 = 354,

y =

 

 

 

х =

 

460

20,4

= 6,62,

 

 

= 4,27,

 

15

17,4

12

 

25

17,4

 

17,4

⁄50

 

38

 

12

25

 

2,73.

 

10

21

17,4

28 15

17,4

12

20

17,4

⁄50

 

Тогда коэффициент корреляции из выражения (2) ryx = (354 – 20,4 17,4)/(6,62 4,27) = –0,034,

коэффициент регрессии из равенства (7)

yx = –0,034 4,27/6,62 = –0,022,

уравнение прямой регрессии имеет вид

– 17,4 = –0,022·(х – 20,4) или

= –0,022х + 17,85,

и корреляционное отношение из выражения (11)

yx = 2,73/4,27 = 0,64.

Диаграмма рассеяния и прямая линия регрессии представлены на рис. 1: в кружках указаны частоты распределения выборки nyx.

25

6

 

6

 

 

 

 

 

= 0,022х + 17,85

15

4

28

6

 

10

20

30

 

 

Рис. 1

 

Из вычисленных показателей можно сделать следующий вывод: линейной связи между признаками нет, но какая-то связь есть, причем весьма существенная.

14

1. Линейная модель множественной регрессии

1.2. Множественная регрессия

Значения экономических переменных определяются обычно влиянием не одного, а нескольких объясняющих факторов. Задача оценки статистической взаимосвязи переменных у и х = (х1, х2, …, хm)T формулируется аналогично случаю парной регрессии. Ищется функция у = f( , х) + , где= ( 0, 1, 2, … , m) – вектор параметров – коэффициентов регрессии;– случайная ошибка.

З а м е ч а н и е 2. Верхний индекс T у вектора x означает операцию транспонирования, т. е. вектор-строка преобразуется в вектор-столбец.

В простейшем случае анализируется линейная зависимость у от х. Уравнение множественной линейной регрессии (3) имеет вид

y = 0 + 1х1 + 2х2 +…+ mхm + .

Если имеется n наблюдений факторов х и переменной у, то отклонение зависимой переменной у в j-м наблюдении от линии регрессии

j = уj 0 1хj1 2хj2 – … – mхjm (j = 1, 2, …, n).

Построение функции (3) проводится в два этапа.

На первом этапе необходимо произвести отбор факторов. Сначала вычисляются коэффициенты корреляции rik по формуле (2) между выбо-

рочными значениями факторов Хi = {xji} и Хk = {xjk}. Если rik > 0,8 (наблюдается сильная линейная связь между факторами Хi и Хk), то один из них отбрасывается (в принципе любой, но рекомендуется отбрасывать тот, информацию по которому труднее собрать или она менее достоверна). Затем вычисляются коэффициенты корреляции rпо формуле (2) между

выборочными значениями фактора Хi = {xji} и Y = {yj}. Если (практически отсутствует линейная связь между фактором Хi и руемым показателем Y), то и этот фактор отбрасывается.

Система нормальных уравнений для многофакторной

имеет вид

 

 

 

 

 

 

α0 α1

 

 

 

α2

 

 

... αm

 

 

 

 

 

 

 

 

 

 

 

x1

x2

xm

y,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

α

 

 

 

 

 

α

 

x 2 α

 

 

 

 

... α

 

 

 

 

 

 

 

 

 

 

 

,

 

 

 

 

x

 

 

 

x x

 

 

x x

 

x y

 

 

 

 

0 1

 

1 1

 

 

 

 

2 1 2

 

 

m 1 m

1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

α

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

α

 

 

 

 

α

 

 

 

 

...

α

 

x 2

 

 

.

0

 

x

x x

 

x x

m

x y

 

 

 

 

m

1 1 m

 

 

2 1

 

m

 

 

 

2

 

 

 

 

 

m

riy < 0,2

анализи-

регрессии

(12)

Для системы (12) можно использовать любой метод решения системы линейных уравнений (Гаусса, Крамера и пр.). Оцененное уравнение описывает как общий тренд (тенденцию) изменения зависимой перемен-

15

Эконометрика

ной у, так и отклонения от этого тренда. Проблема здесь состоит не только в том, чтобы объяснить возможно большую долю колебаний переменной у, но и отделить влияние каждого из факторов.

Для анализа статистической значимости полученных коэффициентов множественной линейной регрессии оценивают дисперсию D( i) и стан-

дартные отклонения S( i) =

 

коэффициентов i. Аналогично выра-

α

жению (10) величина t = i /S( i), называемая t-статистикой, имеет распределение Стьюдента с (n m – 1) степенями свободы. Если число степеней свободы достаточно велико (не менее 10), то при 5%-м уровне значимости можно приближенно считать оценку незначимой, если t-статистика по модулю меньше 1, и весьма надежной, если ее модуль больше 3.

Коэффициенты множественной линейной регрессии i имеют большой экономический смысл. Они показывают, на сколько изменится анализируемый показатель Y при изменении фактора Хi на единицу.

П р и м е р 3. Рассмотреть аналитические модели спроса, используя приведенные в табл. 3 конкретные статистические данные обследования семей, объединенные в девять групп (с приблизительно одинаковым объемом потребления).

 

 

 

 

 

 

 

 

 

 

Таблица 3

 

 

 

 

 

 

 

 

 

 

 

Номер

Расход

 

Душевой

 

Размер

ŷ

j

j2

группы

на питание у

 

 

доход х1

семей х2

 

 

 

1

2

3

4

5

6

7

1

433

628

1,5

333,6

99,4

9 880,36

2

616

1 577

2,1

626,5

–10,5

110,25

3

900

2 659

2,7

928,5

–28,5

812,25

4

1 113

3 701

3,2

1 189,8

–76,8

5 898,24

5

1 305

4 796

3,4

1 340,5

–34,5

1 190,25

6

1 488

5 926

3,6

1 493,6

–5,6

31,36

7

1 645

7 281

3,7

1 624,0

21

441

8

1 914

9 350

4,0

1 879,1

34,9

1 218

9

2 411

18 807

3,7

2 409,5

1,5

2,25

Среднее

у = 1 313,9

 

 

= 6 080,5

 

 

= 3,1

 

 

2 198,2

 

 

 

 

Рассмотрим сначала однофакторную линейную модель зависимости расходов на питание у от величины душевого дохода х1:

ŷ = а0 + а1х1,

параметры которой а0 и а1 найдем по формулам (6), используя данные

табл. 3 и х12 = (∑х12)/9 = 63 989 644,1, х1у = (∑х1у)/9 = 10 894 351. Решение: а0 = 660,06; а1 = 0,1075.

Получаем уравнение регрессии ŷ = 660,06 + 0,1075х1.

16

1. Линейная модель множественной регрессии

Затем вычислим среднюю квадратическую ошибку выборки (корень квадратный из дисперсии у):

Sу = ( (y y)2 ) / n ,

среднюю квадратическую ошибку (по уравнению (4)) Sŷ = ( ( y y)2 ) / n

и коэффициент детерминации Rŷх1 = 1 S 2 y / S 2 y .

В данном примере Sу2 = 454 070, Sŷ2 = 63 846, следовательно,

Rŷх1 = 1 63846⁄454070 = 0,927.

Полученное значение свидетельствует о том, что связь между расходами на питание и душевым доходом очень тесная.

Величина R2ŷх1 показывает долю изменения результативного признака под воздействием факторного признака. В данном примере R2ŷх1 = 0,859; это означает, что фактором душевого дохода можно объяснить почти 86 % изменения расходов на питание.

Рассмотрим теперь двухфакторную линейную модель зависимости расходов на питание у от величины душевого дохода х1 и размера семьи х2:

ŷ = а0 + а1х1 + а2х2 .

Параметры модели а0, а1 и а2 находятся посредством решения следующей системы нормальных уравнений:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

a0 x1a1 x2a2 y,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x1a0 x12a1 x1x2a2 yx1,

 

 

 

 

 

 

 

 

a

 

 

 

 

a

x2

a

 

,

x

x x

yx

 

2

0

1

 

2

1

 

2

 

2

 

 

 

2

 

 

 

 

 

 

 

 

 

которая также формируется с применением метода наименьших квадратов

(средние величины х1х2,

 

х2

и

вычисляются аналогично однофакторной

 

2

 

 

 

модели). Получаем систему

 

 

 

 

a0

6 080a1 3,1a2 1313,9,

 

 

 

 

 

 

21649,1a2 10 894 351,

6 080,5a0 63 989 644,1a1

 

3,1a0

21649,1a1

10,2a2 4 488,

 

которую решаем, например, методом Гаусса. Имеем уравнение

ŷ = –279,94 + 0,068 15х1 + 380,47х2 .

Для определения тесноты связи предварительно вычислим теоретические значения ŷ, затем уклонения j и их квадраты (см. табл. 3, столб-

17

Эконометрика

цы 5–7). Получим Sŷ2 = (∑(у ŷ)2)/n = 2 198,2. Используя ранее рассчитанное Sу2 = 454 070, имеем R2 = 1 – Sŷ2/Sу2 = 0,995. Коэффициент детерминации R2 показывает долю вариации результативного признака под воздействием изучаемых факторных признаков. У нас R2 = 0,995; это означает, что совместное влияние душевого дохода и размера семей объясняет почти 99,5 % изменения расходов на питание.

Влияние отдельных факторов в многофакторных моделях может быть охарактеризовано с помощью частных коэффициентов эластично-

сти, которые в случае линейной двухфакторной модели рассчитываются по формулам

Эŷх1(х2) = а1х1 / у,

Эŷх2(х1) = а2х2 / у.

(13)

Частные коэффициенты эластичности показывают, на сколько процентов изменится результативный признак, если изменить один из факторных признаков на 1 %, не меняя значения остальных.

В примере 3 имеем:

Эŷх1(х2) = 0,068 15·6 080,5/1 313,9 = 0,315, Эŷх2(х1) = 380,47·3,1/1 313,9 = 0,898.

Это означает, что при повишении душевого дохода на 1 % и неизменном размере семьи расходы на питание возрастает на 0,315 %, а увеличение на 1 % (условно) размера семьи при неизменном душевом доходе приведет к росту расходов на питание на 0,898 %.

Пр и м е р 4. Как размер платы за квартиру зависит от ее площади

иот количества человек, прописанных в квартире?

Данные приведены в табл. 4.

 

 

 

 

 

 

 

Таблица 4

 

 

 

 

 

 

 

 

№ п/п

Квартплата y, руб.

Площадь квартиры x1, м2

Количество человек x2

1

244,19

46,0

3

2

450,50

80,2

3

3

199,86

43,8

1

4

192,00

48,9

2

5

98,50

12,0

1

6

356,59

59,8

3

7

381,54

51,9

4

8

118,48

18,0

2

9

324,40

53,8

3

10

182,50

16,0

3

 

= 254,86

 

 

= 43,04

 

 

= 2,5

 

 

 

Построим линейную аддитивную модель в виде ŷ = а0 + а1x1 + а2x2. Необходимые данные для расчета модели представлены в табл. 5.

18

1. Линейная модель множественной регрессии

 

 

 

 

 

 

 

 

 

 

Таблица 5

 

 

 

 

 

 

 

 

x22

 

 

 

№ п/п

yx1

yx2

 

 

x12

 

 

x1x2

1

11 232,74

732,57

2 116

9

138

2

36 130,1

1 351,5

6 432,04

9

240,6

3

8 753,87

199,86

1 918,44

1

43,8

4

9 388,8

384

2 391,21

4

97,8

5

1 182

98,5

144

1

12,0

6

21 324,08

1 069,77

3 576,04

9

179,4

7

19 801,93

1 526,16

2 693,01

16

207,6

8

2 132,64

236,96

324

4

36

9

17 452,72

973,2

2 894,44

9

161,4

10

2 920

547,5

256

9

48,0

 

= 13 031,9

= 712

 

 

 

 

 

 

 

 

= 116,46

 

 

х12 = 2 274,58

 

х22 = 7,1

 

 

 

 

x1x2

Для решения линейной двухфакторной модели построим следующую систему уравнений:

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

a0 x1a1 x2a2 y,

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

x1a0 x12a1 x1x2a2 yx1,

 

 

 

 

 

 

 

 

 

a

 

 

 

 

a

x2

a

 

.

x

x x

yx

 

2

0

 

 

1

 

2

1

 

2

2

 

 

 

 

2

 

 

 

 

 

 

 

 

 

 

 

Нужно решить систему из трех линейных уравнений с тремя неизвестными и найти значения коэффициентов модели а0, а1 и а2.

Подставляя в данную систему найденные числовые значения, получим систему

 

а0 43,04a1 2,5a2 254,86,

 

 

43,04а0 2 274,58a1 116,46a2 13 031,89,

 

2,5а0 116,46a1 7,1a2 712.

 

Можно решить эту систему уравнений, например, методом Крамера. Получим, что ∆ = 280,49 ≠ 0, следовательно, система уравнений име-

ет единственное решение, которое найдем по формулам Крамера:

a

0

,

a

1

,

a

2 .

0

 

 

1

 

 

2

 

 

0 – 8 777,9,

1 1091,2,

2

13 322,02.

Теперь можно вычислить значения коэффициентов модели а0, а1 и а2:

а0 = –8 777,9/280,49 = –31,3, а1 = 1 091,2/280,49 = 3,89, а2 = 13 322,02/280,49 = 47,5.

19

Эконометрика

Тогда линейная аддитивная модель имеет следующий вид:

ŷ = –31,3 + 3,89x1 + 47,5x2.

Коэффициент регрессии модели а1 = 3,89 показывает, что каждый метр площади квартиры повышает квартплату на 3,89 руб., а коэффициент а2 = 47,5 – что каждый прописанный человек увеличивает квартплату на

47,5 руб.

Найдем теоретические значения ŷ и их отклонения от априорных

(табл. 6).

 

 

 

 

 

 

 

 

 

Таблица 6

 

 

 

 

 

 

 

 

 

 

№ п/п

 

 

y

(y

 

)2

ŷ

ε = ŷ – у

ε2

y

1

244,19

113,85

290,14

45,9

2 106,8

2

450,50

38 275,01

423,10

–27,4

750,8

3

199,86

3 025

186,52

–13,3

176,9

4

192,00

3 951,38

253,88

61,9

3 831,6

5

98,50

24 448,45

62,88

–35,6

1 267,4

6

356,59

10 348,99

343,79

–12,8

163,8

7

381,54

16 047,82

360,61

–20,9

436,8

8

118,48

18 599,50

133,74

15,3

234,1

9

324,40

4 835,81

320,47

–3,9

15,2

10

182,50

5 235,97

173,50

–9,0

81,0

∑/n

 

 

= 254,86

12 488,18

 

 

906,4

 

y

 

 

Совокупный коэффициент детерминации

R2 = 1 – 906,4/12 488,18 = 0,927.

Значение данного коэффициента близко к 1, что очень хорошо.

1.3.Оценивание регрессионных моделей

спомощью пакета прикладных программ Excel

Вданном параграфе рассматривается оценивание двух регрессонных моделей (одно- и многофакторной) с помощью прикладных программ

Excel.

1.3.1. Однофакторная регрессионная модель

Статистическая функция ЛИНЕЙН определяет параметры линейной регрессии у = ах + b. Порядок вычисления следующий:

1) введите исходные данные или откройте существующий файл, содержащий анализируемые данные;

20

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]