Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы статистики. Учебное пособие
.pdf
n
x
σ
σ
t
1
r
t
t
η
( )
jj
yy n
−⋅
y
0
y
n
0
( )
n
∑
i
7.2. Этапы корреляционного анализа
— число наблюдений;
,
— соответственно, среднее квадратическое отклонение
y
по факторному и результативному признакам.
Линейный коэффициент корреляции может принимать любые значения в диапазоне от –1 до +1. Чем ближе линейный коэффициент
корреляции по модулю к 1, тем теснее связь, чем ближе к 0, тем связь
слабее, 0 — отсутствие связи. Знак линейного коэффициента корреляции показывает направление связи:
«+» — прямая зависимость,
«—» — обратная.
Для проверки значимости линейного коэффициента корреляции при
большом объеме выборки (n более 50) рассчитывается
1
rn
−
больше
ðàñ÷
−
(7.3)
2
(см. приложение 4) при числе степеней сво-
òàáë
t
ðàñ÷
Если
=
по формуле:
ðàñ÷
боды, равным n-2, и заданном уровне значимости, то в генеральной
совокупности линейный коэффициент корреляции значим;
2) на практике достаточно часто встречаются криволинейные зависимости между признаками. Для оценки степени тесноты связи при
таких зависимостях используют эмпирическое корреляционное отношение:
2
δ
,
= (7.4)
2
σ
0
где:
2
δ
— межгрупповая дисперсия, которая рассчитывается по формуле:
k
∑
1
j
=
2
δ
=
∑
2
0
,
k
n
j
1
j
=
(7.5)
где:
и
— соответственно групповые и общая средние, рассчитанные
j
по значениям результативного признака;
— число наблюдений в j-й группе;
j
k — число групп.
2
–общая дисперсия, которая рассчитывается по формуле:
n
2 22
= = +
0
yy
i
=
1
2
−
i
0
,
(7.6)
где:
y — индивидуальные значения результативного признака;
101

jj
σ
73, 7,
δ
0
σ
η
( ) ( )
22
:.
1
k nk
−−
F
F
1
kk= −
2
k nk= −
1,
∑
i
Глава 7. Основы корреляционного и регрессионного анализа
n — число наблюдений;
2
— средняя из внутригрупповых дисперсий:
k
2
n
σ
∑
⋅
j
=
1
,
k
j
(7.7)
n
j
1
=
∑
2
=
где:
2
— дисперсия результативного признака в j группе.
j
Числовой пример. Рассчитаем эмпирическое корреляционное от-
ношение по данным таблицы 5.3. Так как межгрупповая дисперсия
2
=
а общая дисперсия
2
76,9,
=
эмпирическое корреляционное
отношение составит:
2
δ
= = =
σ
73, 7
2
0
0,979.
76,9
Следовательно, связь между характером образования и уровнем
заработной платы тесная.
Для проверки значимости эмпирического корреляционного отно-
шения используется дисперсионное отношение:
k kn
yy n yy
∑ ∑∑
F
=
ðàñ÷
−⋅ −
j j ij j
j ji
1 11
= = =
0
j
(7.8)
Если
значимости и числе степеней свободы
ционная связь между признаками существенна, в противном случае —
несущественна;
3) Для оценки степени тесноты связи между признаками, распределение которых отлично от нормального, применяется коэффициент
рангов Спирмэна, который рассчитывается по формуле:
ρ
где:
2
ному признаку.
Числовой пример. По данным табл. 7.3 необходимо оценить степень
тесноты и направление связи между уровнем преступности и уровнем
безработицы с помощью коэффициента рангов Спирмэна, расчет которого представлен в табл. 7.5.
102
= −
больше
ðàñ÷
6
2
nn
( )
n
2
d
i
i
=
1
(7.9)
−
1
(см. приложение 5) при заданном уровне
òàáë
1
и
,
корреля-
— квадрат разностей рангов по признаку-фактору и результатив-

7.2. Этапы корреляционного анализа
( )
d
78
6 9,5
⋅
=−=
( )
( )
ad bc
ad bc
−
ad bc
−
++ ++
Расчет коэффициента рангов Спирмэна
Таблица 7.5
Город x y Ранг Разность
по x по y
А 5,3 1039 10 10 0 0
Б 5,2 965 9 7,5 –1,5 2,25
В 5,0 975 8 9 1 1
Г 4,6 830 4 4 0 0
Д 4,9 965 7 7,5 0,5 0,25
Е 4,8 889 6 6 0 0
Ж 4,7 873 5 5 0 0
З 4,4 720 2 3 1 1
И 4,5 670 3 1 –2 4
К 4,3 710 1 2 1 1
Итого – – – – – 9,5
Следует обратить внимание на то, что городам Б и Д были присвое-
ны ранги по y, равные
+
7,5. Это обусловлено тем, что у этих го-
рангов
d
2
2
родов одинаковые значения результативного признака, равные 965.
Коэффициент Спирмена составит:
1 0,942.
ρ
Значение коэффициента Спирмена свидетельствует о том, что связь
между уровнем безработицы и уровнем преступности обратная и очень
тесная;
4) степень тесноты связи между качественными признаками, каждый
из которого может принимать только два альтернативных значения,
используются коэффициенты ассоциации
2
10 10 1
−
( )
K и контингенции
A
:
K
K
K
=
A
+
K
=
K
abcdacbd
( )( )( )( )
,
(7.10)
,
(7.11)
103

( )
f
f
′
1
k
2
k
21
11
kk
ij
ff
∑∑
Глава 7. Основы корреляционного и регрессионного анализа
где:
a, b, c, d — частоты таблицы «четырех полей» (см. табл. 7.6)
Таблица «четырех полей»
Таблица 7.6
Признак Значение
признака B
Альтернативное
значение признака B
Значение признака А a b
тернативное
Аль
c d
значение признака А
Коэффициенты ассоциации и контингенции могут принимать любые значения в диапазоне от –1 до +1. Величина коэффициента по модулю показывает степень тесноты взаимосвязи, а знак — направление
связи;
5) для оценки связи между качественными показателями с большим
числом градаций используется критерий Пирсона
2
,
χ
который рассчи-
тывается по формуле:
2
′
ff
2
χ
kk
21
=
∑∑
11
= =
ij
−
ij ij
′
f
ij
,
(7.12)
где:
и
— соответственно эмпирические и теоретические частоты
ij
ij
в i-той строке и j-том столбце;
и
— число групп в строках и столбцах таблицы.
Теоретические частоты рассчитываются по формуле:
′
f
=
ij
kk
21
∑∑
ij
11
= =
При расчете
.
(7.13)
f
2
χ
важно соблюдать следующие требования:
×
= =
а) критерий Пирсона рассчитывается по совокупности с числом
наблюдений не менее 50;
б) теоретические частоты в каждом интервале должны быть более
или раны 5.
Числовой пример. Известны следующие данные по нелегальной миграции и уровню преступности по области (см. табл. 7.7).
104

Исходные данные по области
24 25
69
⋅
24 26
69
⋅
24 18
69
⋅
25 25
69
⋅
25 26
69
⋅
25 18
69
⋅
20 25
69
⋅
20 26
69
⋅
20 18
69
⋅
( ) ( ) ( ) ( ) ( )
( )( )
3131 4
0,05
α
=
22
χχ
7.3. Уравнение регрессии
Таблица 7.7
Уровень
преступности
Высокие 13 9 2 24
Средние 8 11 6 25
Низкие 4 6 10 20
Итого 25 26 18 69
Высокая Средняя Низкая Итого
Коэффицие
нт нелегальной миграции
Рассчитаем теоретические частоты:
′
f
= =
11
′
f
= =
21
′
f
= =
31
8,7;
9, 1;
7, 3;
′
f
= =
12
′
f
= =
22
′
f
= =
32
9,0;
9,4;
7, 5;
′
f
= =
13
′
f
= =
23
′
f
= =
33
6, 3;
6, 5;
5,2.
Показатель Пирсона составит:
13 8, 7 9 9 2 6, 3 8 9,1 11 9, 4
2
χ
= ++ + + +
ðàñ÷
−−− −
6 6,5 4 7,3 6 7,5 10 5,2
( ) ( ) ( ) ( )
++++ =
22 2 2 2
− −− − −
8,7 9 6, 3 9,1 9, 4
222 2
11,727.
6,5 7,3 7,5 5,2
Табличное значение показателя при числе степеней свободы
k =− −=
и уровне значимости
составляет 9,5 (см.
приложение 6).
Так как
ðàñ÷ òàáë
,
>
то с вероятностью 95% можно считать, что распре-
деление единиц неслучайно, а значит между признаками имеется связь.
признаками строится уравнение регрессии, оценивается его адекватность
и значимость параметров модели.
функции для уравнения регрессии. Наиболее часто используются следующие типы функций:
7.3. Уравнение регрессии
При значимой корреляции между результативным и факторными
На основе логического и эмпирического анализа выбирается тип
105

01
ˆ
x
01 2
x
23
01 2 3
x
01
x
0
x
1
x
( )
∑
+=
+=
∑∑
∑ ∑∑
01
yx
nn
∑ ∑∑
∑∑
3 42
bxbxbx xy
bxbxbx xy
ˆ
nl
Глава 7. Основы корреляционного и регрессионного анализа
• линейная
y b bx=+⋅
• парабола второго порядка
• парабола третьего порядка
• показательная
• степенная
ˆ
y bb= ⋅
ˆ
y bx= ⋅
• гиперболическая
;
ˆ
y b bx bx= + ⋅+ ⋅
ˆ
y b bx bx bx= + ⋅+ ⋅ + ⋅
x
;
b
1
;
ˆ
y bb
=+⋅
01
x
2
;
;
.
Параметры уравнения регрессии рассчитываются с использованием
ˆ
метода наименьших квадратов
yy−→
min.
x
Система нормальных уравнений для определения параметров уравне
ния прямолинейной зависимости имеет вид:
nb b x y
01
b x b x xy
01
2
.
(7.14)
Решая эту систему, можно получить следующие формулы определения параметров b0 и b1:
n xy x y
b
=
1
bb
= −
−
2
nx x
−
2
( )
∑∑
.
(7.15)
Для определения параметров уравнения параболы второго порядка
b0, b1и b2 используют следующую систему нормальных уравнений:
-
012
++ =
nb b x b x y
∑ ∑ ∑∑
01 2
∑ ∑ ∑∑
∑ ∑∑
01 2
++=
2
++=
23
Для оценки адекватности модели рассчитывается средняя квадратическая ошибка, которая представляет собой среднеквадратическое от-
клонение теоретических значений y от эмпирических значений
∑
S
=
e
x
,
(7.17)
−
2
ˆ
yy
−
( )
где l — число параметров в модели регрессии (в модели прямолинейной зависимости l = 2).
106
2
.
(7.16)
:y

S
,SST SSR SSE= +
( )
( )
ii
()
T
1;n−
R
F
T RF
MSR
MSE
7.3. Уравнение регрессии
Среднеквадратическая ошибка модели — именованная величина, т. е. имеет
те же единицы измерения, что и моделируемый показатель.
Для выбора наилучшей модели из нескольких рассчитанных опре-
деляется относительная ошибка модели регрессии, которая определя-
e
ется по формуле: 100.
⋅
Если относительная ошибка не превосходит
y
10–15 %, считается, что модель достаточно хорошо аппроксимирует
взаимосвязь.
Адекватность модели регрессии также определяется на основе дисперсионного анализа. Основное уравнение дисперсионного анализа имеет
вид:
(7.18)
где:
SST (Total Sum of Squares) — общая сумма квадратов отклонений ин-
дивидуальных значений признака от общей средней,
SST Y Y
n
= −
( )
∑
i
=
1
2
i
SSR (Regression Sum of Squares) — сумма квадратов отклонений пред
сказанных значений от общего среднего (объясненная регрессия),
SSR Y Y
n
= −
∑
i
=
1
2
ˆ
;
i
;
-
ний от предсказанных значений (необъясненная регрессия),
боды df (degree of freedom). Для суммы квадратов SST число степеней
свободы
ков-факторов; для SSE: .
критерия Фишера:
SSE (Error Sum of Squares) — сумма квадратов отклонений наблюде-
SSE Y Y
n
= −
∑
i
=
1
2
ˆ
.
SST, SSR и SSE связаны с соответствующим числом степеней сво-
df равно
для SSR: ,
df m= где m — это число призна-
df n m= −
Между степенями свободы существует связь, выраженная формулой:
df df df= +
.
(7.19)
Для оценки адекватности модели используется наблюдаемое значение
F
;1
mn m
−−
= (7.20)
,
107

SSR
1
SSE
nm
−−
;1
F
−−
MSR MSE=
MSR MSE≠
1,nm−−
;1
F
−−
F
−−
=⋅=−⋅
.Ç
Ç
=−⋅
i
b =
i
b
i
b ≠
i
b
Глава 7. Основы корреляционного и регрессионного анализа
где:
MSRm= — the Mean of Regression Sum of Squares, дисперсия, объ-
ясненная регрессией;
MSE
=
— the Mean of Error Sum of Squares, необъяснённая
дисперсия или квадрат стандартной ошибки регрессии.
На основе
проверяется гипотеза H0:
mn m
(уравнение
регрессии статистически незначимо), в случае, если гипотеза H0 будет отклонена, принимается альтернативная гипотеза H1:
(уравнение регрессии статистически значимо).
Гипотеза H0 принимается при уровне значимости α и степенями свободы, равными m и
точки
гипотеза H
(см. приложение 5), в противном случае, принимается
;; 1ámn m
1.
если
окажется меньше критической
mn m
Также на основе дисперсионного анализа можно оценить долю объясненной дисперсии в общей дисперсии регрессионного признака, для
этого необходимо рассчитать коэффициент детерминации по формуле:
SSR SSE
2
Ç
100% 1 100%.
(7.21)
SST SST
На практике часто используется скорректированный коэффициент детерминации, который при включении в имеющуюся линейную
регрессионную модель дополнительного регрессора может, как увеличиваться, так и уменьшаться, в отличие от
ватной, если
2
Ç (7.22)
ñêîð
2
2
от
Ç велики и их отличие несущественное.
ñêîð
MSE
1 100%.
MST
2
Модель считается адек-
О целесообразности использования модели можно судить по ее стандартной ошибке: если стандартная ошибка модели меньше среднего квадратического отклонения результативного признака, использование уравнения регрессии является целесообразным.
После установления адекватности модели, следует оценить значимость параметров уравнения регрессии. Для каждого параметра урав-
нения регрессии проверятся гипотеза H0: 0
чески незначим) при альтернативной гипотезе H1:
(параметр
0
статисти-
(параметр
статистически значим).
108

( )
1,
ˆ
ˆ
i
i
b
S
;1
t
i
b
β
7.3. Уравнение регрессии
Если при заданном уровне значимостиαи степенях свободы, равных
nm−−
( )
T
nm
−−
i
=
(где:
b
1
S
ˆ
b
i
— оценка параметра
;
– стандартная
ˆ
b
i
b
i
ошибка параметра) окажется больше критического критерия Стьюдента
,
гипотеза H0 отклоняется, т. е. параметр
nm
α
−−
статистически значим.
Для сравнения оценок роли каждого признака-фактора в формировании результативного признака используются коэффициенты эластичности, которые показывают, на сколько процентов изменится результативный признак при изменении соответствующего факторного на 1 %:
x
i
ˆ
.
Ýb
= ⋅
ii
(7.23)
y
-коэффициенты показывают, на сколько среднеквадратических
отклонений изменится результативный признак при изменении факторного признака на одно свое среднеквадратическое отклонение:
y
x
ˆ
.
Bb
= ⋅
ii
(7.24)
y
y

ГЛАВА 8.
Ряды динамики
Динамика в статистике — изменение явления во времени.
Динамический (временной) ряд — последовательность значений анализи-
руемого показателя, расположенных в хронологическом порядке.
8.1. Виды и правила построения рядов динамики
Любой временной ряд состоит из двух частей: моменты или периоды
времени, за которые регистрируется показатель, и значения уровней
временного ряда, т. е. значения изучаемого статистического показателя. Уровни временного ряда могут быть представлены абсолютными,
относительными и средними величинами.
Временные ряды абсолютных величин принято считать исходными, а ряды относительных и средних величин — производными, так
как уровни этих рядов получаются в результате вычислений на основе
абсолютных показателей.
В качестве примера ряда динамики абсолютных величин можно привести ряд числа зарегистрированных преступлений (табл. 8.1, гр. 1, 2).
Примером производного ряда динамики (относительных величин) может служить ряд числа зарегистрированных преступлений на 100 тыс.
человек населения (табл. 8.1, гр. 1, 4).
Таблица 8.1
Число зарегистрированных преступлений
на 100 тыс. человек населения за период 2009–2015 гг.
Год Число зарегистри-
рованных престу-
плений, тыс.
2009 2 995 142,8 2 097
2010 2 629 142,9 1 840
110
Среднегодовая чи-
сленность населе-
ед.
ния, млн чел.
Число зарегистрированных
преступлений на 100 тыс.
человек населения, ед.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
