Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы статистики. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
n
x
σ
σ
t
1
r
t
t
η
( )
jj
yy n
−⋅
y
0
y
n
0
( )
n
∑
i
7.2. Этапы корреляционного анализа
— число наблюдений;
,
— соответственно, среднее квадратическое отклонение
y
по факторному и результативному признакам.
Линейный коэффициент корреляции может принимать любые зна­чения в диапазоне от –1 до +1. Чем ближе линейный коэффициент корреляции по модулю к 1, тем теснее связь, чем ближе к 0, тем связь слабее, 0 — отсутствие связи. Знак линейного коэффициента корреля­ции показывает направление связи:
«+» — прямая зависимость,
«—» — обратная.
Для проверки значимости линейного коэффициента корреляции при большом объеме выборки (n более 50) рассчитывается
1
rn
−
больше
ðàñ÷
−
(7.3)
2
(см. приложение 4) при числе степеней сво-
òàáë
t
ðàñ÷
Если
=
по формуле:
ðàñ÷
боды, равным n-2, и заданном уровне значимости, то в генеральной совокупности линейный коэффициент корреляции значим;
2) на практике достаточно часто встречаются криволинейные за­висимости между признаками. Для оценки степени тесноты связи при таких зависимостях используют эмпирическое корреляционное отношение:
2
δ
,
= (7.4)
2
σ
0
где:
2
δ
— межгрупповая дисперсия, которая рассчитывается по формуле:
k
∑
1
j
=
2
δ
=
∑
2
0
,
k
n
j
1
j
=
(7.5)
где:
и
— соответственно групповые и общая средние, рассчитанные
j
по значениям результативного признака;
— число наблюдений в j-й группе;
j
k — число групп.
2
–общая дисперсия, которая рассчитывается по формуле:
n
2 22
= = +
0
yy
i
=
1
2
−
i
0
,
(7.6)
где:
y — индивидуальные значения результативного признака;
101
jj
σ
73, 7,
δ
0
σ
η
( ) ( )
22
:.
1
k nk
−−
F
F
1
kk= −
2
k nk= −
1,
∑
i
Глава 7. Основы корреляционного и регрессионного анализа
n — число наблюдений;
2
— средняя из внутригрупповых дисперсий:
k
2
n
σ
∑
⋅
j
=
1
,
k
j
(7.7)
n
j
1
=
∑
2
=
где:
2
— дисперсия результативного признака в j группе.
j
Числовой пример. Рассчитаем эмпирическое корреляционное от-
ношение по данным таблицы 5.3. Так как межгрупповая дисперсия
2
=
а общая дисперсия
2
76,9,
=
эмпирическое корреляционное
отношение составит:
2
δ
= = =
σ
73, 7
2 0
0,979.
76,9
Следовательно, связь между характером образования и уровнем
заработной платы тесная.
Для проверки значимости эмпирического корреляционного отно-
шения используется дисперсионное отношение:
k kn
yy n yy
∑ ∑∑
F
=
ðàñ÷
−⋅ −
j j ij j
j ji
1 11
= = =
0
j
(7.8)
Если значимости и числе степеней свободы ционная связь между признаками существенна, в противном случае — несущественна;
3) Для оценки степени тесноты связи между признаками, распре­деление которых отлично от нормального, применяется коэффициент рангов Спирмэна, который рассчитывается по формуле:
ρ
где:
2
ному признаку.
Числовой пример. По данным табл. 7.3 необходимо оценить степень тесноты и направление связи между уровнем преступности и уровнем безработицы с помощью коэффициента рангов Спирмэна, расчет ко­торого представлен в табл. 7.5.
102
= −
больше
ðàñ÷
6
2
nn
( )
n
2
d
i
i
=
1
(7.9)
−
1
(см. приложение 5) при заданном уровне
òàáë
1
и
,
корреля-
— квадрат разностей рангов по признаку-фактору и результатив-
7.2. Этапы корреляционного анализа
( )
d
78
 

6 9,5
⋅
=−=
( )
( )
ad bc ad bc
−
ad bc
−
++ ++
Расчет коэффициента рангов Спирмэна
Таблица 7.5
Город x y Ранг Разность
по x по y
А 5,3 1039 10 10 0 0
Б 5,2 965 9 7,5 –1,5 2,25
В 5,0 975 8 9 1 1
Г 4,6 830 4 4 0 0
Д 4,9 965 7 7,5 0,5 0,25
Е 4,8 889 6 6 0 0
Ж 4,7 873 5 5 0 0
З 4,4 720 2 3 1 1
И 4,5 670 3 1 –2 4
К 4,3 710 1 2 1 1
Итого – – – – – 9,5
Следует обратить внимание на то, что городам Б и Д были присвое-
ны ранги по y, равные
+
7,5. Это обусловлено тем, что у этих го-
рангов
d
2
2
родов одинаковые значения результативного признака, равные 965. Коэффициент Спирмена составит:
1 0,942.
ρ
Значение коэффициента Спирмена свидетельствует о том, что связь между уровнем безработицы и уровнем преступности обратная и очень тесная;
4) степень тесноты связи между качественными признаками, каждый из которого может принимать только два альтернативных значения, используются коэффициенты ассоциации
2
10 10 1
−
( )
K и контингенции
A
:
K
K
K
=
A
+
K
=
K
abcdacbd
( )( )( )( )
,
(7.10)
,
(7.11)
103
( )
f
f
′
1
k
2
k
21
11
kk
ij
ff
∑∑
Глава 7. Основы корреляционного и регрессионного анализа
где: a, b, c, d — частоты таблицы «четырех полей» (см. табл. 7.6)
Таблица «четырех полей»
Таблица 7.6
Признак Значение
признака B
Альтернативное
значение признака B
Значение признака А a b
тернативное
Аль
c d
значение признака А
Коэффициенты ассоциации и контингенции могут принимать лю­бые значения в диапазоне от –1 до +1. Величина коэффициента по мо­дулю показывает степень тесноты взаимосвязи, а знак — направление связи;
5) для оценки связи между качественными показателями с большим
числом градаций используется критерий Пирсона
2
,
χ
который рассчи-
тывается по формуле:
2
′
ff
2
χ
kk
21
=
∑∑
11
= =
ij
−
ij ij
′
f
ij
,
(7.12)
где:
и
— соответственно эмпирические и теоретические частоты
ij
ij
в i-той строке и j-том столбце;
и
— число групп в строках и столбцах таблицы.
Теоретические частоты рассчитываются по формуле:
′
f
=
ij
kk
21
∑∑
ij
11
= =
При расчете
.
(7.13)
f
2
χ
важно соблюдать следующие требования:
×
= =
а) критерий Пирсона рассчитывается по совокупности с числом наблюдений не менее 50;
б) теоретические частоты в каждом интервале должны быть более или раны 5.
Числовой пример. Известны следующие данные по нелегальной миг­рации и уровню преступности по области (см. табл. 7.7).
104
Исходные данные по области
24 25
69
⋅
24 26
69
⋅
24 18
69
⋅
25 25
69
⋅
25 26
69
⋅
25 18
69
⋅
20 25
69
⋅
20 26
69
⋅
20 18
69
⋅
( ) ( ) ( ) ( ) ( )
( )( )
3131 4
0,05
α
=
22
χχ
7.3. Уравнение регрессии
Таблица 7.7
Уровень
преступности
Высокие 13 9 2 24
Средние 8 11 6 25
Низкие 4 6 10 20
Итого 25 26 18 69
Высокая Средняя Низкая Итого
Коэффицие
нт нелегальной миграции
Рассчитаем теоретические частоты:
′
f
= =
11
′
f
= =
21
′
f
= =
31
8,7;
9, 1;
7, 3;
′
f
= =
12
′
f
= =
22
′
f
= =
32
9,0;
9,4;
7, 5;
′
f
= =
13
′
f
= =
23
′
f
= =
33
6, 3;
6, 5;
5,2.
Показатель Пирсона составит:
13 8, 7 9 9 2 6, 3 8 9,1 11 9, 4
2
χ
= ++ + + +
ðàñ÷
−−− −
6 6,5 4 7,3 6 7,5 10 5,2
( ) ( ) ( ) ( )
++++ =
22 2 2 2
− −− − −
8,7 9 6, 3 9,1 9, 4
222 2
11,727.
6,5 7,3 7,5 5,2
Табличное значение показателя при числе степеней свободы
k =− −=
и уровне значимости
составляет 9,5 (см.
приложение 6).
Так как
ðàñ÷ òàáë
,
>
то с вероятностью 95% можно считать, что распре-
деление единиц неслучайно, а значит между признаками имеется связь.
признаками строится уравнение регрессии, оценивается его адекватность и значимость параметров модели.
функции для уравнения регрессии. Наиболее часто используются сле­дующие типы функций:
7.3. Уравнение регрессии
При значимой корреляции между результативным и факторными
На основе логического и эмпирического анализа выбирается тип
105
01
ˆ
x
01 2
x
23
01 2 3
x
01
x
0
x
1
x
( )
∑
+=
+=
∑∑
∑ ∑∑
01
yx
nn
∑ ∑∑
∑∑
3 42
bxbxbx xy
bxbxbx xy
ˆ
nl
Глава 7. Основы корреляционного и регрессионного анализа
• линейная
y b bx=+⋅
• парабола второго порядка
• парабола третьего порядка
• показательная
• степенная
ˆ
y bb= ⋅
ˆ
y bx= ⋅
• гиперболическая
;
ˆ
y b bx bx= + ⋅+ ⋅
ˆ
y b bx bx bx= + ⋅+ ⋅ + ⋅
x
;
b
1
;
ˆ
y bb
=+⋅
01
x
2
;
;
.
Параметры уравнения регрессии рассчитываются с использованием
ˆ
метода наименьших квадратов
yy−→
min.
x
Система нормальных уравнений для определения параметров уравне ния прямолинейной зависимости имеет вид:
nb b x y
 
01
b x b x xy
01
2
.
(7.14)
Решая эту систему, можно получить следующие формулы определе­ния параметров b0 и b1:
n xy x y
b
=
1
 
bb
= −
 
−
2
nx x
−
2
( )
∑∑
.
(7.15)
Для определения параметров уравнения параболы второго порядка
b0, b1и b2 используют следующую систему нормальных уравнений:
-
 
 
 
012
++ =
nb b x b x y
∑ ∑ ∑∑
01 2
∑ ∑ ∑∑
∑ ∑∑
01 2
++=
2
++=
23
Для оценки адекватности модели рассчитывается средняя квадрати­ческая ошибка, которая представляет собой среднеквадратическое от-
клонение теоретических значений y от эмпирических значений
∑
S
=
e
x
,
(7.17)
−
2
ˆ
yy
−
( )
где l — число параметров в модели регрессии (в модели прямоли­нейной зависимости l = 2).
106
2
.
(7.16)
:y
S
,SST SSR SSE= +
( )
( )
ii
()
T
1;n−
R
F
T RF
MSR MSE
7.3. Уравнение регрессии
Среднеквадратическая ошибка модели — именованная величина, т. е. имеет те же единицы измерения, что и моделируемый показатель.
Для выбора наилучшей модели из нескольких рассчитанных опре-
деляется относительная ошибка модели регрессии, которая определя-
e
ется по формуле: 100.
⋅
Если относительная ошибка не превосходит
y
10–15 %, считается, что модель достаточно хорошо аппроксимирует взаимосвязь.
Адекватность модели регрессии также определяется на основе ди­сперсионного анализа. Основное уравнение дисперсионного анализа имеет вид:
(7.18)
где:
SST (Total Sum of Squares) — общая сумма квадратов отклонений ин-
дивидуальных значений признака от общей средней,
SST Y Y
n
= −
( )
∑
i
=
1
2
i
SSR (Regression Sum of Squares) — сумма квадратов отклонений пред сказанных значений от общего среднего (объясненная регрессия),
SSR Y Y
n
= −
∑
i
=
1
2
ˆ
;
i
;
-
ний от предсказанных значений (необъясненная регрессия),
боды df (degree of freedom). Для суммы квадратов SST число степеней свободы ков-факторов; для SSE: .
критерия Фишера:
SSE (Error Sum of Squares) — сумма квадратов отклонений наблюде-
SSE Y Y
n
= −
∑
i
=
1
2
ˆ
.
SST, SSR и SSE связаны с соответствующим числом степеней сво-
df равно
для SSR: ,
df m= где m — это число призна-
df n m= −
Между степенями свободы существует связь, выраженная формулой:
df df df= +
.
(7.19)
Для оценки адекватности модели используется наблюдаемое значение
F
;1
mn m
−−
= (7.20)
,
107
SSR
1
SSE
nm
−−
;1
F
−−
MSR MSE=
MSR MSE≠
1,nm−−
;1
F
−−
F
−−

=⋅=−⋅
 
.Ç
Ç

=−⋅
 
i
b =
i
b
i
b ≠
i
b
Глава 7. Основы корреляционного и регрессионного анализа
где:
MSRm= — the Mean of Regression Sum of Squares, дисперсия, объ-
ясненная регрессией;
MSE
=
— the Mean of Error Sum of Squares, необъяснённая
дисперсия или квадрат стандартной ошибки регрессии.
На основе
проверяется гипотеза H0:
mn m
(уравнение регрессии статистически незначимо), в случае, если гипотеза H0 бу­дет отклонена, принимается альтернативная гипотеза H1: (уравнение регрессии статистически значимо).
Гипотеза H0 принимается при уровне значимости α и степенями сво­боды, равными m и точки гипотеза H
(см. приложение 5), в противном случае, принимается
;; 1ámn m
1.
если
окажется меньше критической
mn m
Также на основе дисперсионного анализа можно оценить долю объ­ясненной дисперсии в общей дисперсии регрессионного признака, для этого необходимо рассчитать коэффициент детерминации по формуле:
SSR SSE
2
Ç
100% 1 100%.
(7.21)
SST SST
На практике часто используется скорректированный коэффици­ент детерминации, который при включении в имеющуюся линейную регрессионную модель дополнительного регрессора может, как увели­чиваться, так и уменьшаться, в отличие от ватной, если
2
Ç (7.22)
ñêîð
2
2
от
Ç велики и их отличие несущественное.
ñêîð
MSE
1 100%.
MST
2
Модель считается адек-
О целесообразности использования модели можно судить по ее стан­дартной ошибке: если стандартная ошибка модели меньше среднего ква­дратического отклонения результативного признака, использование урав­нения регрессии является целесообразным.
После установления адекватности модели, следует оценить значи­мость параметров уравнения регрессии. Для каждого параметра урав-
нения регрессии проверятся гипотеза H0: 0 чески незначим) при альтернативной гипотезе H1:
(параметр
0
статисти-
(параметр
статистически значим).
108
( )
1,
ˆ
ˆ
i
i
b
S
;1
t
i
b
β
7.3. Уравнение регрессии
Если при заданном уровне значимостиαи степенях свободы, равных
nm−−
( )
T
nm
−−
i
=
(где:
b
1
S
ˆ
b
i
— оценка параметра
;
– стандартная
ˆ
b
i
b
i
ошибка параметра) окажется больше критического критерия Стьюден­та
,
гипотеза H0 отклоняется, т. е. параметр
nm
α
−−
статистически значим.
Для сравнения оценок роли каждого признака-фактора в формиро­вании результативного признака используются коэффициенты эластич­ности, которые показывают, на сколько процентов изменится результа­тивный признак при изменении соответствующего факторного на 1 %:
x
i
ˆ
.
Ýb
= ⋅
ii
(7.23)
y
-коэффициенты показывают, на сколько среднеквадратических отклонений изменится результативный признак при изменении фак­торного признака на одно свое среднеквадратическое отклонение:
y
x
ˆ
.
Bb
= ⋅
ii
(7.24)
y
y
ГЛАВА 8. Ряды динамики
Динамика в статистике — изменение явления во времени.
Динамический (временной) ряд — последовательность значений анализи-
руемого показателя, расположенных в хронологическом порядке.
8.1. Виды и правила построения рядов динамики
Любой временной ряд состоит из двух частей: моменты или периоды времени, за которые регистрируется показатель, и значения уровней временного ряда, т. е. значения изучаемого статистического показате­ля. Уровни временного ряда могут быть представлены абсолютными, относительными и средними величинами.
Временные ряды абсолютных величин принято считать исходны­ми, а ряды относительных и средних величин — производными, так как уровни этих рядов получаются в результате вычислений на основе абсолютных показателей.
В качестве примера ряда динамики абсолютных величин можно при­вести ряд числа зарегистрированных преступлений (табл. 8.1, гр. 1, 2). Примером производного ряда динамики (относительных величин) мо­жет служить ряд числа зарегистрированных преступлений на 100 тыс. человек населения (табл. 8.1, гр. 1, 4).
Таблица 8.1
Число зарегистрированных преступлений
на 100 тыс. человек населения за период 2009–2015 гг.
Год Число зарегистри-
рованных престу-
плений, тыс.
2009 2 995 142,8 2 097
2010 2 629 142,9 1 840
110
Среднегодовая чи-
сленность населе-
ед.
ния, млн чел.
Число зарегистрированных
преступлений на 100 тыс.
человек населения, ед.
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]