Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы статистики. Учебное пособие
.pdf
1000
1000
n
N
3,t =
xx
pp
ωω
2,4 . 0,09 . 2, 4 . 0,09 .x− ≤≤ +ìåñ ìåñ ìåñ ìåñ
0,295 0,03 0,295 0,03.p− ≤≤ +
6.3. Способы организации выборочного наблюдения
для средней:
для доли: .
µ
= −=
p
В приведенных выше формулах
0,863
µ
= −=ìåñ
x
0,208
(1 0,05) 0, 03 .
(1 0,05) 0, 01
=
0, 05,
так как по условию задачи
выборка бесповторная 5 %.
Предельные ошибки выборки по данным рассматриваемого примера
будут равны:
• для средней: .0,03 3 0,09
• для доли: 0,01 3 0,03.
Для нашего примера
∆= ⋅= ìåñ
x
∆= ⋅=
p
так как по условию задачи необходимо
гарантировать результат с вероятностью 0,997.
Пятый этап оценки параметров генеральной совокупности на базе
выборочного обследования заключается в расчете доверительного интервала:
• для генеральной средней: ;
• для генеральной доли: .
x xx−∆ ≤ ≤ +∆
p
−∆ ≤ ≤ +∆ (6.5)
(6.4)
Числовой пример. Определим доверительные интервалы для генераль-
ной средней и для генеральной доли по данным табл. 6.3:
Таким образом, можно сделать вывод, что с вероятностью 99,7 %
средний срок нахождения дел об административных правонарушениях
в суде общей юрисдикции в генеральной совокупности будет находиться
в интервале от 2,31 месяца до 2,49 месяца, а доля дел со сроком рассмотрения более трех месяцев в генеральной совокупности — в пределах
от 26,5 % до 32,5 %.
6.3. Способы организации выборочного наблюдения
В случае неоднородности генеральной совокупности применение
простой случайной выборки не будет достаточно точно представлять генеральную совокупность. Для достижения условия репрезентативности
первоначально необходимо разделить исходную совокупность на однородные группы и из каждой группы отобрать необходимое количество
наблюдений. Такая выборка называется типической.
Типическая выборка может быть организована с пропорциональным
и оптимальным размещением единиц.
91

ii
nN
nN
1
ii
i
n
Sn
nN
22
ii
Nn
ii
N nN
∑
( )
ωω
∑
t
µ
∆= ⋅
Глава 6. Выборочное наблюдение
При пропорциональном размещении доля каждой группы в выборочной совокупности совпадает с долей этой группы в генеральной
совокупности, то есть соблюдается равенство:
.
+ (6.6)
При оптимальном размещении единиц учитывается степень «колеблемости» признака в совокупности:
N
σ
⋅
ii
,
nn
=
i
∑
k
N
=
(6.7)
σ
⋅
где:
k — количество групп.
Формулы выборочных показателей для типической выборки представлены в табл. 6.5.
Таблица 6.5
Формулы ошибок типической выборки
Средняя квадратическая
стандартная ошибка выборки
при пропорциональном размещении
Средняя квадратическая
стандартная ошибка выборки при оптимальном размещении
Средняя из внутригрупповых
дисперсий для средней
Средняя из внутригрупповых
дисперсий для доли
Предельная ошибка выборки
При серийной выборке случайным образом отбирается часть групп
генеральной совокупности, после чего единицы этих групп обследуются
сплошным методом.
92
Показатель Повторный
отбор
S
µ
=
1
µ
=
∑
2
S
= −=
ωω
2
SN
i
S
1
( )
Бесповторный
µ
= −
1
µ
= −
∑
k
2
2
Sn
=
1
i
=
n
n
∑
i
i
=
1
i ii
∑
отбор
2
(1 )
22
SN n
ii i
i
1
n
−
n
i
(1 )

6.3. Способы организации выборочного наблюдения
m
mM
( )
1
io
i
δ
∑
( )
io
ωω
δ
∑
t
µ
∆= ⋅
N
n
Формулы выборочных показателей для серийной выборки пред-
ставлены в табл. 6.6.
Таблица 6.6
Формулы ошибок серийной выборки
Показатель Повторный
Средняя квадратическая стандартная ошибка выборки
Межгрупповая дисперсия для
средней
Межгрупповая дисперсия для доли
Предельная ошибка выборки
µ
отбор
=
2
σ
2
=
2
=
Бесповторный
µ
= −
m
xx
−
i
=
1
n
m
∑
=
m
−
i
=
1
n
m
∑
i
=
1
отбор
σ
i
i
2
m
1
2
2
В представленных формулах m — число отобранных групп; M — чи-
сло групп в генеральной совокупности.
Большое практическое значение имеет механическая выборка, сущность которой заключается в отборе единиц из генеральной совокупности с определенным «шагом». При этом «шаг» рассчитывается
по формуле:
.
Формулы выборочных показателей при механической
выборке аналогичны формулам простой случайной бесповторной выборки.
При комбинированной выборке последовательно используются несколько способов выборочного наблюдения.
Многоступенчатая выборка заключается в отборе групп из генеральной совокупности в несколько этапов, после чего внутри оставшихся
групп извлекается необходимая часть единиц наблюдения.
Определенные особенности при оценке параметров генеральной
совокупности существуют по данным малых выборок. Малой выбор-
кой считается такая выборка, объем которой не превышает 30 единиц
30 .n ≤
Так, например, для оценки средней квадратической стандарт-
ной ошибки выборки используется следующая формула:
93

1Sn
( )
1.
Глава 6. Выборочное наблюдение
2
µ
=
.
(6.8)
−
А для определения коэффициента доверия t пользуются таблицей
вероятностей Стьюдента (фрагмент таблицы представлен в табл. 6.7).
Значения t определяются в зависимости от гарантийной вероятности
и числа степеней свободы
kn= −
Таблица 6.7
Фрагмент таблицы вероятностей Стьюдента
Число сте-
пеней свобо-
ды (k)
5 2,571 4,032 5,376
10 2,228 3,169 3,892
15 2,133 2,949 3,539
20 2,086 2,845 3,376
25 2,060 2,788 3,288
30 2,042 2,750 3,230
0,95 0,99 0,997
рительная вероятность (Ф (t))
Дове

ГЛАВА 7.
Основы корреляционного
и регрессионного анализа
Одной из основных задач статистики является выявление и оценка взаимосвязей явлений общественной жизни. Такое исследование проводится
на основе изучения признаков (показателей), характеризующих эти явления.
Одни признаки рассматриваются как факторы, другие — как результаты.
Факторные признаки влияют на результативные, формируют их величину.
7.1. Понятие корреляционной связи
Корреляция (от лат. слова correlatio — соотношение) — зависимость между
двумя и более величинами, проявляющаяся в среднем в массе случаев.
Методология теории дисперсий, корреляционного и регрессионного
анализа была разработана к концу XIX в. Большой вклад в развитие теории дисперсий внес ученый В. Лексис, который вывел формулы общей,
средней из внутригрупповых и межгрупповой дисперсии и определил
число степеней свободы каждой из них.
Началом же развития метода корреляции принято считать работу Ф. Гальтона «Регрессия, наследственность и панмиксия» (1896 г.),
в которой он дал определение корреляции, построил теоретическую
модель совместного изменения двух переменных, ввел понятие линии
регрессии и корреляционного индекса [3].
Существуют две категории зависимостей: функциональная и корре-
ляционная.
В отличие от корреляционной зависимости функциональная проявляется в виде полного соответствия между значениями результативного
и факторного признаков. На практике функциональная зависимость
встречается достаточно редко, тем не менее, в физике и математике это
понятие является одним из определяющих.
Примером корреляционной зависимости может служить зависимость между уровнем преступности и уровнем безработицы в Российской Федерации.
95

( )
( )
3xσ±
Глава 7. Основы корреляционного и регрессионного анализа
7.2. Этапы корреляционного анализа
При изучении корреляционных зависимостей между признаками
можно выделить несколько основных этапов:
1. Логический анализ изучаемого явления. На этом этапе устанавли-
вается результативный признак, изучается его сущность, выбираются
признаки-факторы.
Результативный признак
знаки-факторы
;;;
xx x — это независимые переменные, ока-
12
y
— это зависимая переменная; при-
n
зывающие влияние на результативный признак. Если изучается
зависимость результативного признака от одного признака-фактора,
то такая связь называется парной корреляцией; если — от двух и более признаков-факторов, то такая связь называется множественной
корреляцией.
2. Проверка признаков-факторов на однородность и нормальность рас-
пределения, установление факта наличия связи, ее направление.
Для получения качественных результатов корреляционного анализа
необходимо соблюдать требование однородности и нормальности распределения признаков-факторов в совокупности.
Проверка признаков-факторов на однородность распределения
проводится с использованием коэффициента вариации (см. п. 5.3).
Для проверки совокупности на нормальность распределения, как
правило, используется один из следующих методов: графический анализ, правило «3-х сигм», расчет показателей формы распределения
и критериев согласия. Наиболее простым в использовании является
правило «3-х сигм». Учитывая особенность кривой нормального рас-
пределения, в промежутке
находится 99,7 % всех значений признака. Таким образом, по правилу «3-х сигм» из последующего анализа
необходимо исключить все единицы, у которых значения факторного
признака не попадают в этот интервал.
Факт наличия связи между признаками можно установить с помо-
щью следующих способов:
1) сопоставление двух параллельных рядов результативного (y) и фак-
торного (x) признаков. Исходные данные ранжируются (выстраиваются
по возрастанию или убыванию) факторного признака. Затем рассматривается поведение значений результативного признака. Если с возрастанием (убыванием) факторного признака значения результативного
признака планомерно возрастают (убывают), то можно предположить
наличие прямой взаимосвязи между признаками;
2) анализ групповой или корреляционной таблиц.
96

( )
( )
( )
ini
mnm
∑
y
( )
( )
11
n
n
1k
n
∑
1i
n
n
ik
n
∑
1m
n
n
mk
n
∑
∑
∑
∑
11
mk
ij
∑∑
7.2. Этапы корреляционного анализа
Групповая таблица — таблица, содержащая группировку наблюдений
по признаку-фактору и средние значения результативного признака в каждой группе (см. в табл. 7.1).
Если групповые средние результативного признака планомерно
возрастают, то предполагают наличие прямой связи рассматриваемых
признаков. Если групповые средние результативного признака планомерно убывают, то предполагают обратную связь.
Таблица 7.1
Макет групповой таблицы
Номер
группы
Группы по призна-
ку-фактору
Число наблюде-
x
ний
1 …
… … …
m …
Итого:
Средний уровень результа-
n
i
тивного признака
y
i
y
…
y
m
i
1
in=
Корреляционная таблица содержит результаты многомерной группировки по факторному и результативному признакам. Макет корреляционной таблицы представлен в табл. 7.2.
Таблица 7.2
Макет корреляционной таблицы
Группы по признаку-фактору
x
1 …
… …
m …
Итого
Группы по результативному признаку
1 … k
… … …
1 j
ij
mj
m
n
1
i
1
i
=
m
ij
1
in=
m
in=
y
ik
1
Итого
k
1
j
=
k
1
jn=
k
1
jn=
= =
n
1
j
ij
mj
n
i
97

( )
CH
CH
−
Глава 7. Основы корреляционного и регрессионного анализа
Если частоты
n
в корреляционной таблице группируются по диа-
ij
гонали из верхнего левого угла в нижний правый, можно предположить
наличие прямой связи между изучаемыми признаками. В случае если
расположение частот в таблице представлено диагональю из нижнего
левого угла в верхний правый, предполагается наличие обратной зависимости;
3) построение графика «поле корреляции».
Поле корреляции — точечный график, построенный в декартовой системе
координат, на оси абсцисс которой откладываются значения признакафактора, а на оси ординат — значения результативного признака.
При этом совокупность точек называют корреляционным облаком.
По форме корреляционного облака судят о наличии и направлении
связи. Если корреляционное облако принимает форму прямой линии
или вытянутого овала, то можно предположить наличие связи;
4) расчет коэффициента корреляции знаков Г. Фехнера. Коэффициент
корреляции знаков Г. Фехнера определяется по формуле:
K
=
Φ
,
(7.1)
+
где C — число совпадений в знаках отклонений отдельных значений
от среднего; H — число несовпадений в знаках отклонений отдельных
значений от среднего.
Коэффициент Фехнера может принимать любые значения в интервале от –1 до +1. Чем он ближе по модулю к единице, тем достовернее
предположение о наличии связи. Знак коэффициента определяет направление связи: «+» — связь прямая, « — » — связь обратная.
Числовой пример. Рассмотрим пример расчёта коэффициента корреляции рангов. Известны данные об уровне безработицы и уровне
преступности по 10 городам области (табл. 7.3).
Таблица 7.3
Исходные данные по области
98
Города Уровень безработицы, % (х) Число преступлений
100000 человек населения (y)
на
А 5,3 1039
Б 5,2 965

7.2. Этапы корреляционного анализа
( )
( )
5,3 5,2 5,0 4,6 4,9 4,8 4,7 4,4 4,5 4,3
10
+++++++++
1039 965 975 830 965 889 873 720 670 710
10
+++++++++
Города Уровень безработицы, % (х) Число преступлений
100000 человек населения (y)
на
В 5,0 975
Г 4,6 830
Д 4,9 965
Е 4,8 889
Ж 4,7 873
З 4,4 720
И 4,5 670
К 4,3 710
Первоначально необходимо определить средние значения фактор-
ного
x и результативного
y признаков:
x
= =
y
= = ñëó÷
4,8%,
864 .
После чего следует расставить знаки отклонений отдельных значений факторного и результативного признаков от своих средних значений (табл. 7.4).
Таблица 7.4
Расчётные данные по области
Города х у Знак отклонения Совпадение (C)
х по y
по
А 5,3 1039 + + С
Б 5,2 965 + + С
В 5,0 975 + + С
Г 4,6 830 — — С
Д 4,9 965 + + C
Е 4,8 889 0 + Н
Ж 4,7 873 — + Н
З 4,4 720 — — С
И 4,5 670 — — С
К 4,3 710 — — С
или несовпадение (Н)
знаков
99

82
82
−
( ) ( )
ii
∑
ixi
y
,x
y
Глава 7. Основы корреляционного и регрессионного анализа
Коэффициент Фехнера составит:
K
= = +
Φ
0,6.
+
По рассчитанному значению коэффициента можно предложить наличие прямой (знак плюс) и умеренно тесной (0,6) связи между уровнем
преступности и уровнем безработицы.
Как отмечалось выше, связь между признаками может быть прямой
и обратной. В случае если с увеличением значений факторного признака, увеличиваются и значения результативного, имеет место прямая
зависимость, в противном случае — обратная.
3. Установление формы связи между результативным и факторным
признаками.
Существует ряд способов установления формы связи между факторным и результативным признаками. Рассмотрим наиболее простые
из них:
1) графический метод. В системе координат строится эмпирическая
линия связи и сравнивается с теоретической линией. Если эмпирическая
линия представляет собой прямую линию, можно предположить наличие прямой зависимости, если эмпирическая линия отклоняется от прямой, то это свидетельствует о наличии криволинейной зависимости;
2) сравнение разности квадратов корреляционного отношения и линей-
ного коэффициента корреляции. Если
22
0, 1,rη−<
то применение линейной функции в качестве формы уравнения представляется возможным,
в противном случае форма связи — криволинейная.
4. Оценка степени тесноты их связи и определение ее значимости.
Оценка степени тесноты связи проводится с помощью специальных
показателей, выбор которых осуществляется на основе анализа исходных данных:
1) при условии нормального распределения признаков в совокупности и прямолинейной зависимости между ними в случае парной
корреляции наиболее точно оценивает степень тесноты связи линейный
коэффициент корреляции:
n
xx yy
−⋅ −
1
r
=
σσ
n
xy
,
(7.2)
где:
,
— соответственно, i-е значение факторного и результативного
признаков;
— средние значения факторного и результативного признаков;
100
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
