Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы статистики. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
1000
1000
n
N
3,t =
xx

pp
ωω
2,4 . 0,09 . 2, 4 . 0,09 .x− ≤≤ +ìåñ ìåñ ìåñ ìåñ
0,295 0,03 0,295 0,03.p− ≤≤ +
6.3. Способы организации выборочного наблюдения
для средней:
для доли: .
µ
= −=
p
В приведенных выше формулах
0,863
µ
= −=ìåñ
x
0,208
(1 0,05) 0, 03 .
(1 0,05) 0, 01
=
0, 05,
так как по условию задачи
выборка бесповторная 5 %.
Предельные ошибки выборки по данным рассматриваемого примера
будут равны:
• для средней: .0,03 3 0,09
• для доли: 0,01 3 0,03. Для нашего примера
∆= ⋅= ìåñ
x
∆= ⋅=
p
так как по условию задачи необходимо
гарантировать результат с вероятностью 0,997.
Пятый этап оценки параметров генеральной совокупности на базе
выборочного обследования заключается в расчете доверительного ин­тервала:
• для генеральной средней: ;
• для генеральной доли: .
x xx−∆ ≤ ≤ +∆
p
−∆ ≤ ≤ +∆ (6.5)
(6.4)
Числовой пример. Определим доверительные интервалы для генераль-
ной средней и для генеральной доли по данным табл. 6.3:
Таким образом, можно сделать вывод, что с вероятностью 99,7 % средний срок нахождения дел об административных правонарушениях в суде общей юрисдикции в генеральной совокупности будет находиться в интервале от 2,31 месяца до 2,49 месяца, а доля дел со сроком рассмо­трения более трех месяцев в генеральной совокупности — в пределах от 26,5 % до 32,5 %.
6.3. Способы организации выборочного наблюдения
В случае неоднородности генеральной совокупности применение простой случайной выборки не будет достаточно точно представлять ге­неральную совокупность. Для достижения условия репрезентативности первоначально необходимо разделить исходную совокупность на одно­родные группы и из каждой группы отобрать необходимое количество наблюдений. Такая выборка называется типической.
Типическая выборка может быть организована с пропорциональным и оптимальным размещением единиц.
91
ii
nN
nN
1
ii
i
n
Sn
nN
22
ii
Nn
ii
N nN
∑
( )
ωω
∑
t
µ
∆= ⋅
Глава 6. Выборочное наблюдение
При пропорциональном размещении доля каждой группы в выбо­рочной совокупности совпадает с долей этой группы в генеральной совокупности, то есть соблюдается равенство:
.
+ (6.6)
При оптимальном размещении единиц учитывается степень «коле­блемости» признака в совокупности:
N
σ
⋅
ii
,
nn
=
i
∑
k
N
=
(6.7)
σ
⋅
где:
k — количество групп.
Формулы выборочных показателей для типической выборки пред­ставлены в табл. 6.5.
Таблица 6.5
Формулы ошибок типической выборки
Средняя квадратическая стандартная ошибка выборки при пропорциональном раз­мещении
Средняя квадратическая стандартная ошибка выбор­ки при оптимальном разме­щении
Средняя из внутригрупповых дисперсий для средней
Средняя из внутригрупповых дисперсий для доли
Предельная ошибка выборки
При серийной выборке случайным образом отбирается часть групп генеральной совокупности, после чего единицы этих групп обследуются сплошным методом.
92
Показатель Повторный
отбор
S
µ
=
1
µ
=
∑
2
S
= −=
ωω
2
SN
i
S
1
( )
Бесповторный
µ
= −
1
µ
= −
∑
k
2
2
Sn
=
1
i
=
n
n
∑
i
i
=
1
i ii
∑
отбор
2
(1 )
22
SN n
ii i
i
1
n
−
n
i
(1 )
6.3. Способы организации выборочного наблюдения
m
mM
 

( )
1
io
i
δ
∑
( )
io
ωω
δ
∑
t
µ
∆= ⋅
N
n
Формулы выборочных показателей для серийной выборки пред-
ставлены в табл. 6.6.
Таблица 6.6
Формулы ошибок серийной выборки
Показатель Повторный
Средняя квадратическая стандарт­ная ошибка выборки
Межгрупповая дисперсия для средней
Межгрупповая дисперсия для до­ли
Предельная ошибка выборки
µ
отбор
=
2
σ
2
=
2
=
Бесповторный
µ
= −
m
xx
−
i
=
1
n
m
∑
=
m
−
i
=
1
n
m
∑
i
=
1
отбор
σ
i
i
2
m
1
2
2
В представленных формулах m — число отобранных групп; M — чи-
сло групп в генеральной совокупности.
Большое практическое значение имеет механическая выборка, сущ­ность которой заключается в отборе единиц из генеральной совокуп­ности с определенным «шагом». При этом «шаг» рассчитывается
по формуле:
.
Формулы выборочных показателей при механической
выборке аналогичны формулам простой случайной бесповторной вы­борки.
При комбинированной выборке последовательно используются не­сколько способов выборочного наблюдения.
Многоступенчатая выборка заключается в отборе групп из генераль­ной совокупности в несколько этапов, после чего внутри оставшихся групп извлекается необходимая часть единиц наблюдения.
Определенные особенности при оценке параметров генеральной совокупности существуют по данным малых выборок. Малой выбор- кой считается такая выборка, объем которой не превышает 30 единиц
30 .n ≤
Так, например, для оценки средней квадратической стандарт-
ной ошибки выборки используется следующая формула:
93
1Sn
( )
1.
Глава 6. Выборочное наблюдение
2
µ
=
.
(6.8)
−
А для определения коэффициента доверия t пользуются таблицей
вероятностей Стьюдента (фрагмент таблицы представлен в табл. 6.7).
Значения t определяются в зависимости от гарантийной вероятности и числа степеней свободы
kn= −
Таблица 6.7
Фрагмент таблицы вероятностей Стьюдента
Число сте-
пеней свобо-
ды (k)
5 2,571 4,032 5,376
10 2,228 3,169 3,892
15 2,133 2,949 3,539
20 2,086 2,845 3,376
25 2,060 2,788 3,288
30 2,042 2,750 3,230
0,95 0,99 0,997
рительная вероятность (Ф (t))
Дове
ГЛАВА 7.
Основы корреляционного
и регрессионного анализа
Одной из основных задач статистики является выявление и оценка вза­имосвязей явлений общественной жизни. Такое исследование проводится на основе изучения признаков (показателей), характеризующих эти явления. Одни признаки рассматриваются как факторы, другие — как результаты. Факторные признаки влияют на результативные, формируют их величину.
7.1. Понятие корреляционной связи
Корреляция (от лат. слова correlatio — соотношение) — зависимость между двумя и более величинами, проявляющаяся в среднем в массе случаев.
Методология теории дисперсий, корреляционного и регрессионного анализа была разработана к концу XIX в. Большой вклад в развитие тео­рии дисперсий внес ученый В. Лексис, который вывел формулы общей, средней из внутригрупповых и межгрупповой дисперсии и определил число степеней свободы каждой из них.
Началом же развития метода корреляции принято считать рабо­ту Ф. Гальтона «Регрессия, наследственность и панмиксия» (1896 г.), в которой он дал определение корреляции, построил теоретическую модель совместного изменения двух переменных, ввел понятие линии регрессии и корреляционного индекса [3].
Существуют две категории зависимостей: функциональная и корре-
ляционная.
В отличие от корреляционной зависимости функциональная прояв­ляется в виде полного соответствия между значениями результативного и факторного признаков. На практике функциональная зависимость встречается достаточно редко, тем не менее, в физике и математике это понятие является одним из определяющих.
Примером корреляционной зависимости может служить зависимость меж­ду уровнем преступности и уровнем безработицы в Российской Федерации.
95
( )
( )
3xσ±
Глава 7. Основы корреляционного и регрессионного анализа
7.2. Этапы корреляционного анализа
При изучении корреляционных зависимостей между признаками
можно выделить несколько основных этапов:
1. Логический анализ изучаемого явления. На этом этапе устанавли-
вается результативный признак, изучается его сущность, выбираются признаки-факторы.
Результативный признак
знаки-факторы
;;;
xx x — это независимые переменные, ока-
12
y
— это зависимая переменная; при-
n
зывающие влияние на результативный признак. Если изучается зависимость результативного признака от одного признака-фактора, то такая связь называется парной корреляцией; если — от двух и бо­лее признаков-факторов, то такая связь называется множественной корреляцией.
2. Проверка признаков-факторов на однородность и нормальность рас-
пределения, установление факта наличия связи, ее направление.
Для получения качественных результатов корреляционного анализа необходимо соблюдать требование однородности и нормальности рас­пределения признаков-факторов в совокупности.
Проверка признаков-факторов на однородность распределения проводится с использованием коэффициента вариации (см. п. 5.3).
Для проверки совокупности на нормальность распределения, как правило, используется один из следующих методов: графический ана­лиз, правило «3-х сигм», расчет показателей формы распределения и критериев согласия. Наиболее простым в использовании является правило «3-х сигм». Учитывая особенность кривой нормального рас- пределения, в промежутке
находится 99,7 % всех значений при­знака. Таким образом, по правилу «3-х сигм» из последующего анализа необходимо исключить все единицы, у которых значения факторного признака не попадают в этот интервал.
Факт наличия связи между признаками можно установить с помо-
щью следующих способов:
1) сопоставление двух параллельных рядов результативного (y) и фак- торного (x) признаков. Исходные данные ранжируются (выстраиваются по возрастанию или убыванию) факторного признака. Затем рассма­тривается поведение значений результативного признака. Если с возра­станием (убыванием) факторного признака значения результативного признака планомерно возрастают (убывают), то можно предположить наличие прямой взаимосвязи между признаками;
2) анализ групповой или корреляционной таблиц.
96
( )
( )
( )
ini
mnm
∑
y
( )
( )
11
n
n
1k
n
∑
1i
n
n
ik
n
∑
1m
n
n
mk
n
∑
∑
∑
∑
11
mk
ij
∑∑
7.2. Этапы корреляционного анализа
Групповая таблица — таблица, содержащая группировку наблюдений по признаку-фактору и средние значения результативного признака в ка­ждой группе (см. в табл. 7.1).
Если групповые средние результативного признака планомерно возрастают, то предполагают наличие прямой связи рассматриваемых признаков. Если групповые средние результативного признака плано­мерно убывают, то предполагают обратную связь.
Таблица 7.1
Макет групповой таблицы
Номер
группы
Группы по призна-
ку-фактору
Число наблюде-
x
ний
1 …
… … … m …
Итого:
Средний уровень результа-
n
i
тивного признака
y
i
y
…
y
m
i
1
in=
Корреляционная таблица содержит результаты многомерной груп­пировки по факторному и результативному признакам. Макет корре­ляционной таблицы представлен в табл. 7.2.
Таблица 7.2
Макет корреляционной таблицы
Группы по при­знаку-фактору
x
1 …
… …
m …
Итого
Группы по результативному признаку
1 … k
… … …
1 j
ij
mj
m
n
1
i
1
i
=
m
ij
1
in=
m
in=
y
ik
1
Итого
k
1
j
=
k
1
jn=
k
1
jn=
= =
n
1
j
ij
mj
n
i
97
( )
CH CH
−
Глава 7. Основы корреляционного и регрессионного анализа
Если частоты
n
в корреляционной таблице группируются по диа-
ij
гонали из верхнего левого угла в нижний правый, можно предположить наличие прямой связи между изучаемыми признаками. В случае если расположение частот в таблице представлено диагональю из нижнего левого угла в верхний правый, предполагается наличие обратной зави­симости;
3) построение графика «поле корреляции».
Поле корреляции — точечный график, построенный в декартовой системе координат, на оси абсцисс которой откладываются значения признака­фактора, а на оси ординат — значения результативного признака.
При этом совокупность точек называют корреляционным облаком. По форме корреляционного облака судят о наличии и направлении связи. Если корреляционное облако принимает форму прямой линии или вытянутого овала, то можно предположить наличие связи;
4) расчет коэффициента корреляции знаков Г. Фехнера. Коэффициент
корреляции знаков Г. Фехнера определяется по формуле:
K
=
Φ
,
(7.1)
+
где C — число совпадений в знаках отклонений отдельных значений от среднего; H — число несовпадений в знаках отклонений отдельных значений от среднего.
Коэффициент Фехнера может принимать любые значения в интер­вале от –1 до +1. Чем он ближе по модулю к единице, тем достовернее предположение о наличии связи. Знак коэффициента определяет на­правление связи: «+» — связь прямая, « — » — связь обратная.
Числовой пример. Рассмотрим пример расчёта коэффициента кор­реляции рангов. Известны данные об уровне безработицы и уровне преступности по 10 городам области (табл. 7.3).
Таблица 7.3
Исходные данные по области
98
Города Уровень безработицы, % (х) Число преступлений
100000 человек населения (y)
на
А 5,3 1039
Б 5,2 965
7.2. Этапы корреляционного анализа
( )
( )
5,3 5,2 5,0 4,6 4,9 4,8 4,7 4,4 4,5 4,3
10
+++++++++
1039 965 975 830 965 889 873 720 670 710
10
+++++++++
Города Уровень безработицы, % (х) Число преступлений
100000 человек населения (y)
на
В 5,0 975
Г 4,6 830
Д 4,9 965
Е 4,8 889
Ж 4,7 873
З 4,4 720
И 4,5 670
К 4,3 710
Первоначально необходимо определить средние значения фактор-
ного
x и результативного
y признаков:
x
= =
y
= = ñëó÷
4,8%,
864 .
После чего следует расставить знаки отклонений отдельных значе­ний факторного и результативного признаков от своих средних значе­ний (табл. 7.4).
Таблица 7.4
Расчётные данные по области
Города х у Знак отклонения Совпадение (C)
х по y
по
А 5,3 1039 + + С
Б 5,2 965 + + С
В 5,0 975 + + С
Г 4,6 830 — — С
Д 4,9 965 + + C
Е 4,8 889 0 + Н
Ж 4,7 873 — + Н
З 4,4 720 — — С
И 4,5 670 — — С
К 4,3 710 — — С
или несовпадение (Н)
знаков
99
82 82
−
( ) ( )
ii
∑
ixi
y
,x
y
Глава 7. Основы корреляционного и регрессионного анализа
Коэффициент Фехнера составит:
K
= = +
Φ
0,6.
+
По рассчитанному значению коэффициента можно предложить на­личие прямой (знак плюс) и умеренно тесной (0,6) связи между уровнем преступности и уровнем безработицы.
Как отмечалось выше, связь между признаками может быть прямой и обратной. В случае если с увеличением значений факторного при­знака, увеличиваются и значения результативного, имеет место прямая зависимость, в противном случае — обратная.
3. Установление формы связи между результативным и факторным
признаками.
Существует ряд способов установления формы связи между фактор­ным и результативным признаками. Рассмотрим наиболее простые из них:
1) графический метод. В системе координат строится эмпирическая
линия связи и сравнивается с теоретической линией. Если эмпирическая линия представляет собой прямую линию, можно предположить нали­чие прямой зависимости, если эмпирическая линия отклоняется от пря­мой, то это свидетельствует о наличии криволинейной зависимости;
2) сравнение разности квадратов корреляционного отношения и линей-
ного коэффициента корреляции. Если
22
0, 1,rη−<
то применение линей­ной функции в качестве формы уравнения представляется возможным, в противном случае форма связи — криволинейная.
4. Оценка степени тесноты их связи и определение ее значимости.
Оценка степени тесноты связи проводится с помощью специальных показателей, выбор которых осуществляется на основе анализа исход­ных данных:
1) при условии нормального распределения признаков в совокуп­ности и прямолинейной зависимости между ними в случае парной корреляции наиболее точно оценивает степень тесноты связи линейный коэффициент корреляции:
n
xx yy
−⋅ −
1
r
=
σσ
n
xy
,
(7.2)
где:
,
— соответственно, i-е значение факторного и результативного
признаков;
— средние значения факторного и результативного признаков;
100
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]