Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Компьютерная обработка статистических данных. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
можно было скопировать ее в ячейки J2 и K2. Сделав это и
2
ii
Rq
заменив в формулах значение критерия «1» на «2» и «3» соответственно, получаем значения R2 и R3 (рис.4.2)
Значение Н исправленной статистики Краскала-Уоллиса можно вычислить теперь по приведенной выше формуле, но она достаточно громоздка, поэтому для облегчения вычислений проведем вспомогательные построения: укажем объемы выборок q1=15, q2=14, q3=14; вычислим их сумму, получив объем совмещенной выборки n; вычислим величины
(это удобно сделать, введя формулу один раз и
скопировав в соседние ячейки) и их сумму.
Теперь вычислим значение Н, введя в ячейке I7 формулу:
=(12*L4/(L3*(L3+1))-3*(L3+1))/(1-G2/(L3^3-L3)).
Поскольку объемы выборок превышают 8, в таблицах критическое значение критерия найти нельзя; вычислим его при помощи функции ХИ2ОБР (рис.4.2):
Рис.4.2. Применение критерия Краскала-Уоллиса, .
Рассчитанное значение критерия превышает критическое для уровня значимости 0,05, значит с доверительной вероятностью 0,95 можно сделать вывод о влиянии фактора на исследуемый признак, то есть различия в загрязнении на разных уровнях существенны. Заметим, что этот результат
51
согласуется с выводом дисперсионного анализа,
ЦФО
Р.Мордовия
4,7
7,0
6,0
Белг. обл.
5,6
6,0
5,9
Р.Татарстан
5,6
6,7
7,4
Брян. обл.
6,8
6,7
8,8
Удмурт. р.
8,4
7,8
8,0
Влад. обл.
10,9
9,0
9,1
Чув. р.
8,6
11,4
9,9
Ворон. обл.
5,5
7,5
8,6
Перм. край
6,9
7,0
7,0
Иван. обл.
4,2
6,8
4,6
Кир. обл.
7,9
7,1
8,7
Калуж. обл
5,6
5,7
6,3
Нижег. обл.
5,3
6,0
7,4
Костр. обл.
5,0
4,8
5,9
Оренб. обл.
6,5
9,4
10,8
Кур. обл.
7,3
7,1
7,5
Пенз. обл.
6,5
6,5
6,9
Лип. обл.
4,9
8,0
4,2
Сам. обл.
4,3
5,3
5,3
Моск. обл.
3,0
3,3
3,7
Сарат. обл.
8,2
9,1
9,9
Орл. обл.
6,0
6,1
5,9
Ульян. обл.
6,9
7,7
9,5
Ряз. обл.
5,2
5,3
5,8
Уральский ФО
Смол. обл.
8,0
7,8
9,1
12,4
11,3
12,5
Тамб. обл.
8,7
8,5
9,7
7,0
6,7
7,3
Твер. обл.
4,5
5,9
5,3
Тюм. обл.
6,8
6,7
8,7
Тул. обл.
2,7
5,0
4,6
Х.-Манс. АО
6,1
7,8
9,7
Яросл. обл.
3,0
4,0
4,7
Я.-Нен.АО
5,4
7,1
6,5
Г.Москва
1,6
0,8
1,6
Челяб. обл.
5,1
5,4
5,2
С-ЗФО
Сибирский ФО
Р. Карелия
3,6
8,8
7,3
Р. Алтай
11,6
10,0
9,6
Р. Коми
12,4
11,5
12,4
Р. Бурятия
13,4
14,2
15,3
Арх. обл.
5,9
5,5
7,2
Р. Тыва
20,5
21,8
19,7
Волог. обл.
5,3
5,2
6,3
Р.Хакасия
9,1
8,9
10,3
проведенного в примере 4.1.
Задание 4.
4.1. Проверить, существенны ли различия уровня
безработицы в разных регионах России по данным 2006 года (первая колонка данных) при помощи дисперсионного анализа и критерия Краскала-Уоллиса
4.2. Выбрать подходящий метод и проверить, существенны ли различия в уровне безработицы в России в 2006, 2005, 2004 годах
Таблица 4.2. Уровень безработицы в России: 2006, 2005, 2004 гг
52
Калин. обл.
4,5
6,6
6,5
Алт. край
8,8
9,0
9,0
Лен. обл.
5,9
7,4
6,8
Красн. край
9,9
9,0
9,2
Мурм. обл.
6,7
8,8
11,0
Тайм. АО
10,0
14,0
9,1
Новг. обл.
5,5
5,8
6,2
Эвенк. АО
3,9
4,4
3,2
Пск. обл.
7,4
6,6
5,6
Ирк. обл
8,9
10,0
10,5
С-Пб
2,4
2,2
2,7
У.-Орд. АО
12,6
12,8
9,8
ЮФО
Кем. обл.
7,3
8,6
9,8
Р.Адыгея
13,7
12,9
17,6
Новосиб. обл.
7,4
7,8
9,0
Р.Дагестан
22,3
22,3
27,2
Омск. обл.
9,3
8,6
9,1
Р.Ингуш.
58,5
64,9
46,3
Томск. обл..
9,0
10,5
10,1
Каб.-балк.р.
20,7
23,4
25,7
Чит. обл
8,8
11,1
12,4
Р.Калм.
16,7
18,0
21,7
Дальневост. ФО
Кар.-Черк.р.
19,4
13,6
16,9
Р.Саха
9,5
8,9
8,8
Р.Сев.Ос.
8,5
8,8
11,7
Прим. край
8,0
8,0
9,6
Красн.край
8,9
7,5
8,8
Хаб. край
6,0
5,7
6,6
Ставр. край
7,9
7,0
9,6
Амур. обл.
8,2
10,3
11,2
Астр. обл.
7,9
12,0
11,0
Камч. обл.
9,1
9,5
11,0
Волг. обл.
8,6
6,8
9,4
Коряк. АО
6,4
7,8
11,1
Рост. обл.
8,0
8,6
8,6
Магад. обл.
5,4
7,0
7,9
Приволжский ФО
Сах. обл.
4,6
7,6
7,5
Р.Башк.
6,5
7,1
7,1
Евр. АО
9,8
7,9
8,3
Р.Марий Эл
10,2
9,9
9,1
Чукот. АО
3,7
4,4
3,5
экономических систем требует совместного рассмотрения нескольких их свойств и характеристик. Иногда свойства объектов проявляются независимо друг от друга, иногда между ними могут быть выявлены более или менее четкие взаимосвязи.
соответствует определенное значение другой переменной то речь идет о функциональной связи, с ними часто имеют дело естественные науки. В экономике, социологии, медицине,
5. Корреляционно-регрессионный анализ
Моделирование экологических и социо-эколого-
Если каждому значению одной переменной
53
экологии в большинстве случаев каждому значению одной переменной соответствует множество возможных значений другой переменной. Такая связь между параметрами является статистической.
Если разным значениям одной переменной
соответствуют различные средние значения другой, такая связь называется корреляционной.
Выявление корреляционных важно при решении широкого круга задач. Иногда требуется подтвердить не наличие, а отсутствие корреляционной связи.
Наличие корреляционной связи не всегда означает наличие причинно-следственной зависимости. Существуют три пути возникновения корреляционной связи:
• Причинная зависимость одного признака от другого
признака. Например, признак Х – ВВП региона, признак Y – объем выбросов СО2 в регионе.
• Корреляционная связь между двумя следствиями общей причины. Классический пример, приведенный крупнейшим статистиком России начала XX в. А.А. Чупровым: если X – число пожарных команд в городе, а Y - сумма убытков за год в городе от пожаров, то между признаками X и Y в совокупности городов России существенна прямая корреляция. Конечно, это объясняется тем, что оба признака
- следствия общей причины - размера города.
• Взаимосвязь признаков, каждый из которых и причина, и
следствие. Например, корреляция между уровнями производительности труда рабочих и уровнем оплаты 1 ч труда (тарифной ставкой). С одной стороны, уровень зарплаты - следствие производительности труда; с другой стороны, он может играть стимулирующую роль. В такой системе признаков допустимы обе постановки задачи; каждый признак может выступать и в роли независимой переменной Х, и в качестве зависимой переменной Y.
Поэтому результаты корреляционного анализа необходимо проверять логикой, опираясь на теоретические и
54
практические знания об исследуемых свойствах. Иногда при этом требуется проследить длинную цепочку взаимозависимостей. Так, по многолетним статистическим данные о случаях тяжелого производственного травматизма на угольных шахтах было установлено, что их частота связана с фазами луны. Эта загадочная, казалось бы, связь объясняется влиянием положения луны на приливные силы, которые проявляются не только в гидросфере, но и в литосфере, и часто играют роль «спускового крючка» для таких явлений как горный удар, выбросы газа и т.п.
Проверка гипотез о наличии линейной корреляции
Основная задача корреляционного анализа состоит в выявлении связи между случайными переменными путем точечной и интервальной оценки различных (парных, множественных, частных) коэффициентов корреляции.
Для проверки гипотезы о наличии линейной корреляционной связи наибольшее распространение имеет
коэффициент линейной корреляции (Пирсона),
предполагающий нормальный закон распределения наблюдений. Для двумерной нормально распределенной случайной величины XY при отсутствии линейной корреляции между X и Y коэффициент корреляции равен нулю. Поэтому процедура проверки заключается в расчете выборочной оценки коэффициента корреляции и оценке значимости его отличия от нуля.
Коэффициент корреляции – параметр, характеризующий степень линейной взаимосвязи между двумя выборками. Коэффициент корреляции изменяется от –1 (строгая обратная линейная зависимость) до 1 (строгая прямая линейная зависимость). Под прямой понимают зависимость, при которой увеличение или уменьшение значения одного признака ведет, соответственно, к увеличению или уменьшению второго. Например, при увеличении температуры возрастает давление газа, а при уменьшении –
55
снижается (при постоянном объеме). При обратной
1 2 1 2
( ) ( )r n n n n
зависимости увеличение одного признака приводит к уменьшению второго и наоборот. Примером обратной корреляционной зависимости может служить связь между температурой воздуха на улице и количеством топлива, расходуемого на обогрев помещения.
На практике коэффициент корреляции принимает некоторые промежуточные значения между 1 и –1. Для оценки степени взаимосвязи можно руководствоваться следующей классификацией корреляционных связей по абсолютной величине коэффициента корреляции:
- очень сильная, почти линейная зависимость при r>0,95;
- сильная (тесная) при коэффициенте корреляции r>0,7;
- средняя при 0,50<r<0,69; умеренная при 0,30<r<0,49;
- слабая при 0,20<r<0,29; очень слабая при r<0,19. В этих
случаях обычно считают, что линейную взаимосвязь между параметрами выявить не удалось.
Наличие корреляции можно выявить визуально с помощью корреляционного поля точек. Можно даже оценить коэффициент корреляции, разделив поле точек на четыре квадранта линиями, соответствующими медианам величин Х и Y и воспользовавшись формулой
, где n1 – число точек в квадрантах I,
III а n2 – в квадрантах II, IV:
В Excel для вычисления выборочных парных коэффициентов линейной корреляции используется специальная функция КОРРЕЛ(массив1;массив2) или PEARSON(массив1;массив2), аргументами которых являются диапазоны ячеек со значениями исследуемых параметров, попарно измеренных на одних и тех же объектах
Вычислив выборочный коэффициент корреляции, необходимо оценить его статистическую значимость. Не исключено, что ненулевое значение коэффициента является не отражением действительной связи между признаками, а
56
получено в результате специфики данной выборки. Для того,
( ; )
rr
r t r t


2
(1 ) ( 2)
r
rn
2 2 2
,
( 2 ) (1 )
z xy xz yz xz yz xy xy
R r r r r r r
2
;2; 3
0,5 ( 3) (1 )
n
F R n R F
;2; 3n
F
22
1 6 ( ) ( ( 1))
ii
r R S n n 
2
6 ( ( 1)/ 2)( ( 1) / 2) ( ( 1) 0,5( ))
i i X Y
r R n S n n n T T
чтобы понять, насколько значимо отличие выборочного коэффициента корреляции от 0, строят доверительный
интервал
. Средняя ошибка коэффициента
корреляции вычисляется по формуле:
.
Напомним, что коэффициент доверия t для доверительной
вероятности 0,95 равен 2, для 0,999 – 3 (см. работу №2)
Если 0 не попадает в доверительный интервал, то
коэффициент корреляции статистически значим.
Теснота линейной связи одной переменной с
совокупностью других, рассматриваемой в целом, измеряется при помощи выборочного множественного (совокупного) коэффициента корреляции. Например, для трех переменных:
.
Этот коэффициент значим на уровне , если
В Excel значение
.
вычисляется при помощи
функции FРАСПОБР.
В случае, если нельзя обоснованно применить коэффициент Пирсона, для проверки гипотезы о наличии корреляционной связи используются ранговые коэффициенты корреляции, например Спирмена.
Коэффициент ранговой корреляции Спирмена
вычисляют по формуле
(при отсутствии связок),
(при наличии связок),
57
где Ri, Si – ранги сопряженных значений изучаемых величин
2
( 1)
i
Tt
( ) 1
кр
r Z P n
№
проб
Pb
Au
№
проб
Pb
Au
№
проб
Pb
Au
1
2,05
3,76
19
1,21
0,61
37
5,16
0,87
2
5,03
2,09
20
2,92
0,40
38
0,37
1,15
3
0,80
1,98
21
0,74
0,27
39
0,44
0,91
4
0,31
0,20
22
1,53
2,57
40
2,21
4,25
5
0,77
3,10
23
3,70
0,90
41
4,67
2,03
6
4,01
1,67
24
2,71
1,69
42
1,44
4,31
7
1,19
2,59
25
1,90
4,32
43
3,13
0,25
8
1,26
1,70
26
1,51
2,30
44
1,35
0,39
9
0,68
0,23
27
0,21
1,22
45
0,81
1,35
10
0,91
1,21
28
4,81
1,05
46
1,32
3,51
11
4,33
0,91
29
1,38
2,09
47
0,99
1,62
12
2,38
1,68
30
3,96
2,54
48
2,41
3,98
13
0,98
2,44
31
1,96
1,58
49
1,03
0,35
14
0,42
0,50
32
0,52
0,82
50
1,55
2,80 5815
xi и yi в выборках Х и Y; n – количество пар в выборке;
- при суммировании по элементам выборки;
ti – длина связки, в которую входит i-й элемент выборки.
Для проверки значимости рангового коэффициента корреляции можно использовать величину
,
где Z(P) – значение обратной функции нормального распределения при доверительной вероятности
,
рассчитывается при помощи функции НОРМСТОБР().
Если расчетное значение коэффициента Спирмена (r) больше критического (rкр), то гипотеза о независимости исследуемых величин отвергается.
Пример 5.1. Определить наличие корреляционной связи между содержанием золота и свинца в рудах полиметаллического месторождения по данным проб в таблице 5.1
Таблица 5.1. Содержание свинца и золота в рудах
1,71
1,21
33
2,95
0,20
51
3,39
0,41
16
3,51
1,15
34
1,10
1,44
52
1,23
1,58
17
1,11
2,30
35
0,93
3,15
53
1,48
4,22
18
2,10
3,48
36
1,78
1,21
54
4,03
1,19
Решение. Скопируем данные из таблицы на лист Excel: в столбец В – данные по содержанию свинца, в столбец С – по содержанию золота. Вычислить коэффициент корреляции Пирсона легко:
Рис. 5.1. Вычисление коэффициента корреляции Пирсона.
Полученное значение -0,049 показывает отсутствие
линейной корреляционной связи показателей.
Однако для обоснованного применения коэффициента корреляции Пирсона надо быть уверенными в соответствии (хотя бы непротиворечии) данных обеих выборок нормальному закону. Проведем проверку для первой выборки (Pb) (объем выборки n=54 это формально позволяет) (рис.5.2)
Заметим, что число интервалов 7 не позволяет получить размер интервалов в виде конечной десятичной дроби, поэтому вычисленная верхняя граница седьмого интервала несколько меньше максимального значения в выборке. Поэтому при заполнении столбца частот необходимо недоопределить массив интервалов, введя формулу =ЧАСТОТА(B2:B55;E2:E7), а при вычислении теоретической частоты для последнего интервала используем не значение в ячейке Е8, а функцию МАКС(В2:В55)
59
Рис.5.2. Проверка гипотезы о нормальном распределении для обоснования применимости коэффициента корреляции Пирсона
Полученное значение критерия 2 указывает на противоречие данных нормальному закону распределения, поэтому доверять коэффициенту Пирсона нельзя.
Вычислим коэффициент ранговой корреляции Спирмена (рис.5.3). Для этого вычислим значения функции РАНГ для данных обеих выборок и длины связок. Поскольку в выборке данных содержания золота есть совпадающие значения (неединичные связки), следует вычислить согласованные ранги Ri и Si, а также, для применения формулы коэффициента Спирмена в случае совпадающих значений, величины Ri-(n+1)/2 и Si-(n+1)/2:
Рис.5.3. Вычисление коэф. ранговой корреляции Спирмена, начало
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]