Статистика. Учебное пособие
.pdf
3,5
3
2,5
Линия регрессии
2
1,5
1
0,5
0
0 |
0,5 |
1 |
1,5 |
2 |
2,5 |
3 |
3,5 |
Рис. 17. Корреляционное поле
Для количественной оценки тесноты связи широко исполь-
зуют линейный коэффициент корреляции. Иногда его называют просто коэффициентом корреляции. Рассчитывается, если между факторным и результативным признаками существует линейная зависимость. Если заданы значения переменныхx и y, то коэффициент вычисляется по формуле:
ryx = rxy = xy - x × y , s x ×s y
где s x - среднее квадратическое отклонение факторного признака; s y - среднее квадратическое отклонение результативного при-
знака.
Можно использовать и другие формулы, но результат должен быть одинаковым для всех вариантов расчета.
Линейный коэффициент корреляции принимает значения в интервале от -1 до +1. Чем ближе коэффициент корреляции по абсолютной величине к1, тем теснее связь между признаками.
Принято считать, что если |r| <0,30, то связь слабая; при |r| = (0,3÷0,7)
111
– средняя; при |r| >0,70 – сильная, или тесная. Когда |r| =1 – связь функциональная. Знак при линейном коэффициенте корреляции указывает на направление связи – прямой зависимости соответствует знак «+», а обратной зависимости – знак «-». Если же r принимает значение около0, то это дает основание говорить об отсутствии линейной связи междуx и y. Однако в этом случае возможно нелинейное взаимодействие, что требует дополнительной проверки и других измерителей.
Для характеристики тесноты связи также применяются следующие показатели:
- теоретический коэффициент эластичности - показыва-
ет, на сколько процентов изменится результативный показатель, если факторный возрастет на 1 %:
ЭТ = a1 xi , y
где xi - среднее |
значение |
соответствующего |
факторного |
признака; |
|
|
|
y - среднее значение результативного признака;
a1 - коэффициент регрессии при соответствующем фактор-
ном признаке; - эмпирический коэффициент эластичности - характеризу-
ет, на сколько процентов изменяется уровень результативного признака при изменении факторного на 1 %:
ЭЭ = Dy ¸ y0 = Dy ¸ Dx .
Dx x0 y0 x0
Измерение тесноты связи при помощи дисперсионного и корреляционного анализа связано с определенными сложностями и громоздкостью вычислений. Для ориентировочной оценки тесноты связи используются приближенные показатели: коэффициент корреляции знаков Фехнера, коэффициент корреляции рангов Спирмена.
Для |
расчета коэффициента |
корреляции |
знаков Фехнера |
|
необходимо |
предварительно |
определить |
средние |
значения |
112
результативного и факторного признаков, затем для каждой единицы совокупности определить знаки отклонений варианты от средней величины. Коэффициент рассчитывается по формуле:
u - v
Кф = u + v ,
где u - число пар с одинаковыми знаками отклонений вариант факторного и результативного признаков от средней величины;
v - число пар с разными знаками отклонений.
Этот коэффициент позволяет получить представление о направлении связи (если Кф>0, то связь прямая, если Кф<0 - обратная) и приблизительную характеристику ее тесноты. Расчет коэффициента приведен в табл. 33.
Коэффициент корреляции рангов Спирмена - непараметри-
ческий коэффициент связи, применяется как к количественным, так и к непараметрическим, но поддающимся ранжированию признакам. Для его вычисления необходимы не первичные данные, а ранги – порядковые номера, которые присваиваются всем значениям изучаемых признаков, расположенных в порядке их изменения (возрастания или убывания). Полное совпадение рангов в совокупности означает максимально тесную прямую связь, полная противоположность рангов – максимально тесную обратную связь. Коэффициент рассчитывается по формуле:
6 ×åd 2 Кр =1- n ×(n2 -1) ,
где d - разность между рангами соответствующих признаков для каждой единицы совокупности, d = pxi - pyi ;
pxi и pyi - ранги соответствующих признаков для каждой
единицы наблюдения;
n - количество единиц наблюдения.
113
114
|
Расчет коэффициентов корреляции знаков и рангов |
|
|
Таблица 33 |
||||||||||
|
|
|
|
|
||||||||||
№ предпри- |
Производительность |
Потери рабо- |
Знаки отклонений |
Ранги |
|
|
|
d2 |
||||||
ятия |
труда, д.е. (у) |
чего времени, |
|
|
|
|
|
|
y |
|
x |
d |
|
|
yот y |
|
xот x |
|
|
||||||||||
|
|
чел.-д. (х) |
|
|
|
|
|
|||||||
1 |
31,76 |
13,10 |
+ |
|
|
- |
|
|
16 |
|
11 |
5 |
|
25 |
2 |
5,79 |
14,90 |
- |
|
|
+ |
|
|
2 |
|
15 |
13 |
|
169 |
3 |
17,66 |
11,80 |
- |
|
|
- |
|
|
7 |
|
5 |
2 |
|
4 |
4 |
19,50 |
8,80 |
- |
|
|
- |
|
|
9 |
|
1 |
8 |
|
64 |
5 |
33,48 |
11,00 |
+ |
|
|
- |
|
|
17 |
|
4 |
13 |
|
169 |
6 |
37,64 |
10,09 |
+ |
|
|
- |
|
|
20 |
|
3 |
17 |
|
289 |
7 |
13,42 |
13,50 |
- |
|
|
+ |
|
|
3 |
|
12 |
9 |
|
81 |
8 |
24,51 |
12,60 |
+ |
|
|
- |
|
|
14 |
|
10 |
4 |
|
16 |
9 |
18,03 |
15,10 |
- |
|
|
+ |
|
|
8 |
|
17 |
9 |
|
81 |
10 |
25,79 |
12,00 |
+ |
|
|
- |
|
|
15 |
|
6 |
9 |
|
81 |
11 |
15,85 |
17,80 |
- |
|
|
+ |
|
|
6 |
|
20 |
14 |
|
196 |
12 |
4,24 |
13,90 |
- |
|
|
+ |
|
|
1 |
|
14 |
13 |
|
169 |
13 |
23,60 |
12,01 |
+ |
|
|
- |
|
|
13 |
|
7 |
6 |
|
36 |
14 |
21,53 |
15,00 |
+ |
|
|
+ |
|
|
12 |
|
16 |
4 |
|
16 |
15 |
20,09 |
12,02 |
- |
|
|
- |
|
|
10 |
|
8 |
2 |
|
4 |
16 |
14,85 |
13,80 |
- |
|
|
+ |
|
|
5 |
|
13 |
8 |
|
64 |
17 |
34,26 |
9,40 |
+ |
|
|
- |
|
|
18 |
|
2 |
16 |
|
256 |
18 |
36,09 |
17,50 |
+ |
|
|
+ |
|
|
19 |
|
19 |
0 |
|
0 |
19 |
20,44 |
12,03 |
- |
|
|
- |
|
|
11 |
|
9 |
2 |
|
4 |
20 |
13,84 |
16,00 |
- |
|
|
+ |
|
|
4 |
|
18 |
14 |
|
196 |
Итого |
430,37 |
270,35 |
х |
|
х |
х |
|
х |
168 |
|
1920 |
|||
114
Пример. Проанализируйте взаимосвязь между производительностью труда и величиной потерь рабочего времени на основе непараметрических коэффициентов корреляции знаков и рангов по данным табл. 33. Рассчитаем средние значения факторного
ирезультативного признаков:
x= 270,35 = 13,5 чел. - д. 20
y = 430,37 = 21,52 д. е. 20
Определим коэффициенты корреляции знаков и рангов:
|
Кф |
= |
6 |
-14 |
= -0,4. |
||
|
|
+14 |
|||||
|
|
6 |
|
|
|||
К р |
= 1 - |
6×1920 |
= -0,44. |
||||
|
|
|
|||||
20×(400-1) |
|||||||
|
|
|
|||||
Значения полученных непараметрических коэффициентов свидетельствуют о наличии обратной умеренной связи между уровнем производительности труда и величиной потерь рабочего времени.
Для характеристики влияния измененийx на вариациюy служат методы регрессионного анализа. В случае парной линейной зависимости строится регрессионная модель:
yi = a0 + a1 × xi +ei , i =1,2,3...n,
где n - число наблюдений;
а0, а1 - неизвестные параметры уравнения; ei - ошибка случайной переменной y. Уравнение регрессии записывается как
yi теор = a0 + a1 × xi ,
где yi теор - рассчитанное выравненное значение результативного
признака после подстановки в уравнение x.
Параметры а0 и а1 оцениваются с помощью процедур, наибольшее распространение из которых получилметод наимень-
115
ших квадратов. Его суть заключается в том , что наилучшие оценки а0 и а1 получают, когда:
n
å( yi - yiтеор )2 = min,
i =1
т.е. сумма квадратов отклонений эмпирических значений зависимой переменной от вычисленных по уравнению регрессии должна быть минимальной. Сумма квадратов отклонений является функцией параметров а0 и а1. Ее минимизация осуществляется решением системы уравнений:
ìïna0 + a1åx = åy
í
2
ïîa0 åx + a1åx = åxy.
Можно воспользоваться и другими формулами, вытекающими из метода наименьших квадратов, например:
a |
= |
å( |
xi |
- |
x |
)( |
yi |
- |
y |
) |
или a |
= r |
s y |
, |
|
|
|
|
|
|
|
|
|
||||||
1 |
|
å(xi - x)2 |
1 |
xy s x |
|
|||||||||
a0 = y - a1 x.
Аппарат линейной регрессии достаточно хорошо разработан и, как правило, имеется в наборе стандартных программ оценки взаимосвязи для компьютера. Важен смысл параметров: а1 – это коэффициент регрессии, характеризующий влияние, которое оказывает изменениех на у. Он показывает, на сколько единиц в среднем изменится у при изменении х на одну единицу. Если а больше 0, то наблюдается положительная связь. Если а имеет отрицательное значение, то увеличение х на единицу влечет за собой уменьшение у в среднем на а1. Параметр а1 обладает размерностью отношения у к х.
Параметр a0 – это постоянная величина в уравнении регрессии. На наш взгляд, экономического смысла он не имеет, но в ряде случаев его интерпретируют как начальное значениеу.
116
Например, по данным о стоимости оборудованиях и производительности труда у методом наименьших квадратов получено уравнение:
y = -12,14 + 2,08 × x.
Коэффициент а означает, что увеличение стоимости оборудования на 1 млн р. ведет в среднем к росту производительности труда на 2,08 тыс. р.
Значение функции yi = a0 + a1 × xi называется расчетным значением и на графике образуеттеоретическую линию регрессии. Смысл теоретической регрессии в том, что это оценка среднего значения переменной у для заданного значения х.
Парная корреляция или парная регрессия могут рассматриваться как частный случай отражения связи некоторой зависимой переменной, с одной стороны, и одной из множества независимых переменных – с другой. Когда же требуется охарактеризовать связь всего указанного множества независимых переменных с результативным признаком, говорят о множественной корреля-
ции или множественной регрессии.
7.3. Оценка значимости параметров взаимосвязи
Получив оценки корреляции и регрессии, необходимо проверить их на соответствие истинным параметрам взаимосвязи. Существующие прикладные программы включают, как правило, несколько наиболее распространенных критериев. Для оценки значимости коэффициента парной корреляции рассчитывают стандартную ошибку коэффициента корреляции:
srxy = |
1 - r 2 |
xy , |
|
|
n - 2 |
где rxy - выборочное значение коэффициента корреляции;
n - число сравниваемых пар данных или число объектов, у которых измерены два признака.
117
В первом приближении нужно, чтобы srxy < rxy . Значимость rxy проверяется его сопоставлением с srxy , при этом получают:
t |
расч |
= r × n - 2 |
, |
|
xy |
|
|
|
|
1 - r 2 |
|
|
|
xy |
|
где tрасч - расчетное значение t-критерия.
Если tрасч больше теоретического (табличного) значения критерия Стьюдента (tтабл) для заданного уровня вероятности и (n-2) степеней свободы, то можно утверждать, что rxy значимо.
Подобным образом на основе соответствующих формул рассчитывают стандартные ошибки параметров уравнения регрессии, а затем и t-критерии для каждого параметра. Важно проверить, чтобы соблюдалось условиеtрасч >tтабл. В противном случае доверять полученной оценке параметра нет оснований.
Вывод о правильности выбора вида взаимосвязи и характеристику значимости всего уравнения регрессии получают с -по мощью F-критерия, вычисляя его расчетное значение:
R2 (n - m)
Fрасч = (1- R2 )(m -1) ,
где R2 - коэффициент детерминации; n - число наблюдений;
m - число параметров уравнения регрессии.
Fрасч должно быть больше Fтеор (табличного) при v1 = (m-1) и v2 = (n-m) степенях свободы. В противном случае следует пересмотреть форму уравнения, перечень переменных и т.д.
7.4. Непараметрические методы оценки взаимосвязи
Методы корреляционного и дисперсионного анализа не универсальны: их можно применять, если все изучаемые признаки являются количественными. При использовании этих методов нельзя обойтись без вычисления основных параметров распреде-
118
ления (средних величин, дисперсий), поэтому они получили название параметрических методов.
Между тем в статистической практике приходится сталкиваться с задачами измерения связи между качественными признаками, к которым параметрические методы анализа в их обычном виде неприменимы. Статистической наукой разработаны методы, с помощью которых можно измерить связь между явлениями, не используя при этом количественные значения признака, а значит, и параметры распределения. Такие методы получили название непараметрических.
Если изучается взаимосвязь двух качественных признаков, то используют комбинационное распределение единиц совокуп-
ности в форме так называемых таблиц взаимной сопряженности.
Рассмотрим методику анализа таблиц взаимной сопряженности на конкретном примере социальной мобильности как процесса преодоления замкнутости отдельных социальных и профессиональных групп населения. Ниже приведены данные о распределении выпускников средних школ по сферам занятости с выделением аналогичных общественных групп их родителей (табл. 34).
|
|
|
Исходные данные |
|
Таблица 34 |
|
|
|
|
|
|
||
Занятия |
|
Число детей-выпускников школ, выбравших сферу: |
|
|||
|
промышлен- |
сельское |
обслужива- |
интеллекту- |
Всего |
|
родителей |
ности и строи- |
хозяйство |
ния |
ального труда |
||
|
|
тельства |
|
|
|
|
Промыш- |
|
|
|
|
|
|
ленность |
|
|
|
|
|
|
строитель- |
40 |
5 |
7 |
39 |
91 |
|
ство |
|
|||||
Сельское |
|
34 |
29 |
13 |
12 |
88 |
хозяйство |
|
|||||
Сфера |
б- |
16 |
6 |
15 |
19 |
56 |
служивания |
||||||
Сфера |
н- |
|
|
|
|
|
теллекту- |
|
|
|
|
|
|
ального |
|
24 |
5 |
9 |
72 |
110 |
труда |
|
|||||
Всего |
|
114 |
45 |
44 |
142 |
345 |
Распределение частот по строкам и столбцам таблицы взаимной сопряженности позволяет выявить основные закономерности социальной мобильности: 42,9 % детей родителей первой
119
группы («Промышленность и строительство») заняты в сфере интеллектуального труда (39 из 91); 38,9 % детей, родители которых трудятся в сельском хозяйстве, работают в промышленности
(34 из 88) и т.д.
Можно заметить и явную наследственность в передаче профессий. Так, из пришедших в сельское хозяйство, 29 человек (или 64,4 %) являются детьми работников сельского хозяйства; более чем у 50 % детей из сферы интеллектуального труда родители относятся к той же социальной группе и т.д.
Однако важно получить обобщающий показатель, характеризующий тесноту связи между признаками и позволяющий сравнить проявление связи в разных совокупностях. Для этой цели исчисляют, например, коэффициенты взаимной сопряженности Пирсона (С) и Чупрова (К):
j2
С=
1 +j2 ,
где φ – показатель взаимной сопряженности.
К = |
j 2 |
, |
|
|
(К1 -1) (К2 -1) |
где К1 – число групп по колонкам; К2 – число групп по строкам.
Величина коэффициента взаимной сопряженности, отражающая тесноту связи между качественными признаками, колеблется в обычных для этих показателей пределах от 0 до 1.
120
