Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистика. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
15.08.2026
Размер:
972 Кб
Скачать

3,5

3

2,5

Линия регрессии

2

1,5

1

0,5

0

0

0,5

1

1,5

2

2,5

3

3,5

Рис. 17. Корреляционное поле

Для количественной оценки тесноты связи широко исполь-

зуют линейный коэффициент корреляции. Иногда его называют просто коэффициентом корреляции. Рассчитывается, если между факторным и результативным признаками существует линейная зависимость. Если заданы значения переменныхx и y, то коэффициент вычисляется по формуле:

ryx = rxy = xy - x × y , s x ×s y

где s x - среднее квадратическое отклонение факторного признака; s y - среднее квадратическое отклонение результативного при-

знака.

Можно использовать и другие формулы, но результат должен быть одинаковым для всех вариантов расчета.

Линейный коэффициент корреляции принимает значения в интервале от -1 до +1. Чем ближе коэффициент корреляции по абсолютной величине к1, тем теснее связь между признаками.

Принято считать, что если |r| <0,30, то связь слабая; при |r| = (0,3÷0,7)

111

– средняя; при |r| >0,70 – сильная, или тесная. Когда |r| =1 – связь функциональная. Знак при линейном коэффициенте корреляции указывает на направление связи – прямой зависимости соответствует знак «+», а обратной зависимости – знак «-». Если же r принимает значение около0, то это дает основание говорить об отсутствии линейной связи междуx и y. Однако в этом случае возможно нелинейное взаимодействие, что требует дополнительной проверки и других измерителей.

Для характеристики тесноты связи также применяются следующие показатели:

- теоретический коэффициент эластичности - показыва-

ет, на сколько процентов изменится результативный показатель, если факторный возрастет на 1 %:

ЭТ = a1 xi , y

где xi - среднее

значение

соответствующего

факторного

признака;

 

 

 

y - среднее значение результативного признака;

a1 - коэффициент регрессии при соответствующем фактор-

ном признаке; - эмпирический коэффициент эластичности - характеризу-

ет, на сколько процентов изменяется уровень результативного признака при изменении факторного на 1 %:

ЭЭ = Dy ¸ y0 = Dy ¸ Dx .

Dx x0 y0 x0

Измерение тесноты связи при помощи дисперсионного и корреляционного анализа связано с определенными сложностями и громоздкостью вычислений. Для ориентировочной оценки тесноты связи используются приближенные показатели: коэффициент корреляции знаков Фехнера, коэффициент корреляции рангов Спирмена.

Для

расчета коэффициента

корреляции

знаков Фехнера

необходимо

предварительно

определить

средние

значения

112

результативного и факторного признаков, затем для каждой единицы совокупности определить знаки отклонений варианты от средней величины. Коэффициент рассчитывается по формуле:

u - v

Кф = u + v ,

где u - число пар с одинаковыми знаками отклонений вариант факторного и результативного признаков от средней величины;

v - число пар с разными знаками отклонений.

Этот коэффициент позволяет получить представление о направлении связи (если Кф>0, то связь прямая, если Кф<0 - обратная) и приблизительную характеристику ее тесноты. Расчет коэффициента приведен в табл. 33.

Коэффициент корреляции рангов Спирмена - непараметри-

ческий коэффициент связи, применяется как к количественным, так и к непараметрическим, но поддающимся ранжированию признакам. Для его вычисления необходимы не первичные данные, а ранги – порядковые номера, которые присваиваются всем значениям изучаемых признаков, расположенных в порядке их изменения (возрастания или убывания). Полное совпадение рангов в совокупности означает максимально тесную прямую связь, полная противоположность рангов – максимально тесную обратную связь. Коэффициент рассчитывается по формуле:

6 ×åd 2 Кр =1- n ×(n2 -1) ,

где d - разность между рангами соответствующих признаков для каждой единицы совокупности, d = pxi - pyi ;

pxi и pyi - ранги соответствующих признаков для каждой

единицы наблюдения;

n - количество единиц наблюдения.

113

114

 

Расчет коэффициентов корреляции знаков и рангов

 

 

Таблица 33

 

 

 

 

 

№ предпри-

Производительность

Потери рабо-

Знаки отклонений

Ранги

 

 

 

d2

ятия

труда, д.е. (у)

чего времени,

 

 

 

 

 

 

y

 

x

d

 

yот y

 

xот x

 

 

 

 

чел.-д. (х)

 

 

 

 

 

1

31,76

13,10

+

 

 

-

 

 

16

 

11

5

 

25

2

5,79

14,90

-

 

 

+

 

 

2

 

15

13

 

169

3

17,66

11,80

-

 

 

-

 

 

7

 

5

2

 

4

4

19,50

8,80

-

 

 

-

 

 

9

 

1

8

 

64

5

33,48

11,00

+

 

 

-

 

 

17

 

4

13

 

169

6

37,64

10,09

+

 

 

-

 

 

20

 

3

17

 

289

7

13,42

13,50

-

 

 

+

 

 

3

 

12

9

 

81

8

24,51

12,60

+

 

 

-

 

 

14

 

10

4

 

16

9

18,03

15,10

-

 

 

+

 

 

8

 

17

9

 

81

10

25,79

12,00

+

 

 

-

 

 

15

 

6

9

 

81

11

15,85

17,80

-

 

 

+

 

 

6

 

20

14

 

196

12

4,24

13,90

-

 

 

+

 

 

1

 

14

13

 

169

13

23,60

12,01

+

 

 

-

 

 

13

 

7

6

 

36

14

21,53

15,00

+

 

 

+

 

 

12

 

16

4

 

16

15

20,09

12,02

-

 

 

-

 

 

10

 

8

2

 

4

16

14,85

13,80

-

 

 

+

 

 

5

 

13

8

 

64

17

34,26

9,40

+

 

 

-

 

 

18

 

2

16

 

256

18

36,09

17,50

+

 

 

+

 

 

19

 

19

0

 

0

19

20,44

12,03

-

 

 

-

 

 

11

 

9

2

 

4

20

13,84

16,00

-

 

 

+

 

 

4

 

18

14

 

196

Итого

430,37

270,35

х

 

х

х

 

х

168

 

1920

114

Пример. Проанализируйте взаимосвязь между производительностью труда и величиной потерь рабочего времени на основе непараметрических коэффициентов корреляции знаков и рангов по данным табл. 33. Рассчитаем средние значения факторного

ирезультативного признаков:

x= 270,35 = 13,5 чел. - д. 20

y = 430,37 = 21,52 д. е. 20

Определим коэффициенты корреляции знаков и рангов:

 

Кф

=

6

-14

= -0,4.

 

 

+14

 

 

6

 

 

К р

= 1 -

6×1920

= -0,44.

 

 

 

20×(400-1)

 

 

 

Значения полученных непараметрических коэффициентов свидетельствуют о наличии обратной умеренной связи между уровнем производительности труда и величиной потерь рабочего времени.

Для характеристики влияния измененийx на вариациюy служат методы регрессионного анализа. В случае парной линейной зависимости строится регрессионная модель:

yi = a0 + a1 × xi +ei , i =1,2,3...n,

где n - число наблюдений;

а0, а1 - неизвестные параметры уравнения; ei - ошибка случайной переменной y. Уравнение регрессии записывается как

yi теор = a0 + a1 × xi ,

где yi теор - рассчитанное выравненное значение результативного

признака после подстановки в уравнение x.

Параметры а0 и а1 оцениваются с помощью процедур, наибольшее распространение из которых получилметод наимень-

115

ших квадратов. Его суть заключается в том , что наилучшие оценки а0 и а1 получают, когда:

n

å( yi - yiтеор )2 = min,

i =1

т.е. сумма квадратов отклонений эмпирических значений зависимой переменной от вычисленных по уравнению регрессии должна быть минимальной. Сумма квадратов отклонений является функцией параметров а0 и а1. Ее минимизация осуществляется решением системы уравнений:

ìïna0 + a1åx = åy

í

2

ïîa0 åx + a1åx = åxy.

Можно воспользоваться и другими формулами, вытекающими из метода наименьших квадратов, например:

a

=

å(

xi

-

x

)(

yi

-

y

)

или a

= r

s y

,

 

 

 

 

 

 

 

 

 

1

 

å(xi - x)2

1

xy s x

 

a0 = y - a1 x.

Аппарат линейной регрессии достаточно хорошо разработан и, как правило, имеется в наборе стандартных программ оценки взаимосвязи для компьютера. Важен смысл параметров: а1 – это коэффициент регрессии, характеризующий влияние, которое оказывает изменениех на у. Он показывает, на сколько единиц в среднем изменится у при изменении х на одну единицу. Если а больше 0, то наблюдается положительная связь. Если а имеет отрицательное значение, то увеличение х на единицу влечет за собой уменьшение у в среднем на а1. Параметр а1 обладает размерностью отношения у к х.

Параметр a0 – это постоянная величина в уравнении регрессии. На наш взгляд, экономического смысла он не имеет, но в ряде случаев его интерпретируют как начальное значениеу.

116

Например, по данным о стоимости оборудованиях и производительности труда у методом наименьших квадратов получено уравнение:

y = -12,14 + 2,08 × x.

Коэффициент а означает, что увеличение стоимости оборудования на 1 млн р. ведет в среднем к росту производительности труда на 2,08 тыс. р.

Значение функции yi = a0 + a1 × xi называется расчетным значением и на графике образуеттеоретическую линию регрессии. Смысл теоретической регрессии в том, что это оценка среднего значения переменной у для заданного значения х.

Парная корреляция или парная регрессия могут рассматриваться как частный случай отражения связи некоторой зависимой переменной, с одной стороны, и одной из множества независимых переменных – с другой. Когда же требуется охарактеризовать связь всего указанного множества независимых переменных с результативным признаком, говорят о множественной корреля-

ции или множественной регрессии.

7.3. Оценка значимости параметров взаимосвязи

Получив оценки корреляции и регрессии, необходимо проверить их на соответствие истинным параметрам взаимосвязи. Существующие прикладные программы включают, как правило, несколько наиболее распространенных критериев. Для оценки значимости коэффициента парной корреляции рассчитывают стандартную ошибку коэффициента корреляции:

srxy =

1 - r 2

xy ,

 

n - 2

где rxy - выборочное значение коэффициента корреляции;

n - число сравниваемых пар данных или число объектов, у которых измерены два признака.

117

В первом приближении нужно, чтобы srxy < rxy . Значимость rxy проверяется его сопоставлением с srxy , при этом получают:

t

расч

= r × n - 2

,

 

xy

 

 

 

1 - r 2

 

 

 

xy

 

где tрасч - расчетное значение t-критерия.

Если tрасч больше теоретического (табличного) значения критерия Стьюдента (tтабл) для заданного уровня вероятности и (n-2) степеней свободы, то можно утверждать, что rxy значимо.

Подобным образом на основе соответствующих формул рассчитывают стандартные ошибки параметров уравнения регрессии, а затем и t-критерии для каждого параметра. Важно проверить, чтобы соблюдалось условиеtрасч >tтабл. В противном случае доверять полученной оценке параметра нет оснований.

Вывод о правильности выбора вида взаимосвязи и характеристику значимости всего уравнения регрессии получают с -по мощью F-критерия, вычисляя его расчетное значение:

R2 (n - m)

Fрасч = (1- R2 )(m -1) ,

где R2 - коэффициент детерминации; n - число наблюдений;

m - число параметров уравнения регрессии.

Fрасч должно быть больше Fтеор (табличного) при v1 = (m-1) и v2 = (n-m) степенях свободы. В противном случае следует пересмотреть форму уравнения, перечень переменных и т.д.

7.4. Непараметрические методы оценки взаимосвязи

Методы корреляционного и дисперсионного анализа не универсальны: их можно применять, если все изучаемые признаки являются количественными. При использовании этих методов нельзя обойтись без вычисления основных параметров распреде-

118

ления (средних величин, дисперсий), поэтому они получили название параметрических методов.

Между тем в статистической практике приходится сталкиваться с задачами измерения связи между качественными признаками, к которым параметрические методы анализа в их обычном виде неприменимы. Статистической наукой разработаны методы, с помощью которых можно измерить связь между явлениями, не используя при этом количественные значения признака, а значит, и параметры распределения. Такие методы получили название непараметрических.

Если изучается взаимосвязь двух качественных признаков, то используют комбинационное распределение единиц совокуп-

ности в форме так называемых таблиц взаимной сопряженности.

Рассмотрим методику анализа таблиц взаимной сопряженности на конкретном примере социальной мобильности как процесса преодоления замкнутости отдельных социальных и профессиональных групп населения. Ниже приведены данные о распределении выпускников средних школ по сферам занятости с выделением аналогичных общественных групп их родителей (табл. 34).

 

 

 

Исходные данные

 

Таблица 34

 

 

 

 

 

Занятия

 

Число детей-выпускников школ, выбравших сферу:

 

 

промышлен-

сельское

обслужива-

интеллекту-

Всего

родителей

ности и строи-

хозяйство

ния

ального труда

 

 

тельства

 

 

 

 

Промыш-

 

 

 

 

 

 

ленность

 

 

 

 

 

 

строитель-

40

5

7

39

91

ство

 

Сельское

 

34

29

13

12

88

хозяйство

 

Сфера

б-

16

6

15

19

56

служивания

Сфера

н-

 

 

 

 

 

теллекту-

 

 

 

 

 

 

ального

 

24

5

9

72

110

труда

 

Всего

 

114

45

44

142

345

Распределение частот по строкам и столбцам таблицы взаимной сопряженности позволяет выявить основные закономерности социальной мобильности: 42,9 % детей родителей первой

119

группы («Промышленность и строительство») заняты в сфере интеллектуального труда (39 из 91); 38,9 % детей, родители которых трудятся в сельском хозяйстве, работают в промышленности

(34 из 88) и т.д.

Можно заметить и явную наследственность в передаче профессий. Так, из пришедших в сельское хозяйство, 29 человек (или 64,4 %) являются детьми работников сельского хозяйства; более чем у 50 % детей из сферы интеллектуального труда родители относятся к той же социальной группе и т.д.

Однако важно получить обобщающий показатель, характеризующий тесноту связи между признаками и позволяющий сравнить проявление связи в разных совокупностях. Для этой цели исчисляют, например, коэффициенты взаимной сопряженности Пирсона (С) и Чупрова (К):

j2

С= 1 +j2 ,

где φ – показатель взаимной сопряженности.

К =

j 2

,

 

(К1 -1) (К2 -1)

где К1 – число групп по колонкам; К2 – число групп по строкам.

Величина коэффициента взаимной сопряженности, отражающая тесноту связи между качественными признаками, колеблется в обычных для этих показателей пределах от 0 до 1.

120

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]