Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Методы математической статистики в социальных науках (описательная статистика). Учебник
.pdf
6. КОРРЕЛЯЦИИ: ИЗМЕРЕНИЕ ВЗАИМОСВЯЗИ
Ключевые термины: диаграмма рассеивания, индекс, коэффициент
детерминации, коэффициент Пирсона, корреляционный коэффициент,
линейная связь, нелинейная связь, смешанный момент, совместное (перекрестное) произведение.
До этого момента мы обсуждали статистические процедуры,
используя для описания распределения в основном одну случайную переменную. Мы рассмотрели меры центральной тенденции
и меры рассеивания в качестве основных характеристик распределения. Предположим, что для группы студентов были измерены значения по двум переменным. Вспомним группу 180 первокурсников из прошлых глав. Пусть, кроме результата экзамена
по статистике для каждого студента дан результат
нечно, каждая переменная и ее распределение могут быть описаны отдельно, но очень часто возникает вопрос о степени связи этих двух переменных. Например, если студент, имеет более
высокий балл по статистике, имеет ли он более высокий
результат? В более общих терминах: если значения одной переменной увеличиваются, значения другой также показывают тенденцию к росту? Статистическая мера для описания связи между двумя случайными переменными называется коэффициентом
корреляции.
Исследования взаимосвязи между двумя переменными наибо-
лее часто встречаются в области социологии и социальных наук.
Примеры этого многочисленны. Изучение отношения между двумя и более переменными это основной подход для исследователей
в области социологии и когнитивных наук, психологии, психиатрии и т. д. Нет научной дисциплины, которая бы не была связана с раскрытием структуры взаимосвязей между различными
исследуемыми переменными. Знание такой структуры считается
базовым для любого дальнейшего анализа данных, особенно при
использовании современных многомерных методов.
В этой главе мы остановимся, прежде всего, на классическом
коэффициенте корреляции Пирсона, который рассчитывается через так называемые смешанные моменты и обозначается
тературе встречаются и другие обозначения), когда относится к генеральной совокупности, и обозначается
r, когда относится к вы-
IQ-теста. Ко-
IQ-
(â ëè-
✂
121

6. Корреляции: измерение взаимосвязи
борке. При этом коэффициент корреляции, полученный на выборочной совокупности, до известной степени может быть распространен на генеральную совокупность, и чем больше выборочная совокупность, т. е. выборка достаточно репрезентативна, тем
точнее выборочный коэффициент корреляции характеризует тесноту связи переменных на генеральной совокупности. Но в любом случае коэффициент корреляции для генеральной совокупности, если
r – 3
n 50, имеет значение, заключенное в интервале
1 – r
☎
✝
2
✁✂✁
r + 3 .
1 + r
☎
2
✝
А вообще-то во всех случаях для определения уровня значимости необходимо обращаться к табличным критическим значениям (распределение Стьюдента).
Коэффициент корреляции принимается как стандартная мера
взаимосвязи между двумя случайными переменными, измеренными в метрических шкалах. Другие коэффициенты, подобные
в содержательном смысле этому коэффициенту будут рассмотрены в главе 7.
6.1. Корреляционный коэффициент и значение
корреляции
Коэффициент корреляции – это индекс, который описывает,
в какой степени два множества значений линейно связаны между собой. Другими словами, корреляционный коэффициент является мерой или индексом зависимости между двумя переменными. Коэффициент корреляции принимает любое значение из интервала [–1,0; +1,0]. Знак плюс или минус перед коэффициентом
показывает направление этой связи. Абсолютное значение коэффициента показывает размер взаимосвязи.
Рассмотрим данные, приведенные в таблице 15. Чтобы облегчить изложение, приведем только 15 измерений. Среднее значение по результатам
нии – 93,26, среднее значение результата тестирования по статистике – 51,47 при стандартном отклонении – 9,76.
Данные о результатах тестирования по статистике и
¹
1 595 68
IQ-теста – 534 при стандартном отклоне-
Таблица 15
IQ
IQ
Тест по статистике
122

6.1. Корреляционный коэффициент и значение корреляции
Окончание табл. 15
¹
IQ
Тест по статистике
2 520 55
3 715 65
4 405 42
5 680 64
6 490 45
7 565 56
8 580 59
9 615 56
10 435 42
11 440 38
12 515 50
13 380 37
14 510 42
15
x
✁
565 53
534 51,47
93,26 9,76
Предположим, что у нас есть основания считать, что студенты, показавшие более высокий результат в тесте по статистике,
показывают и более высокий результат IQ-теста и, наоборот, более низкий результат в тесте по статистике связан с более низким результатом для IQ-теста. Это может быть изображено графически с помощью диаграммы рассеивания.
Такое графическое представление результатов измерений двух
переменных в прямоугольной (Декартовой) системе координат
показано на рисунке 27.
Ðèñ. 27. Диаграмма рассеивания, иллюстрирующая взаимосвязь между
результатами теста по статистике (X) и IQ теста (Y)
123

6. Корреляции: измерение взаимосвязи
Каждое наблюдение представляет собой точку с абсциссой, соответствующей измерению по первой переменной (
те, соответственно, равной измерению по второй переменной (
X) и ордина-
Y).
6.2. Направление и сила взаимосвязи
Вернемся к рисунку 27. Точки на графике показывают тенденцию группировки вокруг линии, которая начинается в нижнем левом углу и стремится к правому верхнему углу. Такая конфигурация говорит о положительной корреляции между двумя
переменными, в то время как положение линии из левого верхнего угла, в правый нижний угол говорит об отрицательной кор-
реляции. Эти два основные вида конфигурации показаны на рисунке 28. Если взаимосвязь между двумя переменными является идеальной, то все точки будут лежать на одной прямой линии.
В этом случае будем говорить об идеальной положительной èëè
идеальной отрицательной корреляции, характеризующей функциональную связь между переменными.
Это наглядно можно показать с помощью рисунка 29. Когда
точки расположены примерно по кругу, эта конфигурация говорит о нулевой или близкой к нулевой корреляции (рис. 30).
Коэффициент при идеальной положительной корреляции равен +1,0, а при идеальной отрицательной корреляции равен –1,0.
Когда между двумя переменными не существует линейная взаимосвязь, то соответствующий коэффициент корреляции равен 0.
Величина коэффициента корреляции является функцией наклона конфигурации точек в положительную сторону оси
и одновременно ширины эллипса, ограждающего множество значений измерения. Если наклон конфигурации точек идет под тупым углом к оси абсцисс, то коэффициент корреляции отрицательный, обратный (как это представлено на рисунке 28), если
наклон конфигурации точек идет под острым углом, то коэффициент корреляции положительный.
124
✂
,

6.2. Направление и сила взаимосвязи
Ðèñ. 28. Диаграмма рассеивания, иллюстрирующая положительную
и отрицательную корреляцию между случайными переменными X è Y
Ðèñ. 29. Диаграмма рассеивания, иллюстрирующая идеальную корре-
ляцию между случайными переменными X è Y
Ðèñ. 30. Диаграмма рассеивания, иллюстрирующая нулевую корреля-
цию между случайными переменными X è Y
125

6. Корреляции: измерение взаимосвязи
Если эллипс узкий (плоский) в продолжение всей оси, то степень взаимосвязи – высокая и коэффициент корреляции показывает высокие значения. Если обе оси эллипса примерно равны,
то он по виду приближается к окружности, и коэффициент корреляции имеет крайне низкое значение. Два дополнительных понятия важны для понимания смысла корреляционного коэффициента.
Âî-первых, чтобы определить корреляцию необходимо наличие попарных измерений двух переменных на одном и том
же множестве объектов. Корреляционный коэффициент не может быть рассчитан, если по одной переменной у нас измеряется
одна группа объектов, а по другой – другая (отличная от первой
по числу сопоставляемых градаций) группа.
Âî-вторых, корреляционный коэффициент – это индекс âçàè-
мосвязи между двумя переменными только для указанной группы объектов, для которой он вычисляется. Например, не представляется возможным говорить о взаимосвязи между ростом
и весом без указания на возраст индивидов, о которых собраны
данные. Эта взаимосвязь будет меняться для разных возрастных
групп.
6.3. Вычисление коэффициента корреляции
Из диаграммы рассеивания, изображенной на рисунке 28, видно, что, как правило, студенты, показавшие высокий результат
в тесте по статистике, показали высокий результат и в
IQ-тесте.
Мы уже упоминали, что, когда большим значениям переменной X соответствуют большие значения переменной Y и наоборот,
то имеем положительную взаимосвязь. С другой стороны, когда
большим значениям
X, соответствуют меньшие значения Y и наоборот, то это говорит об отрицательной взаимосвязи. Несмотря
на то, что можно получить некоторое представление о силе взаимосвязи между двумя переменными на графике, такой подход
не может выявить количественное соответствие и не достаточен
для дальнейшего статистического анализа. В этом случае необходимо вычислить количественный показатель взаимосвязи называемый корреляционным коэффициентом èëè коэффициентом
корреляции.
126

6.3. Вычисление коэффициента корреляции
6.3.1. Понятие корреляции и ее коэффициента
При вычислении корреляционного коэффициента суще-
ственную роль играет так называемое смешанное èëè кросспроизведение измерения. Смешанное произведение получается, когда перемножаются значения двух переменных, имеющих
одинаковую градацию, по каждой из них. Если же их сложить,
то для
му смешанных произведений:
n элементов выборки (количества градаций), получим сум-
В качестве примера используем данные таблицы 16 для рас-
✂
i = 1
n
xi yi.
смотрения процесса определения суммы смешанных произведений.
Таблица 16
Нахождения суммы смешанных произведений о различии переменных
X R XR S XS T XT U XU V XV
2 2 4 8 16 3 6 8 16 20 40
3 3 9 7 21 2 6 6 18 30 90
4 4 16 6 24 4 16 5 20 40 160
5 5 25 5 25 8 40 7 35 50 250
6 6 36 4 24 6 36 2 12 60 360
7 7 49 3 21 5 35 4 28 70 490
8 8 64 2 16 7 56 3 24 80 640
Сумма 203 147 195 153 2030
Рассмотрим значения взятых в качестве абстрактного приме-
ра переменных
равные, одинаково выстроенные значения, в то время как
X, R, S, T, U è V. Переменные X è R принимают
S ïðè-
нимает те же значения, но в обратном порядке. Для переменной
T значения те же, что и для X, но в измененном порядке. Очевид-
но, значения
T не идеально связанны со значениями X, но налицо тенденция положительной связи между двумя переменными.
Переменная
U принимает те же значения, что и X, но связь меж-
ду двумя переменными имеет по видимости отрицательный знак.
Значения переменной
менной
X. Очевидно, суммы смешанных произведений (за ис-
ключением переменной
V это умноженные на 10 значения пере-
V), дают некоторое представление о свя-
зи между X с другими переменными. Существуют, однако, два се-
рьезных ограничения для непосредственного использования этих
сумм в качестве индекса связи.
127

6. Корреляции: измерение взаимосвязи
Первое ограничение вытекает из того факта, что абсолютное
значение суммы является функцией единицы измерения для
каждой переменной. Например, переменные
X, R, S, T è U измеряются в одинаковых единицах, и соответствующие произведения непосредственно сопоставимы, в то время как переменная
V измеряется в единицах, отличных от этих остальных переменных. Поэтому сумма произведения соответствующих значений
X è V не является непосредственно сравнимой с другими суммами. Следовательно, если нужно использовать суммы смешанных
произведений для построения индекса корреляции, то исходные
данные должны быть выражены в одинаковых единицах измерения. Это может быть достигнуто путем преобразования исходных
значений к стандартным (и безразмерным)
формуле 19. Таблица 17 содержит соответствующие
z-значениям согласно
z-значения
для переменных из таблицы 16. Создается впечатление, что теперь суммы произведений уже не зависят от единиц измерения,
.
так что сумма
z
xzR
z
v
x
Второе ограничение исходит из того факта, что смешанная
сумма это функция от количества измерений. Это ограничение
может измениться, если вместо суммы произведений рассматривать средние значения, т. е. когда сумма разделится на количество пар, по которым она была. Обобщая выше сказанное, получаем следующую формулу для вычисления корреляционного коэффициента между двумя случайными переменными õ è ó, èçìå-
ренными по генеральной совокупности:
N
xi z
✂
i
i = 1
=
✂
xy
. (29)
N
Этот индекс впервые был получен английским математиком
Карлом Пирсоном и назван корреляционным коэффициентом
смешанных моментов или просто – корреляционный коэффици-
ент Пирсона. Обозначается он символом
выборка, и символом
, когда это относится к генеральной сово-
✂
R, когда оценивается
купности. В таблице 17 показаны значения коэффициента корреляции для гипотетической генеральной совокупности.
128

6.3. Вычисление коэффициента корреляции
Таблица 17
Z-значения, суммы смешенных произведений и коэффициент
корреляции для переменных из таблицы 16
Z
x
ZRZxZ
Z
R
ZxZ
a
s
ZRZxZ
ZuZxZuZ
R
ZxZ
y
–1,5 –1,5 2,25 1,5 –2,25 –1,0 1,50 1,5 –2,25 –1,5 2,25
–1,0 –1,0 1,00 1,0 –1,00 –1,5 1,50 0,5 –0,50 –1,0 1,00
–0,5 –0,5 0,25 0,5 –0,25 –0,5 0,25 0,0 0,00 –0,5 0,25
0,0 0,0 0,0 0,0 0,0 1,5 0,00 1,0 0,00 0,0 0,00
0,5 0,5 0,25 –0,5 –0,25 0,5 0,25 –1,5 –0,75 0,5 0,25
1,0 1,0 1,00 –1,0 –1,00 0,0 0,00 –0,5 –0,50 1,0 1,0
1,5 1,5 2,25 –1,5 –2,25 1,0 1,50 –1,0 –1,50 1,5 2,25
y
✂
7,00 – –7,00 – 5,00 – –5,50 – 7,00
+1,00 – –1,00 – +0,71 – –0,79 – +1,00
6.3.2. Формула для вычисления в общем случае
Использование формулы (29) для вычисления корреляцион-
ного коэффициента между двумя переменными очень неудобно
и трудоемко, потому, что первоначально любое исходное измерение должно быть преобразовано в
ем определение для
z-значения и для стандартного отклонения,
z-значение. Если использу-
то можем получить формулу для корреляционного коэффициента, которая использует непосредственно исходные измерения.
Имеем:
Òàê êàê
x –
✂
x
=
z
x
2
(x –
✂
=
✁
☎
x
)
✂
x
N
✁
x
=
è
✁
y
è z
☎
✂
=
y
(y –
y –
✂
y
.
✁
y
2
)
✂
y
, подставляя эти значе-
N
ния в формулу (29) получим:
N
(x –
) (y –
N
✂(y –
☎
i = 1
)
✂
y
. (30)
2
)
✂
y
✂
✂
i = 1
=
✂
xy
N
✂(x –
☎
i = 1
x
2
)
✂
x
Если раскроем скобки и перегруппируем соответствующие
члены, получим более удобную для вычислений формулу:
129

6. Корреляции: измерение взаимосвязи
N
✂xi yi – ✂xi ✂y
N
i = 1
i = 1
N
2
i
( ✂xi)
–
N
i = 1
✂
=
xy
[N ✂x
☎
Соответствующие формулы для выборки, которая имеет
2
] [N
i = 1Ni = 1
N
✂y
i = 1
N
2
i
i
( ✂yi)
–
. (31)
N
2
]
i = 1
n èç-
мерений, будут выглядеть следующим образом:
r
n
n
✂xi yi – ✂xi ✂y
=
xy
[n ✂x
☎
rxy =
i = 1
n
2
– ( ✂xi)
i
i = 1
n
✂(xi – x) (yi – y)
i = 1
n
✂(xi – x)
☎
i = 1
=
r
xy
i = 1
n
xy
✁
n
i = 1ni = 1
2
] [n
2
– x y
✁
x
i
n
2
✂y
– ( ✂yi)
i
i = 1
n
✂(yi – y)
i = 1
. (32)
y
;
n
2
]
i = 1
;
2
В принципе это одна и та же формула, и при вычислениях
можно воспользоваться любой из них в зависимости от того, что
удобнее в данном конкретном случае.
Отметим, что
N è n при вычислении корреляционного коэффициента дают число пар измерений в генеральной совокупности
и выборке соответственно. Данные формулы носят еще название
формул исходных баллов (Row Score formulas).
Рассмотрим пример. В таблице 18.1 показаны значения, полученные с использованием этих формул по данным таблицы 15.
Для коэффициента корреляции имеем:
15 × 424580 – 8010 ×772
r =
(15 × 4407800 – 8010
2
× (15 × 41162 – 7722)
)
Вычисление корреляционного коэффициента по формуле (30)
x y xy
2
✂
595 68 40460 354025 4624
520 55 28600 270400 3025
715 65 46475 511225 4225
405 42 17010 164025 1764
=
0,90.
Таблица 18.1
2
y
130
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
