Математические методы в психологии. Учебное пособие-1
.pdfгенеральную совокупность, основные типы потенциальных испытуемых, существующие в популяции. Испытуемые должны быть правильно распределены по экспериментальной и контрольным группам, чтобы все группы были эквивалентными. Кроме того, исследователь распределяет группы относительно разных условий эксперимента так, чтобы контролировать или учитывать возможные эффекты последовательности, дифференцированного переноса и др.
Существует множество конкретных приёмов (стратегий) формирования выборки.
1. Рандомизация.
Считается первым основным приёмом формирования экспериментальной выборки, представляя собой процедуру простого случайного отбора. Считается, что для того чтобы выборка представляла генеральную совокупность, потенциальным испытуемым должны быть предоставлены равные шансы стать реальными участниками исследования. Техника рандомизации состоит в том, что всем представителям совокупности присваивается индекс, а затем производится случайный отбор в группу необходимой численности для участия в эксперименте. В этом случае мы имеем три группы: 1) всю генеральную совокупность; 2) группу рандомизации, из которой производится отбор; 3) экспериментальную рандомизированную выборку.
Случайным отбором может рассматриваться жребий. Жеребьёвка позволяет создать условия равновозможности попадания любых объектов генеральной совокупности. Однако жеребьёвка предполагает некоторое количество объектов, из которых делается отбор, что не всегда возможно при проведении психологического исследования. Если мы изучаем младших школьников, то генеральная совокупность представляет бесконечное множество объектов, жеребьёвка которых представляет определённую сложность. Помимо жребия, можно использовать таблицы случайных чисел. С помощью таблиц случайных чисел объектам, из которых производится формирование выборки (выборок), приписывается случайным образом новое значение, взятое из таблицы. Далее значения могут быть упорядочены и часть их может попасть в одну группу, оставшиеся – в другую либо в одну группу относят объекты с чётными значениями, с нечётными – в другую.
2. Попарный отбор.
Экспериментальная и контрольная группы здесь составляются из индивидов, эквивалентных по значимым для эксперимента по-
41
бочным параметрам. Идеальный вариант – использование близнецовых пар (моно- и дизиготных). Разновидностью этой стратегии является подбор однородных подгрупп, в которых испытуемые уравнены по всем характеристикам, кроме интересующих исследователя дополнительных переменных. Другой вариант – выделение значимой дополнительной переменной. Все испытуемые тестируются, ранжируются по уровню выраженности переменной. Группы формируются так, чтобы испытуемые, обладающие одинаковыми или близкими значениями переменной, попали в разные группы.
3. Стратометрический отбор.
Генеральная совокупность рассматривается как совокупность групп, обладающих определёнными характеристиками. В экспериментальную выборку отбираются испытуемые с соответствующими характеристиками – так, чтобы в ней были равно представлены лица из каждой страты. Чаще всего используются следующие характеристики: пол, возраст, политические предпочтения, образование и уровень доходов. Эту стратегию применяют психодиагносты при разработке тестов, педагогические психологи, в основном же ею пользуются социологи и социальные психологи при опросах общественного мнения, исследовании социальных установок и т.д.
4. Приближённое моделирование.
Иногда невозможно найти способ создания репрезентативной группы. Тогда используется метод приближенного моделирования. В частности, исследование может проводиться при участии студентов 2-го курса университета, а данные приписываются всем людям, или «людям в возрасте от 17 до 21 года», или «людям со средним образованием в возрасте от 17 до 21 года» и т.д. Чем меньше генерализация, т.е. чем точнее набор критериев, описывающих популяцию, на которую распространяются выводы о характеристиках экспериментальной выборки, тем выше внешняя валидность эксперимента.
5. Привлечение реальных групп.
Проведение рандомизации и стратифицированного отбора достаточно сложные процедуры. В психологических исследованиях чаще применяется иной метод формирования – реальная группа или простая выборка. Берётся некоторая группа респондентов, на которой проводятся измерения. Предполагается, что можно выделить особенности, характерные для всех людей. Однако данный способ не даёт оснований переносить полученные результаты на всю гене-
42
ральную совокупность, т.к. мы не знаем, насколько полученная выборка отражает основные свойства генеральной совокупности.
Различают два основных типа привлечения испытуемых в группу: а) отбор, б) распределение. Отбор проводят при рандомизации, рандомизации с выделением страт, при репрезентативном и приближенном моделировании. Распределение осуществляется при способе составления групп из эквивалентных пар и исследованиях с участием реальных групп.
Выводы. Часто бывает, что отобрать дополнительно объекты из генеральной совокупности невозможно. Это может быть связано с множеством факторов, оказывающих влияние на изучаемый признак, которые невозможно проконтролировать, или на основе имеющихся данных представить различные модели поведения в зависимости от различных условий, либо для оценки воздействия факторов перемешивание различных условий для групп (как это проводится в сбалансированных планах, например, латинском или греколатинском квадратах). В этом случае из одной выборки можно создавать другие выборки для изучения выборочных параметров (данная процедура в настоящее время получила название бутстреп-
методы) – так называемые «псевдовыборки».
Псевдовыборки – это выборки, полученные на основе исходной выборки путём многократной генерации, «размножения» выборок. Применяя данный метод, необходимо строить новые выборки (псевдовыборки), моделируя из имеющейся выборки на основе случайного отбора. В результате в одной псевдовыборке некоторые исходные объекты могут встретиться несколько раз, другие же – отсутствовать. Для каждой псевдовыборки определяют основные статистические характеристики для изучения распределения. Данный метод в настоящее время находит широкое применение и в психологии, и в психометрике. Эта процедура формирования выборок создаёт так называемые повторные выборки, при которых отобранный объект перед отбором следующего возвращается в генеральную совокупность. Также можно выделить и бесповторные выборки, при которых отобранный объект в генеральную совокупность не возвращается.
Построение псевдовыборок позволило иначе рассмотреть вопросы привлечения реальных групп. Отобранная совокупность объектов может быть рассмотрена как одна из возможных псевдовыборок, поэтому привлечение нескольких реальных групп или состав-
43
ление из некоторой совокупности объектов новых выборок позволит установить особенности изучаемого признака.
Вопросы для самопроверки
1.Понятие статистической гипотезы.
2.Нулевая и альтернативная гипотезы.
3.Направленные и ненаправленные гипотезы.
4.Ошибка 1-го рода (значимость).
5.Ошибка 2-го рода (мощность).
6.Соотношение ошибок 1-го и 2-го рода.
7.Статистические критерии, область допустимых и критических значений.
8.Условия увеличения мощности критерия.
9.Односторонние и двусторонние критерии.
10.Параметрические и непараметрические критерии.
11.Классификация исследовательских задач в психологии.
Рекомендуемая литература и интернет-источники
Основная: 1–3. Дополнительная: 1– 3. Методическая: 1–2. Интернет-ресурсы: 1– 3.
44
4. Корреляционный анализ. Коэффициенты корреляции
План
4.1.Сущность корреляции.
4.2.Классификация корреляционных связей.
4.3.Коэффициент корреляции Пирсона.
4.4.Коэффициент корреляции Спирмена.
4.5.Коэффициент корреляции Кендалла.
4.1. Сущность корреляции
Первоначальное значение термина «корреляция» – взаимная связь. Корреляционная связь – это согласованные изменения двух
признаков или большего количества признаков (множественная корреляция).
Корреляционная связь отражает тот факт, что изменчивость одного признака находится в некотором соответствии с изменчивостью другого.
Стохастическая (вероятностная, существует в психологии в отличие от физики, математики, где связи – функциональные, детерминированные) связь имеется тогда, когда каждому из значений одной случайной величины соответствует условное распределение вероятностей значений другой величины и наоборот.
Корреляционная зависимость – это изменения, которые вносят значения одного признака в вероятность появления разных значений другого признака. Иногда эти термины используются как синонимы. Однако зависимость – это всегда связь, а связь – не всегда зависимость. Зависимость предполагает влияние, а связь – любые согласованные действия. Корреляционные связи не могут рассматриваться как свидетельство причинно-следственных связей, они свидетельствуют лишь о том, что изменения одного признака, как правило, сопровождают изменения другого.
Причинно-следственная связь предполагает три условия:
-наличие корреляционной связи – собственно согласованное действие одной или более переменных;
-причина должна быть раньше следствия во времени – это условие наличия временного критерия связи двух переменных, в психологии очень сложно или невозможно сказать о временной причине по отношению следствию;
-следствие невозможно объяснить другой причиной.
45
В строгом смысле о зависимостях в психологии мы можем говорить только в том случае, когда однозначно контролируем действие независимой переменной на зависимую. Но этого в принципе невозможно. Поэтому корректно всегда в психологии говорить о связях. И всё же в случаях с дополнительными переменными (пол, возраст, стаж работы и некоторые другие, то есть те, которые мы можем только учесть, а не изменять) можно корреляционные связи называть корреляционными зависимостями.
Коэффициенты корреляции могут обозначаться разными символами, но в общем случае они обозначаются буквой r (от англ. regression). Это обозначение связано с именем Фр. Гальтона, описавшим феномен регрессии и используя для этого математический аппарат. Здесь и далее мы будем использовать этот символ для обозначения коэффициентов корреляции в случаях «по умолчанию».
Значение коэффициента корреляции может варьироваться в пределах от -1 до +1. Величины, лежащие в этих пределах, отражают максимально возможную взаимосвязь сравниваемых переменных. Когда коэффициент корреляции равен нулю, то это означает, что взаимосвязь отсутствует. Положительная корреляционная связь указывает на прямо пропорциональное отношение между двумя переменными, а отрицательная – на обратно пропорциональную взаимосвязь. Чем больше абсолютное значение коэффициента корреляции, тем теснее связь между изучаемыми переменными. При значениях коэффициентов ± 1 можно говорить об отношении тождественности между переменными.
4.2. Классификация корреляционных связей
Коэффициенты корреляции могут обозначаться разными символами, но в общем случае они обозначаются буквой r (от англ. regression). Это обозначение связано с именем Фр. Гальтона, описавшим феномен регрессии и используя для этого математический аппарат.
По форме корреляционная связь может быть:
-прямолинейная;
-криволинейная.
По направлению корреляционная связь может быть:
- прямая (положительная), коэффициент корреляции имеет знак
«+»;
- обратная (отрицательная), коэффициент корреляции имеет знак «˗».
46
По силе:
А) Общая классификация:
-сильная, или тесная при коэффициенте корреляции r>0.70;
-средняя при 0.50<r<0.69;
-умеренная при 0.30<r<0.49;
-слабая при 0.20<r<0.29;
-очень слабая при r<0.19.
Б) Частная классификация:
-высокая значимая корреляция при r, соответствующего уровню значимости p<0.01;
-значимая корреляция при r, соответствующего уровню значи-
мости p<0.05;
-тенденция достоверной связи при r, соответствующего уровню значимости p<0.10;
-незначимая корреляция при r, не достигающем уровня статистической значимости.
Эти классификации не совпадают, и более достоверной может быть признана классификация Б, поскольку учитывает объём выборки.
Для выявления корреляционной связи можно использовать условно классические три критерия.
Первый – коэффициент корреляции К. Пирсона. Этот критерий является классическим случаем расчёта коэффициента корреляции
иприменяется к «сырым» данным, полученным в результате психологической диагностики.
Второй коэффициент – коэффициент ранговой корреляции rs- Спирмена. Он используется для того, чтобы можно было находить связи между сильно различающейся по параметру размаха (Р) выборкой, когда можно говорить о наличии так называемых «выбросов» (экстремально высоких или низких значениях измеренного признака). Метод ранговой корреляции Спирмена позволяет определить тесноту (силу) и направление корреляционной связи между двумя признаками или двумя профилями признаков. Для подсчёта ранговой корреляции необходимо располагать двумя рядами значений, которые могут быть проранжированы.
Третий коэффициент – коэффициент корреляции τ-Кендалла. Он представляет собой меру линейной связи между случайными величинами. Корреляция Кендалла является ранговой, то есть для оценки силы связи используются не численные значения, а соответ-
47
ствующие им ранги. Коэффициент инвариантен по отношению к любому монотонному преобразованию шкалы измерения.
4.3. Коэффициент корреляции Пирсона
Коэффициент корреляции по формуле Пирсона рассчитывается на основе отклонения первичных результатов и среднего квадратичного отклонения от их среднеарифметического значения. Формула расчета коэффициента корреляции по К. Пирсону может быть представлена следующим образом:
rxy = x y ,
Nσ x σ y
где х – отклонение величины Х (первичного результата) от средней арифметической Мх; у – отклонение величины Y (первичного результата) от средней арифметической MY; xy – алгебраическая сумма произведений отклонений х и у от Мх и MY; N – объём выборки сравниваемых пар первичных результатов; х – среднее квадратичное отклонение для первичных результатов Х; y – среднее квадратичное отклонение для первичных результатов Y.
Рассмотрим пример, который позволит проследить этапы расчёта. Допустим, что переменная Х представлена результатами измерения (в сантиметрах) величины коленного рефлекса при инструкции расслабить мышцы; переменная Y – то же, но при инструкции напрячь мышцы (табл. 4.1). Проверяется гипотеза о том, что величины коленного рефлекса не взаимосвязаны между собой.
Последовательность расчёта коэффициента следующая.
1. По формулам ниже находим средние арифметические значения для переменных Х и Y (в нашем примере Мх =7,5; MY = 8,0).
Мх = X и MY = Y N N
2.Находим величины отклонений каждого из первичных результатов от Мх и MY – соответственно х и у (см. 4-ю и 5-ю графы).
3.Значение каждого отклонения х и у возводим в квадрат: x2 и у2 (см. 5-ю и 6-ю графы).
48
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Таблица 4.1 |
||
|
Расчёт коэффициента корреляции по Пирсону |
||||||||||||||||
Номер |
|
|
|
|
|
|
|
|
|
x2 |
|
|
y2 |
|
|
|
|
пары |
X |
Y |
|
x |
|
|
|
y |
|
|
|
|
x y |
|
|||
измерения |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
1 |
10 |
7 |
|
+2,5 |
|
|
1 |
|
6,25 |
|
1 |
|
-2,5 |
|
|||
2 |
8 |
9 |
|
+0,5 |
|
|
+1 |
|
0,25 |
|
1 |
|
+0,5 |
|
|||
3 |
6 |
11 |
|
-1,5 |
|
|
+3 |
|
2,25 |
|
9 |
|
-4,5 |
|
|||
4 |
6 |
3 |
|
-1,5 |
|
|
-5 |
|
2,25 |
|
25 |
|
+7,5 |
|
|||
5 |
13 |
11 |
|
+5,5 |
|
|
+3 |
|
30,25 |
|
9 |
|
+16,5 |
|
|||
6 |
5 |
7 |
|
-1,5 |
|
|
-1 |
|
6,25 |
|
1 |
|
+2,5 |
|
|||
7 |
12 |
14 |
|
+4,5 |
|
|
+6 |
|
20,25 |
|
36 |
|
+27,5 |
|
|||
8 |
10 |
11 |
|
+2,5 |
|
|
+3 |
|
6,25 |
|
9 |
|
+7,5 |
|
|||
9 |
3 |
6 |
|
-4,5 |
|
|
-2 |
|
20,25 |
|
4 |
|
+9,5 |
|
|||
10 |
2 |
1 |
|
-5,5 |
|
|
-7 |
|
30,25 |
|
49 |
|
+38,5 |
|
|||
: |
75 |
83 |
|
0,0 |
|
|
0,0 |
|
124,50 |
144 |
|
+102,0 |
|
||||
М: |
7,5 |
8,0 |
|
|
|
|
|
|
|||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
Таким образом: rXY = |
x y |
|
= |
|
|
102,0 |
|
= |
102,0 |
= 0,76. |
|
||||||
|
|
|
|
|
|
|
|
|
|||||||||
|
|
|
|
Nσ x σ y |
10 3,53 3,79 |
|
133,78 |
|
|
|
|||||||
4.По формуле для среднего квадратичного отклонения рассчитываем х и y (в нашем примере х =3.53; y =3.79).
5.Определяем произведения для каждой пары отклонений (см. 8-ю графу).
6.Полученные величины подставляем в формулу коэффициента корреляции по Пирсону. Полученный для нашего примера ко-
эффициент корреляции rXY = 0,76 свидетельствует о том, что обе величины коленного рефлекса взаимосвязаны, несмотря на различные условия их измерения.
4.4. Коэффициент ранговой корреляции Спирмена
Метод ранговой корреляции Спирмена позволяет определить тесноту (силу) и направление корреляционной связи между двумя признаками или двумя профилями признаков. Для подсчёта ранговой корреляции необходимо располагать двумя рядами значений, которые могут быть проранжированы.
Ограничения критерия корреляции Спирмена:
1.Количество сравниваемых наблюдений должно быть одинаковым в сравниваемых группах и не менее 5 и не более 40.
2.Большое количество одинаковых рангов требует внесения поправки на одинаковые ранги и огрубляет полученный результат.
49
Пример и алгоритм расчёта.
Допустим, что с помощью двух опросников (X и Y), требующих альтернативных ответов «да» или «нет», были получены первичные результаты - ответы 15 испытуемых (N =15). Результаты представлены в виде сумм баллов за утвердительные ответы («да») для каждого испытуемого отдельно для опросника Х и опросника Y. Требуется определить, измеряют ли опросники Х и Y похожие личностные качества испытуемых, или не измеряют. Можно предположить, что если опросники по содержанию и формулировкам мало отличаются друг от друга, то сумма баллов, набранная каждым из испытуемых по опроснику X, будет близка к сумме баллов, набранных по опроснику Y.
Полученные в эксперименте первичные результаты представляют собой два ряда порядковых величин для переменной Х и для переменной Y. Для установления взаимосвязи между каждой парой порядковых величин применяют коэффициент порядковой корреляции Спирмена ( или rs). Для расчёта величины известна следующая формула:
6 d 2
= 1 N N 2 1 ,
где N – число сравниваемых пар величин двух переменных и d2 – квадрат разностей рангов этих величин.
Для вычисления предстоит проделать ряд операций. Прежде всего надлежит табулировать все первичные результаты (табл. 4.2). В 1-й графе записывают номер испытуемого, а во 2-й и 3-й – полученные им суммы баллов по первой методике (переменная X) и по второй (переменная Y).
Таким образом: = |
1 |
6 |
d 2 |
|
=1- |
|
6 171 |
=1- |
1026 |
=1- |
||||
N N 2 |
1 |
|
|
|
|
|
||||||||
15 |
224 |
3360 |
||||||||||||
|
|
|
|
|
||||||||||
0.305=0.695.
Затем каждому первичному результату присваивают ранг. Эта процедура называется ранжированием.
На следующем этапе табулирования определяют разность рангов для каждой пары значений Х и Y и полученные результаты про-
ставляют в 6-й графе: d =Rx-Ry.
Наконец, в 7-й графе отражены значения квадратов разности рангов, т. е. d2 для каждой пары Х и Y. Полученные величины суммируют и записывают в последней строке таблицы: d2. Получен-
50
