Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Основы математической обработки данных в психологии. Учебное пособие для студентов 3 курса факультета клинической психологии ОрГМА
.pdf
Количество выборок
(градаций Х)
Две выборки
Больше двух выборок
Зависимость выборок
Независимые
Зависимые
Независимые
Зависимые
Метрический
Параметрические методы сравнения
t-Стьюдента
мых выборок
t-Стьюдента
выборок
ANOVA с по-
мерениями
Ранговый
Непараметрические методы сравнения
U-Манна-
рий серий
Т-Вилкоксона,
ков
Н-Краскала-
χ2-Фридмана
Признак Y
Типы исследовательских ситуаций при сравнении групп
для независи-
для зависимых
ANOVA
Таблица 4
вторными из-
Уитни, крите-
критерий зна-
Уоллеса
2. Корреляционный анализ в психологическом исследовании
2.1 Понятие корреляционного анализа и коэффициента корреляции
Термин «корреляция» впервые применил французский палеонтолог Ж. Кювье, который вывел закон «корреляции частей и органов животных» (этот закон позволяет восстанавливать по найденным частям тела весь облик животного). В статистику указанный термин
ввел английский биолог и статистик Ф. Гальтон (не просто «связь», а «как бы связь»).
Корреляционный анализ – это проверка гипотез о связях между переменными с ис-
пользованием коэффициентов корреляции.
Коэффициент корреляции – двумерная описательная статистика, количественная
мера взаимосвязи (совместной изменчивости) двух переменных.
Основное назначение корреляционного анализа – выявление связи между двумя или
более изучаемыми переменными, которая рассматривается как совместное согласованное
изменение двух исследуемых характеристик.
На языке математики взаимосвязи обычно описываются при помощи функций, которые графически изображаются в виде линий:
а) линейная функция – если изменение одной переменной на одну единицу всегда
приводит к изменению другой переменной на одну и ту же величину; любая другая связь нелинейная;
б) положительная (прямая) – если увеличение одной переменной связано с увеличением другой;
в) отрицательная (обратная) – если увеличение одной переменной связано с уменьшением другой;
г) монотонная – если направление изменения одной переменной не меняется с возрастанием (убыванием) другой переменной; в противном случае функцию называют немонотонной.
В психологии при изучении взаимосвязи признаков из поля зрения исследователя
неизбежно выпадает множество возможных причин изменчивости этих признаков. Результатом является то, что даже существующая в реальности функциональная связь между переменными выступает эмпирически как вероятностная: одному и тому же значению одной переменной соответствует распределение различных значений другой переменной (и наоборот). Простейшим примером является соотношение роста и веса людей. Полученная эмпирически положительная их взаимосвязь будет отличаться от строгой, линейной, идеальной математической функции, даже при всех ухищрениях исследователя.
Наглядное представление о характере вероятностной связи дает диаграмма рассеивания – график, оси которого соответствуют значениям двух переменных, а каждый испытуемый представляет собой точку (рис. 5).
43

Рис. 5 Диаграмма рассеивания частот
В качестве числовой характеристики вероятностной связи используют коэффициенты
корреляции.
Коэффициент корреляции – это количественная мера силы и направления вероят-
ностной взаимосвязи двух переменных; принимает значения в диапазоне от -1 до +1.
Сила связи – определяется по абсолютной величине корреляции и достигает макси-
мума при условии взаимно однозначного соответствия: когда каждому значению одной переменной соответствует только одно значение другой переменной; эмпирически взаимосвязь
при этом совпадает с функциональной линейной связью. Абсолютная величина корреляции
определяется по таблице «Критические значения коэффициентов корреляции Пирсона и
Спирмена» (Приложение 2).
Направление связи – определяется прямым или обратным соотношением значений
двух переменных: если возрастанию значения одной переменной соответствует возрастание
значения другой переменной, то взаимосвязь называется положительной (прямой); если возрастанию одной переменной соответствует убывание значения другой переменной, то взаимосвязь называется обратной (отрицательной). Показателем направления является знак коэффициента корреляции.
Надежность (достоверность) связи – определяется p-уровнем статистической значи-
мости (чем меньше p-уровень, тем выше статистическая значимость, достоверность связи).
Основная проверяемая статистическая гипотеза – в отношении коэффициентов кор-
реляции является ненаправленной и содержит утверждение о равенстве корреляции нулю в
генеральной совокупности Н0:rxy=0. при её отклонении принимается альтернативная гипотеза
Н1:r
≠0 о наличии положительной (отрицательной) корреляции – в зависимости от знака
xy
выборочного (вычисленного) коэффициента корреляции.
Содержательные выводы: если по результатам статистической проверки Н0:rxy=0 не
отклоняется на уровне α, то содержательный вывод: связь между Х и Y не обнаружена. Если
Н0:rxy=0 отклоняется на уровне α, то содержательный вывод: обнаружена положительная
(отрицательная) связь между Х и Y.
Для статистического решения о принятии или отклонении Н0: обычно устанавлива-
ют α=0,05, а для выборок больше 100 человек α=0,01. Если р≤α, Н0 отклоняется и делается
содержательный вывод об обнаружении статистически достоверной (значимой) связи между
изучаемыми переменными. Когда р>α, Н0 не отклоняется и содержательный вывод ограничивается констатацией того, что связь не обнаружена.
Критерием для отбора «достаточно сильных корреляций» может быть как абсолютное
значение самого коэффициента корреляции (от 0,7 до 1,0), так и относительная величина
этого коэффициента, определяемая по уровню статистической значимости (от 0,01 до 0,1),
зависящему от размера выборки.
Традиционно рассматриваются три градации величин корреляции по силе связи:
- r≤0,3 – слабая связь (менее 10% от общей доли дисперсии);
44

- 0,3<r≤0,7 – умеренная связь (от 10 до 50% от общей доли дисперсии);
- r>0,7 – сильная связь (50% и более от общей доли дисперсии).
В малых выборках для дальнейшей интерпретации корректнее отбирать сильные корреляции на основании уровня статистической значимости.
Для исследований, которые проведены на больших выборках, лучше использовать абсолютное значение коэффициентов корреляции.
Условия применения коэффициентов корреляции:
1. Переменные измерены в количественной (ранговой, метрической) шкале на одной и
той же выборке объектов.
2. Связь между переменными является монотонной.
2.2 Коэффициент корреляции Пирсона
r-Пирсона – применяется для изучения взаимосвязи двух метрических переменных,
измеренных на одной и той же выборке. Формула коэффициента корреляции r-Пирсона:
(2.1)
Особенности коэффициента корреляции r-Пирсона:
а) на величину коэффициента корреляции не влияет то, в каких единицах измерения
представлены признаки;
б) любые линейные преобразования признаков не меняют значения коэффициента
корреляции (умножение константы, прибавление константы); исключение составляет умножение одного из признаков на отрицательную константу – коэффициент корреляции меняет
свой знак на противоположный;
в) коэффициент корреляции Пирсона есть мера прямолинейной взаимосвязи;
г) коэффициент корреляции Пирсона наиболее сильно подвержен влиянию так называемых «выбросов» - экстремально больших или малых значений признака; в таких случаях
рекомендуется либо перейти к рангам и применить ранговые коэффициенты корреляции, либо провести «чистку» данных, т.е. не включать в диапазон данных те наблюдения, которые
выходят за пределы М±2σ (или даже М±1,5σ).
2.3 Ранговые коэффициенты корреляции Спирмена и Кендалла
Если обе переменные, между которыми изучается связь, представлены в порядковой
шкале, или одна из них в порядковой, а другая – в метрической, то применяют ранговые ко-
эффициенты корреляции: r-Спирмена и τ-Кендалла. И тот, и другой требует для своего
применения предварительного ранжирования обеих переменных.
Коэффициент корреляции r-Спирмена
Коэффициент корреляции r-Спирмена применяется при условии отсутствия связей в
рангах (т.е. отсутствия повторяющихся рангов):
(2.2)
где d2 – разность рангов для испытуемого с номером.
Преимущество r-Спирмена по сравнению с r-Пирсона:
а) более чувствителен к связи в случае существенного отклонения распределения хотя
бы одной переменной от нормального вида (асимметрия, выбросы);
б) более чувствителен к связи в случае криволинейной (монотонной) связи.
Коэффициент корреляции τ-Кендалла
В основе корреляции Кендалла лежит идея о том, что о направлении связи можно судить, попарно сравнивая между собой испытуемых: если у пары испытуемых направление по
45

Х совпадает, по направлению с изменением по Y, это положительная связь, если не совпадает – отрицательная - инверсии.
Корреляция τ-Кендалла – есть разность относительных частот совпадений и инверсий при переборе всех пар испытуемых в выборке:
(2.3)
где Р – число совпадений, Q- число инверсий
При подсчете τ-Кендалла вручную данные сначала упорядочиваются по переменной
Х. Затем для каждого испытуемого подсчитывается, сколько раз его ранг по Y оказывается
меньше, чем ранг испытуемых, находящихся ниже. Результат записывается в столбец «Совпадение». Сумма всех значений столбца «Совпадение» и есть Р – общее число совпадений.
Далее для каждого испытуемого подсчитывается, сколько раз его ранг по Y оказывается
больше, чем ранг испытуемых, находящихся ниже. Результат записывается в столбец «Инверсии». Сумма всех значений столбца «Инверсии» и есть Q – общее число инверсий.
Для более полной интерпретации данного коэффициента корреляции полезны соотношения между величиной Кендалла и вероятностью отдельно совпадений и инверсий:
Р
= (1+τ)/2; Р
(р)
=(1-τ)/2
(q)
Так, если τ=0,5 значит, что вероятность совпадений равна 0,75, а вероятность инверсий – 0,25, т.е. при сравнении объектов друг с другом прямо пропорциональное соотношение
(например, роста и веса) встречается в 3 раза чаще, чем обратно пропорциональное соотношение.
τ-Кендалла кажется более простым в вычислительном отношении. Однако при возрастании числа выборки, объем вычислений возрастает не пропорционально, а в геометрической прогрессии.
Проблема связанных (одинаковых) рангов
При одинаковых (связанных) рангах формулы ранговой корреляции Спирмена и Кендалла не подходят. При использовании корреляции Спирмена в случае связанных рангов
возможны два подхода:
1. Если связей немного (менее 10% для каждой переменной), то можно вычислить ко-
эффициент Спирмена приближенно по формуле.
2. При большом количестве связей применить к ранжированным данным классиче-
скую формулу Пирсона; это всегда позволит определить ранговую корреляцию независимо
от наличия связей в рангах.
При использовании корреляции Кендалла в случае наличия связанных рангов в формулу вносятся поправки, и тогда получается общая формула для вычисления коэффициента
корреляции Кендалла, независимо от наличия или отсутствия связей в рангах:
(2.4)
где Кх – (1/2)×Σfi(fi -1) ( i – количество групп связей по Х, f – численность каждой груп-
пы); Ку – (1/2)×Σfi(fi -1) (i – количество групп связей по Y, f – численность каждой группы).
Определение р-уровня значимости для коэффициента корреляции Кендалла
Природа данного коэффициента иная, чем у Пирсона и Спирмена, поэтому р-уровень
значимости определяется следующим образом: применяется Z-критерий и единичное нормальное распределение:
(2.5)
46

Затем по таблице «Стандартные нормальные вероятности» (Приложение 1) определя-
1 2 3 4 5 6 7 8 9 1 1 2 1 3 1 4 1 5 1 6 1 7 1 8 1 9
1
ется теоретическое значение Z, ближайшее меньшее к эмпирическому значению Zэ. Далее
определяется площадь Р под кривой справа от Zr. Затем вычисляется р-уровень по формуле
р<2Р
2.4 Корреляционные матрицы и плеяды
Корреляционная матрица – результат вычисления корреляций одного типа для каж-
дой пары из множества Р переменных, измеренных в количественной шкале на одной выборке (рис.6).
Рис. 6 Шаблон корреляционной матрицы
Корреляционная матрица является квадратной: число строк и столбцов равно числу
переменных. Она симметрична относительно главной диагонали, т.к. корреляция Х с Y равна
корреляции Y с Х. На её главной диагонали располагаются единицы, т.к. корреляция признака с самим собой равна 1. Следовательно, анализу подлежат те элементы матрицы, которые
находятся выше или ниже главной диагонали. Основная задача анализа корреляционной
матрицы – выявление структуры взаимосвязей множества признаков.
При вычислении большого количества коэффициентов корреляции (например, матрица для 15 переменных составляет 105 коэффициентов), можно гарантированно (α×к, 5 раз)
получить подтверждение статистической гипотезы независимо от того, существует ли связь
на самом деле. В таком случае нельзя с уверенностью говорить о том, какие коэффициенты
корреляции были получены обоснованно, а какие – случайно.
В таком случае можно предложить следующее: разделить выборку случайным образом на 2 части и принимать во внимание только те корреляции, которые статистически значимы в обеих частях выборки. Альтернативой может являться многомерный метод (факторный, кластерный или множественный регрессионный анализ).
Корреляционная плеяда – фигура, состоящая из вершин и соединяющих их линий.
Вершины соответствуют признакам и обозначаются обычно цифрами – номерами переменных. Линии соответствуют статистически достоверным связям и графически выражают знак,
а иногда и р-уровень значимости связи.
Построение корреляционной плеяды начинают с выделения в матрице статистически
значимых корреляций (*- 0,05; **-0,01; ***-0,001). Затем для строк (столбцов) матрицы, содержащих статистически значимые корреляции, подсчитывается их количество. Построение
плеяды начинается с переменной, имеющей наибольшее число значимых связей, постепенно
добавляя в рисунок другие переменные – по мере убывания числа связей и связывая их линиями, соответствующими связям между ними.
Примерные фразы для интерпретации коэффициентов корреляции:
1. Анализ корреляционных зависимостей показал следующие результаты…..
2. На наличие данного дефекта указывают корреляционные зависимости меж-
ду……Это значит, ……
3. С помощью корреляционного анализа выявлена обратная взаимосвязь …….
4. Статистически значимой взаимосвязи между ….. не выявлено, что свидетельствует
о том, что ….
47

5. Чем выше показатели по шкале…., тем выше (ниже) …… Это подтверждается по-
ложительной (отрицательной) взаимосвязью между ……
6. Применение двумерной описательной статистики (мер совместной изменчивости,
взаимосвязи) к переменным….. показало, что….
3. Методы анализа номинативных данных
3.1 Анализ классификаций
Методы анализа номинативных данных – методы, касающиеся проверки самого
широкого класса гипотез – в отношении тех явлений, измерения тех явлений, измерения которых доступны в номинативной шкале.
Несмотря на достаточно широкую представленность номинативных ситуаций в психологических исследованиях, все их можно свести к трем типичным случаям:
1. Сравнение наблюдаемого (эмпирического) распределения частот с ожидаемым
(теоретическим) распределением.
2. Сравнение двух или более наблюдаемых распределений частот.
3. Сравнение наблюдаемого распределения событий Х среди событий Y (серий Х, Y)
со случайным распределением.
Ситуация 1.
Кто чаще обращается в службу знакомств: мужчины или женщины? Для ответа на
этот вопрос необходимо:
а) подсчитать количество женщин и мужчин, обратившихся в службу знакомств;
б) воспользовавшись методом статистической проверки, сопоставить полученное эмпирическое соотношение мужчин и женщин с ожидаемым (теоретическим) равномерным
распределением.
Ситуация 2.
Зависит ли предпочтение одного из пяти кандидатов на выборах от пола потенциального избирателя? Для проверки этого предположения необходимо для каждого респондента
определить пол (первая номинативная переменная, две градации – мужчина и женщина) и
предпочитаемого кандидата, одного из пяти (вторая номинативная переменная, пять градаций).
Ситуация 3.
Наблюдается ли некоторая закономерность в чередовании быстрых и медленных реакций на некоторый стимул: имеют ли они тенденцию к группированию или после медленной реакции следует быстрая (и наоборот)?
Для решения 1 и 2 ситуаций (анализ классификаций и таблицы сопряженности) используется один и тот же критерий - χ2-Пирсона, хотя в каждом случае его применение обладает своей спецификой. Таблица «Критические значения критерия χ2-Пирсона» представлена в Приложении 3.
Для решения задач 3 типа необходимо упорядочить события во времени и подсчитать
число серий. Серия – это последовательность однотипных событий, непосредственно перед
и после которой произошли события другого типа. В соответствии с этим применяется кри-
терий серий, позволяющий определить вероятность случайного появления наблюдаемого
числа серий при условии хаотичного распределения событий Х среди событий Y.
Очень часто при анализе номинативных данных нет необходимости в построении
таблиц первичных данных, таблиц типа «объект-признак»: результаты наблюдения сразу заносятся в таблицу распределения (сопряженности) или составляют последовательность. В
этом случае нет необходимости в использовании специальных статистических программ, и
все расчеты можно провести «вручную», тем более, что они не составляют особого труда.
Сравнение эмпирического и теоретического распределений
при количестве градаций 2
Эта задача сводится к сравнению численности двух долей объектов (людей, событий и
т.д.) в совокупности: обладающих и не обладающих некоторым свойством.
48

Сопоставляя доли, мы надеемся обнаружить отличие их пропорции от некоторого
ожидаемого соотношения. Соотношение численности групп, которое мы получаем в результате исследования, называется эмпирическим распределением. Ожидаемому соотношению
соответствует теоретическое распределение. В качестве теоретического распределения чаще всего выступает равномерное распределение.
Формула критерия χ2-Пирсона:
(2.6)
где Р – количество ячеек таблицы распределения, содержащих эмпирические значения
частот; f
– эмпирическое и теоретическое значения частот для одной ячейки; k – число
э, fт
градаций сопоставляемых распределений; l – количество сопоставляемых распределений.
Принятие Н0 не позволяет сделать никакого вывода о соотношении численности сравниваемых групп, т.е. что одна доля больше другой.
В качестве ожидаемого (теоретического) распределения может выступать не обязательно равномерное распределение. Например, мы можем проверять содержательную гипотезу о том, что некоторая группа составляет по численности менее 20% совокупности. Тогда
соотношение теоретических частот будет на 1:1, а 1:4. В остальном весь ходе решения остается прежним.
При обработке на компьютере задается «Непараметрические методы», «Биноминальный критерий».
Сравнение эмпирического и теоретического распределений при количестве
градаций более двух
Как и в предыдущем случае, при сопоставлении нескольких градаций чаще всего проверяют гипотезу о том, различаются ли по численности соответствующие доли совокупности. Это соответствует задаче сопоставления эмпирического и равномерного теоретического
распределения. Но ожидаемое (теоретическое) распределение может быть и любым другим:
последовательность решения при этом не меняется. Для проверки подобных гипотез применяют критерий χ2-Пирсона, который еще называют критерием согласия.
Отклоняя Н0, мы принимаем альтернативную гипотезу о том, что распределение
предпочтений является неравномерным. Но альтернативная гипотеза не содержит и не может
содержать утверждения о том, что в какой-то конкретной ячейке наблюдений больше, а в какой-то меньше. Любая конкретизация этого утверждения будет некорректной. Для утверждения о том, что в какой-то ячейке (градации) наблюдений больше или меньше, необходима дополнительная статистическая проверка.
Подобная проблема множественных сравнений возникает всегда, если нулевая гипотеза содержит утверждение о равенстве более чем двух величин. При её отклонении принимается альтернативная гипотеза, содержащая изрядную долю неопределенности: сравниваемые величины не тождественны. Для конкретизации этого утверждения необходимы, как
правило, парные сравнения величин, в отношении которых проверяется гипотеза.
При обработке на компьютере задается «Непараметрические методы», «Хи-квадрат».
3.2 Анализ таблиц сопряженности
Анализ таблиц сопряженности применяется для решения задач, которые могут быть
сформулированы следующим образом:
1. Необходимо сравнить два или более распределения между собой. Например: разли-
чаются ли мужчины и женщины по распределению предпочтений пяти политических лидеров?
2. Необходимо определить связь между двумя номинативными признаками (между
классификациями объектов по двум разным основаниям). Например: связано ли соотношение предпочтений трех групп напитков (соки, лимонады, минеральные воды) с сезонностью
(зима, весна, лето, осень)?
49

В подобных случаях подразумевается анализ таблиц сопряженности, в которых
столбцы соответствуют сравниваемым распределениям (градациям одной номинативной переменной), а строки соответствуют градациям сравниваемых распределений (градациям другой номинативной переменной).
Формулировка проверяемой Н0: классификация объектов (людей, событий) по одному
основанию не зависит от их классификации по другому основанию.
Исходные данные: определена принадлежность каждого объекта выборки к одной из
градаций одной номинативной переменной и к одной из градаций второй номинативной переменной. Иными словами, две номинативные переменные измерены на выборке объектов.
Строки таблицы сопряженности соответствуют градациям одной номинативной переменной, столбцы – градациям другой номинативной переменной.
Если проверка содержательной гипотезы предполагает анализ таблиц сопряженности,
то принципиальным является вопрос о размерности таблицы. Различаются два случая:
1. Общий случай (число градаций хотя бы одного из признаков больше двух).
2. Частный случай: таблицы сопряженности 2×2 (по две градации для каждой пере-
менной).
Эти случаи различаются как порядком расчетов, так и особенностями интерпретации.
Число градаций больше 2
По сравнению с анализом классификаций, специфика применения критерия χ2Пирсона к таблицам сопряженности заключается в том, что теоретические частоты рассчитываются отдельно для каждой ячейки таблицы. Таким образом, число слагаемых в формуле
данного критерия равно количеству ячеек таблицы сопряженности и равно Р= k× l, где k –
число строк, а l – число столбцов.
(2.7)
Формула для расчета теоретической частоты для ячейки i – строки и j – столбца:
fij = (fi × fj) / N,
где fi – сумма частот во всех ячейках i – строки; fj – сумма частот во всех ячейках j –
столбца; N – сумма частот всей таблицы сопряженности.
Таблицы сопряженности 2×2
Существует большое разнообразие различных ситуаций, когда по результатам исследования может быть построена таблица сопряженности 2×2. Их объединяет то, что объекты
(испытуемые, события) классифицированы по двум основаниям, каждое из которых представляет собой дихотомию. Важно различать два варианты такой классификации объек-
тов:
1. По двум различным дихотомическим основаниям – случай независимых выборок.
Для этого случая применяется критерий χ2-Пирсона.
2. По одному и тому же дихотомическому основанию дважды (например, до и после
воздействия) – случай зависимых выборок. Во втором случае более адекватным является
критерий Мак-Нимара.
Независимые выборки
Это наиболее часто встречающаяся ситуация применения таблиц 2×2, когда одна
группа объектов классифицируется по двум дихотомическим основаниям и проверяется гипотеза о связи этих двух оснований классификации.
По сравнению с другими таблицами сопряженности особенность таблиц 2×2 проявляется в нескольких отношениях:
1. Эти таблицы могут быть построены разными способами, но только один из них яв-
ляется правильным в отношении применимости критерия χ2-Пирсона (см.формулу 2.7).
2. Допустима проверка направленных альтернатив. Соответственно меняется способ
определения р-уровня значимости, он делится на 2.
50

3. В некоторых случаях при расчете χ2-Пирсона необходимо введение поправки на не-
После
До
0 1 0 а b 1 с
d
прерывность Йетса (см. формулу 2.8). χ2-Пирсона с поправкой на непрерывность применим
для анализа таблиц сопряженности 2×2, когда N≥20, а если хотя бы одна из теоретических
частот меньше 5, то при N≥40. Такая поправка используется в большинстве случаев для проверки направленных альтернатив.
(2.8)
Зависимые выборки
Структура исходных данных соответствует ситуации, когда одна выборка объектов
классифицирована на две группы дважды по одному и тому же основанию. В таких ситуациях применяется критерий Мак-Нимара, который позволяет сопоставить долю тех, кто не обладал некоторой характеристикой до воздействия (0), но стал обладать ею после воздействия
(1), с долей тех, кто обладал этой характеристикой до воздействия (1) и перестал обладать ею
после воздействия (0). Иначе говоря, метод позволяет сопоставить диагональные элементы
таблицы сопряженности 2×2, построенной непосредственно по дважды проведенной дихотомической классификации одной и той же выборки:
Проверка гипотезы проводится по z-критерию по формулам для эмпирического значения:
(2.9)
где с и b – одна пара диагональных элементов таблицы, для проверки одной гипотезы;
а и d – другая пара диагональных элементов для проверки другой гипотезы.
Для определения р-уровня значимости эмпирическое значение Zэ сравнивается с теоретическим – единичным нормальным распределением (Приложение 1).
Ограничение: сумма сравниваемых частот не должна быть меньше 10.
3.3 Анализ последовательности серий
Как следует из названия, метод применяется для анализа последовательности объектов (явлений, событий), упорядоченных во времени или в порядке возрастания (убывания)
значений измеренного признака.
Метод требует представления последовательности в виде бинарной переменной – как
чередования событий 0 (m) и 1 (n). Поэтому исходные данные, как правило, требуют преобразования: упорядочивания (по времени или по уровню) и приведения к бинарному виду.
Математическая идея критерия основана на подсчете числа серий в упорядоченной
последовательности событий двух типов, например, 0 и 1. Серия (W) – это последовательность однотипных событий, непосредственно перед и после которой произошли события
другого типа. Гипотеза Н0 о случайном распределении событий 1 среди событий 0 может
быть отклонена, если количество серий либо слишком мало, либо слишком велико.
Проблема направленности гипотезы должна решаться еще до проведения исследования. Исследователя может интересовать любое отклонение от Н0 – как в сторону слишком
малого, так и слишком большого числа серий (W). Тогда необходима проверка ненаправленной гипотезы. Если же исследователя интересуют только малые значения W или только
слишком большие значения W, то необходима проверка направленной гипотезы. Важность
предварительного определения направленности гипотезы обусловлена тем, что при одном и
51

том же числе серий W р-уровень для направленной альтернативы будет в 2 раза меньше,
чем для ненаправленной гипотезы.
Если численность m(n) меньше 20, то для проверки Н0 применяются таблицы критических значений для числа серий. Если эмпирическое значение меньше или равно W
больше или равно W
, то Н0 отклоняется.
0,975
0,025
или
Альтернативным способом определения р-уровня является применение Z-критерия
серий и таблицей «Стандартные нормальные вероятности» (Приложение 1), основанного на
том факте, что число серий W при выполнении Н0 распределено примерно нормально с известными М
и σW. Формула для определения эмпирического значения Z-критерия серий:
Wэ
(2.10)
Ограничение на применение Z-критерия серий: m≥20 и n≥20; m и n несущественно
различаются. Если m и n существенно различаются, то следует воспользоваться комбинаторным методом (например, Монте-Карло в программе SPSS).
4. Параметрические и непараметрические методы сравнения выборок
по уровню выраженности признака
4.1 Общее представление о параметрических методах. Сравнение дисперсий
Сравнение двух выборок по признаку, измеренному в метрической шкале, обычно
предполагает сравнение средних значений с использованием параметрического критерия tСтьюдента и критерию F-Фишера. Следует различать три ситуации по соотношению выбо-
рок между собой:
а) случай независимых выборок;
б) случай зависимых выборок;
в) сравнение одного среднего значения с заданной величиной (критерий t-Стьюдента
для одной выборки).
При сравнении средних или дисперсий двух выборок проверяется ненаправленная
статистическая гипотеза о равенстве средних (дисперсий) в генеральной совокупности.
Соответственно, при её отклонении допустимо принятие двусторонней альтернативы о конкретном направлении различий с соотношением выборочных средних (дисперсий).
К параметрическим методам относится сравнение дисперсий двух выборок по
критерию F-Фишера. Иногда этот метод приводит к ценным содержательным методам, а в
случае сравнения средних для независимых выборок сравнение дисперсий является обязательной процедурой. Основные характеристики:
1. Метод позволяет проверить гипотезу о том, что дисперсии двух генеральных сово-
купностей, из которых извлечены сравниваемые выборки, отличаются друг от друга.
2
2. Проверяемая статистическая гипотеза Н0: σ
2
=σ
1
. При её отклонении принимается
2
альтернативная гипотеза о том, что одна дисперсия больше другой.
3. Исходные предположения: две выборки извлекаются случайно из разных генераль-
ных совокупностей с нормальным распределением изучаемого признака.
4. Структура исходных данных: изучаемый признак измерен у объектов (испытуе-
мых), каждый из которых принадлежит к одной из двух сравниваемых выборок.
5. Ограничения: распределения признака и в той, и в другой выборке существенно не
отличаются от нормального.
6. Альтернатива методу: критерий Ливена, применение которого не требует проверки
предположения о нормальности распределения.
52
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
