Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Основы математической обработки данных в психологии. Учебное пособие для студентов 3 курса факультета клинической психологии ОрГМА

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
☆
Количество выборок
(градаций Х)
Две выборки
Больше двух выборок
Зависимость выборок
Независимые
Зависимые
Независимые
Зависимые
Метрический
Параметрические методы сравнения
t-Стьюдента
мых выборок
t-Стьюдента
выборок
ANOVA с по-
мерениями
Ранговый
Непараметрические методы сравнения
U-Манна-
рий серий
Т-Вилкоксона,
ков
Н-Краскала-
χ2-Фридмана
Признак Y
Типы исследовательских ситуаций при сравнении групп
для независи-
для зависимых
ANOVA
Таблица 4
вторными из-
Уитни, крите-
критерий зна-
Уоллеса
2. Корреляционный анализ в психологическом исследовании
2.1 Понятие корреляционного анализа и коэффициента корреляции
Термин «корреляция» впервые применил французский палеонтолог Ж. Кювье, кото­рый вывел закон «корреляции частей и органов животных» (этот закон позволяет восстанав­ливать по найденным частям тела весь облик животного). В статистику указанный термин ввел английский биолог и статистик Ф. Гальтон (не просто «связь», а «как бы связь»).
Корреляционный анализ – это проверка гипотез о связях между переменными с ис- пользованием коэффициентов корреляции.
Коэффициент корреляции – двумерная описательная статистика, количественная мера взаимосвязи (совместной изменчивости) двух переменных.
Основное назначение корреляционного анализа – выявление связи между двумя или более изучаемыми переменными, которая рассматривается как совместное согласованное изменение двух исследуемых характеристик.
На языке математики взаимосвязи обычно описываются при помощи функций, кото­рые графически изображаются в виде линий:
а) линейная функция – если изменение одной переменной на одну единицу всегда приводит к изменению другой переменной на одну и ту же величину; любая другая связь не­линейная;
б) положительная (прямая) – если увеличение одной переменной связано с увеличени­ем другой;
в) отрицательная (обратная) – если увеличение одной переменной связано с уменьше­нием другой;
г) монотонная – если направление изменения одной переменной не меняется с возрас­танием (убыванием) другой переменной; в противном случае функцию называют немоно­тонной.
В психологии при изучении взаимосвязи признаков из поля зрения исследователя неизбежно выпадает множество возможных причин изменчивости этих признаков. Результа­том является то, что даже существующая в реальности функциональная связь между пере­менными выступает эмпирически как вероятностная: одному и тому же значению одной пе­ременной соответствует распределение различных значений другой переменной (и наобо­рот). Простейшим примером является соотношение роста и веса людей. Полученная эмпири­чески положительная их взаимосвязь будет отличаться от строгой, линейной, идеальной ма­тематической функции, даже при всех ухищрениях исследователя.
Наглядное представление о характере вероятностной связи дает диаграмма рассеива­ния – график, оси которого соответствуют значениям двух переменных, а каждый испытуе­мый представляет собой точку (рис. 5).
43
Рис. 5 Диаграмма рассеивания частот
В качестве числовой характеристики вероятностной связи используют коэффициенты корреляции.
Коэффициент корреляции – это количественная мера силы и направления вероят- ностной взаимосвязи двух переменных; принимает значения в диапазоне от -1 до +1.
Сила связи – определяется по абсолютной величине корреляции и достигает макси- мума при условии взаимно однозначного соответствия: когда каждому значению одной пе­ременной соответствует только одно значение другой переменной; эмпирически взаимосвязь при этом совпадает с функциональной линейной связью. Абсолютная величина корреляции определяется по таблице «Критические значения коэффициентов корреляции Пирсона и Спирмена» (Приложение 2).
Направление связи – определяется прямым или обратным соотношением значений двух переменных: если возрастанию значения одной переменной соответствует возрастание значения другой переменной, то взаимосвязь называется положительной (прямой); если воз­растанию одной переменной соответствует убывание значения другой переменной, то взаи­мосвязь называется обратной (отрицательной). Показателем направления является знак ко­эффициента корреляции.
Надежность (достоверность) связи – определяется p-уровнем статистической значи- мости (чем меньше p-уровень, тем выше статистическая значимость, достоверность связи).
Основная проверяемая статистическая гипотеза – в отношении коэффициентов кор- реляции является ненаправленной и содержит утверждение о равенстве корреляции нулю в генеральной совокупности Н0:rxy=0. при её отклонении принимается альтернативная гипотеза Н1:r
≠0 о наличии положительной (отрицательной) корреляции – в зависимости от знака
xy
выборочного (вычисленного) коэффициента корреляции.
Содержательные выводы: если по результатам статистической проверки Н0:rxy=0 не отклоняется на уровне α, то содержательный вывод: связь между Х и Y не обнаружена. Если Н0:rxy=0 отклоняется на уровне α, то содержательный вывод: обнаружена положительная (отрицательная) связь между Х и Y.
Для статистического решения о принятии или отклонении Н0: обычно устанавлива- ют α=0,05, а для выборок больше 100 человек α=0,01. Если р≤α, Н0 отклоняется и делается содержательный вывод об обнаружении статистически достоверной (значимой) связи между изучаемыми переменными. Когда р>α, Н0 не отклоняется и содержательный вывод ограни­чивается констатацией того, что связь не обнаружена.
Критерием для отбора «достаточно сильных корреляций» может быть как абсолютное значение самого коэффициента корреляции (от 0,7 до 1,0), так и относительная величина этого коэффициента, определяемая по уровню статистической значимости (от 0,01 до 0,1), зависящему от размера выборки.
Традиционно рассматриваются три градации величин корреляции по силе связи:
- r≤0,3 – слабая связь (менее 10% от общей доли дисперсии);
44
- 0,3<r≤0,7 – умеренная связь (от 10 до 50% от общей доли дисперсии);
- r>0,7 – сильная связь (50% и более от общей доли дисперсии).
В малых выборках для дальнейшей интерпретации корректнее отбирать сильные кор­реляции на основании уровня статистической значимости.
Для исследований, которые проведены на больших выборках, лучше использовать аб­солютное значение коэффициентов корреляции.
Условия применения коэффициентов корреляции:
1. Переменные измерены в количественной (ранговой, метрической) шкале на одной и
той же выборке объектов.
2. Связь между переменными является монотонной.
2.2 Коэффициент корреляции Пирсона
r-Пирсона – применяется для изучения взаимосвязи двух метрических переменных, измеренных на одной и той же выборке. Формула коэффициента корреляции r-Пирсона:
(2.1)
Особенности коэффициента корреляции r-Пирсона:
а) на величину коэффициента корреляции не влияет то, в каких единицах измерения представлены признаки;
б) любые линейные преобразования признаков не меняют значения коэффициента корреляции (умножение константы, прибавление константы); исключение составляет умно­жение одного из признаков на отрицательную константу – коэффициент корреляции меняет свой знак на противоположный;
в) коэффициент корреляции Пирсона есть мера прямолинейной взаимосвязи;
г) коэффициент корреляции Пирсона наиболее сильно подвержен влиянию так назы­ваемых «выбросов» - экстремально больших или малых значений признака; в таких случаях рекомендуется либо перейти к рангам и применить ранговые коэффициенты корреляции, ли­бо провести «чистку» данных, т.е. не включать в диапазон данных те наблюдения, которые выходят за пределы М±2σ (или даже М±1,5σ).
2.3 Ранговые коэффициенты корреляции Спирмена и Кендалла
Если обе переменные, между которыми изучается связь, представлены в порядковой шкале, или одна из них в порядковой, а другая – в метрической, то применяют ранговые ко- эффициенты корреляции: r-Спирмена и τ-Кендалла. И тот, и другой требует для своего применения предварительного ранжирования обеих переменных.
Коэффициент корреляции r-Спирмена
Коэффициент корреляции r-Спирмена применяется при условии отсутствия связей в рангах (т.е. отсутствия повторяющихся рангов):
(2.2)
где d2 – разность рангов для испытуемого с номером.
Преимущество r-Спирмена по сравнению с r-Пирсона:
а) более чувствителен к связи в случае существенного отклонения распределения хотя бы одной переменной от нормального вида (асимметрия, выбросы);
б) более чувствителен к связи в случае криволинейной (монотонной) связи.
Коэффициент корреляции τ-Кендалла
В основе корреляции Кендалла лежит идея о том, что о направлении связи можно су­дить, попарно сравнивая между собой испытуемых: если у пары испытуемых направление по
45
Х совпадает, по направлению с изменением по Y, это положительная связь, если не совпада­ет – отрицательная - инверсии.
Корреляция τ-Кендалла – есть разность относительных частот совпадений и инвер­сий при переборе всех пар испытуемых в выборке:
(2.3)
где Р – число совпадений, Q- число инверсий
При подсчете τ-Кендалла вручную данные сначала упорядочиваются по переменной Х. Затем для каждого испытуемого подсчитывается, сколько раз его ранг по Y оказывается меньше, чем ранг испытуемых, находящихся ниже. Результат записывается в столбец «Сов­падение». Сумма всех значений столбца «Совпадение» и есть Р – общее число совпадений. Далее для каждого испытуемого подсчитывается, сколько раз его ранг по Y оказывается больше, чем ранг испытуемых, находящихся ниже. Результат записывается в столбец «Ин­версии». Сумма всех значений столбца «Инверсии» и есть Q – общее число инверсий.
Для более полной интерпретации данного коэффициента корреляции полезны соот­ношения между величиной Кендалла и вероятностью отдельно совпадений и инверсий:
Р
= (1+τ)/2; Р
(р)
=(1-τ)/2
(q)
Так, если τ=0,5 значит, что вероятность совпадений равна 0,75, а вероятность инвер­сий – 0,25, т.е. при сравнении объектов друг с другом прямо пропорциональное соотношение (например, роста и веса) встречается в 3 раза чаще, чем обратно пропорциональное соотно­шение.
τ-Кендалла кажется более простым в вычислительном отношении. Однако при возрас­тании числа выборки, объем вычислений возрастает не пропорционально, а в геометриче­ской прогрессии.
Проблема связанных (одинаковых) рангов
При одинаковых (связанных) рангах формулы ранговой корреляции Спирмена и Кен­далла не подходят. При использовании корреляции Спирмена в случае связанных рангов возможны два подхода:
1. Если связей немного (менее 10% для каждой переменной), то можно вычислить ко-
эффициент Спирмена приближенно по формуле.
2. При большом количестве связей применить к ранжированным данным классиче-
скую формулу Пирсона; это всегда позволит определить ранговую корреляцию независимо от наличия связей в рангах.
При использовании корреляции Кендалла в случае наличия связанных рангов в фор­мулу вносятся поправки, и тогда получается общая формула для вычисления коэффициента корреляции Кендалла, независимо от наличия или отсутствия связей в рангах:
(2.4)
где Кх – (1/2)×Σfi(fi -1) ( i – количество групп связей по Х, f – численность каждой груп-
пы); Ку – (1/2)×Σfi(fi -1) (i – количество групп связей по Y, f – численность каждой группы).
Определение р-уровня значимости для коэффициента корреляции Кендалла
Природа данного коэффициента иная, чем у Пирсона и Спирмена, поэтому р-уровень значимости определяется следующим образом: применяется Z-критерий и единичное нор­мальное распределение:
(2.5)
46
Затем по таблице «Стандартные нормальные вероятности» (Приложение 1) определя-
1 2 3 4 5 6 7 8 9 1 1 2 1 3 1 4 1 5 1 6 1 7 1 8 1 9
1
ется теоретическое значение Z, ближайшее меньшее к эмпирическому значению Zэ. Далее определяется площадь Р под кривой справа от Zr. Затем вычисляется р-уровень по формуле р<2Р
2.4 Корреляционные матрицы и плеяды
Корреляционная матрица – результат вычисления корреляций одного типа для каж-
дой пары из множества Р переменных, измеренных в количественной шкале на одной выбор­ке (рис.6).
Рис. 6 Шаблон корреляционной матрицы
Корреляционная матрица является квадратной: число строк и столбцов равно числу переменных. Она симметрична относительно главной диагонали, т.к. корреляция Х с Y равна корреляции Y с Х. На её главной диагонали располагаются единицы, т.к. корреляция призна­ка с самим собой равна 1. Следовательно, анализу подлежат те элементы матрицы, которые находятся выше или ниже главной диагонали. Основная задача анализа корреляционной матрицы – выявление структуры взаимосвязей множества признаков.
При вычислении большого количества коэффициентов корреляции (например, матри­ца для 15 переменных составляет 105 коэффициентов), можно гарантированно (α×к, 5 раз) получить подтверждение статистической гипотезы независимо от того, существует ли связь на самом деле. В таком случае нельзя с уверенностью говорить о том, какие коэффициенты корреляции были получены обоснованно, а какие – случайно.
В таком случае можно предложить следующее: разделить выборку случайным обра­зом на 2 части и принимать во внимание только те корреляции, которые статистически зна­чимы в обеих частях выборки. Альтернативой может являться многомерный метод (фактор­ный, кластерный или множественный регрессионный анализ).
Корреляционная плеяда – фигура, состоящая из вершин и соединяющих их линий. Вершины соответствуют признакам и обозначаются обычно цифрами – номерами перемен­ных. Линии соответствуют статистически достоверным связям и графически выражают знак, а иногда и р-уровень значимости связи.
Построение корреляционной плеяды начинают с выделения в матрице статистически значимых корреляций (*- 0,05; **-0,01; ***-0,001). Затем для строк (столбцов) матрицы, со­держащих статистически значимые корреляции, подсчитывается их количество. Построение плеяды начинается с переменной, имеющей наибольшее число значимых связей, постепенно добавляя в рисунок другие переменные – по мере убывания числа связей и связывая их ли­ниями, соответствующими связям между ними.
Примерные фразы для интерпретации коэффициентов корреляции:
1. Анализ корреляционных зависимостей показал следующие результаты…..
2. На наличие данного дефекта указывают корреляционные зависимости меж-
ду……Это значит, ……
3. С помощью корреляционного анализа выявлена обратная взаимосвязь …….
4. Статистически значимой взаимосвязи между ….. не выявлено, что свидетельствует
о том, что ….
47
5. Чем выше показатели по шкале…., тем выше (ниже) …… Это подтверждается по-
ложительной (отрицательной) взаимосвязью между ……
6. Применение двумерной описательной статистики (мер совместной изменчивости,
взаимосвязи) к переменным….. показало, что….
3. Методы анализа номинативных данных
3.1 Анализ классификаций
Методы анализа номинативных данных – методы, касающиеся проверки самого
широкого класса гипотез – в отношении тех явлений, измерения тех явлений, измерения ко­торых доступны в номинативной шкале.
Несмотря на достаточно широкую представленность номинативных ситуаций в пси­хологических исследованиях, все их можно свести к трем типичным случаям:
1. Сравнение наблюдаемого (эмпирического) распределения частот с ожидаемым
(теоретическим) распределением.
2. Сравнение двух или более наблюдаемых распределений частот.
3. Сравнение наблюдаемого распределения событий Х среди событий Y (серий Х, Y)
со случайным распределением.
Ситуация 1.
Кто чаще обращается в службу знакомств: мужчины или женщины? Для ответа на этот вопрос необходимо:
а) подсчитать количество женщин и мужчин, обратившихся в службу знакомств;
б) воспользовавшись методом статистической проверки, сопоставить полученное эм­пирическое соотношение мужчин и женщин с ожидаемым (теоретическим) равномерным распределением.
Ситуация 2.
Зависит ли предпочтение одного из пяти кандидатов на выборах от пола потенциаль­ного избирателя? Для проверки этого предположения необходимо для каждого респондента определить пол (первая номинативная переменная, две градации – мужчина и женщина) и предпочитаемого кандидата, одного из пяти (вторая номинативная переменная, пять градаций).
Ситуация 3.
Наблюдается ли некоторая закономерность в чередовании быстрых и медленных ре­акций на некоторый стимул: имеют ли они тенденцию к группированию или после медлен­ной реакции следует быстрая (и наоборот)?
Для решения 1 и 2 ситуаций (анализ классификаций и таблицы сопряженности) ис­пользуется один и тот же критерий - χ2-Пирсона, хотя в каждом случае его применение об­ладает своей спецификой. Таблица «Критические значения критерия χ2-Пирсона» представ­лена в Приложении 3.
Для решения задач 3 типа необходимо упорядочить события во времени и подсчитать число серий. Серия – это последовательность однотипных событий, непосредственно перед и после которой произошли события другого типа. В соответствии с этим применяется кри- терий серий, позволяющий определить вероятность случайного появления наблюдаемого числа серий при условии хаотичного распределения событий Х среди событий Y.
Очень часто при анализе номинативных данных нет необходимости в построении таблиц первичных данных, таблиц типа «объект-признак»: результаты наблюдения сразу за­носятся в таблицу распределения (сопряженности) или составляют последовательность. В этом случае нет необходимости в использовании специальных статистических программ, и все расчеты можно провести «вручную», тем более, что они не составляют особого труда.
Сравнение эмпирического и теоретического распределений
при количестве градаций 2
Эта задача сводится к сравнению численности двух долей объектов (людей, событий и т.д.) в совокупности: обладающих и не обладающих некоторым свойством.
48
Сопоставляя доли, мы надеемся обнаружить отличие их пропорции от некоторого ожидаемого соотношения. Соотношение численности групп, которое мы получаем в резуль­тате исследования, называется эмпирическим распределением. Ожидаемому соотношению соответствует теоретическое распределение. В качестве теоретического распределения ча­ще всего выступает равномерное распределение.
Формула критерия χ2-Пирсона:
(2.6)
где Р – количество ячеек таблицы распределения, содержащих эмпирические значения
частот; f
– эмпирическое и теоретическое значения частот для одной ячейки; k – число
э, fт
градаций сопоставляемых распределений; l – количество сопоставляемых распределений.
Принятие Н0 не позволяет сделать никакого вывода о соотношении численности срав­ниваемых групп, т.е. что одна доля больше другой.
В качестве ожидаемого (теоретического) распределения может выступать не обяза­тельно равномерное распределение. Например, мы можем проверять содержательную гипо­тезу о том, что некоторая группа составляет по численности менее 20% совокупности. Тогда соотношение теоретических частот будет на 1:1, а 1:4. В остальном весь ходе решения оста­ется прежним.
При обработке на компьютере задается «Непараметрические методы», «Биноминаль­ный критерий».
Сравнение эмпирического и теоретического распределений при количестве
градаций более двух
Как и в предыдущем случае, при сопоставлении нескольких градаций чаще всего про­веряют гипотезу о том, различаются ли по численности соответствующие доли совокупно­сти. Это соответствует задаче сопоставления эмпирического и равномерного теоретического распределения. Но ожидаемое (теоретическое) распределение может быть и любым другим: последовательность решения при этом не меняется. Для проверки подобных гипотез приме­няют критерий χ2-Пирсона, который еще называют критерием согласия.
Отклоняя Н0, мы принимаем альтернативную гипотезу о том, что распределение предпочтений является неравномерным. Но альтернативная гипотеза не содержит и не может содержать утверждения о том, что в какой-то конкретной ячейке наблюдений больше, а в ка­кой-то меньше. Любая конкретизация этого утверждения будет некорректной. Для утвер­ждения о том, что в какой-то ячейке (градации) наблюдений больше или меньше, необходи­ма дополнительная статистическая проверка.
Подобная проблема множественных сравнений возникает всегда, если нулевая гипо­теза содержит утверждение о равенстве более чем двух величин. При её отклонении прини­мается альтернативная гипотеза, содержащая изрядную долю неопределенности: сравнивае­мые величины не тождественны. Для конкретизации этого утверждения необходимы, как правило, парные сравнения величин, в отношении которых проверяется гипотеза.
При обработке на компьютере задается «Непараметрические методы», «Хи-квадрат».
3.2 Анализ таблиц сопряженности
Анализ таблиц сопряженности применяется для решения задач, которые могут быть сформулированы следующим образом:
1. Необходимо сравнить два или более распределения между собой. Например: разли-
чаются ли мужчины и женщины по распределению предпочтений пяти политических лидеров?
2. Необходимо определить связь между двумя номинативными признаками (между классификациями объектов по двум разным основаниям). Например: связано ли соотноше­ние предпочтений трех групп напитков (соки, лимонады, минеральные воды) с сезонностью (зима, весна, лето, осень)?
49
В подобных случаях подразумевается анализ таблиц сопряженности, в которых столбцы соответствуют сравниваемым распределениям (градациям одной номинативной пе­ременной), а строки соответствуют градациям сравниваемых распределений (градациям дру­гой номинативной переменной).
Формулировка проверяемой Н0: классификация объектов (людей, событий) по одному основанию не зависит от их классификации по другому основанию.
Исходные данные: определена принадлежность каждого объекта выборки к одной из градаций одной номинативной переменной и к одной из градаций второй номинативной пе­ременной. Иными словами, две номинативные переменные измерены на выборке объектов.
Строки таблицы сопряженности соответствуют градациям одной номинативной пере­менной, столбцы – градациям другой номинативной переменной.
Если проверка содержательной гипотезы предполагает анализ таблиц сопряженности, то принципиальным является вопрос о размерности таблицы. Различаются два случая:
1. Общий случай (число градаций хотя бы одного из признаков больше двух).
2. Частный случай: таблицы сопряженности 2×2 (по две градации для каждой пере-
менной).
Эти случаи различаются как порядком расчетов, так и особенностями интерпретации.
Число градаций больше 2
По сравнению с анализом классификаций, специфика применения критерия χ2­Пирсона к таблицам сопряженности заключается в том, что теоретические частоты рассчи­тываются отдельно для каждой ячейки таблицы. Таким образом, число слагаемых в формуле данного критерия равно количеству ячеек таблицы сопряженности и равно Р= k× l, где k – число строк, а l – число столбцов.
(2.7)
Формула для расчета теоретической частоты для ячейки i – строки и j – столбца:
fij = (fi × fj) / N,
где fi – сумма частот во всех ячейках i – строки; fj – сумма частот во всех ячейках j – столбца; N – сумма частот всей таблицы сопряженности.
Таблицы сопряженности 2×2
Существует большое разнообразие различных ситуаций, когда по результатам иссле­дования может быть построена таблица сопряженности 2×2. Их объединяет то, что объекты (испытуемые, события) классифицированы по двум основаниям, каждое из которых пред­ставляет собой дихотомию. Важно различать два варианты такой классификации объек-
тов:
1. По двум различным дихотомическим основаниям – случай независимых выборок.
Для этого случая применяется критерий χ2-Пирсона.
2. По одному и тому же дихотомическому основанию дважды (например, до и после
воздействия) – случай зависимых выборок. Во втором случае более адекватным является критерий Мак-Нимара.
Независимые выборки
Это наиболее часто встречающаяся ситуация применения таблиц 2×2, когда одна группа объектов классифицируется по двум дихотомическим основаниям и проверяется ги­потеза о связи этих двух оснований классификации.
По сравнению с другими таблицами сопряженности особенность таблиц 2×2 проявля­ется в нескольких отношениях:
1. Эти таблицы могут быть построены разными способами, но только один из них яв-
ляется правильным в отношении применимости критерия χ2-Пирсона (см.формулу 2.7).
2. Допустима проверка направленных альтернатив. Соответственно меняется способ
определения р-уровня значимости, он делится на 2.
50
3. В некоторых случаях при расчете χ2-Пирсона необходимо введение поправки на не-
После
До
0 1 0 а b 1 с
d
прерывность Йетса (см. формулу 2.8). χ2-Пирсона с поправкой на непрерывность применим для анализа таблиц сопряженности 2×2, когда N≥20, а если хотя бы одна из теоретических частот меньше 5, то при N≥40. Такая поправка используется в большинстве случаев для про­верки направленных альтернатив.
(2.8)
Зависимые выборки
Структура исходных данных соответствует ситуации, когда одна выборка объектов классифицирована на две группы дважды по одному и тому же основанию. В таких ситуаци­ях применяется критерий Мак-Нимара, который позволяет сопоставить долю тех, кто не об­ладал некоторой характеристикой до воздействия (0), но стал обладать ею после воздействия (1), с долей тех, кто обладал этой характеристикой до воздействия (1) и перестал обладать ею после воздействия (0). Иначе говоря, метод позволяет сопоставить диагональные элементы таблицы сопряженности 2×2, построенной непосредственно по дважды проведенной дихо­томической классификации одной и той же выборки:
Проверка гипотезы проводится по z-критерию по формулам для эмпирического зна­чения:
(2.9)
где с и b – одна пара диагональных элементов таблицы, для проверки одной гипотезы; а и d – другая пара диагональных элементов для проверки другой гипотезы.
Для определения р-уровня значимости эмпирическое значение Zэ сравнивается с тео­ретическим – единичным нормальным распределением (Приложение 1).
Ограничение: сумма сравниваемых частот не должна быть меньше 10.
3.3 Анализ последовательности серий
Как следует из названия, метод применяется для анализа последовательности объек­тов (явлений, событий), упорядоченных во времени или в порядке возрастания (убывания) значений измеренного признака.
Метод требует представления последовательности в виде бинарной переменной – как чередования событий 0 (m) и 1 (n). Поэтому исходные данные, как правило, требуют преоб­разования: упорядочивания (по времени или по уровню) и приведения к бинарному виду.
Математическая идея критерия основана на подсчете числа серий в упорядоченной последовательности событий двух типов, например, 0 и 1. Серия (W) – это последователь­ность однотипных событий, непосредственно перед и после которой произошли события другого типа. Гипотеза Н0 о случайном распределении событий 1 среди событий 0 может быть отклонена, если количество серий либо слишком мало, либо слишком велико.
Проблема направленности гипотезы должна решаться еще до проведения исследова­ния. Исследователя может интересовать любое отклонение от Н0 – как в сторону слишком малого, так и слишком большого числа серий (W). Тогда необходима проверка ненаправлен­ной гипотезы. Если же исследователя интересуют только малые значения W или только слишком большие значения W, то необходима проверка направленной гипотезы. Важность предварительного определения направленности гипотезы обусловлена тем, что при одном и
51
том же числе серий W р-уровень для направленной альтернативы будет в 2 раза меньше, чем для ненаправленной гипотезы.
Если численность m(n) меньше 20, то для проверки Н0 применяются таблицы крити­ческих значений для числа серий. Если эмпирическое значение меньше или равно W больше или равно W
, то Н0 отклоняется.
0,975
0,025
или
Альтернативным способом определения р-уровня является применение Z-критерия серий и таблицей «Стандартные нормальные вероятности» (Приложение 1), основанного на том факте, что число серий W при выполнении Н0 распределено примерно нормально с из­вестными М
и σW. Формула для определения эмпирического значения Z-критерия серий:
Wэ
(2.10)
Ограничение на применение Z-критерия серий: m≥20 и n≥20; m и n несущественно различаются. Если m и n существенно различаются, то следует воспользоваться комбинатор­ным методом (например, Монте-Карло в программе SPSS).
4. Параметрические и непараметрические методы сравнения выборок по уровню выраженности признака
4.1 Общее представление о параметрических методах. Сравнение дисперсий
Сравнение двух выборок по признаку, измеренному в метрической шкале, обычно
предполагает сравнение средних значений с использованием параметрического критерия t­Стьюдента и критерию F-Фишера. Следует различать три ситуации по соотношению выбо-
рок между собой:
а) случай независимых выборок; б) случай зависимых выборок; в) сравнение одного среднего значения с заданной величиной (критерий t-Стьюдента
для одной выборки).
При сравнении средних или дисперсий двух выборок проверяется ненаправленная
статистическая гипотеза о равенстве средних (дисперсий) в генеральной совокупности.
Соответственно, при её отклонении допустимо принятие двусторонней альтернативы о кон­кретном направлении различий с соотношением выборочных средних (дисперсий).
К параметрическим методам относится сравнение дисперсий двух выборок по
критерию F-Фишера. Иногда этот метод приводит к ценным содержательным методам, а в
случае сравнения средних для независимых выборок сравнение дисперсий является обяза­тельной процедурой. Основные характеристики:
1. Метод позволяет проверить гипотезу о том, что дисперсии двух генеральных сово-
купностей, из которых извлечены сравниваемые выборки, отличаются друг от друга.
2
2. Проверяемая статистическая гипотеза Н0: σ
2
=σ
1
. При её отклонении принимается
2
альтернативная гипотеза о том, что одна дисперсия больше другой.
3. Исходные предположения: две выборки извлекаются случайно из разных генераль-
ных совокупностей с нормальным распределением изучаемого признака.
4. Структура исходных данных: изучаемый признак измерен у объектов (испытуе-
мых), каждый из которых принадлежит к одной из двух сравниваемых выборок.
5. Ограничения: распределения признака и в той, и в другой выборке существенно не
отличаются от нормального.
6. Альтернатива методу: критерий Ливена, применение которого не требует проверки
предположения о нормальности распределения.
52
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]