Математические методы в психологии. Учебное пособие-1
.pdfВыводы. Многомерные методы могут быть использованы, вопервых, для самостоятельных типов задач, когда, условно говоря, под метод (критерий) подбирается задача, но, строго говоря, такой путь некорректный, и его ценность и научная достоверность выводов очень и очень ограничены. Во-вторых, прибегнуть к использованию этих методов можно и нужно в том случае, когда с использованием других методов результаты получаются сомнительные или их нет вовсе. Здесь формула «отрицательный результат – тоже результат» не работает, поскольку отрицательный результат в статистике – это отсутствие всякого результата. Именно в этом случае можно и нужно использовать всяческие возможности (кроме тех, что нарушают этику исследования) для получения необходимых исследователю выводов.
Вопросы для самопроверки
1.Критерий φ* – угловое преобразование Фишера.
2.Использование критерия φ* в сочетании с критерием λ Кол- могорова-Смирнова.
3.Биномиальный критерий m.
Рекомендуемая литература и интернет-источники
Основная: 1–3. Дополнительная: 1– 3. Методическая: 1–2. Интернет-ресурсы: 1– 3.
91
9.Многомерные методы и модели: общее представление Дисперсионный анализ: понятие. Однофакторный
дисперсионный анализ
План
9.1.Дисперсионный двухфакторный анализ.
9.2.Многомерные виды анализа для задач классификации и структурирования изучаемых признаков
9.3.Моделирование в психологии.
9.1. Дисперсионный анализ: понятие. Однофакторный дисперсионный анализ
Дисперсионный анализ – это анализ изменчивости признака под влиянием каких-либо контролируемых переменных факторов. В зарубежной литературе он обозначается ANOVA (Analysis of Variance). Автор метода – Р.А. Фишер.
Задача дисперсионного анализа состоит в том, чтобы соотнести вариативность, обусловленную действием исследуемых переменных и их взаимодействием со случайной вариативностью. Показателем этой вариативности является критерий Фишера (F).
Вформулу расчёта F входят оценки дисперсий, т.е. параметров распределения признака, поэтому этот критерий является парамет-
рическим.
Чем в большей степени вариативность признака обусловлена исследуемыми переменными (факторами) или их взаимодействием, тем выше эмпирическое значение F.
Вдисперсионном анализе исследователь исходит из предположения, что одни переменные могут рассматриваться как причины, другие – как следствия, в этом отличие, например, от корреляционного анализа.
Только исследовательское чутьё может помочь в определении того, что причина, а что – следствие, поэтому любые выводы здесь уязвимы для критики.
Нулевая гипотеза дисперсионного анализа (Н0): средние величины исследуемого результативного признака во всех исследуемых условиях одинаковы.
Альтернативная гипотеза (Н1): средние величины результативного признака в разных условиях разные.
Таким образом, дисперсионный анализ позволяет нам констатировать изменение признака, но при этом не указывает направле-
92
ние изменений. Подобного рода задачи решаются непараметрическими критериями – Н и L. Однако это касается только тех задач, где исследуется влияние одного фактора. Задачи однофакторного дисперсионного анализа действительно могут эффективно решаться непараметрическими критериями. Но только дисперсионный анализ может решить задачи многофакторного взаимодействия.
Экспериментальные данные, представленные по условиям (градациям, ступеням стадиям, уровням развития и т.п.), называются дисперсионным комплексом. Данные, относящиеся к отдельным градациям – ячейками комплекса.
Комплекс, в котором каждая ячейка представлена одинаковым количеством наблюдений, называется равномерным. Существуют неравномерные (неортогональные) комплексы и соответствующие методы их обсчёта. Но в принципе целесообразно уравнивать комплексы методом случайного отбора.
Дисперсионный анализ относится к группе пара методов, и мы должны прежде всего убедиться в нормальности распределения результативного признака.
1-й вариант определения нормальности распределения (по Н.А. Плохинскому):
-определение среднего арифметического: х=∑хi/n;
-определение стандартного отклонения: σ=√∑(хi-х)2/(n-1);
-определение показателя асимметрии: А=∑(хi-х)3/nσ3;
-определение ошибки репрезентативности: mа=√6/n;
-определение показателя эксцесса: Е=(∑(хi-х)4/nσ4) – 3;
-определение ошибки репрезентативности: mе=2√6/n. Показатели асимметрии и эксцесса свидетельствуют о досто-
верном отличии эмпирических распределений от нормального в том случае, если они превышают по абсолютной величине свою ошибку репрезентативности в 3 и более раз, т.е.:
Tа=│А│/mа≥3 и / или Tе=│Е│/mе≥3.
2-й вариант определения нормальности распределения вариант (по Е.И. Пустыльнику).
-определение, помимо показателей, представленных в первом варианте (по Плохинскому), ещё и критических значений асимметрии (Акр) и эксцесса (Екр):
-Акр=3√(6(n-1))/((n+1)(n+3));
-Екр=5√(24n(n-2)(n-3))/((n+1)2(n+3)(n+5));
93
Эмпирические значения асимметрии и эксцесса (Аэмп и Еэмп соответственно) должны быть меньше своих критических значений.
Из предложенных вариантов можно выбрать любой.
Далее для упрощения расчётов можно произвести некоторые преобразования эмпирических данных: умножение, деление, вычитание или их совокупность с последующим обратным преобразованием.
Однофакторный дисперсионный анализ для несвязанных выбо-
рок применяется тогда, когда изменения исследуемого результативного признака – следствия изменяющихся условий или градаций какого-либо фактора. Здесь влиянию каждой из градаций подвергаются разные выборки испытуемых. Градаций – не менее трёх. Аналог – Н Крускала-Уоллиса.
Н0: различия между градациями фактора (разными условиями) являются не более выраженными, чем различия внутри каждой группы.
Н1: различия между градациями фактора являются более выраженными, чем случайные различия внутри каждой группы.
Ограничения однофакторного дисперсионного анализа:
-не менее трёх градаций (условий) и не менее двух испытуемых в каждой градации;
-должно соблюдаться правило равенства дисперсий в каждой ячейке дисперсионного комплекса;
-результативный признак должен быть нормально распределён.
Однофакторный дисперсионный анализ для связанных выборок
применяется тогда, когда исследуется влияние разных условий (градаций) на одну и ту же выборку. Градаций должно быть не менее трёх. Непараметрический аналог – χr2 Фридмана, L критерий тенденций Пейджа.
Гипотезы в данном виде анализа двухуровневые (представим здесь только альтернативные гипотезы, имея в виду, что нульгипотзы содержат обратные формулировки):
Н1: различия исследуемого параметра в имеющемся наборе условий являются более выраженными, чем случайные различия.
Н1: индивидуальные различия между испытуемыми являются более выраженными, чем случайные различия.
Таким образом, подчеркнём, что дисперсионный анализ выступает параметрическим статистическим методом (подходом, критерием), выявляющим различия в исследуемых группах испытуемых, в исследуемой выборке испытуемых по какому-либо параметру. Он
94
преследует цель выявления достоверности действия причины по отношению к следствию, что в психологии, как уже подчёркивалось выше, необходимо озвучивать очень осторожно. Однофакторный дисперсионный анализ, в отличие от многих многомерных методов и моделей, имеет аналоги среди непараметрических критериев.
9.2. Дисперсионный двухфакторный анализ
Дисперсионный двухфакторный анализ позволяет оценить не только влияние каждого из факторов в отдельности, но и их взаимодействие. Например, может оказаться, что одна переменная значимо действует на признак только при малых (больших) значениях другой переменной (усиление наказания может снижать количество агрессивных реакций у девочек и повышать у мальчиков).
Если нами установлено значимое взаимодействие факторов, то это зачастую важнее, чем действие каждого из факторов в отдельности.
Дисперсионный двухфакторный анализ в большей степени отвечает дифференциально-психологическому подходу в экспериментальных исследованиях. Он приближает к установлению закономерностей индивидуальных стилей.
Дисперсионный двухфакторный анализ предъявляет особые требования к формированию комплексов. Комплекс должен представлять собой симметричную систему: каждой градации фактора А должно соответствовать одинаковое количество градаций фактора В.
Дисперсионный двухфакторный анализ для несвязанных выбо-
рок применим тогда, когда исследуется одновременное действие двух факторов на разные выборки испытуемых, т.е. тогда, когда разные выборки испытуемых оказываются под воздействием разных сочетаний двух факторов.
Гипотезы дисперсионного двухфакторного анализа трёхуровневые (представим здесь только альтернативные, понимая, что нуль-гипотезы содержат обратную формулировку):
Н1: различия в уровне исследуемого параметра, обусловленные фактором А, более выраженные, чем случайные.
Н1: различия в уровне исследуемого параметра, обусловленные фактором В, более выраженные, чем случайные.
Н1: влияние фактора А на исследуемый параметр различно при разных градациях фактора В, и наоборот.
Ограничения применения дисперсионного двухфакторного анализа для несвязанных выборок:
95
-у каждого фактора должно быть не менее двух градаций;
-в каждой ячейке комплекса должно быть не менее двух наблюдаемых значений;
-комплекс должен быть равномерным;
-комплекс должен быть симметричной системой;
-результативный признак должен быть нормально распределён;
-факторы (переменные) должны быть независимы.
Дисперсионный двухфакторный анализ для связанных выборок
применим тогда, когда исследуется действие двух факторов на одну
иту же выборку испытуемых. В данном случае проверяются фактически четыре гипотезы: о влиянии фактора А, о влиянии фактора В, о влиянии взаимодействия факторов А и В и о влиянии фактора индивидуальных различий. Ограничения те же, что и в дисперсионный двухфакторный анализ для несвязанных выборок.
Более сложные схемы дисперсионного анализа позволяют анализировать совокупное действие 3-х, 4-х и более факторов и получить ещё более глубокие результаты.
9.3.Многомерные виды анализа для задач классификации
иструктурирования изучаемых признаков
Регрессионный анализ.
Этот метод позволяет изучать зависимость среднего значения одной величины от вариации другой (других) величины. Специфика метода заключается в том, что хотя бы одна из рассматриваемых величин носит случайный характер. Тогда описание зависимости распадается на две задачи:
1)выявление общего вида зависимости;
2)уточнение путём вычисления оценок параметров зависимости. Решение первой задачи – дело мастерства и интуиции исследо-
вателя, т.к. стандартных методов её решения не существует. Решение же второй задачи, по сути, представляет собой нахождение аппроксимирующей кривой. Чаще всего эта аппроксимация осуществляется с помощью математического метода наименьших квадратов.
Идея этого метода принадлежит Фрэнсису Гальтону, заметившему, что у очень высоких родителей дети были несколько меньше ростом, а у очень маленьких родителей – дети более рослые. Эту закономерность он назвал регрессией.
96
Таксономический (кластерный) анализ.
Этот анализ представляет собой математический приём группировки данных в классы (таксоны, кластеры) таким образом, чтобы объекты, входящие в один класс, были более однородны по ка- кому-либо признаку по сравнению с объектами, входящими в другие классы. В итоге появляется возможность определить в той или иной метрике расстояние между изучаемыми объектами и дать упорядоченное описание их взаимоотношений на количественном уровне. В силу недостаточной проработанности критериев эффективности и допустимости кластерных процедур данный метод рассматривается как дополнительный или дополняется другими методами, в частности, факторным анализом.
Факторный анализ.
Основная идея факторного анализа была сформулирована ещё Фр. Гальтоном, основоположником измерений индивидуальных различий. Она сводится к тому, что если несколько признаков, измеренных на группе индивидом, изменяются согласованно, то можно предположить существование одной общей причины этой совместной изменчивости – фактора как скрытой (латентной) переменной, которая непосредственно не доступна измерению.
Как общенаучный метод, факторный анализ сегодня выступает средством для замены набора коррелирующих измерений существенно меньшим числом новых переменных (факторов). При этом основными требованиями являются:
-минимальная потеря информации, содержащейся в исходных данных;
-возможность представления (интерпретации) факторов через исходные переменные.
Таким образом, главная цель факторного анализа – уменьшение размерности исходных данных с целью их экономичного описания при условии минимальных потерь исходной информации. Результатом факторного анализа является переход от множества исходных переменных к существенно меньшему числу новых переменных – факторов. Фактор при этом интерпретируется как причина совместной изменчивости нескольких исходных переменных.
Основой анализа является матрица корреляций, т.е. таблицы коэффициентов корреляции каждого признака со всеми остальными. В зависимости от числа факторов в корреляционной матрице различают:
-однофакторный (по Спирмену);
97
-бифакторный (по Холзингеру);
-многофакторный (по Терстону.
Весьма сложный математический и логический аппараты факторного анализа часто затрудняют выбор адекватного задачам исследования варианта метода.
Дискриминантный анализ.
Дискриминантный анализ используется для анализа данных в том случае, когда зависимая переменная категориальная, а предикторы (независимые переменные) интервальные.
Дискриминантный анализ используется для принятия решения о том, какие переменные различают (дискриминируют) две или более возникающие совокупности (группы). Например, некий исследователь в области образования может захотеть исследовать, какие переменные относят выпускника средней школы к одной из трех категорий: (1) поступающий в колледж, (2) поступающий в профессиональную школу или (3) отказывающийся от дальнейшего образования или профессиональной подготовки. Для этой цели исследователь может собрать данные о различных переменных, связанных с учащимися школы. После выпуска большинство учащихся естественно должно попасть в одну из названных категорий. Затем можно использовать дискриминантный анализ для определения того, какие переменные дают наилучшее предсказание выбора учащимися дальнейшего пути.
Дискриминантный анализ преследует такие цели:
1.Определение дискриминантных функций или линейных комбинаций независимых переменных, которые наилучшим образом различают (дискриминируют) категории (группы) зависимой переменной.
2.Проверка существования между группами значимых различий с точки зрения независимых переменных.
3.Определение предикторов, вносящих наибольший вклад в межгрупповые различия.
4.Отнесение случаев к одной из групп (классификация), исходя из значений предикторов.
5.Оценка точности классификации данных на группы. Дискриминантная функция при этом понимается как выведенная
посредством дискриминантного анализа линейная комбинация независимых переменных, с помощью которой можно наилучшим образом различить (дискриминировать) категории зависимой переменной.
98
9.4. Моделирование в психологии
Метод моделирования отличен как от теоретического метода, дающего обобщённое, абстрагированное знание, так и от эмпирического. При моделировании исследователь пользуется методом аналогий, умозаключением «от частного к частному», тогда как экспериментатор работает с помощью методов индукции (математическая статистика является современным вариантом индуктивного вывода). Теоретик пользуется правилами дедуктивного умозаключения, разработанными ещё Аристотелем.
Для исследователя, применяющего моделирование, модель – аналог объекта. Моделирование используется тогда, когда невозможно провести экспериментальное исследование объекта. К таким объектам относятся уникальные системы, недоступные экспериментальному изучению, или системы, на которых эксперимент производить по моральным соображениям нельзя: Вселенная, Солнечная система, экосистема парка и человек как объект, например, ряда медицинских и психофармакологических исследований. Иногда модель выбирается исходя из принципа удобства, большей простоты и экономичности проведения исследования. Так, вместо испытания гигантского корабля первоначально исследуется его плавучесть на модели (с учётом принципиально важных масштабных искажений). Вместо того чтобы исследовать особенности элементарных форм научения и познавательной активности у человека, психологи успешно используют для этого «биологические модели»: крыс, обезьян, кроликов и даже свиней.
Различают «физическое» и «знаково-символическое» моделирование. «Физическая» модель исследуется экспериментально. «Знаково-символическая» модель, как правило, реализуется в виде более или менее сложной компьютерной программы, и исследование её поведения – дело теоретиков. Проблема «внешней» валидности метода моделирования особенно остра, так как его успех зависит от меры сходства объекта исследования с его аналогом.
Моделирование некоторых условий, например, в экспериментах по сенсорной депривации или выработке классических условных рефлексов, не соответствует никакой жизненной реальности. При условии, если под реальностью понимать то, что было, а не то, что потенциально может быть. Поэтому многостраничные рассуждения такого солидного автора, как Готтсданкер, по поводу «экспериментов полного соответствия» или «экспериментов, улучшающих реальность», кажутся надуманными и архаичными.
99
Выбранная для моделирования в эксперименте ситуация может быть совершенно нерепрезентативной с точки зрения жизни той группы испытуемых, которая участвует в эксперименте, или являться редкой и нетипичной.
Для нас уже очевидно, что экспериментальная выборка представляет собой модель популяции в целом или той её части, поведение которой нас интересует.
В самом общем смысле модель – это формализованное представление об объекте исследования относительно поставленной цели.
Информационный аспект подчеркивается в следующем определении (Н.Н. Моисеев): «Под моделью мы будем понимать упрощенное, если угодно, упакованное знание, несущее вполне определённую, ограниченную информацию о предмете (явлении), отражающее те или иные его отдельные свойства. Модель можно рассматривать как специальную форму кодирования информации. В отличие от обычного кодирования, когда известна вся исходная информация, и мы лишь переводим её на другой язык, модель, какой бы язык она не использовала, кодирует и ту информацию, которую люди раньше не знали. Можно сказать, что модель содержит в себе потенциальное знание, которое человек, исследуя её, может приобрести, сделать наглядным и использовать в своих практических жизненных нуждах. Для этих целей в рамках самих наук развиты специальные методы анализа. Именно этим и обусловлена предсказательная способность модельного описания».
Модели можно различать по характеру моделируемых объектов, сферам приложения, глубине моделирования. В зависимости от средств моделирования выделяют материальное (предметное) и идеальное моделирование.
Материальное моделирование, основывающееся на материаль-
ной аналогии моделируемого объекта и модели, осуществляется путём воспроизведения основных геометрических, физических, других функциональных характеристик изучаемого объекта.
Идеальное моделирование отличается от материального принципиально. Оно основано на идеальной, или мыслимой, аналогии. Идеальное моделирование, в свою очередь, разбивается на два подкласса: знаковое (формализованное) и интуитивное моделирование. При знаковом моделировании моделями служат схемы, графики, чертежи, формулы. Важнейшим видом знакового моделирования
100
