Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Статистические методы и математическое моделирование в психологии. Учебно-методическое пособие

.pdf
Скачиваний:
2
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
☆
ГЛАВА 6
КЛАСТЕРНЫЙ АНАЛИЗ
Основные понятия: кластерный анализ, кластер, квадратное эвклидово расстояние, метод ближайшего соседа, стратегия дальне­го соседа, метод средней связи, дендограмма.
6.1. ПОНЯТИЕ КЛАСТЕРНОГО АНАЛИЗА
Кластерный анализ – это общее название множества вы­числительных процедур, используемых при создании классифи­кации. Главная цель кластерного анализа – нахождение групп схожих объектов в выборке данных. Эти группы удобно назы­вать кластерами [22].
В качестве объектов в кластерном анализе выступают испы­туемые.
Кластерный анализ можно применять только в том случае, если все измерительные шкалы имеют один и тот же диапазон. В противном случае, переменные перед проведением кластерно­го анализа необходимо стандартизировать.
При проведении кластерного анализа задается метрика (ме­ра), то есть формула, по которой вычисляется сходство между объектами аналогично расстоянию в геометрии, близко распола­гаются похожие, далеко – отличные. Чаще в качестве этой меры выступает квадратное эвклидово расстояние.
номер испытуемого
1
D= Ʃ (X
индекс переменной
Первоначально все объекты считаются кластерами, и рас­считывается матрица попарных расстояний между всеми объек­тами. Объекты, находящиеся на наименьшем расстоянии, объе-
30)2
-X
i
i
61
диняются в один кластер, после чего процедура повторяется до тех пор, пока все объекты не объединятся в единый кластер. При этом используются различные стратегии классификации, которые задаются способом вычисления расстояния между кла­стерами, то есть между группами объектов.
Стратегии классификации:
1. Метод ближайшего соседа. Данный метод начинает про-
цесс кластеризации с поиска двух наиболее схожих объектов. По правилу объединения новый объект присоединяется к суще­ствующей группе в том случае, если он имеет наивысший уро­вень сходства с каким-либо членом этой группы. Таким обра­зом, присоединение определяется наличием связи между объек­том и кластером. В результате кластеры оказываются как бы вложенными: каждый кластер может рассматриваться как эле­мент другого более широкого кластера на более высоком уровне сходства.
2. Стратегия дальнего соседа. Расстояние между кластера­ми определяется наибольшим расстоянием между любыми дву­мя объектами в различных кластерах: самый далекий элемент кластера находится ближе к новому объекту, чем самые далекие элементы других кластеров.
3. Метод средней связи (межгрупповой связи). Мера сход- ства между объектами и кластером определяется усредненными значениями. В качестве средних могут быть рассмотрены, на­пример, среднее арифметическое расстояние между всеми пара­ми объектов, медиана и т.п. [9].
6.2. ИНТЕРПРЕТАЦИЯ ДАННЫХ КЛАСТЕРНОГО АНАЛИЗА
Интерпретировать данные кластерного анализа легче всего
с помощью дендограмм – это график по одной оси расположены номера объектов, по другой – расстояние, при котором эти объ­екты объединяются в кластеры (рис. 16). Дендограммы могут иметь как вертикальный, так и горизонтальный вид.
62
Рис. 16. Дендограмма
(ОХ – номера объектов, ОУ – расстояние)
Маленькое расстояние говорит о сходстве между объекта-
ми, большое – о различии.
Выбор числа кластеров является отдельной проблемой в кластерном анализе. Не существует статистических критериев, позволяющих выбрать число кластеров, т.е. этапа, на котором процедуру кластеризации необходимо прекратить. Решение принимается исследователем, исходя из теоретических сообра­жений. Объединение в группы должно быть осмысленно и должно иметь содержательное объяснение, почему именно данные объекты попали в ту или иную группу.
Можно выделить интуитивные способы определения числа кластеров и формальные, основанные на определенных проце­дурах. Интуитивный связан с анализом полученных дендро­грамм, когда исследователь выделяет хорошо выделяемые кла­стеры «на глаз». Данная структура связана с субъективными
63
факторами, а также зависит от нужд и представлений исследо­вателей о «правильной» структуре данных.
Другим формализованным способом выбора числа класте­ров может быть разрыв расстояния между кластерами. Также можно обратиться к таблице последовательности агломерации, которая позволяет проследить динамику увеличения различий по шагам кластеризации и определить шаг, на котором отмеча­ется резкое возрастание различий. Оптимальному числу классов соответствует разность между числом объектов и порядковым номером шага, на котором обнаружен перепад различий [9].
Контрольные вопросы:
1. Каково предназначение процедуры кластерного анализа?
2. Использование какого типа данных возможно в кластер-
ном анализе?
3. В чем основная идея кластерного анализа? На основании
чего происходит классификация данных?
4. Что такое дендрограмма?
Практические задания для самостоятельной работы
по теме «Кластерный анализ»
Задание №1.
Приведены данные опроса 58 испытуемых, страдающих от бессонницы. Испытуемых спрашивали, сколько часов в сутки они спят фактически и сколько часов сна им нужно для нор­мального самочувствия. Проведите кластерный анализ, выдели­те группы испытуемых с различным соотношением этих двух показателей. Предложите интерпретацию полученных результа­тов (приложение 5).
Задание №2. С целью исследования структуры способно- стей учащихся старших классов школы рассчитывался интегра­тивный показатель знаний по следующим предметам: геомет­рия, алгебра, русский язык, литература, физика, история, анг-
64
лийский язык, черчение. Результаты оценивались по 15-балль­ной шкале. Предполагалось, что школьные предметы можно сгруппировать на основе их усвояемости школьниками, выделив как минимум две группы: гуманитарные и естественные. Про­верьте гипотезы исследования с помощью кластерного анализа (приложение 7).
65
МАТЕМАТИКО-СТАТИСТИЧЕСКАЯ
ОБРАБОТКА ДАННЫХ
С ПРИМЕНЕНИЕМ КОМПЬЮТЕРНОЙ
ПРОГРАММЫ SPSS
1. Проверка нормальности распределения
Критерии асимметрии и эксцесса. Анализ => описательные статистики => описательные => нажав параметры, можно вы­брать и произвести подсчет стандартного отклонения, асиммет­рии и эксцесса => нажать продолжить и вернуться в основное окно => ОК.
Графический способ. Анализ => описательные статистики
=> Графики Р-Р – графики накопленных частот (или Графики Q-Q – квантильные графики) => ОК.
Критерий нормальности Колмогорова-Смирнова.Анализ => непараметрические критерии => устаревшие диалоговые окна =>одновыборочный Колмогорова–Смирнова. Переносим из ле­вого в правое окно интересующие нас переменные. Нажимаем ОК.
Если значение Асимпт. знч. меньше или равно 0,05, то рас­пределение существенно отличается от нормального вида. Если Асимпт. знч. больше 0,05, то существенного отличия от нор­мальности не обнаружено.
2. Первичные описательные статистики.
Анализ => Описательные статистики => Описательные => нажав Параметры, можно выбрать и произвести подсчет средне­го арифметического, суммы, стандартного отклонения, диспер­сии, размаха, минимума, максимума, стандартной ошибки сред­него, асимметрии и эксцесса => нажать Продолжить и вернуться в основное окно => ОК.
3. Т-критерий Стьюдента.
Анализ => Сравнение средних => Т-критерий для независи­мых выборок... => в левом подокне выбрать одну или несколько переменных и с помощью кнопки-указателя переместить их в подокно Проверяемые переменные => с помощью кнопки-
66
указателя выбрать и переместить в соответствующее подокно группирующую переменную, в которой на основании значений программа выделит две сравниваемые группы => ОК.
Критерий Ливиня: программа предполагает вариант провер­ки по критерию Т-Стьюдента с поправкой на неоднородность дисперсии. В случае получения достоверного различия диспер­сий по критерию Ливиня, рекомендуется воспользоваться непа­раметрической проверкой различий для независимых выборок (по критерию Манна-Уитни).
4. Непараметрические критерии.
Критерий Манна-Уитни. Анализ => Непараметрические критерии => Устаревшие диалоговые окна => для двух незави­симых выборок => в левом подокне выбрать одну или несколько переменных и с помощью кнопки-указателя переместить их в подокно Проверяемые переменные => с помощью кнопки­указателя выбрать и переместить в соответствующее подокно группирующую переменную, в которой на основании значений программа выделит две сравниваемые группы => ОК.
Критерий Уилкоксона. Анализ => Непараметрические кри­терии => Устаревшие диалоговые окна => для двух связанных выборок … => ОК.
Критерий Краскала-Уоллеса. Анализ => Непараметрические критерии=>Устаревшие диалоговые окна => Для К независимых выборок … => ОК.
Критерий Фридмана. Анализ => Непараметрические крите­рии=>Устаревшие диалоговые окна => Для К связанных выбо­рок … => ОК.
5. Корреляционный анализ.
Анализ => Корреляции => Парные... =>в подокне слева вы­брать две или более переменных, которые необходимо прокор­релировать => с помощью кнопки-указателя переместить вы­бранные переменные в подокно справа => выбрать метод, с по­мощью которого будет выявляться корреляционная связь между переменными => в окне Критерий значимости указать способ расчета статистической значимости вычисляемых коэффициен­тов (по умолчанию в программе принят двусторонний способ
67
вычисления достоверности, который является более строгим, но исследователь по своему желанию сможет изменить его на од­носторонний.=> для большей наглядности и удобства во время работы с полученными результатами оставить установленный по умолчанию флажок Отмечать значимые корреляции => ОК.
6. Факторный анализ.
Анализ => Снижение размерности => Факторный анализ... => в левом окне выделить мышкой переменные, которые будут подвергаться факторному анализу => перенести их в окно Пе­ременные, нажав на кнопку со стрелкой между окошками => выбрать параметры работы процедуры ФА => Продолжить => ОК.
7. Кластерный анализ.
Анализ => Классификация => Иерархическая кластериза­ция... => в левом окне выделить мышкой переменные, которые будут подвергаться кластерному анализу => перенести их в окно Переменные, нажав на кнопку со стрелкой между окошками => выбрать параметры работы процедуры кластерного анализа => Продолжить => ОК.
68
ОБЩИЕ ТРЕБОВАНИЯ К ВЫПОЛНЕНИЮ
ПРАКТИЧЕСКИХ ЗАДАНИЙ
ПО «КОМПЬЮТЕРНОЙ ОБРАБОТКЕ
ДАННЫХ В ПСИХОЛОГИИ»
В процессе изучения курса «Компьютерная обработка дан­ных в психологии» каждый студент должен выполнить ряд практических заданий, для приобретения навыков подбора и ис­пользования методов статистической обработки, адекватных предложенным данным.
В течение изучения дисциплины необходимо выполнить самостоятельную работу по обработке экспериментальной мат­рицы, которая представляет собой результаты заполнения не­скольких опросников. Далее, по мере прохождения материала, студенты должны, используя получаемые знания, обработать эту матрицы с помощью различных статистических методов. Примером такого рода обработки могут служить проверка нор­мальности распределения полученных данных, подсчет корре­ляций между шкалами опросника и т.п. При этом творческая со­ставляющая работы подразумевает, что студенты самостоятель­но придумывают и формулируют различные гипотезы, прове­ряют их с использованием статистических процедур и формули­руют выводы на основе получаемых результатов. В процессе выполнения самостоятельной работы студенты могут пользо­ваться литературными источниками, советоваться с преподава­телем и т.п.
Выполненная работа проверяется преподавателем и может быть возвращена автору с его замечаниями. При этом проверя­ются, самостоятельно ли выполнена работа, степень знания и понимания автором использованных методов статистической обработки. В случае если работа выполнена некачественно, ее необходимо переделать.
69
ЛИТЕРАТУРА
1. Агарков Ю.А., Исаева С.Н., Комлев А.А. Математико-
статистическая обработка данных для психологов с применени­ем компьютерной программы SPSS: учеб. пособие; Федеральное агентство по образованию, ГОУВПО «Тамб. гос. ун-т им. Г.Р. Державина». Тамбов: Издательский дом ТГУ им. Г.Р. Дер­жавина, 2004. 56 с.
2. Большой психологический словарь / под ред. Б.Г. Меще-
рякова, В.П. Зинченко. – М.: Прайм-Еврознак, 2003. – 672 с.
3. Вентцель Е.С., Овчаров Л.А. Теория вероятностей. – М.:
Наука, 1969. – 368 с.
4. Горбатов Д.С. Практикум по психологическому исследо-
ванию: учебное пособие / Д.С. Горбатов. – Самара: Бахрах-М,
2006. – 272 с.
5. Гудвин Д. Исследование в психологии – методы и пла-
нирование / Дж. Гудвин. – СПб.: Питер, 2004. – 558 с.
6. Гусев А. Н., Измайлов Ч.А., Михалевская М.Б. Измерение
в психологии: общий психологический практикум / 2-е изд. – М.: Смысл, 1998. – 286 с.
7. Гусев А.Н., Уточкин И.С. Психологические измерения: Теория. Методы: Учеб. пособие для студентов вузов / А.Н. Гу­сев, И.С. Уточкин. – М.: Аспект Пресс, 2011. – 319 с.
8. Дружинин В.Н. Экспериментальная психология / В.Н. Дру­жинин. – СПб.: Питер, 2011. – 320 с.
9. Дьячук А.А. Математические методы в психологических и педагогических исследованиях: учебное пособие; Красноярск: Красноярский гос. пед. ун-т им. В.П. Астафьева, 2013. – 347 с.
10. Ермолаев О.Ю. Математическая статистика для психо­логов: Учебник / О.Ю. Ермолаев. – 5-е изд. – М.: НОУ ВПО «МПСИ»: Флинта, 2011. – 336 с.
11. Калинин С.И. Компьютерная обработка данных для психологов / Под науч. ред. А.Л. Тулупьева. Изд. 2-е. – СПб.: «Речь», 2004. – 134 с.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]