Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Статистические методы и математическое моделирование в психологии. Учебно-методическое пособие
.pdf
ГЛАВА 6
КЛАСТЕРНЫЙ АНАЛИЗ
Основные понятия: кластерный анализ, кластер, квадратное
эвклидово расстояние, метод ближайшего соседа, стратегия дальнего соседа, метод средней связи, дендограмма.
6.1. ПОНЯТИЕ КЛАСТЕРНОГО АНАЛИЗА
Кластерный анализ – это общее название множества вычислительных процедур, используемых при создании классификации. Главная цель кластерного анализа – нахождение групп
схожих объектов в выборке данных. Эти группы удобно называть кластерами [22].
В качестве объектов в кластерном анализе выступают испытуемые.
Кластерный анализ можно применять только в том случае,
если все измерительные шкалы имеют один и тот же диапазон.
В противном случае, переменные перед проведением кластерного анализа необходимо стандартизировать.
При проведении кластерного анализа задается метрика (мера), то есть формула, по которой вычисляется сходство между
объектами аналогично расстоянию в геометрии, близко располагаются похожие, далеко – отличные. Чаще в качестве этой меры
выступает квадратное эвклидово расстояние.
номер испытуемого
1
D= Ʃ (X
индекс переменной
Первоначально все объекты считаются кластерами, и рассчитывается матрица попарных расстояний между всеми объектами. Объекты, находящиеся на наименьшем расстоянии, объе-
30)2
-X
i
i
61

диняются в один кластер, после чего процедура повторяется до
тех пор, пока все объекты не объединятся в единый кластер.
При этом используются различные стратегии классификации,
которые задаются способом вычисления расстояния между кластерами, то есть между группами объектов.
Стратегии классификации:
1. Метод ближайшего соседа. Данный метод начинает про-
цесс кластеризации с поиска двух наиболее схожих объектов.
По правилу объединения новый объект присоединяется к существующей группе в том случае, если он имеет наивысший уровень сходства с каким-либо членом этой группы. Таким образом, присоединение определяется наличием связи между объектом и кластером. В результате кластеры оказываются как бы
вложенными: каждый кластер может рассматриваться как элемент другого более широкого кластера на более высоком уровне
сходства.
2. Стратегия дальнего соседа. Расстояние между кластерами определяется наибольшим расстоянием между любыми двумя объектами в различных кластерах: самый далекий элемент
кластера находится ближе к новому объекту, чем самые далекие
элементы других кластеров.
3. Метод средней связи (межгрупповой связи). Мера сход-
ства между объектами и кластером определяется усредненными
значениями. В качестве средних могут быть рассмотрены, например, среднее арифметическое расстояние между всеми парами объектов, медиана и т.п. [9].
6.2. ИНТЕРПРЕТАЦИЯ ДАННЫХ КЛАСТЕРНОГО АНАЛИЗА
Интерпретировать данные кластерного анализа легче всего
с помощью дендограмм – это график по одной оси расположены
номера объектов, по другой – расстояние, при котором эти объекты объединяются в кластеры (рис. 16). Дендограммы могут
иметь как вертикальный, так и горизонтальный вид.
62

Рис. 16. Дендограмма
(ОХ – номера объектов, ОУ – расстояние)
Маленькое расстояние говорит о сходстве между объекта-
ми, большое – о различии.
Выбор числа кластеров является отдельной проблемой
в кластерном анализе. Не существует статистических критериев,
позволяющих выбрать число кластеров, т.е. этапа, на котором
процедуру кластеризации необходимо прекратить. Решение
принимается исследователем, исходя из теоретических соображений. Объединение в группы должно быть осмысленно
и должно иметь содержательное объяснение, почему именно
данные объекты попали в ту или иную группу.
Можно выделить интуитивные способы определения числа
кластеров и формальные, основанные на определенных процедурах. Интуитивный связан с анализом полученных дендрограмм, когда исследователь выделяет хорошо выделяемые кластеры «на глаз». Данная структура связана с субъективными
63

факторами, а также зависит от нужд и представлений исследователей о «правильной» структуре данных.
Другим формализованным способом выбора числа кластеров может быть разрыв расстояния между кластерами. Также
можно обратиться к таблице последовательности агломерации,
которая позволяет проследить динамику увеличения различий
по шагам кластеризации и определить шаг, на котором отмечается резкое возрастание различий. Оптимальному числу классов
соответствует разность между числом объектов и порядковым
номером шага, на котором обнаружен перепад различий [9].
Контрольные вопросы:
1. Каково предназначение процедуры кластерного анализа?
2. Использование какого типа данных возможно в кластер-
ном анализе?
3. В чем основная идея кластерного анализа? На основании
чего происходит классификация данных?
4. Что такое дендрограмма?
Практические задания для самостоятельной работы
по теме «Кластерный анализ»
Задание №1.
Приведены данные опроса 58 испытуемых, страдающих от
бессонницы. Испытуемых спрашивали, сколько часов в сутки
они спят фактически и сколько часов сна им нужно для нормального самочувствия. Проведите кластерный анализ, выделите группы испытуемых с различным соотношением этих двух
показателей. Предложите интерпретацию полученных результатов (приложение 5).
Задание №2. С целью исследования структуры способно-
стей учащихся старших классов школы рассчитывался интегративный показатель знаний по следующим предметам: геометрия, алгебра, русский язык, литература, физика, история, анг-
64

лийский язык, черчение. Результаты оценивались по 15-балльной шкале. Предполагалось, что школьные предметы можно
сгруппировать на основе их усвояемости школьниками, выделив
как минимум две группы: гуманитарные и естественные. Проверьте гипотезы исследования с помощью кластерного анализа
(приложение 7).
65

МАТЕМАТИКО-СТАТИСТИЧЕСКАЯ
ОБРАБОТКА ДАННЫХ
С ПРИМЕНЕНИЕМ КОМПЬЮТЕРНОЙ
ПРОГРАММЫ SPSS
1. Проверка нормальности распределения
Критерии асимметрии и эксцесса. Анализ => описательные
статистики => описательные => нажав параметры, можно выбрать и произвести подсчет стандартного отклонения, асимметрии и эксцесса => нажать продолжить и вернуться в основное
окно => ОК.
Графический способ. Анализ => описательные статистики
=> Графики Р-Р – графики накопленных частот (или Графики
Q-Q – квантильные графики) => ОК.
Критерий нормальности Колмогорова-Смирнова.Анализ =>
непараметрические критерии => устаревшие диалоговые окна
=>одновыборочный Колмогорова–Смирнова. Переносим из левого в правое окно интересующие нас переменные. Нажимаем
ОК.
Если значение Асимпт. знч. меньше или равно 0,05, то распределение существенно отличается от нормального вида. Если
Асимпт. знч. больше 0,05, то существенного отличия от нормальности не обнаружено.
2. Первичные описательные статистики.
Анализ => Описательные статистики => Описательные =>
нажав Параметры, можно выбрать и произвести подсчет среднего арифметического, суммы, стандартного отклонения, дисперсии, размаха, минимума, максимума, стандартной ошибки среднего, асимметрии и эксцесса => нажать Продолжить и вернуться
в основное окно => ОК.
3. Т-критерий Стьюдента.
Анализ => Сравнение средних => Т-критерий для независимых выборок... => в левом подокне выбрать одну или несколько
переменных и с помощью кнопки-указателя переместить их
в подокно Проверяемые переменные => с помощью кнопки-
66

указателя выбрать и переместить в соответствующее подокно
группирующую переменную, в которой на основании значений
программа выделит две сравниваемые группы => ОК.
Критерий Ливиня: программа предполагает вариант проверки по критерию Т-Стьюдента с поправкой на неоднородность
дисперсии. В случае получения достоверного различия дисперсий по критерию Ливиня, рекомендуется воспользоваться непараметрической проверкой различий для независимых выборок
(по критерию Манна-Уитни).
4. Непараметрические критерии.
Критерий Манна-Уитни. Анализ => Непараметрические
критерии => Устаревшие диалоговые окна => для двух независимых выборок => в левом подокне выбрать одну или несколько
переменных и с помощью кнопки-указателя переместить их
в подокно Проверяемые переменные => с помощью кнопкиуказателя выбрать и переместить в соответствующее подокно
группирующую переменную, в которой на основании значений
программа выделит две сравниваемые группы => ОК.
Критерий Уилкоксона. Анализ => Непараметрические критерии => Устаревшие диалоговые окна => для двух связанных
выборок … => ОК.
Критерий Краскала-Уоллеса. Анализ => Непараметрические
критерии=>Устаревшие диалоговые окна => Для К независимых
выборок … => ОК.
Критерий Фридмана. Анализ => Непараметрические критерии=>Устаревшие диалоговые окна => Для К связанных выборок … => ОК.
5. Корреляционный анализ.
Анализ => Корреляции => Парные... =>в подокне слева выбрать две или более переменных, которые необходимо прокоррелировать => с помощью кнопки-указателя переместить выбранные переменные в подокно справа => выбрать метод, с помощью которого будет выявляться корреляционная связь между
переменными => в окне Критерий значимости указать способ
расчета статистической значимости вычисляемых коэффициентов (по умолчанию в программе принят двусторонний способ
67

вычисления достоверности, который является более строгим, но
исследователь по своему желанию сможет изменить его на односторонний.=> для большей наглядности и удобства во время
работы с полученными результатами оставить установленный
по умолчанию флажок Отмечать значимые корреляции => ОК.
6. Факторный анализ.
Анализ => Снижение размерности => Факторный анализ...
=> в левом окне выделить мышкой переменные, которые будут
подвергаться факторному анализу => перенести их в окно Переменные, нажав на кнопку со стрелкой между окошками =>
выбрать параметры работы процедуры ФА => Продолжить =>
ОК.
7. Кластерный анализ.
Анализ => Классификация => Иерархическая кластеризация... => в левом окне выделить мышкой переменные, которые
будут подвергаться кластерному анализу => перенести их в окно
Переменные, нажав на кнопку со стрелкой между окошками =>
выбрать параметры работы процедуры кластерного анализа =>
Продолжить => ОК.
68

ОБЩИЕ ТРЕБОВАНИЯ К ВЫПОЛНЕНИЮ
ПРАКТИЧЕСКИХ ЗАДАНИЙ
ПО «КОМПЬЮТЕРНОЙ ОБРАБОТКЕ
ДАННЫХ В ПСИХОЛОГИИ»
В процессе изучения курса «Компьютерная обработка данных в психологии» каждый студент должен выполнить ряд
практических заданий, для приобретения навыков подбора и использования методов статистической обработки, адекватных
предложенным данным.
В течение изучения дисциплины необходимо выполнить
самостоятельную работу по обработке экспериментальной матрицы, которая представляет собой результаты заполнения нескольких опросников. Далее, по мере прохождения материала,
студенты должны, используя получаемые знания, обработать
эту матрицы с помощью различных статистических методов.
Примером такого рода обработки могут служить проверка нормальности распределения полученных данных, подсчет корреляций между шкалами опросника и т.п. При этом творческая составляющая работы подразумевает, что студенты самостоятельно придумывают и формулируют различные гипотезы, проверяют их с использованием статистических процедур и формулируют выводы на основе получаемых результатов. В процессе
выполнения самостоятельной работы студенты могут пользоваться литературными источниками, советоваться с преподавателем и т.п.
Выполненная работа проверяется преподавателем и может
быть возвращена автору с его замечаниями. При этом проверяются, самостоятельно ли выполнена работа, степень знания
и понимания автором использованных методов статистической
обработки. В случае если работа выполнена некачественно, ее
необходимо переделать.
69

ЛИТЕРАТУРА
1. Агарков Ю.А., Исаева С.Н., Комлев А.А. Математико-
статистическая обработка данных для психологов с применением компьютерной программы SPSS: учеб. пособие; Федеральное
агентство по образованию, ГОУВПО «Тамб. гос. ун-т им.
Г.Р. Державина». Тамбов: Издательский дом ТГУ им. Г.Р. Державина, 2004. 56 с.
2. Большой психологический словарь / под ред. Б.Г. Меще-
рякова, В.П. Зинченко. – М.: Прайм-Еврознак, 2003. – 672 с.
3. Вентцель Е.С., Овчаров Л.А. Теория вероятностей. – М.:
Наука, 1969. – 368 с.
4. Горбатов Д.С. Практикум по психологическому исследо-
ванию: учебное пособие / Д.С. Горбатов. – Самара: Бахрах-М,
2006. – 272 с.
5. Гудвин Д. Исследование в психологии – методы и пла-
нирование / Дж. Гудвин. – СПб.: Питер, 2004. – 558 с.
6. Гусев А. Н., Измайлов Ч.А., Михалевская М.Б. Измерение
в психологии: общий психологический практикум / 2-е изд. – М.:
Смысл, 1998. – 286 с.
7. Гусев А.Н., Уточкин И.С. Психологические измерения:
Теория. Методы: Учеб. пособие для студентов вузов / А.Н. Гусев, И.С. Уточкин. – М.: Аспект Пресс, 2011. – 319 с.
8. Дружинин В.Н. Экспериментальная психология / В.Н. Дружинин. – СПб.: Питер, 2011. – 320 с.
9. Дьячук А.А. Математические методы в психологических
и педагогических исследованиях: учебное пособие; Красноярск:
Красноярский гос. пед. ун-т им. В.П. Астафьева, 2013. – 347 с.
10. Ермолаев О.Ю. Математическая статистика для психологов: Учебник / О.Ю. Ермолаев. – 5-е изд. – М.: НОУ ВПО
«МПСИ»: Флинта, 2011. – 336 с.
11. Калинин С.И. Компьютерная обработка данных для
психологов / Под науч. ред. А.Л. Тулупьева. Изд. 2-е. – СПб.:
«Речь», 2004. – 134 с.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
