- •Вводные замечания
- •1. Начало работы
- •2. Описательные статистики
- •2.1. Проверка наличия «выбросов»
- •2.2. Проверка нормальности распределения
- •2.2.1. Критерии нормальности
- •2.2.2. Визуальная проверка нормальности распределения
- •3.2. Сравнение двух зависимых групп
- •3. Сравнение двух выборок
- •3.1. Сравнение двух независимых групп
- •4. Корреляционный анализ
- •5. Многомерные методы
- •5.1. Анализ главных компонент и эксплораторный факторный анализ
- •5.2. Кластерный анализ
- •5.2.1. Иерархический кластерный анализ
- •5.2.2. Кластерный анализ методом К-средних
- •Список рекомендуемой литературы и интернет-источников
5.Многомерные методы
5.1.Анализ главных компонент и эксплораторный факторный анализ
Эксплораторный факторный анализ (exploratory factor analysis, EFA) и анализ главных компонент (principal component analysis, PCA) позволяют снизить размерность первичных переменных, перейти к более общим категориям. В базовом R есть несколько функций для проведения указанных анализов: factanal(), princomp(), prcomp(), но мы советуем обратиться к пакету "psych", имеющему соответствующие функции с расширенным функционалом. Для примера рассмотрим шкалы «Большой пятерки».
library(psych)
# Определим количество компонент (факторов) по графику «каменистой осыпи» scree(rx = epi.bfi[, 6:10])
35
На диаграмме приведены две линии, одна для анализа главных компонент (PC), другая для факторного анализа (FA), они несколько отличаются. В зависимости от того, какой анализ вы проводите, ориентируйтесь на соответствующую линию.
График «каменистой осыпи» позволяет определить количество компонент (факторов), ориентируясь на собственные значения (eigenvalues) компоненты (фактора). Точки на графике – отдельные компоненты (факторы) (их не может быть больше, чем количество первоначальных переменных), по графику определяем место «перелома», после которого собственные значения изменяются слабо. Некоторый «намек» на такой «перелом» отмечается на 2 и 4 компоненте (факторе), однако в целом график достаточно пологий.
Горизонтальная линия, отходящая от единицы собственного значения, – еще один критерий отбора количества факторов, критерий Кайзера. Ориентируясь на данный критерий, отбирается количество факторов, лежащих выше линии, т.е. единицы собственного значения.
Современным методом определения количества компонент (факторов) является параллельный анализ (parallel analysis), при котором из исходных данных путем ресемплинга, либо симуляции создаются псевдовыборки того же размера, что и оригинальная, результаты накладываются на график «каменистой осыпи» и позволяют оценить оптимальное количество компонент (факторов): на диаграмме ниже следует остановиться на двух главных компонентах, либо на трех факторах.
# Параллельный анализ fa.parallel(x = epi.bfi[, 6:10],
n.iter = 100, # Количество симуляций (ресемплинга)
sim = FALSE) # Не выводить результаты симуляции, а только
ресемплинга
36
## Parallel analysis suggests that the number of factors = 3 and the number of components = 2
# Проведем анализ главных компонент (PCA), количество факторов укажем 2,
вращение - "varimax"
pp <- principal(r = epi.bfi[, 6:10], nfactors = 2, rotate = "varimax") pp
##Principal Components Analysis
##Call: principal(r = epi.bfi[, 6:10], nfactors = 2, rotate = "varimax")
##Standardized loadings (pattern matrix) based upon correlation matrix
## |
RC1 |
RC2 |
h2 |
u2 |
com |
## bfagree |
0.84 |
-0.08 |
0.71 0.29 1.0 |
||
## bfcon |
0.68 |
0.00 |
0.47 |
0.53 |
1.0 |
## bfext |
0.74 |
0.13 |
0.57 |
0.43 |
1.1 |
## bfneur |
-0.07 |
0.94 |
0.88 |
0.12 |
1.0 |
## bfopen |
0.62 |
0.55 |
0.69 |
0.31 |
2.0 |
37
## |
|
|
## |
RC1 |
RC2 |
## SS loadings |
2.11 |
1.21 |
## Proportion Var |
0.42 |
0.24 |
## Cumulative Var |
0.42 |
0.66 |
## Proportion Explained |
0.64 |
0.36 |
## Cumulative Proportion 0.64 1.00 |
||
## |
|
|
## Mean item complexity = |
1.2 |
|
## Test of the hypothesis that 2 components are sufficient. |
||
##
## The root mean square of the residuals (RMSR) is 0.13
## with the empirical chi square 77.53 with prob < 1.3e-18
##
## Fit based upon off diagonal values = 0.84
Некоторые пояснения к полученным результатам: RC1 и RC2 – это выделенные главные компоненты с приведенными нагрузками для каждой переменной; h2 – общность (communalities), т.е. дисперсия переменной, объясняемая компонентой (фактором); u2 – характерность (uniquenesses), т.е. часть дисперсии переменной, не объясняемая компонентой (фактором); SS loadings – собственные значения главных компонент (факторов); Proportion Var – доля объясненной компонентой (фактором) дисперсии; Cumulative Var – совокупная доля объясненной компонентами (факторами) дисперсии.
# График компонент factor.plot(pp)
38
# Компонентная модель fa.diagram(pp)
39
# Эксплораторный факторный анализ (EFA) методом "максимального правдоподобия" ("ml"), oblimin-вращение, количество факторов - 3
ff <- fa(r = epi.bfi[, 6:10], nfactors = 3, rotate = "oblimin", fm = "ml") ff
##Factor Analysis using method = ml
##Call: fa(r = epi.bfi[, 6:10], nfactors = 3, rotate = "oblimin", fm = "ml")
##Standardized loadings (pattern matrix) based upon correlation matrix
## |
ML1 |
ML3 |
ML2 |
h2 |
u2 |
com |
## bfagree |
0.38 |
0.50 |
-0.13 0.60 0.40 2.0 |
|||
## bfcon |
-0.08 |
0.71 |
0.06 |
0.45 |
0.55 |
1.0 |
## bfext |
0.73 |
0.00 |
-0.01 0.53 0.47 1.0 |
|||
## bfneur |
-0.06 -0.02 |
0.61 |
0.36 |
0.64 |
1.0 |
|
## bfopen |
0.47 |
0.12 |
0.44 |
0.60 |
0.40 |
2.1 |
## |
|
|
|
|
|
|
## |
|
|
ML1 |
ML3 |
ML2 |
|
## SS loadings |
|
1.04 0.88 0.61 |
|
|||
|
|
|
|
|
|
40 |
## Proportion Var |
0.21 |
0.18 |
0.12 |
|||
## Cumulative Var |
0.21 |
0.38 |
0.51 |
|||
## Proportion Explained |
0.41 |
0.35 |
0.24 |
|||
## Cumulative Proportion 0.41 |
0.76 1.00 |
|||||
## |
|
|
|
|
|
|
## |
With factor correlations of |
|
||||
## |
ML1 |
ML3 |
ML2 |
|
|
|
## ML1 1.00 0.61 |
0.22 |
|
|
|
||
## ML3 0.61 |
1.00 |
0.13 |
|
|
|
|
## ML2 0.22 |
0.13 |
1.00 |
|
|
|
|
## |
|
|
|
|
|
|
## Mean item complexity = |
1.4 |
|
|
|||
## Test of the hypothesis that 3 factors are sufficient. |
||||||
##
## The degrees of freedom for the null model are 10 and the objective function was 0.93 with Chi Square of 210.62
## The degrees of freedom for the model are -2 and the objective function was
0 |
|
|
|
|
|
|
## |
|
|
|
|
|
|
## The root mean square of the residuals (RMSR) is |
0 |
|
|
|
||
## The df corrected root mean square of the residuals is |
NA |
|
|
|||
## |
|
|
|
|
|
|
## The harmonic number of observations is |
231 with the empirical chi square |
0 |
||||
with prob < |
NA |
|
|
|
|
|
## The total number of observations was |
231 with Likelihood Chi Square = |
0 |
||||
with prob < |
NA |
|
|
|
|
|
## |
|
|
|
|
|
|
## Tucker Lewis Index of factoring reliability = |
1.05 |
|
|
|
||
## Fit based upon off diagonal values = 1 |
|
|
|
|
|
|
## Measures of factor score adequacy |
|
|
|
|
|
|
## |
|
|
ML1 |
ML3 |
ML2 |
|
## Correlation of (regression) scores with factors |
0.85 |
0.82 |
0.73 |
|
||
## Multiple R square of scores with factors |
0.72 |
0.68 |
0.54 |
|
||
## Minimum correlation of possible factor scores |
0.45 |
0.36 |
0.08 |
|
||
|
|
|
|
|
|
|
# Диаграмма эксплораторного факторного анализа fa.diagram(fa.results = ff,
cut = 0.1, # Минимальная демонстрируемая на диаграмме нагрузка digits = 2) # Количество знаков после запятой у выводимых
нагрузок
41
42
