Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
Находя частные производные от функции Лагранжа по компонен-
j
т
там вектора A
и приравнивая их нулю, получаем матричное уравнение
CE
A
=
0.
Последнее равенство определяет задачу на собственные значения (чис­ла) и собственные векторы матрицы ковариаций С. Причем из него сле­дует D[U]
AтC A = λ.
=
Таким образом, задача определения максимальной D[U] сведена к задаче определения максимального собственного значения матрицы С. Последнее означает, что для того, чтобы достичь максимума дисперсии, необходимо найти все собственные числа матрицы ковариаций С и вы­брать максимальное. Условие нетривиальности решения задачи на соб­ственные векторы (вырожденность соответствующей матрицы)
0CE
приводит к алгебраическому уравнению ственного значения λ. Таким образом, получаем
  . При этом каждому собственному значению
12 kn
(числу)
который образует
 ( 1,kn ) соответствует собственный вектор A
k
n
UaX
kkii
1
i
.

n-го порядка относительно соб-
n собственных чисел
k = {aki
, 1,in },
С учетом упорядоченности собственных чисел первое собственное
n
значение
достигает максимальное значение дисперсии
1
UaX
11
ii
1
i
.
Второе и последующие собственные числа
n
вующие линейные комбинации
UaX
kkii
1
i
определяют соответст-
k
, не коррелированные с
предыдущими линейными комбинациями и имеющие следующие по ве­личине дисперсии (
После нахождения всех компонент
D[U
k] = λk
).
U
( 1,kn ) задаемся вопросом,
k
какие из них главные, так как их число существенно меньше исходной размерности матрицы ковариаций:
mn
. Принято, что главные компо-
ненты должны объяснять не менее 80 % суммарной дисперсии признаков:
mn
ii
11
Заметим, что, так как единицы измерения разных исходных (
1,
n ) могут различаться, вместо ковариационной матрицы лучше
4

ii
5
71
.
Х
j
использовать корреляционную. Выкладки будут теми же, только соб­ственные числа и векторы будут уже находиться по корреляционной матрице.
1.2.7. Факторный анализ
Факторный анализ является [13, 20, 24, 26, 37, 38] естественным обобщением и развитием метода главных компонент. Если объект опи­сывается с помощью n признаков (микроэлементов), то в результате действия метода получается математическая модель, зависящая от меньшего ные измеряемые данные {X число латентных (скрытых) признаков (факторов) {
числа переменных. При этом предполагается, что на исход-
, X2, …, Xn} оказывает влияние небольшое
1
,,
UU }, mn.
1
m
Цель факторного анализа заключается в выявлении этих скрытых ха­рактеристик (факторов) и оценивании их числа.
Главными целями факторного анализа являются:
сокращение числа переменных (редукция данных),
1)
определение структуры взаимосвязей между переменными, т. е.
2)
классификация переменных.
Поэтому факторный анализ используется или как метод сокраще­ния данных или как метод классификации. Ниже описываются принци­пы факторного анализа и способы его применения для достижения этих двух целей.
Факторный анализ как метод редукции данных основан на ис-
пользовании зависимости между переменными: вводится новая пере­менная на основе регрессии, то есть включающая в себя наиболее суще­ственные черты исходных переменных, так что ее использование (замена нескольких старых коррелированных переменных одной новой) приводит к сокращению число переменных. При этом новый фактор (переменная) представляется линейной
комбинацией исходных пере­менных. Принцип представления двух или более зависимых перемен­ных одним фактором демонстрирует главную идею факторного анализа или, более точно, анализа главных компонент. После выделения первого фактора, то есть построения первой линии регрессии, для которой дис­персия максимальна, определяется следующая линия, максимизирую­щая остаточную вариацию (разброс данных вокруг первой
прямой), то есть выделяется второй фактор, и т. д. Факторы выделяются один за другим так, чтобы максимизировать изменчивость, оставшуюся от пре­дыдущих, то есть оказываются независимыми друг от друга. Другими словами, некоррелированными или
ортогональными. Отметим, что
в процессе последовательного выделения факторов они включают в се­бя все меньше и меньше изменчивости. Решение о том, когда следует
72
остановить процедуру выделения факторов, главным образом зависит от точки зрения на то, что считать малой «случайной» изменчивостью. Это решение достаточно произвольно, однако имеются некоторые об­щие рекомендации, позволяющие рационально выбрать число факторов: критерий накопленной или кумулятивной дисперсии, критерий Кайзера, критерий каменистой осыпи, содержательная интерпретация получен­ного решения. Поэтому обычно исследуется несколько
решений с большим или меньшим числом факторов (факторных моделей), и за­тем выбирается одно наиболее «осмысленное».
Факторный анализ как метод классификации основан на оцен­ках корреляций (факторных нагрузок) между исходными переменными и факторами (или «новыми» переменными) в рамках выбранной фак­торной модели и позволяет узнать значимость факторов, то есть можно ли интерпретировать их разумным образом и как это сделать. Фактор­ные нагрузки можно изобразить в виде диаграммы рассеяния, на кото­рой каждая исходная переменная представлена точкой в координатах «факторные нагрузки». Можно повернуть оси в любом направлении без изменения относительного положения точек; однако действительные координаты точек, то есть факторные нагрузки, должны,
без сомнения, меняться. Одним из типичных методов вращения является варимакс, описанный выше. Целью вращения является получение понятной (ин­терпретируемой) матрицы нагрузок, то есть факторов, которые ясно от­мечены высокими нагрузками для некоторых переменных и низкими – для других, что и позволяет провести классификацию переменных.
Дополнительным способом проверки числа выделенных факторов
является вычисление
воспроизведенной корреляционной матрицы, кото­рая близка исходной, если факторы выделены правильно. Как следст­вие, можно вычислить разность между ними. Полученная матрица на­зывается матрицей остаточных корреляций. Остаточная матрица может указать на «несогласие», то есть на то, что рассматриваемые ко­эффициенты корреляции не могут быть получены с достаточной точно­стью на
основе имеющихся факторов.
Факторный анализ, как раздел многомерного статистического ана­лиза, объединяет математико-статистические методы решения задач, связанных с построением линейной модели:
X =
где X
= {X1
, X2, …, Xn}т – исходная наблюдаемая n-мерная случайная ве-
AU +, (1.35)
личина c нулевыми математическими ожиданиями M[X] ционной матрицей С,
M[XX т]; A = (a
=
) – неизвестная (nm)-матрица
ij
нагрузок общих факторов на наблюдаемые величины; U
73
0 и корреля-
=
{
,,
UU }т
=
1
m
ненаблюдаемая многомерная случайная величина общих факторов c ну-
левыми математическими ожиданиями M[U]
т
] =
ционной матрицей M[UU
величина ошибок c M[] вариационной (D[
2
 ) матрицей Ψ
i] =
i
Е;
0, M[U
=
, 2, …,
= {1
т
] = 0 и неизвестной диагональной ко-
M[
=
0 и единичной корреля-
=
}т – n-мерная случайная
n
т
].
Из модели факторного анализа следует фундаментальное соотно­шение факторной структуры:
M[XUт] =
Таким образом, M[XU и U
равна матрице нагрузок общих факторов A = (aij).
j
M[(AU +)U
т
] – матрица коэффициентов корреляций между Xi
т
] = AM[UU
т
] + M[U
т
] = AЕ+0 = A.
Из модели факторного анализа также следует, что
С = M[XXт] =
M[(AU +)(AU +)
т
] = AM[UUт] A
т
+M[
т
] = AAт+ Ψ,
то есть, корреляции c заны с факторными нагрузками а
между исходными случайными величинами свя-
ij
и дисперсиями ошибок
ij
2
с помощью
i
соотношений:
22
ha
где
iil
mm
caa ca h


ij il jl ii il i i i
ll

11
m
,1
называется общностью исходной случайной величины Xi
1
l
2222
, (1.36)
и определяется суммой квадратов факторных нагрузок, то есть вкладом всех m общих факторов в дисперсию величины X
. В результате можно
i
сформулировать так называемую фундаментальную теорему факторно­го анализа:
AA
где С
называется редуцированной корреляционной матрицей, отли-
h
т
=
, (1.36)
Сh
чающейся от С тем, что на ее главной диагонали стоят не единицы, а
2
общности
h .
i
Факторный анализ в современном математическом обеспечении представлен разными методами (главных факторов, центроидным, мак­симального правдоподобия, минимальных остатков), дающими сопос­тавимые результаты.
Проведем дальнейшее рассмотрение в рамках метода главных факторов, под которым понимают приложение метода главных ком­понент к редуцированной корреляционной матрице С
в случае ли-
h
нейной модели:
X
AU или
=
XaUinmn
iijj
m
j
1
1, ;

, (1.35)
74
где X = {X1, X2, …, Xn}т c M[X] = 0 и корреляционной матрицей Сh.
Представим матрицу нагрузок общих факторов в виде
A
где
k = {a1k
, a2k,…, ank}т – k-ый столбец матрицы факторных нагрузок A.
= (aij) = {1
, 2, …, k, …,
m
},
С другой стороны,
A
где
k = {ak1
, ak2,…, akm} – k-ая строка матрицы A. Тогда линейную мо-
= (aij) = {1
, 2, …, k, …,
}т,
n
дель (1.35) можно представить в виде:
X
k = k
Согласно методу главных компонент, общий фактор U
U
1,kn . (1.35)
должен вносить
k
максимальный вклад в суммарную общность:
n
l
2
a
lk
1
при условии (1.36), выраженном через
где с
ij = сji
и с
ii =
2
h .
i
caa
ij il jl
= k
m
1
l
т
max
k
= i j
:
k
т
, (1.36)
Данная задача условного экстремума решается с помощью метода неопределенных множителей Лагранжа:
n
,1
ij
(i 
ij
т
сij),
j
L
= k
т
k
где μ
ij = μji
– множители Лагранжа.
Находя частные производные от функции Лагранжа по компонен-
там вектора
т
и приравнивая их нулю, получаем систему n линейных
k
однородных алгебраических уравнений, которую с учетом обозначения
n
l
2
a
lk
1
= k
т
k =
k
после ряда алгебраических преобразований удается представить незави­симо от k в матричной форме:
CE
hk
k =
0.
Последнее равенство определяет задачу на собственные значения
(числа)
и собственные векторы
матрицы С
k
.
h
редуцированной корреляционной
k
Условие нетривиальности решения задачи на собственные векторы (вырожденность соответствующей матрицы)
75
0
A
A
CE

hk
приводит к алгебраическому уравнению ственного значения. Таким образом, получаем
венных чисел
му значению
  . При этом каждому собственно-
12 kn
(числу)
 ( 1,kn ) соответствует собственный вектор
k
n-го порядка относительно соб-
n упорядоченных собст-
k
k-ый столбец матрицы факторных нагрузок A, соответствующий факто-
ру
U
, то есть столбец коэффициентов при факторе U
k
в (1.35). С учетом
k
упорядоченности собственных чисел и нормировки соответствующих собственных векторов (
k
k =
) удается ранжировать факторы по их
k
т
вкладу в суммарную общность.
На основе наблюдаемой величины грузок общих факторов
A возможно получить оценки общих факторов
U. Например, в рамках метода главных компонент (m
будет квадратной и разрешение матричного уравнения (1.35 тельно вует
U =
U не вызывает затруднений, если ранг A равен n, то есть сущест-
–1
A
обратная к A матрица:
A–1X.
В рамках метода главных факторов (
X и рассчитанной матрицы на-
n) матрицы A
=
) относи-
mn
) прямоугольная матрица
A не имеет обратной, и процедура оценки U усложняется:
U
=
тA)–1Aт
(A
X,
где матрица
AтA уже является квадратной порядка m.
По полученным оценкам U можно судить о каждом объекте на­блюдения по
m общим факторам.
Для проверки значимости построенной модели факторного анализа можно воспользоваться критерием Бартлетта по проверке нулевой гипо-
Н
тезы
о том, что m общих факторов достаточно для объяснения выбо-
0
рочных коэффициентов корреляции. Наблюденное статистическое зна­чение критерия вычисляют по формуле
T
252
n

2

Nm
H
 
63
ln
A
,
C
где Nчисло наблюдений (объектов исследования),
T
A определитель воспроизведенной моделью матрицы корреляций,
C – определитель исходной корреляционной матрицы.
При заданном уровне значимости Н
2
определяется с помощью калькулятора распределения вероятно-
где
кр
отвергают, если
0
>
2
H
2
кр
,
76
сти (см. рис. 1.11) по закону
M
так, чтобы
22
()
P  . Это значит, что m общих факторов недоста-
кр
H
2
с
nm nm
=
2

2
степенями свободы
точно и следует выделить хотя бы
m+1 фактор. После этого процедура
проверки повторяется.
Далее на основе результатов факторного анализа, можно провести, например, классификацию объектов наблюдений по общим факторам, число которых значительно меньше числа исходных показателей.
1.2.8. Кластерный анализ
Кластерный анализ [12, 17, 20, 24, 26, 38] – это статистический ана­лиз, позволяющий получить разбиение большого объема данных на классы или группы (от англ.
cluster – класс) согласно некоторому
критерию или их совокупности.
,,
Для проведения классификации данных
XX используют по-
1
n
нятие метрики или расстояния.
Метрикой называется функция :
, отображающая некото-
рое метрическое пространство в пространство действительных чисел и обладающая следующими свойствами (аксиомами метрики):
1)
2)
(,) 0,XY
(,) (,)XY YX,
3)
4)
(,) 0XYXY , (,) (,) (,)XY XZ ZY.
В теории кластерного анализа используются следующие метрики для измерения расстояния между отдельными точками (векторами):
1) евклидово расстояние
ij i j
2()() () ()2
(, ) ( )
XX X X

m
k
kk
1
;
2) взвешенное евклидово расстояние
ij i j
где
w – веса, пропорциональные важности признака в задаче класси-
k
2()() () ()2
(, ) ( )
XX wX X

m
kk k
k
1
,
фикации. Веса задают после проведения дополнительных исследований
m
1
w
и полагают, что
k
1
;
k
3) хеммингово расстояние (или city-block) – расстояние по карте меж-
ду кварталами в городе
77
ij i j


() ( ) () ( )
(, )
XX X X

m
k
kk
1
;
4) расстояние Махаланобиса (или угол Махаланобиса)
2()() () ()TT1 () ()
где
 – симметричная положительно определенная матрица весовых
,
ij ij ij
(, )( ) ( )
XX X X A X X
коэффициентов (часто выбирается диагональной);
,,
ций векторов
XX ;
1
n
Аматрица ковариа-
5) расстояние Минковского
() ( ) () ( )
pi j i j
(, )
XX X X

m
k
kk
1
p
.
Расстояния 1), 2), 3) или 5) используют в случае нормального рас­пределения независимых случайных величин
,, ~(,)
XXNMA
1
n
или в
случае их однородности по геохимическому смыслу, когда каждый век­тор одинаково важен для классификации. Расстояние 4) используют в случае наличия ковариационной связи векторов
,,
XX
1
.
n
Выбор метрики осуществляется исследователем в зависимости от то­го, какой результат он хочет получить. Этот выбор неформализуем, так как зависит от многих факторов, в частности от ожидаемого результата, от опыта исследователя, уровня его математической подготовки и т. д.
В ряде алгоритмов наряду с расстояниями между векторами исполь­зуются расстояниями между
Пусть
()i
X выборочное среднее по точкам, попадающим в кластер iS , или
S – i-ый кластер, состоящий из in векторов или точек. Пусть
i
кластерами и объединениями кластеров.
центр тяжести кластера
. Тогда различают следующие расстояния
S
i
между кластерами, не имеющими внутри других кластеров:
расстояние между кластерами по принципу «ближнего соседа»
1)
() ( )
2)
расстояние между кластерами по принципу «дальнего соседа»
3)
расстояние между центрами тяжести групп
(, ) ( , )
SS X X
 ;
ij
(, ) ( , )
SS X X
 ;
ij
(, ) ( , )
SS X X ;
min
max
ij
XS
si
XS
kj
XS
si
XS
kj
78
sk
sk
sk
4) расстояние между кластерами по принципу «средней связи»
s

(, ) ( , )
SS X X
5)
обобщенное расстояние по Колмогорову

ij
nn

sk
ij
XSX S


ij
1
1
(, ) ( , )
SS X X

ij
nn
ij

sk
XSX S


ij
p
 
 
k
;
sk
1/
 
p
.
Расстояние между кластерами, являющимися объединением других классов, можно вычислить по общей формуле:
(, ) (, ) (,) ( ,) (, ) (,)
SS SS SS S S SS SS,
iikilklikil
kl
,

где
кластер, полученный объединением классов
S
,kl

S и lS .
k
Все частные случаи расстояний получаются из этой обобщенной формулы. При
ципу «ближнего соседа», при
n
при

k
,
nn
kl

1/2 , 1 / 2
n
l
nn
kl
 , 0 имеем расстояние по прин-
, 0,
0 – расстояние по центрам тяже-

1/2
0
,
– «дальнего соседа»,
сти групп.
Методы кластерного анализа подразделяются на I) агломеративные (объединяющие), II) дивизимные (разделяющие) и III) итеративные.
Первые последовательно объединяют отдельные объекты в класте­ры, вторые, наоборот, расчленяют кластеры на объекты. Третьи объеди­няют первые два. Их особенностью является формирование кластеров, исходя из условий разбиения (так называемых параметров), которые могут
быть изменены в процессе работы алгоритма для улучшения ка­чества разбиения. Итеративные методы обычно используются для клас­сификации больших объемов информации.
Рассмотрим подробнее агломеративные методы.
Агломеративные
методы являются наиболее простыми и распространенными среди алго­ритмов кластерного анализа. На первом шаге каждый вектор или объект
,,
XX
1
исходных данных рассматривается как отдельный кластер или
n
класс. По вычисленной матрице расстояний выбираются наиболее близ­кие друг к другу и объединяются. Очевидно, что процесс завершится через (
n – 1) шаг, когда в результате все объекты будут объединены
в один кластер.
Последовательность объединений можно представить в виде денд­рограммы, или дерева. На рис. 1.18 показано, что на первом шаге были объединены векторы
,XX, так как расстояние между ними 0,3.
12
79
На втором шаге к ним был присоединен вектор
стера
,XX на расстояние 0,5, и т. д. На последнем шаге объединя-
12
X , отстоящий от кла-
3
ются все векторы в один кластер.
Рис. 1.18. Дендограмма
К агломеративным относят методы одиночной, средней, полной связи и метод Уорда.
Метод одиночной связи. Пусть
1.
,,
XX
1
векторные данные,
n
причем каждый вектор образует один кластер. Сначала вычисляется матрица расстояний между этими кластерами, причем в качестве метри­ки используется расстояние по принципу ближнего соседа. С помощью этой матрицы выбирают два наиболее близких вектора, которые и обра­зуют первый кластер
S . На следующем шаге между 1S и оставшимися
1
векторами (которые мы считаем кластерами) вычисляется новая матри­ца расстояний, причем в качестве метрики используется расстояние ме-
1/2
жду кластерами, объединенными в классы (
 , 1/ 2 ,
0 ). Ближайший к полученному ранее классу
ся с ним, образуя
. И т. д. Через n–1 шагов получаем, что все векторы
S
2
S кластер объединяет-
1
объединены в один кластер.
Достоинства: 1) на каждом шаге алгоритма добавляется только
один элемент, 2) метод чрезвычайно прост, 3) алгоритм нечувствителен к преобразованиям исходных данных (вращению, сдвигу, переносу, рас­тяжению).
Недостатки: 1) необходимо постоянно пересчитывать матрицу
расстояний, 2) число кластеров заранее известно и не может быть уменьшено
2.
Метод полной связи. Метод практически повторяет метод
одиночной связи за исключением того, что включение нового объекта в кластер происходит тогда и только тогда, когда расстояние между объ­ектами (векторами или кластерами) меньше некоторого наперед задан-
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]