Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
сти проверить нулевую гипотезу Н0: r = 0 при альтернативной Н1: r  0
x
j
M
R
R
(двусторонняя критическая область). Если нулевая гипотеза отвергает­ся, то выборочный коэффициент корреляции значимо отличается от но­ля, а X и Y коррелированны. В качестве критерия проверки нулевой ги­потезы Н
: r = 0 принимается случайная величина
0
2
Tr
Н
n
, (1.34)
2
1
r
а критическое значение T
T(, k) находится с помощью калькулятора
кр =
распределения (1.13) вероятности Стьюдента (см. рис. 1.1) по заданному уровню значимости
Гипотеза Н
и числу степеней свободы k = n – 2.
: r = 0 отвергается, т. е. выборочный коэффициент кор-
0
реляции значимо отличается от ноля или иными словами X и Y коррели-
рованны, если
TT .
Н
кр
Если выборки малы или распределения существенно отличаются от нормального закона, то для проверки гипотезы о наличии корреляцион­ной связи можно использовать непараметрический аналог коэффициен­та корреляции
r Пирсона – ранговый коэффициент корреляции R Спир-
мена, вычисляемый аналогично r заменой наблюдаемых значений случайных величин их рангами (порядковыми номерами наблюдаемых значений в объединенной выборке, записанной в порядке возрастания). Значимость коэффициента корреляции R Спирмена проверяется анало­гично значимости коэффициента корреляции r Пирсона.
Аналогично рассматривается регрессия рая лучше всего аппроксимирует массив {
f(x) =
,
y
i
+ 2 x +
1
} в смысле метода наи-
i
меньших квадратов, то есть определяющая коэффициенты
вия
=

[()]
yfxpmin
iii
i
2
, где
вычисляются по формуле (1.33).
y
i
2
x
, кото-
3
из усло-
Таким образом, наряду с прямой линейной регрессии строятся кри­вые полиномиальных регрессий, построенных методом наименьших квадратов и аппроксимированных полиномами порядка М:
( ) ...
Yx b bx bx bx  
01 2
2
.
M
Оценка значимости регрессии (качество уравнения регрессии) про­веряется с помощью F-критерия [6, 33]
k
2
F
Н
1
RkM

2
1
,
M
2
i

()
Yx Y p
1
k
1
i
61
ii
yYp
ii
2
2
k
i
ii
1
Yyp
,
,
имеющего F-распределение (1.14) со степенями свободы M и k – M – 1.
j
Если уравнение регрессии служит для прогнозирования, то для повы­шения надежности рекомендуется добиться путем подбора соответст­вующего уравнения регрессии выполнения соотношения
FН > F
кр = 4F 0,5; M, n – M – 1
.
Степень адекватности регрессионной модели можно оценить, на­пример, скорректированным коэффициентом детерминации
2
11
RR
 
2
kM
1
k
,
1
лежащим в пределах от 0 до 1. Он измеряет качество построенной рег­рессии: чем ближе коэффициент детерминации к 1, тем лучше регрессия «объясняет» зависимость в данных.
1.2.5. Метод канонических корреляций
Метод канонических корреляций [2, 8, 11] предназначен для анали­за корреляционных зависимостей между группами случайных величин двух множеств-векторов {X нонических корреляций также принята нумерация Y объединенного множества {X
{X
, X2, …, Xn} и правое {X
1
, X2, …, Xn} и {Y1, Y2, …, Ym}. В теории ка-
1
и разделение
} на левое
n+m
n+1
, X2, …, Xn, X
1
, X
, …, X
n+2
j = Xn+j
, X
n+1
}, совпадающее с {Y1, Y2, …, Ym}.
n+m
, …, X
n+2
Таким образом, метод канонических корреляций обобщает парный кор­реляционный анализ двух случайных величин и позволяет исследовать зависимость между двумя множествами случайных величин.
По матрице корреляций исходных переменных данный метод ка-
нонических корреляций подсчитывает собственные значения (числа)
2
k
(
1,kK ) и соответствующие собственные векторы A
и B
k = {bkj
, 1,
m }. Эти собственные значения равны доле дисперсии,
k = {aki
, 1,in }
объясняемой корреляцией между соответствующими каноническими
переменными
n
UaX
kkii
1
i
и
VbY
m
kkjj
1
j
, 1,kK , представленны-
ми взвешенными суммами по двум исходным множествам переменных
{X
, X2, …, Xn} и {Y1, Y2, …, Ym}. При проведении анализа вычисляется
1
столько собственных значений, сколько переменных имеется в наи­меньшем множестве (K
min{n, m}).
=
Последовательно вычисляемые собственные значения будут все меньшего и меньшего размера. На первом шаге метод вычисляет собст­венное значение, максимизирующее корреляцию между первой парой взвешенных сумм по двум множествам U
62
и V1. Далее, на каждом шаге,
1
метод находит следующую пару канонических переменных, имеющих
R
j
максимальную корреляцию, и не коррелирующих с предыдущими парами.
Если извлечь квадратный корень из полученных собственных зна­чений, получим набор чисел
проинтерпретировать как коэффициенты корреляции следовательными парами канонических переменных U
(канонических корней), который можно
k
между по-
kk
и Vk. Поэтому
k
их также называют каноническими корреляциями. Как и собственные значения, корреляции между последовательно выделяемыми на каждом шаге каноническими переменными убывают. Коррелированность между множествами переменных характеризуется прежде всего первым (мак­симальным) собственным значением, определяющим наиболее значимо коррелированную первую пару канонических переменных. Однако дру­гие канонические переменные также могут быть значимо коррелирова­ны, и эти корреляции часто допускают достаточно осмысленную интер­претацию. Критерий значимости канонических корреляций сравнительно несложен. Только те корни, которые оказались статисти­чески значимыми, оставляются для последующего анализа. Хотя на са­мом деле вычисления происходят немного иначе. Метод сначала оцени­вает значимость всего набора корней, затем значимость набора, остающегося после удаления
первого корня, второго корня, и т. д.
Исследования показали, что используемый критерий значимости канонических корреляций обнаруживает большие (близкие к 1) значи­мые канонические корреляции даже при небольшом размере выборки (например, n ции (например, R
50). Наоборот, слабые значимые канонические корреля-
=
0,3) требуют больших размеров выборки (n > 200).
=
Отметим, что слабые значимые канонические корреляции обычно не представляют практической ценности, поскольку им соответствует не­большая реальная изменчивость исходных данных. После определения числа значимых канонических корней возникает вопрос об интерпрета-
ции каждого (значимого) корня. Напомним, что каждому корню
(
1,kK ) в действительности соответствует две взвешенные суммы
n
UaX
kkii
1
i
и
VbY
m
kkjj
1
j
, по одной на каждое множество переменных.
k
Одним из способов толкования «смысла» каждого канонического корня является рассмотрение весов {
, 1,in } и {b
ki
, 1,
kj
m }, сопоставлен-
a
ных каждому множеству переменных. Эти веса также называются кано­ническими весами.
По аналогии с множественной регрессией можно применить для канонических весов интерпретацию, использованную для бета-весов в
63
уравнении множественной регрессии. Рассмотрение канонических весов
R
позволяют понять «значение» каждого канонического корня, т. е. уви­деть, как конкретные переменные в каждом множестве влияют на взве­шенную сумму (т. е. каноническую переменную).
Канонические веса также могут использоваться для вычисления значений канонических переменных. Для этого достаточно сложить ис­ходные стандартизированные переменные с соответствующими
весо-
выми коэффициентами.
При анализе обычно пользуются тем, что чем больше приписанный вес (т. е., абсолютное значение веса), тем больше вклад соответствую­щей переменной в значение канонической переменной.
Еще одним способом интерпретации канонических корней является рассмотрение обычных корреляций между каноническими переменны-
R
UX
и
R
VY
Эти корреляции также называются каноническими нагрузками факторов. Считается, что переменные, сильно коррелированные с канонической переменной, имеют с ней много общего. Поэтому при описании смысла канонической переменной следует исходить в основном из реального смысла этих сильно коррелированных переменных. Можно заметить, что если канонические веса соответствуют уникальному (частному) вкладу, вносимому соответствующей переменной
во взвешенную сумму (каноническую переменную), то нагрузки канонических факторов отра­жают полную корреляцию между соответствующей переменной и взве­шенной суммой.
В данном методе подсчитываются также суммарные характеристики канонических корней: извлеченную дисперсию и избыточность. Коэффи­циенты канонической корреляции R
соответствуют корреляции между
k
взвешенными суммами по двум множествам переменных. Они не говорят ничего о том, какую часть изменчивости (дисперсии) каждый канониче­ский корень объясняет в переменных. Однако вы можете сделать заклю­чение о доле объясняемой дисперсии, рассматривая нагрузки канониче-
.
ских факторов
R
UX
и
R
. Напомним, что они представляют собой
VY
корреляции между каноническими и исходными переменными в соответствующем множестве. Если вы возведете эти корреляции в квад­рат, полученные числа будут отражать долю дисперсии, объясняемую ка-
ждой переменной. Для каждого корня
n
значение этих долей:
1
n
i
2
R
для левого множества и
UX
ki
1
вы можете вычислить среднее
k
m
1
m
j
2
для
VY
kj
1
правого множества. При этом получится средняя доля изменчивости,
64
объясненной в этом множестве, на основании соответствующей кано-
R
R
R
R
R
R
x
нической переменной. Другими словами, вы можете вычислить сред­нюю долю дисперсии, извлеченной каждым корнем. Каноническая кор-
реляция при возведении в квадрат
сумм по каждому множеству. Если вы умножите эту долю
2
дает долю дисперсии, общей для
k
2
на сред-
k
нюю долю дисперсии, извлеченной каждым корнем, вы получите по
n
1
каждому корню меру избыточности переменных
m
1
го множества и
22
kVY
m
j
R
для левого множества, т. е. величину, по-
kj
1
22
RR
kUX
n
i
1
для лево-
ki
казывающую, насколько избыточно одно множество переменных, если задано другое множество. Отметим, что вы можете вычислить избыточ­ность первого (левого) множества переменных при заданном втором (правом) множестве и избыточность второго (правого) множества пере­менных при заданном первом (левом) множестве. Поскольку последова­тельно извлекаемые канонические
корни не коррелированы между со­бой, то вы можете просто просуммировать построенные для каждого корня характеристики (извлеченную дисперсию и
избыточности) по
всем корням, получив при этом общий коэффициент (в %) извлеченной
Kn
дисперсии
1

n
ki

11
2
R
для левого множества и
UX
ki
го множества, а также избыточности
Km
ства и
1
m

kj

11
22
VY k
для правого множества.
R
kj
Kn
1

n
ki

11
UX k
Km
1

m

kj
11
22
R
для левого множе-
ki
2
для право-
VY
kj
Метод канонических корреляций является обобщением регресси­онного анализа на случай нескольких откликов (зависимых перемен­ных). Он предназначен для статистического анализа связей между мас­совыми явлениями и процессами. Цель применения метода заключается в нахождении максимальных корреляционных связей между группами двух исходных множеств переменных:
,,
x и 1,,
1
n
yy , mn.
m
В случае линейной зависимости между какими–либо элементами двух групп корреляция достигает максимального значения, равного единице. Поэтому канонический анализ позволяет оценить степень тесноты раз­личных внутригрупповых корреляционных связей, найти максимальные корреляционные связи между группами двух множеств, а так же опре­делить количество малозначительных групп, имеющих между собой
65
наименьшую корреляцию. В связи с малой информативностью послед-
j
ние можно исключить из дальнейшего анализа и тем самым сократить объем данных.
Оформим математические основы метода канонических корреля­ций. Пусть имеются исходные многомерные случайные величины
{X
, X2, …, Xn} = Xт и {Y1, Y2, …, Ym} = Yт (X и Y – транспонированные
1
матрицы-строки, то есть матрицы-столбцы) c нулевыми математиче­скими ожиданиями и объединенной ковариационной матрицей С, на ос­нове которых строятся так называемые канонические случайные вели­чины U и V c нулевыми математическими ожиданиями и единичными
n
дисперсиями в виде линейных комбинаций:
m
VbY
и
j
j
1
YтA, где A
=
т
= {a1
, a2, …, an} и B
т
= {b1
UaX
ii
1
i
=
XтA
, b2, …, bm} являются
неизвестными параметрами. Величины
U и V принято называть канони-
ческими переменными.
Для нахождения канонических переменных составляется блочная выборочная матрица ковариаций вида:
CC

C – выборочная внутригрупповая матрица ковариаций переменных
где
казателей
11
,,
XX ; 22C – выборочная внутригрупповая матрица ковариаций по-
1
n
,,
YY ; 12C (
1
m
ковариаций переменных
C
CC
) – выборочная межгрупповая матрица
21 12
,,
XX
1
объединить данные в одно множество
матрицу
С. Затем, учитывая размерности 11C и 22C , выделить соответст-
11 12

CC
21 22

и
n
,
,,
YY
1
. На практике достаточно
m
,, ,,,
XXYY и построить
11
nm
вующие готовые блоки.
Задача метода заключается в нахождении таких пар
M[U]
1
1
=
=
D[U]
D[V]
M[UV]
=
=
=
M[U
M[V
M[(X
2
] =
2
] =
тA)т(Y т
M[(X
M[(Y
тA)т(X т
тB)т(Y т
B)]
= 0 =
=
A
т
M[V],
A)]
=
B)]
=
M[XY
B
A
т
т
т
]B
M[XX
M[YY
=
A
т
]A
т
]B
т
C
12
U и V, что
т
A
C
C
11
22
A,
B,
=
=
B
т
B max.
По условию задачи, канонические переменные
U и V должны обла-
дать максимальной корреляцией. Данная задача условного экстремума решается с помощью метода неопределенных множителей Лагранжа.
66
Для того чтобы Aт C
j
j
A и
B из условия экстремума соответствующей функции Лагранжа:
B достигало максимума, необходимо определить
12
L
где
, – неизвестные коэффициенты Лагранжа.
=
AтC
B – λ(Aт C
12
A –1)/2 – (Bт C
11
B–1)/2,
22
Находя частные производные от функции Лагранжа по компонен­там векторов A
т
и Bт и приравнивая их нулю, получаем систему, поиск
нетривиального решения которой приводит к соотношению
= λ, =
A
т
C
B
12
и постановке задачи на собственные значения и собственные векторы:
11 2

CCCC E
11 12 22 21
11 2

CCCC E
22 21 11 12

 B
A =
=
0,
0.
Таким образом, задача определения максимальной корреляции ме­жду каноническими переменными сведена к задаче определения собст-
венных значений матриц

CCCC
11 12 22 21
и
11

CCCC
22 21 11 12
и их собственных
11
векторов. Условие нетривиальности решения задачи на собственные векторы (вырожденность соответствующей матрицы) приводит к алгеб-
2
раическому уравнению относительно собственного значения λ вая размерность матриц, получаем K (K
22 2 2
чисел
чению (числу)
  . При этом каждому собственному зна-
12 kK
2
( 1,kK ) соответствуют собственные векторы
k
min{n, m}) собственных
=
. Учиты-
A
k = {aki
щие пары канонических переменных
, 1,in } и B
k = {bkj
, 1,
m }, которые образуют соответствую-
n
UaX
kkii
1
i
и
VbY
m
kkjj
1
j
, пред-
ставленных взвешенными суммами по двум исходным множествам пе­ременных {
Корни из собственных чисел вующими каноническими переменными сти собственных чисел, первая каноническая корреляция
X
, X2, …, Xn} и {Y1, Y2, …, Ym}.
1
равны корреляции между соответст-
k
U
и Vk. С учетом упорядоченно-
k
достигает
1
максимальное значение между соответствующими каноническими пере-
менными
n
UaX
11
1
i
и
ii
m
VbY
11
1
j
. Вторая и последующие канониче-
j
ские корреляции определяются соответствующими линейными комбина­циями, не коррелированными с предыдущими линейными комбинациями и имеющими следующий по величине коэффициент канонические корре­ляции, объясняющий оставшуюся межгрупповую корреляцию.
67
Для проверки значимости найденных канонических переменных
(то есть, отличия от нуля канонических корреляций) используется
2
 –
критерий. Если предположить, что kk (
0, 1kk K
) первых канониче-
ских корреляций не равны нулю, то статистика критерия для проверки гипотезы о том, что остальные равны нулю, имеет вид:
222
        
Hjj
Nkknm
 
11ln1
1

2
kk
j
1
K
  

1
jkk

,
где N – число измерений по каждой переменной объединенного множе­ства
данном уровне значимости
()( )nkkmkk
 . Значимость (kk+1)-ой пары канонических перемен-
ных подтверждается, если
ки
следует проводить до тех пор, пока подтверждается значимость
пар. Из K
,, ,,,
XXYY.
11
nm
Наблюденное значение
. Заметим, что вычисление статисти-
2
H
min{n, m} ненулевых канонических корреляций оставляются
=
2
сравнивают с критическим
H
и числе степеней свободы
22
H кр
2
при за-
кр
для интерпретации только те корни, которые оказались статистически значимыми.
Проведенный анализ позволяет отсеять слабо коррелированные пары канонических переменных. Полученная таким образом компакт­ная, максимально информативная система данных может служить осно­вой для дальнейших исследований, например, при помощи методов факторного анализа.
1.2.6. Метод главных компонент
Метод главных компонент
является обобщением корреляционно-
регрессионного анализа на случай системы многих случайных величин
, X2, …, Xn} =
{X
1
x
, , xjN}, среди которых не все являются линейно независимыми друг
j2
т
X
с наблюдаемыми значениями для компоненты Хj:{xj1,
относительно друга. Если существуют зависимые между собой (корре­лированные) величины, то их можно исключить переходом к новым «главным» и «некоррелированным» переменным величинам
т
} =
U
{
UU
1
,,
m
, mn .
На простейшем примере системы двух случайных величин зависи­мость между переменными можно обнаружить с помощью диаграммы рассеяния. Полученная путем подгонки линия регрессии дает графиче­ское представление зависимости. Если определить новую переменную на основе линии регрессии, изображенной на этой диаграмме, то такая
68
переменная будет включать в себя наиболее существенные черты обеих
j
переменных. Фактически, происходит сокращение числа переменных и замена двух одной. Отметим, что новая переменная (фактор) в действи­тельности является линейной комбинацией двух исходных переменных.
Пример, в котором две коррелированные переменные объединены в один фактор, показывает главную идею анализа главных компонент. Если пример
с двумя переменными распространить на большее число переменных, то вычисления становятся сложнее, однако основной принцип представления двух или более зависимых переменных одним фактором остается в силе. В том случае, когда имеются три коррелиро­ванные переменные, можно построить 3-х мерную диаграмму рассеяния точно так же, как в случае двух переменных плоскую
диаграмму рас­сеяния. Снова можно построить прямую регрессии, но уже в трехмер­ном пространстве. Для случая более трех переменных становится не­возможным представить точки на диаграмме рассеяния, однако логика вращения осей с целью максимизации дисперсии нового фактора оста­ется прежней.
После того, как вы нашли линию, для которой дисперсия макси-
мальна
, вокруг нее остается некоторый разброс данных, на основании которого повторяется процедура выделения направления максимальной остаточной дисперсии. В анализе главных компонент именно так и де­лается: после того, как первый фактор выделен, то есть после того, как первая линия проведена, определяется следующая линия, максимизи­рующая остаточную вариацию (разброс данных вокруг первой
прямой), и т. д. Таким образом, последовательно выделяются факторы, один за другим. Так как каждый последующий фактор определяется так, чтобы максимизировать изменчивость, оставшуюся от предыдущих, то факто­ры оказываются независимыми друг от друга, то есть, некоррелирован­ными или ортогональными. Результатом будет новый факторный набор
переменных (главных компонент U
, 1, ,im ), которые являются некор-
i
релирующими и линейными комбинациями первоначальных перемен­ных Х
, 1,
j
n ( mn ).
В основном процедура выделения главных компонент подобна вращению, максимизирующему дисперсию (варимакс) исходного про­странства переменных. Например, на диаграмме рассеяния можно рас­сматривать прямую регрессии как новую (факторную) ось. Этот тип вращения называется вращением, максимизирующим дисперсию, так как цель вращения заключается в максимизации дисперсии (изменчиво­сти) новой переменной (фактора) и минимизации
разброса вокруг нее.
Новый набор m факторных осей, проходящих через центр облака точек
69
исходного n-мерного пространства, получен в пространстве меньшей
j
размерности (
mn
). Этот метод применяется к данным в векторном
пространстве переменных и наблюдений{x
}, 1, ,
jl
n 1,lN , и находит
прямые линии, которые лучше всего соответствуют облаку N точек на­блюдений в n-мерном векторном пространстве переменных.
Математически вычисление факторов в основном состоит в диа­гонализации симметричной матрицы: матрицы корреляций или кова­риаций, в зависимости от того, нужно ли данные стандартизировать или центрировать относительно средних значений. Геометрически цель состоит в том, чтобы получить набор ортогональных факторных векторов, где каждый вектор образует прямую линию в векторном пространстве исходных переменных. Эти векторы называются осями факторов и в дальнейшем используются для вычисления факторных координат точек наблюдений, что позволяет классифицировать наблю­дения по категориям.
Математические основы метода главных компонент оформим ана­логично методу канонических корреляций (п. 1.2.5.). Пусть имеются ис­ходная многомерная случайная величина ми математическими ожиданиями M[ С,
M[XXт], на основе которой строятся новые случайные величины
=
n
UaX
в виде линейных комбинаций
1
i
X =
X]
0 и ковариационной матрицей
=
=
ii
, X2, …, Xn}т c нулевы-
{X1
XтA c нулевыми математи-
ческими ожиданиями и дисперсиями, достигающими максимальных значений. Здесь
A
= {a1
, a2, …, an} – неизвестные параметры.
т
Задача метода заключается в нахождении таких U, что
M[U] = 0,
D[U] = M[U2] = M[(X
тA)т(Xт
A)]
=
A
т
M[XX т]A
т
A
CA max.
=
По условию задачи, переменная U должна обладать максимальной дисперсией. Чтобы решение задачи было единственным, необходимо наложить дополнительные ограничения, например, ортонормирован­ность вектора коэффициентов
A
А:
т
A
1.
=
Данная задача условного экстремума решается с помощью метода
т
A
неопределенных множителей Лагранжа. Для того чтобы максимума, необходимо определить
A из условия экстремума соответ-
CA достигало
ствующей функции Лагранжа
L
=
A
т
CА – λ(A
т
A–1),
где λнеизвестный коэффициент Лагранжа.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]