Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие
.pdf
сти проверить нулевую гипотезу Н0: r = 0 при альтернативной Н1: r 0
x
j
M
R
R
(двусторонняя критическая область). Если нулевая гипотеза отвергается, то выборочный коэффициент корреляции значимо отличается от ноля, а X и Y коррелированны. В качестве критерия проверки нулевой гипотезы Н
: r = 0 принимается случайная величина
0
2
Tr
Н
n
, (1.34)
2
1
r
а критическое значение T
T(, k) находится с помощью калькулятора
кр =
распределения (1.13) вероятности Стьюдента (см. рис. 1.1) по заданному
уровню значимости
Гипотеза Н
и числу степеней свободы k = n – 2.
: r = 0 отвергается, т. е. выборочный коэффициент кор-
0
реляции значимо отличается от ноля или иными словами X и Y коррели-
рованны, если
TT .
Н
кр
Если выборки малы или распределения существенно отличаются от
нормального закона, то для проверки гипотезы о наличии корреляционной связи можно использовать непараметрический аналог коэффициента корреляции
r Пирсона – ранговый коэффициент корреляции R Спир-
мена, вычисляемый аналогично r заменой наблюдаемых значений
случайных величин их рангами (порядковыми номерами наблюдаемых
значений в объединенной выборке, записанной в порядке возрастания).
Значимость коэффициента корреляции R Спирмена проверяется аналогично значимости коэффициента корреляции r Пирсона.
Аналогично рассматривается регрессия
рая лучше всего аппроксимирует массив {
f(x) =
,
y
i
+ 2 x +
1
} в смысле метода наи-
i
меньших квадратов, то есть определяющая коэффициенты
вия
=
[()]
yfxpmin
iii
i
2
, где
вычисляются по формуле (1.33).
y
i
2
x
, кото-
3
из усло-
Таким образом, наряду с прямой линейной регрессии строятся кривые полиномиальных регрессий, построенных методом наименьших
квадратов и аппроксимированных полиномами порядка М:
( ) ...
Yx b bx bx bx
01 2
2
.
M
Оценка значимости регрессии (качество уравнения регрессии) проверяется с помощью F-критерия [6, 33]
k
2
F
Н
1
RkM
2
1
,
M
2
i
()
Yx Y p
1
k
1
i
61
ii
yYp
ii
2
2
k
i
ii
1
Yyp
,
,

имеющего F-распределение (1.14) со степенями свободы M и k – M – 1.
j
Если уравнение регрессии служит для прогнозирования, то для повышения надежности рекомендуется добиться путем подбора соответствующего уравнения регрессии выполнения соотношения
FН > F
кр = 4F 0,5; M, n – M – 1
.
Степень адекватности регрессионной модели можно оценить, например, скорректированным коэффициентом детерминации
2
11
RR
2
kM
1
k
,
1
лежащим в пределах от 0 до 1. Он измеряет качество построенной регрессии: чем ближе коэффициент детерминации к 1, тем лучше регрессия
«объясняет» зависимость в данных.
1.2.5. Метод канонических корреляций
Метод канонических корреляций [2, 8, 11] предназначен для анализа корреляционных зависимостей между группами случайных величин
двух множеств-векторов {X
нонических корреляций также принята нумерация Y
объединенного множества {X
{X
, X2, …, Xn} и правое {X
1
, X2, …, Xn} и {Y1, Y2, …, Ym}. В теории ка-
1
и разделение
} на левое
n+m
n+1
, X2, …, Xn, X
1
, X
, …, X
n+2
j = Xn+j
, X
n+1
}, совпадающее с {Y1, Y2, …, Ym}.
n+m
, …, X
n+2
Таким образом, метод канонических корреляций обобщает парный корреляционный анализ двух случайных величин и позволяет исследовать
зависимость между двумя множествами случайных величин.
По матрице корреляций исходных переменных данный метод ка-
нонических корреляций подсчитывает собственные значения (числа)
2
k
(
1,kK ) и соответствующие собственные векторы A
и B
k = {bkj
, 1,
m }. Эти собственные значения равны доле дисперсии,
k = {aki
, 1,in }
объясняемой корреляцией между соответствующими каноническими
переменными
n
UaX
kkii
1
i
и
VbY
m
kkjj
1
j
, 1,kK , представленны-
ми взвешенными суммами по двум исходным множествам переменных
{X
, X2, …, Xn} и {Y1, Y2, …, Ym}. При проведении анализа вычисляется
1
столько собственных значений, сколько переменных имеется в наименьшем множестве (K
min{n, m}).
=
Последовательно вычисляемые собственные значения будут все
меньшего и меньшего размера. На первом шаге метод вычисляет собственное значение, максимизирующее корреляцию между первой парой
взвешенных сумм по двум множествам U
62
и V1. Далее, на каждом шаге,
1

метод находит следующую пару канонических переменных, имеющих
R
j
максимальную корреляцию, и не коррелирующих с предыдущими парами.
Если извлечь квадратный корень из полученных собственных значений, получим набор чисел
проинтерпретировать как коэффициенты корреляции
следовательными парами канонических переменных U
(канонических корней), который можно
k
между по-
kk
и Vk. Поэтому
k
их также называют каноническими корреляциями. Как и собственные
значения, корреляции между последовательно выделяемыми на каждом
шаге каноническими переменными убывают. Коррелированность между
множествами переменных характеризуется прежде всего первым (максимальным) собственным значением, определяющим наиболее значимо
коррелированную первую пару канонических переменных. Однако другие канонические переменные также могут быть значимо коррелированы, и эти корреляции часто допускают достаточно осмысленную интерпретацию. Критерий значимости канонических корреляций
сравнительно несложен. Только те корни, которые оказались статистически значимыми, оставляются для последующего анализа. Хотя на самом деле вычисления происходят немного иначе. Метод сначала оценивает значимость всего набора корней, затем значимость набора,
остающегося после удаления
первого корня, второго корня, и т. д.
Исследования показали, что используемый критерий значимости
канонических корреляций обнаруживает большие (близкие к 1) значимые канонические корреляции даже при небольшом размере выборки
(например, n
ции (например, R
50). Наоборот, слабые значимые канонические корреля-
=
0,3) требуют больших размеров выборки (n > 200).
=
Отметим, что слабые значимые канонические корреляции обычно не
представляют практической ценности, поскольку им соответствует небольшая реальная изменчивость исходных данных. После определения
числа значимых канонических корней возникает вопрос об интерпрета-
ции каждого (значимого) корня. Напомним, что каждому корню
(
1,kK ) в действительности соответствует две взвешенные суммы
n
UaX
kkii
1
i
и
VbY
m
kkjj
1
j
, по одной на каждое множество переменных.
k
Одним из способов толкования «смысла» каждого канонического корня
является рассмотрение весов {
, 1,in } и {b
ki
, 1,
kj
m }, сопоставлен-
a
ных каждому множеству переменных. Эти веса также называются каноническими весами.
По аналогии с множественной регрессией можно применить для
канонических весов интерпретацию, использованную для бета-весов в
63

уравнении множественной регрессии. Рассмотрение канонических весов
R
позволяют понять «значение» каждого канонического корня, т. е. увидеть, как конкретные переменные в каждом множестве влияют на взвешенную сумму (т. е. каноническую переменную).
Канонические веса также могут использоваться для вычисления
значений канонических переменных. Для этого достаточно сложить исходные стандартизированные переменные с соответствующими
весо-
выми коэффициентами.
При анализе обычно пользуются тем, что чем больше приписанный
вес (т. е., абсолютное значение веса), тем больше вклад соответствующей переменной в значение канонической переменной.
Еще одним способом интерпретации канонических корней является
рассмотрение обычных корреляций между каноническими переменны-
R
UX
и
R
VY
Эти корреляции также называются каноническими нагрузками факторов.
Считается, что переменные, сильно коррелированные с канонической
переменной, имеют с ней много общего. Поэтому при описании смысла
канонической переменной следует исходить в основном из реального
смысла этих сильно коррелированных переменных. Можно заметить,
что если канонические веса соответствуют уникальному (частному)
вкладу, вносимому соответствующей переменной
во взвешенную сумму
(каноническую переменную), то нагрузки канонических факторов отражают полную корреляцию между соответствующей переменной и взвешенной суммой.
В данном методе подсчитываются также суммарные характеристики
канонических корней: извлеченную дисперсию и избыточность. Коэффициенты канонической корреляции R
соответствуют корреляции между
k
взвешенными суммами по двум множествам переменных. Они не говорят
ничего о том, какую часть изменчивости (дисперсии) каждый канонический корень объясняет в переменных. Однако вы можете сделать заключение о доле объясняемой дисперсии, рассматривая нагрузки канониче-
.
ских факторов
R
UX
и
R
. Напомним, что они представляют собой
VY
корреляции между каноническими и исходными переменными
в соответствующем множестве. Если вы возведете эти корреляции в квадрат, полученные числа будут отражать долю дисперсии, объясняемую ка-
ждой переменной. Для каждого корня
n
значение этих долей:
1
n
i
2
R
– для левого множества и
UX
ki
1
вы можете вычислить среднее
k
m
1
m
j
2
– для
VY
kj
1
правого множества. При этом получится средняя доля изменчивости,
64

объясненной в этом множестве, на основании соответствующей кано-
R
R
R
R
R
R
x
нической переменной. Другими словами, вы можете вычислить среднюю долю дисперсии, извлеченной каждым корнем. Каноническая кор-
реляция при возведении в квадрат
сумм по каждому множеству. Если вы умножите эту долю
2
дает долю дисперсии, общей для
k
2
на сред-
k
нюю долю дисперсии, извлеченной каждым корнем, вы получите по
n
1
каждому корню меру избыточности переменных
m
1
го множества и
22
kVY
m
j
R
для левого множества, т. е. величину, по-
kj
1
22
RR
kUX
n
i
1
для лево-
ki
казывающую, насколько избыточно одно множество переменных, если
задано другое множество. Отметим, что вы можете вычислить избыточность первого (левого) множества переменных при заданном втором
(правом) множестве и избыточность второго (правого) множества переменных при заданном первом (левом) множестве. Поскольку последовательно извлекаемые канонические
корни не коррелированы между собой, то вы можете просто просуммировать построенные для каждого
корня характеристики (извлеченную дисперсию и
избыточности) по
всем корням, получив при этом общий коэффициент (в %) извлеченной
Kn
дисперсии
1
n
ki
11
2
R
для левого множества и
UX
ki
го множества, а также избыточности
Km
ства и
1
m
kj
11
22
VY k
для правого множества.
R
kj
Kn
1
n
ki
11
UX k
Km
1
m
kj
11
22
R
для левого множе-
ki
2
для право-
VY
kj
Метод канонических корреляций является обобщением регрессионного анализа на случай нескольких откликов (зависимых переменных). Он предназначен для статистического анализа связей между массовыми явлениями и процессами. Цель применения метода заключается
в нахождении максимальных корреляционных связей между группами
двух исходных множеств переменных:
,,
x и 1,,
1
n
yy , mn.
m
В случае линейной зависимости между какими–либо элементами двух
групп корреляция достигает максимального значения, равного единице.
Поэтому канонический анализ позволяет оценить степень тесноты различных внутригрупповых корреляционных связей, найти максимальные
корреляционные связи между группами двух множеств, а так же определить количество малозначительных групп, имеющих между собой
65

наименьшую корреляцию. В связи с малой информативностью послед-
j
ние можно исключить из дальнейшего анализа и тем самым сократить
объем данных.
Оформим математические основы метода канонических корреляций. Пусть имеются исходные многомерные случайные величины
{X
, X2, …, Xn} = Xт и {Y1, Y2, …, Ym} = Yт (X и Y – транспонированные
1
матрицы-строки, то есть матрицы-столбцы) c нулевыми математическими ожиданиями и объединенной ковариационной матрицей С, на основе которых строятся так называемые канонические случайные величины U и V c нулевыми математическими ожиданиями и единичными
n
дисперсиями в виде линейных комбинаций:
m
VbY
и
j
j
1
YтA, где A
=
т
= {a1
, a2, …, an} и B
т
= {b1
UaX
ii
1
i
=
XтA
, b2, …, bm} являются
неизвестными параметрами. Величины
U и V принято называть канони-
ческими переменными.
Для нахождения канонических переменных составляется блочная
выборочная матрица ковариаций вида:
CC
C – выборочная внутригрупповая матрица ковариаций переменных
где
казателей
11
,,
XX ; 22C – выборочная внутригрупповая матрица ковариаций по-
1
n
,,
YY ; 12C (
1
m
ковариаций переменных
C
CC
) – выборочная межгрупповая матрица
21 12
,,
XX
1
объединить данные в одно множество
матрицу
С. Затем, учитывая размерности 11C и 22C , выделить соответст-
11 12
CC
21 22
и
n
,
,,
YY
1
. На практике достаточно
m
,, ,,,
XXYY и построить
11
nm
вующие готовые блоки.
Задача метода заключается в нахождении таких пар
M[U]
1
1
=
=
D[U]
D[V]
M[UV]
=
=
=
M[U
M[V
M[(X
2
] =
2
] =
тA)т(Y т
M[(X
M[(Y
тA)т(X т
тB)т(Y т
B)]
= 0 =
=
A
т
M[V],
A)]
=
B)]
=
M[XY
B
A
т
т
т
]B
M[XX
M[YY
=
A
т
]A
т
]B
т
C
12
U и V, что
т
A
C
C
11
22
A,
B,
=
=
B
т
B → max.
По условию задачи, канонические переменные
U и V должны обла-
дать максимальной корреляцией. Данная задача условного экстремума
решается с помощью метода неопределенных множителей Лагранжа.
66

Для того чтобы Aт C
j
j
A и
B из условия экстремума соответствующей функции Лагранжа:
B достигало максимума, необходимо определить
12
L
где
, – неизвестные коэффициенты Лагранжа.
=
AтC
B – λ(Aт C
12
A –1)/2 – (Bт C
11
B–1)/2,
22
Находя частные производные от функции Лагранжа по компонентам векторов A
т
и Bт и приравнивая их нулю, получаем систему, поиск
нетривиального решения которой приводит к соотношению
= λ, =
A
т
C
B
12
и постановке задачи на собственные значения и собственные векторы:
11 2
CCCC E
11 12 22 21
11 2
CCCC E
22 21 11 12
B
A =
=
0,
0.
Таким образом, задача определения максимальной корреляции между каноническими переменными сведена к задаче определения собст-
венных значений матриц
CCCC
11 12 22 21
и
11
CCCC
22 21 11 12
и их собственных
11
векторов. Условие нетривиальности решения задачи на собственные
векторы (вырожденность соответствующей матрицы) приводит к алгеб-
2
раическому уравнению относительно собственного значения λ
вая размерность матриц, получаем K (K
22 2 2
чисел
чению (числу)
. При этом каждому собственному зна-
12 kK
2
( 1,kK ) соответствуют собственные векторы
k
min{n, m}) собственных
=
. Учиты-
A
k = {aki
щие пары канонических переменных
, 1,in } и B
k = {bkj
, 1,
m }, которые образуют соответствую-
n
UaX
kkii
1
i
и
VbY
m
kkjj
1
j
, пред-
ставленных взвешенными суммами по двум исходным множествам переменных {
Корни из собственных чисел
вующими каноническими переменными
сти собственных чисел, первая каноническая корреляция
X
, X2, …, Xn} и {Y1, Y2, …, Ym}.
1
равны корреляции между соответст-
k
U
и Vk. С учетом упорядоченно-
k
достигает
1
максимальное значение между соответствующими каноническими пере-
менными
n
UaX
11
1
i
и
ii
m
VbY
11
1
j
. Вторая и последующие канониче-
j
ские корреляции определяются соответствующими линейными комбинациями, не коррелированными с предыдущими линейными комбинациями
и имеющими следующий по величине коэффициент канонические корреляции, объясняющий оставшуюся межгрупповую корреляцию.
67

Для проверки значимости найденных канонических переменных
(то есть, отличия от нуля канонических корреляций) используется
2
–
критерий. Если предположить, что kk (
0, 1kk K
) первых канониче-
ских корреляций не равны нулю, то статистика критерия для проверки
гипотезы о том, что остальные равны нулю, имеет вид:
222
Hjj
Nkknm
11ln1
1
2
kk
j
1
K
1
jkk
,
где N – число измерений по каждой переменной объединенного множества
данном уровне значимости
()( )nkkmkk
. Значимость (kk+1)-ой пары канонических перемен-
ных подтверждается, если
ки
следует проводить до тех пор, пока подтверждается значимость
пар. Из K
,, ,,,
XXYY.
11
nm
Наблюденное значение
. Заметим, что вычисление статисти-
2
H
min{n, m} ненулевых канонических корреляций оставляются
=
2
сравнивают с критическим
H
и числе степеней свободы
22
H кр
2
при за-
кр
для интерпретации только те корни, которые оказались статистически
значимыми.
Проведенный анализ позволяет отсеять слабо коррелированные
пары канонических переменных. Полученная таким образом компактная, максимально информативная система данных может служить основой для дальнейших исследований, например, при помощи методов
факторного анализа.
1.2.6. Метод главных компонент
Метод главных компонент
является обобщением корреляционно-
регрессионного анализа на случай системы многих случайных величин
, X2, …, Xn} =
{X
1
x
, , xjN}, среди которых не все являются линейно независимыми друг
j2
т
X
с наблюдаемыми значениями для компоненты Хj:{xj1,
относительно друга. Если существуют зависимые между собой (коррелированные) величины, то их можно исключить переходом к новым
«главным» и «некоррелированным» переменным величинам
т
} =
U
{
UU
1
,,
m
, mn .
На простейшем примере системы двух случайных величин зависимость между переменными можно обнаружить с помощью диаграммы
рассеяния. Полученная путем подгонки линия регрессии дает графическое представление зависимости. Если определить новую переменную
на основе линии регрессии, изображенной на этой диаграмме, то такая
68

переменная будет включать в себя наиболее существенные черты обеих
j
переменных. Фактически, происходит сокращение числа переменных и
замена двух одной. Отметим, что новая переменная (фактор) в действительности является линейной комбинацией двух исходных переменных.
Пример, в котором две коррелированные переменные объединены
в один фактор, показывает главную идею анализа главных компонент.
Если пример
с двумя переменными распространить на большее число
переменных, то вычисления становятся сложнее, однако основной
принцип представления двух или более зависимых переменных одним
фактором остается в силе. В том случае, когда имеются три коррелированные переменные, можно построить 3-х мерную диаграмму рассеяния
точно так же, как в случае двух переменных плоскую
диаграмму рассеяния. Снова можно построить прямую регрессии, но уже в трехмерном пространстве. Для случая более трех переменных становится невозможным представить точки на диаграмме рассеяния, однако логика
вращения осей с целью максимизации дисперсии нового фактора остается прежней.
После того, как вы нашли линию, для которой дисперсия макси-
мальна
, вокруг нее остается некоторый разброс данных, на основании
которого повторяется процедура выделения направления максимальной
остаточной дисперсии. В анализе главных компонент именно так и делается: после того, как первый фактор выделен, то есть после того, как
первая линия проведена, определяется следующая линия, максимизирующая остаточную вариацию (разброс данных вокруг первой
прямой),
и т. д. Таким образом, последовательно выделяются факторы, один за
другим. Так как каждый последующий фактор определяется так, чтобы
максимизировать изменчивость, оставшуюся от предыдущих, то факторы оказываются независимыми друг от друга, то есть, некоррелированными или ортогональными. Результатом будет новый факторный набор
переменных (главных компонент U
, 1, ,im ), которые являются некор-
i
релирующими и линейными комбинациями первоначальных переменных Х
, 1,
j
n ( mn ).
В основном процедура выделения главных компонент подобна
вращению, максимизирующему дисперсию (варимакс) исходного пространства переменных. Например, на диаграмме рассеяния можно рассматривать прямую регрессии как новую (факторную) ось. Этот тип
вращения называется вращением, максимизирующим дисперсию, так
как цель вращения заключается в максимизации дисперсии (изменчивости) новой переменной (фактора) и минимизации
разброса вокруг нее.
Новый набор m факторных осей, проходящих через центр облака точек
69

исходного n-мерного пространства, получен в пространстве меньшей
j
размерности (
mn
). Этот метод применяется к данным в векторном
пространстве переменных и наблюдений{x
}, 1, ,
jl
n 1,lN , и находит
прямые линии, которые лучше всего соответствуют облаку N точек наблюдений в n-мерном векторном пространстве переменных.
Математически вычисление факторов в основном состоит в диагонализации симметричной матрицы: матрицы корреляций или ковариаций, в зависимости от того, нужно ли данные стандартизировать
или центрировать относительно средних значений. Геометрически
цель состоит в том, чтобы получить набор ортогональных факторных
векторов, где каждый вектор образует прямую линию в векторном
пространстве исходных переменных. Эти векторы называются осями
факторов и в дальнейшем используются для вычисления факторных
координат точек наблюдений, что позволяет классифицировать наблюдения по категориям.
Математические основы метода главных компонент оформим аналогично методу канонических корреляций (п. 1.2.5.). Пусть имеются исходная многомерная случайная величина
ми математическими ожиданиями M[
С,
M[XXт], на основе которой строятся новые случайные величины
=
n
UaX
в виде линейных комбинаций
1
i
X =
X]
0 и ковариационной матрицей
=
=
ii
, X2, …, Xn}т c нулевы-
{X1
XтA c нулевыми математи-
ческими ожиданиями и дисперсиями, достигающими максимальных
значений. Здесь
A
= {a1
, a2, …, an} – неизвестные параметры.
т
Задача метода заключается в нахождении таких U, что
M[U] = 0,
D[U] = M[U2] = M[(X
тA)т(Xт
A)]
=
A
т
M[XX т]A
т
A
CA→ max.
=
По условию задачи, переменная U должна обладать максимальной
дисперсией. Чтобы решение задачи было единственным, необходимо
наложить дополнительные ограничения, например, ортонормированность вектора коэффициентов
A
А:
т
A
1.
=
Данная задача условного экстремума решается с помощью метода
т
A
неопределенных множителей Лагранжа. Для того чтобы
максимума, необходимо определить
A из условия экстремума соответ-
CA достигало
ствующей функции Лагранжа
L
=
A
т
CА – λ(A
т
A–1),
где λ – неизвестный коэффициент Лагранжа.
70
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
