Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие
.pdf
вышение ηij − η
над своим средним называется взаимодействием i-го
∗
j
уровня A с j-м уровнем B
γ
ij = (ηij
− η
)− αi = ηij − βj − αi – μ.
∗
j
Мы могли бы прийти к тому же результату, если бы начали с главного
эффекта j-го уровня B специально по отношению к i-му уровню A;
взаимодействие симметрично, поэтому мы можем назвать γ
взаимодей-
ij
ствием i-го уровня A и j-го уровня B.
Обозначим через y
k-е наблюдение в (i, j)-ячейке, тогда математи-
ijk
ческая модель примет вид
y
ijk = ηij
+ ε
μ + αi + βj + γij + ε
ijk =
, (1.31)
ijk
i = 1, …, I; j = 1, …, J; k = 1, …, K,
где ε
равным нулю, и дисперсией σ
независимы и имеют нормальное распределение со средним,
ijk
2
, а константы αi, βj, γij удовлетворяют до-
полнительным условиям:
I
I
i
1
J
j
1
ij
ij
i
i
1
при всех j =
0
при всех i = 1, …, I.
0
J
0
,
1
j
0
j
1, …, J;
,
Согласно (1.31), мы должны минимизировать
IJK IJK
Sy
ijk ijk
111 111
Нормальные уравнения имеют единственное решение
22
()
ijk ijk ij
ij ijy
. Как
следствие получим оценки генерального среднего, главных эффектов
и взаимодействий в виде
,, ,
yyy yy
i
ij
ij
j
(1.32)
ij i j ij i j
ij
yyy y
.
Сумма квадратов ошибок, являющаяся минимумом S, т. е. с учетом
(1.32), равна
IJK
SS y y
R ijk ij
111
ijk
51
2
.

Чтобы получить в данном случае основное тождество дисперсион-
RMSB
R
ного анализа, возьмем тождество
yy yy yyy y yy y y
ijk ijk ij ij i j i j
возведем в квадрат его правую и левую части и просуммируем по всем
значениям индексов i, j, k. Так как все смешанные произведения при
суммировании равны нулю, получаем основное тождество двухфакторного дисперсионного анализа, аналогичное (1.30):
SST = SSR + SSAB + SSA + SSB.
Величины SS
и B, или SS строк и столбцов, а SS
и SSB называют соответственно SS главных эффектов A
A
называют SS взаимодействия эф-
AB
фектов A и B. C учетом (1.32) можно получить
II
SS K y y y y K
AB ij i j
SS JK y y JK
Ai
SS IK y y IK
Bj
IJ IJ
ij ij
11 11
ii
11
JJ
11
jj
22
22
()
22
i
()
j
,
()
.
ij
Число степеней свободы SS
линейно независимых условий гипотезы H
логично число степеней свободы SS
свободы SS
является
AB
(I−1)(J−1), а
AB =
равно
A
равно
B
I −1, то есть равно числу
A =
, допускающих оценку; ана-
A
J−1. Числом степеней
B =
I J (K−1). Далее вычисля-
R =
ются средние квадраты MS делением SS на соответствующее число степеней свободы. В связи с проверкой гипотез вычисляются соответствующие критерии (табл. 1.10):
Таблица 1.10
Проверка гипотез в рамках повторяемого двухфакторного
дисперсионного анализа с фиксированными эффектами фактора
Гипотеза H
Критерий F
набл
Числа степеней
свободы
: все αi= 0 HB : все βj= 0 HAB : все γ
A
MS
ν1 = I – 1
IJ(K − 1)
ν
2 =
/MS
A
ν
/MS
ν
J – 1
1 =
= IJ(K − 1)
2
MSAB/MSR
ν
(I − 1)(J − 1)
1 =
ν
2 =
ij =
IJ(K − 1)
0
Уровень значимости определяется как площадь справа от числа F
кривой плотности распределения Фишера F(ν
, ν2), изображенной на
1
набл
под
рис. 1.13–1.15.
52

Основные понятия и результаты двухфакторного дисперсионного
B
анализа без затруднений допускают обобщение на случай, когда число
факторов больше двух. Наиболее подробное рассмотрение различных
схем дисперсионного анализа содержится в [3, 43].
Рассмотрим, наконец, однофакторный многомерный дисперсион-
ный анализ.
k
Пусть n
борки из k выборок (групп) для каждой из m переменных Y
Обозначим через
(
r
nn
1
r
()
r
yi mj nr k значение переменной Y
ij r
) – число наблюдений, полученных для r-й вы-
r
, Y2,…, Ym.
1
(1,, 1,, 1,)
i
определенное j-м наблюдением r-ой выборки. Тогда
n
r
Yyimrk
ir
n
r
1
j
r
()
(1,, 1,)
ij
1
– выборочные (групповые) среднее значение переменной Yi для r-й выборки, а
n
k
Yyim
i
n
1
r
rj
11
r
()
(1,)
ij
,
– общее среднее значение для объединенной выборки по каждой Yi из m
переменных. Кроме того, пусть
nn
rrr
() () ()
SyYyYijm
ij il ir jq jr
rr
lq
11
(, 1, )
– значение остаточной суммы квадратов и произведений для r-й выбор-
ки с n
–1 степенями свободы.
r
Аналогично SS
в одномерном дисперсионном анализе, определим
B
в многомерном случае
k
ij r ir jr i j
nYY nYY i j m
r
1
(, 1, )
как межгрупповую сумма квадратов отклонений, и аналогично SS
k
r
WSijm
ij ij
r
()
(, 1, )
1
R
внутригрупповая (остаточная) сумма квадратов и произведений отклонений.
Матрицы (B
) и (Wij) формируют соответствующие (межгрупповой
ij
и внутригрупповой) источники дисперсии системы m случайных величин {Y
, Y2,…, Ym} с соответственно k–1 и n–k числами степеней свобо-
1
53

ды. Эти величины являются основой таблицы многомерного дисперси-
онного анализа. Тогда многомерный Λ-критерий Уилкса (лямбдакритерий Уилкса) для проверки гипотезы о равенстве средних значений
для k выборок по совокупности m переменных имеет вид
Λ = |W|/|W + B|,
где |W| и |B +W| –определители матриц (W
) и (Bij)+(Wij) соответственно.
ij
Статистика Λ имеет U-распределение с m, k−1 и n−k степенями свободы [2]. За исключением специальных случаев, процентили
U–распределения бывает трудно вычислять и поэтому на практике
обычно используется одна из двух аппроксимаций. Так, вопрос о том,
следует ли отвергать проверяемую гипотезу, можно решить сравнением
критерия Бартлета
χ
2
с процентилями χ
-распределения с m(k − 1) степенями свободы. С дру-
2
−[n − 1 –(m+k)/2]ln
=
гой стороны, можно использовать F-аппроксимацию U, предложенную
Рао [29]:
1/ 2 2
1( )/2 ( 1)/21
nmksmk
Fs
(1) (1)5
mk m k
Гипотеза отвергается, если F >F
со степенями свободы, определен-
1−α
1(1)4
s
,
1/ 2 2
s
mk
.
ными числителем и знаменателем первой дроби в выражении F.
Таким образом, если одновременно имеются несколько зависимых
переменных, возрастает лишь сложность вычислений, а содержание
и основные принципы не меняются. Вместо одномерного F-критерия
используется многомерный F-критерий (лямбда-критерий Уилкса), ос-
нованный на сравнении ковариационной матрицы ошибок
и межгрупповой ковариационной матрицы. Если общий многомерный критерий
значим, можно заключить, что соответствующий эффект значим по совокупности всех переменных. Поэтому после получения значимого
многомерного критерия, для отдельного главного эффекта или взаимодействия исследуется одномерный F-критерий, то есть отдельно исследуются зависимые переменные, которые вносят вклад в значимость
многомерного
критерия. Иными словами, если гипотеза о равенстве
средних по совокупности всех переменных отвергается на основании
Λ-критерия, то далее проверяется гипотеза о равенстве средних по каждой переменной на основании одномерного F-критерия. Если и она отвергается, то мы делаем вывод, что некоторые μ
не совпадают. Так как
i
F-критерий не дает информации о том, какие именно из средних не рав-
ны, необходимо провести
множественный анализ средних. Рассмот-
54

рим в связи с этим вопрос о критерии для линейной комбинации сред-
k
них. Обозначим линейную комбинацию через
rc
1
, где cr – постоян-
rr
ные. Выделяют три процедуры множественного сравнения.
В первой из них – метод Шеффе – для проверки гипотезы H
k
r
c
1
rr
0
против альтернативы H1:
k
r
1
c
rr
0
с уровнем значимости α
0
образуют следующий 100(1 − α)%-ый доверительный интервал:
:
kk
где
MS
– средний квадрат, является несмещенной оценкой внутригруп-
R
cy k MS F kn k
rr R
rr
11
(, )
1
повой дисперсии с числом степеней свободы ν
лицы однофакторного дисперсионного анализа, а
100(1
не содержит нуль, то
− α)%-я процентиль распределения F(k, n − k). Если этот интервал
H
отвергается с уровнем α. Этот процесс повторя-
0
2
c
r
R =
,
n
r
n – k и берется из таб-
F
(k, n − k) есть
1−α
ется для каждой интересующей нас линейной комбинации, причем общим для всех критериев уровнем значимости остается α.
На практике обычно проводятся сравнения контрастов в средних.
k
Контрастом называется
линейная комбинация средних
циенты которой удовлетворяют условию
k
r
0
. Каждый контраст
r
1
r
1
, коэффи-
rr
пропорционален разности между взвешенными средними от средних.
Например,
μ1 − μ
, (μ
+ μ2)/2 – (μ3 + μ4 + μ5)/3 и т. д.
2
1
Метод Шеффе для контрастов имеет следующий вид. Для проверки
гипотезы
H
0
значимости α
k
:
r
rr
1
0
против альтернативы H1:
образуют следующий 100(1 − α)%-ый доверительный ин-
k
r
1
rr
0
с уровнем
тервал:
kk
а
ykMSFknk
rr R
rr
11
F
(k −1, n− k) есть 100(1−α)%-я процентиль распределения F(k −1, n − k).
1−α
(1) (1, )
1
Если этот интервал не содержит нуль, то
H
отвергается с уровнем α.
0
2
r
,
n
r
Этот процесс повторяется для каждого интересующего нас контра-
55

ста, причем общий для всех критериев уровень значимости остается
s
равным α.
Вторая процедура множественного сравнения – метод Тьюки, ко-
торый применим только для контрастов и только в случае равных объемов выборок, т. е. при n
k
H
:
0
r
1
rr
0
против альтернативы H1:
1 = n2 = … = nk =
n/k. Для проверки гипотезы
k
0
r
1
rr
образуют следую-
щий доверительный интервал:
q
а
го размаха с
есть 100(1 − α)%-я процентиль распределения стьюдентизованно-
1−α
k и ν = n – k степенями свободы. Если этот интервал не со-
держит нуль, то
kk
rr r
rr
11
H
отвергается с уровнем значимости α. Этот процесс
0
1
kMS
yq
2
R
n
1
,
повторяется для каждого представляющего интерес контраста, причем
общим для всех критериев уровнем значимости остается α. Заметим, что
стьюдентизованный размах с
ется следующим образом. Пусть
величины с распределением
min
Y . Если
r
r
оценка
2
, то распределение W/s
y
2
с ν степенями свободы есть независимая несмещенная
y
k и ν = n − k степенями свободы определя-
Y1, Y2, …, Yk – независимые случайные
N(μy,
2
), а W – их размах, т. е. W
y
и будет распределением стъюденти-
y
=
max
r
Y −
r
зованного размаха с
Третьей процедурой является множественный
k и ν = n − k степенями свободы.
t-метод. Пусть k0 –
число заранее выбранных контрастов. Тогда для проверки гипотезы
H
:
0
k
r
1
rr
0
против альтернативы H1:
k
r
1
rr
0
следует построить
доверительный интервал:
kk
а
t
1−α/2ko
11
rr
есть 100(1 – α/2k
yt MS
rr k R R
)%-я процентиль t-распределения ν
0
1/2
()
0
боды. Если этот интервал не содержит нуль, то мы должны отвергнуть
2
r
,
n
r
степенями сво-
R
H
.
0
В рамках сравнительного анализа этих трёх процедур множествен-
ного сравнения можно заметить следующее.
1. Так как в методах Шеффе, Тьюки и множественном
за основу взяты различные распределения (соответственно
t-методе
F, q и t),
то в них, вообще говоря, рассматриваются разные доверительные интервалы. Метод Шеффе допускает различные объемы выборок и любые
56

линейные комбинации средних, в то время как метод Тьюки применяет-
ся лишь при равных объемах выборок и лишь для контрастов. Множественный t-метод применяется только к множеству контрастов, выбранных до начала исследования данных, в то время как в двух других
методах множество контрастов может быть любым.
2. При получении
доверительного интервала для контраста пользователь должен выбрать метод, который дает самый короткий доверительный интервал. В среднем для простых контрастов, содержащих не
более трех средних, метод Тьюки дает более короткие доверительные
интервалы, чем метод Шеффе. С другой стороны, для контрастов из четырех или более средних метод Шеффе дает в
среднем более короткие
доверительные интервалы.
3. Если число заранее выбранных контрастов «мало», то множественный t-метод может дать наиболее короткий доверительный интервал.
Но контрасты обычно выбираются не до, а после анализа данных.
4. Если k
равно квадрату t-статистики для двух выборок, т. е. F(1, ν
2, то F-отношение в таблице дисперсионного анализа
=
t2(νR).
R) =
5. F-критерий дисперсионного анализа значим с уровнем α тогда и
k
только тогда, когда гипотеза H
:
0
r
1
rr
отвергается для некоторого
0
контраста в соответствии с процедурой Шеффе. При этом задача отыскания и интерпретации значимого контраста может оказаться нелегкой.
Возможна ситуация, когда F-критерий окажется значимым с уровнем α,
а значимые при этом уровне контрасты найти не удаётся. Чтобы опознать эти контрасты, нужно использовать множественные критерии
сравнения
при большем α, чем при множественном сравнении для кон-
траста целесообразно взять 90%-ый доверительный интервал.
6. Некоторые результаты множественного анализа могут выглядеть
противоречивыми. Например, при k
что μ
значимо отличается от μ
незначимо отличается от μ2, μ2 незначимо отличается от μ3, а μ1
1
. Если «незначимо отличается» интерпретиро-
3
3 можно прийти к заключению,
=
вать как «равно», а «значимо отличается» интерпретировать как «не
равно», то эти заключения действительно противоречат друг другу. Но
такая интерпретация некорректна, так как наши заключения могут с ненулевой вероятностью быть ложными. Корректной интерпретацией этого примера будет такая: на основе имеющихся данных можно с достаточной уверенностью утверждать. что как μ1 и μ2, так и μ2 и μ
различаются незначимо, а μ1 и μ3 – значимо.
В однофакторном многомерном дисперсионном анализе довери-
тельные интервалы для всех переменных одновременно могут быть по-
3
57

строены из одномерного интервала, заданного формулой в случае мето-
да Шеффе для контрастов. Прежде всего, для этого требуется знание
верхней 100(1 − α)-й процентили U-распределения. Для больших n она
может быть аппроксимирована величиной
2
U
exp ,
1
1
nmk
(1)
mk
1( )/2
1
Определим
. Тогда если в формуле случая метода Шеффе
1
U
1
1
для контрастов считать r-м групповым средним для любой из переменных Y
, …, Yk величину
1
, то соответствующий многомерный совмест-
ry
ный 100(1 − α)%-ый доверительный интервал задается как
kk
ynkMS
rr R
rr
11
()
1
2
r
.
n
r
1.2.4. Корреляционно-регрессионный анализ
Для многих явлений в природе типичны случайные зависимости.
Случайные величины находятся в корреляционной зависимости, если
каждому значению одной из них соответствует некоторое распределение другой, что математически отражается в уравнении регрессии одной случайной величины на другую.
По результатам эксперимента сначала оформляется таблица наблюдений системы дискретных случайных величин {X, Y} –
распределения
– прямоугольная таблица, в которой записаны наблю-
матрица
даемые значений для Х:{x
вующая каждой паре {x
творяющая условию
, x2, , xk}, для Y:{y1, y2, , ym} и соответст-
1
, yj } вероятность p
i
1
p . При этом система двух случайных
ij
ij
P{X = xi, Y = yj }, удовле-
i j =
величин (X, Y) характеризуется набором начальных и центральных мо-
ментов (см. п. 1.1.5).
В общем случае Y и X связаны вероятностной зависимостью, спра-
ведливой лишь в среднем, так как при фиксированном значении X
=
x
зависимая переменная Y имеет случайный разброс (столбец значений)
из-за ошибок измерения, влияние неучтенных факторов или других
причин. Таким образом, фиксированному значению X
усредненное значение
Y
=
x
i
M[Y/(X = x
)] – условное математическое
i
соответствует
= xi
ожидание, вычисляемое по формуле
58

x
m
j
x
k
k
f
j
f
x
f
j
f
j
j
j
p
j
j
f
x
1
Y
i
=
y
=
i
p
1
j
i
. (1.33)
yp
ij
В итоге исходная таблица {x
, yj} эквивалентна таблице {xi,
i
Условное математическое ожидание
регрессией Y на X, график зависимости Y
Y = M[Y/(X = x)] называется
(x) называется линией регрес-
x
}.
y
i
сии. Аналогично определяется регрессия X на Y.
Таблица 1.11
Регрессионная матрица распределения двумерной случайной величины
x
i
y
i
рi
x1 x
y
1
р2
р
1
2
y
2
x
y
р
Рассмотрим модель линейной по параметрам регрессии Y на X, на-
n
ходящей линейную комбинацию Y
функций
тов аппроксимирует массив {
, которая лучше всего в смысле метода наименьших квадра-
, iy}. В этом случае результаты наблю-
i
(x) =
x
() ()
xfx
jj
j
1
базисных
дений представляются в виде
k
где
– случайные некоррелированные ошибки наблюдений в предпо-
i
ложении, что M[
i] =
0,
ных базисных функциях
y
[] [ ]
DM . Таким образом, при выбран-
iii
оценки
()
i
i
22
x +
=
,
i
коэффициентов
определяются
из условия
2
.
(
)
=
i
2
ii
=
[()]min
yfx p
iii
i
Качество аппроксимации результатов наблюдений регрессивной
моделью определяется остаточной дисперсией
2
s
(n – число
kn
оцениваемых параметров
), которую можно использовать для сравни-
тельного анализа нескольких регрессивных моделей.
Рассмотрим простую линейную регрессию, которая считается вы-
2
()
xx
полненной
и 2 из условия минимизации выражения
тов
1
1
j
1
j
, если найдем оценки коэффициен-
=
12
[]
yxp
12
iii
i
2
:
59

k
x
x
x
f
x
x
x
j
x
x
x
D
x
j
D
x
x
x
x
x
+
1
2
k
1
p
+
ii
1
i
i
1
2
p
ii
k
1
i
=
i
2
p
=
ii
k
1
yp
ii
k
1
i
;
yx p
ii i
.
В этом случае
и 2 можно выразить через точечные оценки чи-
1
словых характеристик системы дискретных случайных величин:
где
y
=
2
x
2
y
K
=
y
r
xy
() ( )
xyr xx
k
p
=
1
i
m
yp
1
j
()
ii
i
()
yyp
j
()( )
ijij
,
ij
K
y
– выборочный коэффициент корреляции Пирсона, значение
y
– оценка mx по массиву {
ii
– оценка m
j
2
xp
=
2
=
j
xy yp
по массиву {
y
D – оценка
– оценка
y
– оценка ковариации по {
y
xy
x
},
y
k
по массиву {
D по массиву {
y
i
},
,
},
i
y },
k
,
i
y },
k
которого по модулю равно единице в случае линейной зависимости
Y
X. Таким образом, xyr характеризует степень тесноты линейной за-
висимости между
Y и X, проявляющейся в том, что при возрастании од-
ной случайной величины другая проявляет тенденцию также возрастать
(в этом случае
случае говорят, что
r > 0) или убывать (в таком случае xyr < 0). В первом
xy
Y и X связаны положительной корреляцией, а во
втором корреляция отрицательна. При этом зависимость тем ближе к
линейному закону, чем
r ближе к единице слева. Если
xy
означает только отсутствие линейной связи между
Y и X, любой другой
r
=
xy
0, то это
вид связи может при этом присутствовать.
Рассмотрим
корреляции
.
гипотезу о значимости выборочного коэффициента
Пусть дана нормально распределенная система дискретных случайных величин (
xi, y
{
корреляции
}, характеризуемая, в частности, выборочным коэффициентом
j
r Пирсона (см. п. 1.1.5), который оказался отличным от но-
X, Y) – совокупность k пар наблюдаемых значений
ля. При этом возникает необходимость при заданном уровне значимо-
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
