Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
вышение ηij η

над своим средним называется взаимодействием i-го
j
уровня A с j-м уровнем B
γ
ij = (ηij
η
) αi = ηij βj αi – μ.
j
Мы могли бы прийти к тому же результату, если бы начали с главного эффекта j-го уровня B специально по отношению к i-му уровню A; взаимодействие симметрично, поэтому мы можем назвать γ
взаимодей-
ij
ствием i-го уровня A и j-го уровня B.
Обозначим через y
k-е наблюдение в (i, j)-ячейке, тогда математи-
ijk
ческая модель примет вид
y
ijk = ηij
+ ε
μ + αi + βj + γij + ε
ijk =
, (1.31)
ijk
i = 1, …, I; j = 1, …, J; k = 1, …, K,
где ε равным нулю, и дисперсией σ
независимы и имеют нормальное распределение со средним,
ijk
2
, а константы αi, βj, γij удовлетворяют до-
полнительным условиям:
I
I
i
1
J
j
1

ij

ij
i
i
1
при всех j =
0
при всех i = 1, …, I.
0
J
0
,
1
j
0
j
1, …, J;
,
Согласно (1.31), мы должны минимизировать
IJK IJK

Sy
 
ijk ijk
 
111 111
Нормальные уравнения имеют единственное решение
22
()
ijk ijk ij

ij ijy
. Как
следствие получим оценки генерального среднего, главных эффектов и взаимодействий в виде
,, ,
  
yyy yy
  
     
i
ij
ij
j
(1.32)
 

ij i j ij i j
ij
    
yyy y
.
Сумма квадратов ошибок, являющаяся минимумом S, т. е. с учетом (1.32), равна
IJK
SS y y


R ijk ij
111

ijk
51
2
.
Чтобы получить в данном случае основное тождество дисперсион-
RMSB
R
ного анализа, возьмем тождество
       
yy yy yyy y yy y y
ijk ijk ij ij i j i j

         



возведем в квадрат его правую и левую части и просуммируем по всем значениям индексов i, j, k. Так как все смешанные произведения при суммировании равны нулю, получаем основное тождество двухфактор­ного дисперсионного анализа, аналогичное (1.30):
SST = SSR + SSAB + SSA + SSB.
Величины SS и B, или SS строк и столбцов, а SS
и SSB называют соответственно SS главных эффектов A
A
называют SS взаимодействия эф-
AB
фектов A и B. C учетом (1.32) можно получить
II
SS K y y y y K
AB ij i j
SS JK y y JK

Ai
SS IK y y IK

Bj
IJ IJ

 
ij ij


 
11 11


ii

 


11
JJ

  


11
jj
   
22
22
()
22
i
()
j
,
()
.
ij
Число степеней свободы SS линейно независимых условий гипотезы H логично число степеней свободы SS
свободы SS
является
AB
(I1)(J1), а
AB =
равно
A
равно
B
I 1, то есть равно числу
A =
, допускающих оценку; ана-
A
J1. Числом степеней
B =
I J (K−1). Далее вычисля-
R =
ются средние квадраты MS делением SS на соответствующее число сте­пеней свободы. В связи с проверкой гипотез вычисляются соответст­вующие критерии (табл. 1.10):
Таблица 1.10
Проверка гипотез в рамках повторяемого двухфакторного
дисперсионного анализа с фиксированными эффектами фактора
Гипотеза H
Критерий F
набл
Числа степеней
свободы
: все αi= 0 HB : все βj= 0 HAB : все γ
A
MS
ν1 = I – 1
IJ(K 1)
ν
2 =
/MS
A
ν
/MS
ν
J – 1
1 =
= IJ(K 1)
2
MSAB/MSR
ν
(I 1)(J 1)
1 =
ν
2 =
ij =
IJ(K 1)
0
Уровень значимости определяется как площадь справа от числа F кривой плотности распределения Фишера F
, ν2), изображенной на
1
набл
под
рис. 1.13–1.15.
52
Основные понятия и результаты двухфакторного дисперсионного
B
анализа без затруднений допускают обобщение на случай, когда число факторов больше двух. Наиболее подробное рассмотрение различных схем дисперсионного анализа содержится в [3, 43].
Рассмотрим, наконец, однофакторный многомерный дисперсион-
ный анализ.
k
Пусть n
борки из k выборок (групп) для каждой из m переменных Y Обозначим через
(
r
nn
1
r
()
r
yi mj nr k значение переменной Y
ij r
) – число наблюдений, полученных для r-й вы-
r
, Y2,…, Ym.
1
(1,, 1,, 1,)
i
определенное j-м наблюдением r-ой выборки. Тогда
n
r
Yyimrk

ir
n
r
1
j
r
()
(1,, 1,)
ij
1
выборочные (групповые) среднее значение переменной Yi для r-й вы­борки, а
n
k
Yyim

i
n
1
r

rj

11
r
()
(1,)
ij
,
общее среднее значение для объединенной выборки по каждой Yi из m переменных. Кроме того, пусть
nn
rrr
() () ()
SyYyYijm
ij il ir jq jr
rr


lq



11
(, 1, )
значение остаточной суммы квадратов и произведений для r-й выбор-
ки с n
1 степенями свободы.
r
Аналогично SS
в одномерном дисперсионном анализе, определим
B
в многомерном случае
k
ij r ir jr i j
nYY nYY i j m

r
1
(, 1, )
как межгрупповую сумма квадратов отклонений, и аналогично SS
k
r
WSijm

ij ij
r
()
(, 1, )
1
R
внутригрупповая (остаточная) сумма квадратов и произведений откло­нений.
Матрицы (B
) и (Wij) формируют соответствующие (межгрупповой
ij
и внутригрупповой) источники дисперсии системы m случайных вели­чин {Y
, Y2,…, Ym} с соответственно k–1 и n–k числами степеней свобо-
1
53
ды. Эти величины являются основой таблицы многомерного дисперси-
онного анализа. Тогда многомерный Λ-критерий Уилкса (лямбда­критерий Уилкса) для проверки гипотезы о равенстве средних значений
для k выборок по совокупности m переменных имеет вид
Λ = |W|/|W + B|,
где |W| и |B +W| –определители матриц (W
) и (Bij)+(Wij) соответственно.
ij
Статистика Λ имеет U-распределение с m, k1 и nk степеня­ми свободы [2]. За исключением специальных случаев, процентили U–распределения бывает трудно вычислять и поэтому на практике обычно используется одна из двух аппроксимаций. Так, вопрос о том, следует ли отвергать проверяемую гипотезу, можно решить сравнением критерия Бартлета
χ
2
с процентилями χ
-распределения с m(k 1) степенями свободы. С дру-
2
[n 1 –(m+k)/2]ln
=
гой стороны, можно использовать F-аппроксимацию U, предложенную Рао [29]:
1/ 2 2
 
1( )/2 ( 1)/21
nmksmk

Fs

(1) (1)5
mk m k

Гипотеза отвергается, если F >F
со степенями свободы, определен-
1α
1(1)4
s

,
1/ 2 2
s
mk
.
ными числителем и знаменателем первой дроби в выражении F.
Таким образом, если одновременно имеются несколько зависимых переменных, возрастает лишь сложность вычислений, а содержание и основные принципы не меняются. Вместо одномерного F-критерия используется многомерный F-критерий (лямбда-критерий Уилкса), ос- нованный на сравнении ковариационной матрицы ошибок
и межгруп­повой ковариационной матрицы. Если общий многомерный критерий значим, можно заключить, что соответствующий эффект значим по со­вокупности всех переменных. Поэтому после получения значимого многомерного критерия, для отдельного главного эффекта или взаимо­действия исследуется одномерный F-критерий, то есть отдельно иссле­дуются зависимые переменные, которые вносят вклад в значимость многомерного
критерия. Иными словами, если гипотеза о равенстве средних по совокупности всех переменных отвергается на основании Λ-критерия, то далее проверяется гипотеза о равенстве средних по каж­дой переменной на основании одномерного F-критерия. Если и она от­вергается, то мы делаем вывод, что некоторые μ
не совпадают. Так как
i
F-критерий не дает информации о том, какие именно из средних не рав-
ны, необходимо провести
множественный анализ средних. Рассмот-
54
рим в связи с этим вопрос о критерии для линейной комбинации сред-
k
них. Обозначим линейную комбинацию через
rc
1
, где cr – постоян-
rr
ные. Выделяют три процедуры множественного сравнения.
В первой из них – метод Шеффе – для проверки гипотезы H
k
r
c
1

rr
0
против альтернативы H1:
k
r
1
c
rr
0
с уровнем значимости α
0
образуют следующий 100(1 α)%-ый доверительный интервал:
:
kk
где
MS
средний квадрат, является несмещенной оценкой внутригруп-
R
cy k MS F kn k
  

rr R

rr
11
(, )
1
повой дисперсии с числом степеней свободы ν лицы однофакторного дисперсионного анализа, а
100(1 не содержит нуль, то
α)%-я процентиль распределения F(k, n k). Если этот интервал
H
отвергается с уровнем α. Этот процесс повторя-
0
2
c
r
R =
,
n
r
n – k и берется из таб-
F
(k, n k) есть
1α
ется для каждой интересующей нас линейной комбинации, причем об­щим для всех критериев уровнем значимости остается α.
На практике обычно проводятся сравнения контрастов в средних.
k
Контрастом называется
линейная комбинация средних
циенты которой удовлетворяют условию
k
r
0
. Каждый контраст
r
1
r

1
, коэффи-
rr
пропорционален разности между взвешенными средними от средних. Например,
μ1 μ
, (μ
+ μ2)/2 – (μ3 + μ4 + μ5)/3 и т. д.
2
1
Метод Шеффе для контрастов имеет следующий вид. Для проверки
гипотезы
H
0
значимости α
k
:
r
rr
1

0
против альтернативы H1:
образуют следующий 100(1 α)%-ый доверительный ин-
k
r
1

rr
0
с уровнем
тервал:
kk
а
ykMSFknk
   

rr R

rr
11
F
(k 1, n k) есть 100(1α)%-я процентиль распределения F(k −1, n k).
1α
(1) (1, )

1
Если этот интервал не содержит нуль, то
H
отвергается с уровнем α.
0
2
r
,
n
r
Этот процесс повторяется для каждого интересующего нас контра-
55
ста, причем общий для всех критериев уровень значимости остается
s
равным α.
Вторая процедура множественного сравнения – метод Тьюки, ко-
торый применим только для контрастов и только в случае равных объе­мов выборок, т. е. при n
k
H
:
0
r
1
 
rr
0
против альтернативы H1:
1 = n2 = … = nk =
n/k. Для проверки гипотезы
k
0
r
1

rr
образуют следую-
щий доверительный интервал:
q
а го размаха с
есть 100(1 α)%-я процентиль распределения стьюдентизованно-
1α
k и ν = n – k степенями свободы. Если этот интервал не со-
держит нуль, то
kk


rr r
rr
11

H
отвергается с уровнем значимости α. Этот процесс
0
1
kMS
yq

2
R
n
1
,
повторяется для каждого представляющего интерес контраста, причем общим для всех критериев уровнем значимости остается α. Заметим, что стьюдентизованный размах с ется следующим образом. Пусть
величины с распределением
min
Y . Если
r
r
оценка
2
 , то распределение W/s
y
2
с ν степенями свободы есть независимая несмещенная
y
k и ν = n k степенями свободы определя-
Y1, Y2, …, Yk – независимые случайные
N(μy,
2
), а W их размах, т. е. W
y
и будет распределением стъюденти-
y
=
max
r
Y
r
зованного размаха с
Третьей процедурой является множественный
k и ν = n k степенями свободы.
t-метод. Пусть k0 –
число заранее выбранных контрастов. Тогда для проверки гипотезы
H
:
0
k
r
1
 
rr
0
против альтернативы H1:
k
r
1

rr
0
следует построить
доверительный интервал:
kk
а
t
1α/2ko


11
rr
есть 100(1 α/2k
yt MS

rr k R R
)%-я процентиль t-распределения ν
0
1/2

()
0
боды. Если этот интервал не содержит нуль, то мы должны отвергнуть
2
r
,
n
r
степенями сво-
R
H
.
0
В рамках сравнительного анализа этих трёх процедур множествен-
ного сравнения можно заметить следующее.
1. Так как в методах Шеффе, Тьюки и множественном
за основу взяты различные распределения (соответственно
t-методе
F, q и t),
то в них, вообще говоря, рассматриваются разные доверительные ин­тервалы. Метод Шеффе допускает различные объемы выборок и любые
56
линейные комбинации средних, в то время как метод Тьюки применяет-
ся лишь при равных объемах выборок и лишь для контрастов. Множе­ственный t-метод применяется только к множеству контрастов, выбран­ных до начала исследования данных, в то время как в двух других методах множество контрастов может быть любым.
2. При получении
доверительного интервала для контраста пользо­ватель должен выбрать метод, который дает самый короткий довери­тельный интервал. В среднем для простых контрастов, содержащих не более трех средних, метод Тьюки дает более короткие доверительные интервалы, чем метод Шеффе. С другой стороны, для контрастов из че­тырех или более средних метод Шеффе дает в
среднем более короткие
доверительные интервалы.
3. Если число заранее выбранных контрастов «мало», то множест­венный t-метод может дать наиболее короткий доверительный интервал. Но контрасты обычно выбираются не до, а после анализа данных.
4. Если k равно квадрату t-статистики для двух выборок, т. е. F(1, ν
2, то F-отношение в таблице дисперсионного анализа
=
t2(νR).
R) =
5. F-критерий дисперсионного анализа значим с уровнем α тогда и
k
только тогда, когда гипотеза H
:
0
r
1

rr
отвергается для некоторого
0
контраста в соответствии с процедурой Шеффе. При этом задача оты­скания и интерпретации значимого контраста может оказаться нелегкой. Возможна ситуация, когда F-критерий окажется значимым с уровнем α, а значимые при этом уровне контрасты найти не удаётся. Чтобы опо­знать эти контрасты, нужно использовать множественные критерии сравнения
при большем α, чем при множественном сравнении для кон-
траста целесообразно взять 90%-ый доверительный интервал.
6. Некоторые результаты множественного анализа могут выглядеть противоречивыми. Например, при k что μ значимо отличается от μ
незначимо отличается от μ2, μ2 незначимо отличается от μ3, а μ1
1
. Если «незначимо отличается» интерпретиро-
3
3 можно прийти к заключению,
=
вать как «равно», а «значимо отличается» интерпретировать как «не равно», то эти заключения действительно противоречат друг другу. Но такая интерпретация некорректна, так как наши заключения могут с не­нулевой вероятностью быть ложными. Корректной интерпретацией это­го примера будет такая: на основе имеющихся данных можно с доста­точной уверенностью утверждать. что как μ1 и μ2, так и μ2 и μ различаются незначимо, а μ1 и μ3 – значимо.
В однофакторном многомерном дисперсионном анализе довери-
тельные интервалы для всех переменных одновременно могут быть по-
3
57
строены из одномерного интервала, заданного формулой в случае мето-
да Шеффе для контрастов. Прежде всего, для этого требуется знание верхней 100(1 α)-й процентили U-распределения. Для больших n она может быть аппроксимирована величиной
2


U
exp ,

1
1

nmk
(1)
mk

1( )/2
 
1
Определим
 . Тогда если в формуле случая метода Шеффе
1

U
1
1

для контрастов считать r-м групповым средним для любой из перемен­ных Y
, …, Yk величину
1
, то соответствующий многомерный совмест-
ry
ный 100(1 α)%-ый доверительный интервал задается как
kk

ynkMS
 
rr R

rr
11
()

1
2
r
.
n
r
1.2.4. Корреляционно-регрессионный анализ
Для многих явлений в природе типичны случайные зависимости. Случайные величины находятся в корреляционной зависимости, если каждому значению одной из них соответствует некоторое распределе­ние другой, что математически отражается в уравнении регрессии од­ной случайной величины на другую.
По результатам эксперимента сначала оформляется таблица на­блюдений системы дискретных случайных величин {X, Y} –
распределения
прямоугольная таблица, в которой записаны наблю-
матрица
даемые значений для Х:{x вующая каждой паре {x
творяющая условию
, x2, , xk}, для Y:{y1, y2, , ym} и соответст-
1
, yj } вероятность p
i
1

p . При этом система двух случайных
ij
ij
P{X = xi, Y = yj }, удовле-
i j =
величин (X, Y) характеризуется набором начальных и центральных мо- ментов (см. п. 1.1.5).
В общем случае Y и X связаны вероятностной зависимостью, спра- ведливой лишь в среднем, так как при фиксированном значении X
=
x
зависимая переменная Y имеет случайный разброс (столбец значений) из-за ошибок измерения, влияние неучтенных факторов или других причин. Таким образом, фиксированному значению X усредненное значение
Y
=
x
i
M[Y/(X = x
)] – условное математическое
i
соответствует
= xi
ожидание, вычисляемое по формуле
58
x
m
j
x
k
k
f
j
f
x
f
j
f
j
j
j
p
j
j
f
x
1
Y
i
=
y
=
i
p
1
j
i
. (1.33)
yp
ij
В итоге исходная таблица {x
, yj} эквивалентна таблице {xi,
i
Условное математическое ожидание
регрессией Y на X, график зависимости Y
Y = M[Y/(X = x)] называется
(x) называется линией регрес-
x
}.
y
i
сии. Аналогично определяется регрессия X на Y.
Таблица 1.11
Регрессионная матрица распределения двумерной случайной величины
x
i
y
i
рi
x1 x
y
1
р2
р
1
2
y
2
 
x
y
р
Рассмотрим модель линейной по параметрам регрессии Y на X, на-
n
ходящей линейную комбинацию Y
функций
тов аппроксимирует массив {
, которая лучше всего в смысле метода наименьших квадра-
, iy}. В этом случае результаты наблю-
i
(x) =
x
() ()
xfx

jj
j
1
базисных
дений представляются в виде
k
где
случайные некоррелированные ошибки наблюдений в предпо-
i
ложении, что M[
i] =
0,
ных базисных функциях
y
[] [ ]
DM  . Таким образом, при выбран-
iii
оценки
()
i
i
22
x +
=
,
i
коэффициентов
определяются
из условия
2
.
(
 )
=
i
2
ii
=
[()]min
yfx p
iii
i
Качество аппроксимации результатов наблюдений регрессивной
моделью определяется остаточной дисперсией
2
s
(n – число
kn
оцениваемых параметров
), которую можно использовать для сравни-
тельного анализа нескольких регрессивных моделей.
Рассмотрим простую линейную регрессию, которая считается вы-
2
()
xx
полненной
и 2 из условия минимизации выражения
тов
1

1
j
1
j
 , если найдем оценки коэффициен-
=
12
[]
yxp 
12
iii
i
2
:
59
k
x
x
x
f
x
x
x
j
x
x
x
D
x
j
D
x
x
x
x
x
+
1
2
k
1
p
+
ii
1
i
i
1
2
p
ii
k
1
i
=
i
2
p
=
ii
k
1
yp
ii
k
1
i
;
yx p
ii i
.
В этом случае
и 2 можно выразить через точечные оценки чи-
1
словых характеристик системы дискретных случайных величин:
где
y
=
2

x
2

y
K
=
y
r
xy
() ( )
xyr xx
k
p
=
1
i
m
yp
1
j
()
ii
i
()
yyp
j
()( )
ijij
,
ij
K
y
выборочный коэффициент корреляции Пирсона, значение
y
оценка mx по массиву {
ii
оценка m
j
2
xp
=
2
=
j
xy yp
по массиву {
y
D оценка
оценка
y
оценка ковариации по {

y
xy
x
},
y
k
по массиву {
D по массиву {
y
i
},
,
},
i
y },
k
,
i
y },
k
которого по модулю равно единице в случае линейной зависимости
Y
X. Таким образом, xyr характеризует степень тесноты линейной за-
висимости между
Y и X, проявляющейся в том, что при возрастании од-
ной случайной величины другая проявляет тенденцию также возрастать (в этом случае
случае говорят, что
r > 0) или убывать (в таком случае xyr < 0). В первом
xy
Y и X связаны положительной корреляцией, а во
втором корреляция отрицательна. При этом зависимость тем ближе к
линейному закону, чем
r ближе к единице слева. Если
xy
означает только отсутствие линейной связи между
Y и X, любой другой
r
=
xy
0, то это
вид связи может при этом присутствовать.
Рассмотрим
корреляции
.
гипотезу о значимости выборочного коэффициента
Пусть дана нормально распределенная система дискретных слу­чайных величин (
xi, y
{ корреляции
}, характеризуемая, в частности, выборочным коэффициентом
j
r Пирсона (см. п. 1.1.5), который оказался отличным от но-
X, Y) – совокупность k пар наблюдаемых значений
ля. При этом возникает необходимость при заданном уровне значимо-
60
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]