Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
отвергается, то есть дисперсии хотя и неизвестны, но предполагаются
s
x
s
разными. Тестирование такой гипотезы H
: mX = mY основано на рас-
0
пределении (1.13) Стьюдента с числом степеней свободы k:
222
()
sn sn
k
22
sn
()
xx
nn
xy
xx y y
22
()
yy
11
.
n
В этом случае вычисляют наблюдаемое значение критерия по формуле
T
Н
22
nsn
XyY
. (1.25)
Затем строят критическую область в зависимости от конкурирую­щей гипотезы следующим образом:
xy
При конкурирующей гипотезе ская область) или
H1: mX > m
H1: mX  m
Y (mX
< m
) (односторонняя критическая
Y
(двусторонняя критиче-
Y
область) с помощью калькулятора распределения вероятности (1.13) Стьюдента (см. рис. 1.1) по заданному уровню значимости и числу сте­пеней свободы
Если
Если
TН< tTН> t
k найти критическую точку t
, то нет оснований отвергать нулевую гипотезу.
кp
, то нулевую гипотезу отвергают.
кp
кp
.
В случае логнормальной (1.11) модели (см. рис. 1.7) рекомендуется использовать критерий Родионова (уровень значимости α
при заданном уровне значимости за о равенстве дисперсий по
предварительно проверяется гипоте-
F-критерию Фишера (1.23). Если не будет
). Вначале
R
оснований отвергать гипотезу о равенстве дисперсий, то далее надо рас­считать значение критерия Стьюдента
T
ns ns

(1) (1)
xxyy
а критическое значение
ln ln
xy
22
ln ln
T
T(, k) найти с помощью калькулятора
кр =
nn n n
xy x y
nn
xy
, (1.26)
(2)
распределения (1.13) вероятности Стьюдента (см. рис. 1.1) по заданному уровню значимости
и числу степеней свободы k
+ ny – 2. Если ги-
= nx
потеза о равенстве дисперсий отвергается, то тестирование основной гипотезы основано на нормальном (1.10) распределении чайной величины
Z
Н
Z:
1
xy ss
 
ln ln
22 4 4
snsn s n s n
ln ln ln ln
  
xx y y x x y y
(/( 1) /( 1))/2
41
22
ln ln
xy
2
N(z,0,1) слу-
. (1.26)
В случае неопределённости с законом распределения следует при-
менять непараметрические критерии, которые особенно полезны для малых выборок.
Рассмотрим в качестве примера U-критерий Манна-Уитни для про­верки гипотезы Н
об однородности двух выборок, представляющий непа-
0
раметрическую альтернативу t-критерию Стьюдента для независимых вы­борок. U-критерий Манна-Уитни предполагает, что все значения двух выборок случайных величин X и Y объемов n и m, соответственно, ранжи­руются, то есть записываются в один ряд в порядке возрастания. После этого каждый элемент
выборок характеризуется рангом – порядковым но­мером каждого элемента выборок в общем ранжированном ряду из обеих выборок. Наблюденное значение критерия U вычисляется по формуле
UW mm
 

2
1
1
nm
11

ij
,
ij
где W – значение критерия Уилкоксона, численно равное сумме рангов элементов второй выборки (объема m) в общем ранжированном ряду, а
равно 1, если Xi<Yj, и 0 в противном случае.
ij
Таким образом, U-критерий подсчитывает общее число тех случа­ев, в которых элементы второй выборки превосходят элементы первой выборки.
Распределение случайной величины U асимптотически нормально с параметрами M[U]
nm/2 и D[U] = nm(n+m+1)/12, чем и пользуются
=
на практике, если min{n,m}>25, для определения критического значения
(,n,m), соответствующего заданному уровню значимости . Для
U
кр
случаев, когда n и m <25, пользуются специальными таблицами [4, 14].
Проверка гипотезы о равенстве средних, определенных по двум выборкам объёмов n
и n2, с помощью Х-критерия Ван-дер-Вардена на-
1
чинается с того, что все значения по обеим выборкам ранжируются, то есть записываются в один ряд в порядке возрастания. Х-критерий представляет собой случайную величину
n
2
X
Н

i
1



i
nn
12
,
1
где i – порядковый номер каждого значения второй выборки в общем
ряду; – функция, обратная функции нормального распределения, вы-
числяется с помощью калькулятора распределения вероятности по нор­мальному закону (см. рис. 1.6).
Вычисленное значение критерия Х
сравнивается с Хкр, определен-
Н
ным по специальным таблицам для заданного уровня значимости и объ-
42
емов выборок [4, 14]. Если ХН > Х
, то гипотеза о равенстве выбороч-
кр
ных средних отвергается.
При этом следует учитывать особенности применения непарамет­рических критериев, например, ранговый Х-критерий Ван – дер – Вар­дена [14] рекомендуется применять, если предполагается, что наблюде­ния близко следуют нормальному закону [8]; статистическим U-критерием Манна-Уитни [7] для проверки гипотезы об однородности двух выборок X и если только min{n
Y объемов nx и ny следует пользоваться на практике,
}>25 [8]; критерии серий Вальда–Вольфовица
x,ny
предполагает, что рассматриваемые переменные являются непрерыв­ными и измерены в порядковой шкале [7]. Заметим, что двухвыбороч­ный критерий Колмогорова–Смирнова (уровень значимости α
2K-S
), ос-
нованный на сравнении эмпирических функций распределения двух выборок и проверяющий гипотезу однородности двух выборок [7], яв­ляется чувствительным как к различию в положении двух выборок, так и к различию общих форм распределений двух выборок (в частности, различия в рассеянии, асимметрии и т. д.).
1.2.3. Дисперсионный анализ
Дисперсионный анализ [1, 3, 43, 44] – статистический метод, по
-
зволяющий анализировать влияние различных факторов (категориаль­ных, группирующих, независимых переменных), обозначаемых латин­скими буквами A,B,C и т. д., на результаты эксперимента (зависимые переменные). Для проведения дисперсионного анализа необходимо, чтобы независимая переменная была категориальной, а зависимая – метрической. Например, факторами, влияющими на содержание микро­элементов в пробе, могут быть: A – метод
геохимического анализа
(ИНАА, ISP), Bтерритория (гг. Томск, Междуреченск, Стрежевой),
C – среда съёмки (почва, снег, зола, накипь). В этом случае говорят о применении 3-х факторного дисперсионного анализа для исследования влияния 3-х факторов (A – метод геохимического анализа с 2-мя уров- нями; B – территория с 3-мя уровнями и C – среда съемки с 4-мя
уров-
нями) на содержание микроэлементов в пробе.
Суть дисперсионного анализа (analysis of variance – сокращенно ANOVA) заключается в разложении дисперсии измеряемого признака на независимые слагаемые, каждое из которых характеризует влияние того или иного фактора или их взаимодействия. Последующее сравнение та­ких слагаемых позволяет оценить значимость каждого изучаемого фак­тора, а также их комбинации.
Анализ основан на расчете F-статистики (статистика Фишера), которая представляет собой отношение двух дисперсий: межгрупповой
43
и внутригрупповой. F-тест в однофакторном дисперсионном анализе определяет, значимо ли различаются средние нескольких независимых выборок. Он заменяет t-тест (1.25) для независимых выборок при нали­чии более двух выборок и дает тот же результат в случае двух выборок.
Дисперсионный анализ в терминах общей линейной модели позволил рассматривать с единой точки зрения
не только задачи множественного сравнения средних, но и задачи оценивания и проверки гипотез в моделях регрессии, факторного анализа, а также классификации объектов.
В случае применения дисперсионного анализа строят математиче­скую модель, т. е. математическое соотношение, представляющее каж­дую зависимую переменную в виде суммы среднего значения и ошибки. В свою очередь,
среднее значение каждого наблюдения представляется в виде суммы генерального среднего и «эффекта» от каждого фактора. Возникающие здесь статистические задачи связаны с оценкой этих эф­фектов и проверкой статистических гипотез о них. Задача проверки вы­двинутых гипотез может быть решена только при введении дополни­тельных предположений о вероятностной структуре погрешностей наблюдений. Обычно
предполагают, что они независимы и подчиняют­ся нормальному закону с нулевым средним и постоянной дисперсией, что позволяет использовать развитую теорию метода наименьших квад­ратов (МНК). Менее жёсткие предположения требуют соответственно достаточно большого числа наблюдений, при котором становится оп­равданным обращение к результатам асимптотической теории.
Классификация моделей дисперсионного анализа основана прежде всего на характере анализируемых факторов: различают модели с фикси­рованные факторами (модель I), со случайными факторами (модель II). Пусть, например, рассматривается задача о существенности различий ме­жду выборками, отвечающими данным уровням фактора. Если включить в исследование все уровни, то влияние такого фактора фиксированное (модель I); если же включить только отобранную случайно часть уровней, то влияние фактора случайное (модель II), а полученные выводы приме­нимы не только к тем отдельным уровням, которые привлекались при ис­следовании, но и ко всем остальным уровням случайного фактора. В мно­гофакторных комплексах возможна смешанная модель III, в которой одни факторы имеют случайные уровни, а другие – фиксированные.
Рассмотрим наиболее распространенные варианты эксперимента организуемого для проведения дисперсионного анализа: однофактор­ный (многофакторный) дисперсионный анализ с разным числом уров­ней факторов и разным числом опытов на каждом уровне.
Техника дисперсионного анализа меняется в зависимости от числа изучаемых независимых факторов.
,
44
Рассмотрим параметрический однофакторный одномерный дис-
персионный анализ.
Однофакторный дисперсионный анализ используется в тех случа­ях, когда есть в распоряжении три или более независимые выборки (группы), полученные из одной генеральной совокупности путем изме­нения какого-либо фактора A, имеющего, соответственно, три или более уровня A
, i = 1, …, k. Предполагается, что эти выборки распределены
i
по нормальному закону и имеют разные выборочные средние и одина­ковые выборочные дисперсии σ
2
. Поэтому необходимо ответить на во-
прос, оказал ли этот фактор существенное влияние на разброс выбороч­ных средних группы или разброс является следствием случайностей, вызванных, например, небольшим объемом выборок. Другими словами, если выборки принадлежат одной и той же генеральной совокупности, то разброс данных между выборками (между группами) должен быть не больше,
чем разброс данных внутри этих выборок (внутри групп).
Пусть Y – случайная величина, определенная на этой генеральной совокупности, а μ – ее среднее. В представлении μ величины Y на i-й выборке объема n эффект, соответствующий уровню A ределенное j-м наблюдением (j
=
величина αi есть дифференциальный
i
. Обозначим через yij значение Y, оп-
i
1, …, ni) i-ой выборки. Рассматриваемая
μ + αi для среднего
i =
здесь модель дисперсионного анализа описывает именно такую ситуа­цию в предположении, что распределение Y на каждой выборке нормаль­но с одной и той же дисперсией σ дое значение y
равно сумме генерального среднего μ (единого для всех
ij
k уровней фактора), дифференциального эффекта α
уровнем A
, и случайной ошибки εij, вызванной влиянием неконтроли-
i
2
, т. е. подчинено закону N(μi, σ2). Каж-
, определяемого
i
руемых факторов:
y
ij = μi
+ ε
μ + αi + εij; (1.27)
ij =
j = 1, …, ni; i = 1, …, k,
где {ε
} независимы и распределены по нормальному закону N(0, σ2).
ij
Фактор будет интерпретироваться по модели I, то есть эксперимен­татора интересуют только выборки, отвечающие именно данным уров­ням фактора. Модель однофакторного дисперсионного анализа с фик­сированными эффектами (модель I) задается соотношением (1.27). Проверяется гипотеза H
(1.27) можно вывести МНК-оценки кают МНК-оценки величин μ и α
: все αi = 0. Из представления модели в виде
0
для μi, i = 1, …, k. Из них выте-
i
. Для того чтобы обеспечить единст-
i
венность МНК-оценок, нам придется наложить дополнительное ограни­чение на параметры α
, …, αk. Обычное требование состоит в том, чтобы
1
взвешенная сумма эффектов равнялась нулю:
45
k

i
n
1
ii
0
.
Таким образом, задача сводится к минимизации суммы квадратов
nn
kk
ii
Sy

 
11 11
ij ij
 
2

ij ij i
2
по переменным μ
, i = 1, …, p.
i
Нормальные уравнения можно получить, приравняв к нулю произ­водные
n
i
, i = 1, …, k.
j
1
y
ij i
2
1
yy
iij
n
j
i
n
i
, i = 1, …, k. (1.28)
1
МНК-оценки
S
 

i
 (решения нормальных уравнений) находятся в виде
i

i
Здесь звездочкой вместо индекса обозначено усреднение по этому ин­дексу. Дополнительное ограничение с учетом α
kk

nnn

11

ii

ii i
 
μ эквивалентно
i = μi
,
что с учетом (1.28) дает МНК-оценку
n
k

1
yy

n
i

ij
11
ij
(1.29)
и, как следствие,
 , i
i
i
Чтобы построить критерий для проверки гипотезы рассмотрим сумму квадратов отклонений наблюдений средней
:
y

k


11
 
nn n
kk k
ii i
 
  
  
11 11 11
ij ij ij
yy yy yy y y
 
 
ij i i ij i i
ij
22
yy
i
n
i


yy
ij

=

2



1, …, k.
2
H
(все α
0
yij от общей
Последнее слагаемое
nn
kk
i i

[][ ][ ][]0
yyyy yy yy

 

11 1 1
ij i j
ij i i i ij i
46
,
i =
0),
n
i
так как сумма

yy
j
ij i

1
равна нулю в силу (1.28).
В результате получим следующее тождество:
SST = SSB + SSR, (1.30)
где
n
k
SST =


ij
11
i
yy
ij
2

общая, или полная, сумма квадратов отклонений;
n
k
SSB =


ij
11
i
[]
yy

i
2
сумма квадратов отклонений групповых средних от общей средней,
или межгрупповая (межуровневая факторная) сумма квадратов откло­нений;
n
k
SSR =


ij
11
i
yy
ij i
2
– сумма квадратов отклонений наблюдений от групповых средних, или внутригрупповая (остаточная) сумма квадратов отклонений.
В разложении (1.30) заключена основная идея дисперсионного ана­лиза: общая вариация переменной, порожденная влиянием фактора и измеренная суммой SS
, складывается из двух компонент: SSB и SSR,
T
характеризующих изменчивость этой переменной между уровнями фак­тора (SS
) и изменчивость внутри уровней (SSR).
B
В дисперсионном анализе анализируются не сами суммы квадратов отклонений, а так называемые средние квадраты, которые получаются делением сумм квадратов отклонений на соответствующее число степе­ней свободы. Напомним, что число степеней свободы определяется как общее число наблюдений минус число связывающих их уравнений. По­этому для среднего квадрата MS межгрупповой дисперсии, число степеней свободы ν при его расчете используются собой одним уравнением (1.29). А для среднего квадрата MS
, являющегося несмещенной оценкой
B
k 1, так как
В =
k групповых средних, связанных между
, являю-
R
щегося несмещенной оценкой внутригрупповой дисперсии, число сте­пеней свободы ν блюдений, связанных между собой
n k, ибо при её расчете используются все n на-
R =
k уравнениями (1.28). Таким
образом, имеем
MSB = SS
/(k 1); MS
B
R = SSR
/(n k).
47
Для проверки гипотезы H0: α1 = … = αk = 0 о том, что все дифференци­альные эффекты равны нулю, вычислим наблюдаемое F-отношение:
F
МSB / MSR,
Н =
т. е. отношение среднего межгруппового квадрата к среднему внутри­групповому квадрату. Для того чтобы сделать окончательный вывод,
необходимо найти критическое значение F Фишера с учётом количества степеней свободы (ν вующего уровня значимости. Если наблюдаемое значение критерия F
по таблице распределения
кр
и νR) и соответст-
В
,
Н
вычисленное по данным выборки, принадлежит критической области (F
Н
> F
), то гипотезу отвергают; если наблюдаемое значение не при-
кр
надлежит критической области, то нет оснований отвергать гипотезу.
Принятие (не отвержение) гипотезы H вость эквивалентной гипотезы, т. е. H
: все αi = 0 означает справедли-
0
: μ1 = … = μk = μ, что все k группо-
0
вых средних равны генеральному среднему, что практически означает не значимое различие групповых и генерального средних. Результат яв-
ляется значимым, если гипотезу отвергают
, поскольку это говорит о на-
личии существенных различий между средними значениями по группам (уровням фактора).
В случае нескольких независимых групп непараметрическими ана­логами (альтернативами) однофакторного дисперсионного анализа яв­ляются ранговый дисперсионный анализ КраскелаУоллиса и медиан­ный тест. Предполагается, что файл данных должен содержать независимую переменную с кодами для однозначной
идентификации групповой принадлежности каждого наблюдения в файле. Процедура позволяет сравнивать до 10 групп. Критерий Краскела–Уоллиса основан на рангах, а не на исходных наблюдениях и предполагает, что рассмат­риваемая переменная непрерывна и измерена, как минимум, в порядко­вой шкале. Критерий Краскела–Уоллиса проверяет гипотезу: сравни­ваемые выборки имеют одно и то же
распределение или распределения с одной и той же медианой. Таким образом, интерпретация критерия схожа с интерпретацией параметрической однофакторной ANOVA, за исключением того, что этот критерий основан на рангах, а не на средних значениях. Медианный тест – это грубая версия критерия Крас­кела–Уоллиса. В этом случае просто подсчитывается число наблюдений каждой выборки,
которые попадают выше или ниже общей медианы выборок, и вычисляет затем значение хи-квадрат для таблицы сопря­женности. При нулевой гипотезе (все выборки извлечены из совокупно­стей с равными медианами) ожидается, что примерно 50 % всех наблю­дений в каждой выборке попадают выше (или ниже) общей медианы. Медианный тест особенно полезен, когда шкала
содержит искусствен-
48
ные границы и многие наблюдения попадают в ту или иную крайнюю
j
точку (оказываются вне шкалы). В этом случае медианный тест – фак­тически единственный метод сравнения выборок.
Рассмотрим теоретические основы критерия Краскела–Уоллиса на
k
примере следующей задачи [40]. Данные состоят из
Nn
j
1
наблюде-
ний, по n
наблюдений на j-ю выборку (группу), j = 1, …, k. Предполага-
j
ется следующая исходная математическая модель непараметрического однофакторного дисперсионного анализа:
x
где μ неизвестное общее среднее; τ
k
ки (
j
1

j
0
). Все ε
μ + τj + εij, i = 1, …, nj, j = 1,…, k,
ij =
неизвестный эффект j-ой выбор-
j
(случайные ошибки) взаимно независимы и извле-
ij
чены из одной и той же непрерывной совокупности. По имеющимся предположениям требуется проверить гипотезу:
H
: τ1 = τ2 =
0
… = τk
. Для
этого надо выполнить следующие действия.
1.
Проранжировать все N наблюдений вместе от меньшего к большему.
Пусть
2.
Положить для j =
Например, R
rij обозначает ранг xij в этой совместной ранжировке.
1,…, k
n
j

RrR R
jijj
сумма рангов, присвоенных выборке 1, а R*1 – сред-
1
,,
i
1
R
j

n
j
N
1
.
2
ний ранг, который получила эта выборка.
Вычислить статистику
3.
HnRR N

NN NN n

12 12
kk


11


jj
11

jj

2
 

4. На уровне значимости α отклонить H
нять H удовлетворяет условию P{H
гипотеза H
(при min(n
, если H <h(α, k, (n1, …, nk)), где постоянная h(α, k, (n1, …, nk))
0
h(α, k, (n
верна, то статистика H имеет асимптотическое
0
,, nk) →∞) распределение χ2 с k1 степенями свободы.
1

, если H h(α, k, (n
0
2
R
j
j
, …, nk))} = α. Если
1
Приближенный критерий уровня α таков: отклонить H H
верхняя α %-ая точка χ
Рассмотрим
2
χ
(k 1, α), принять H0, если H <χ2(k 1, α), где χ2(k 1, α) –
2
-распределения с k 1 степенями свободы.
двухфакторный дисперсионный анализ.
49
31

,, nk)), при-
1
.
, если
0
Двухфакторный дисперсионный анализ используется в тех случаях,
j
когда анализируется влияние двух различных факторов на результаты эксперимента (содержание микроэлементов в пробе): фактора A, имею­щего уровни A
, i = 1, …, I, и фактора B, имеющего уровни Bj, j = 1, …, J.
i
В таких моделях наблюдения могут быть оформлены по этим двум факторам в виде таблицы с двумя входами (двухфакторной таблицы), I строк которой соответствуют уровням фактора A, а J столбцов – уров­ням B. В «(i, j)-ячейку», расположенную на пересечении i-й строки и j-го столбца, записываются наблюдения, полученные при одновремен­ном
исследовании факторов A и B соответственно в i-м и j-м уровнях. В рамках двухфакторного дисперсионного анализа с повторами обозна­чим одинаковое число наблюдений в (i, j)-ячейке через K >1. Обозначим среднее результатов наблюдений (i, j)-ячейки через η
. Средним i-го
ij
уровня A называют среднее iстроки, таким образом, это среднее явля­ется средним результатом i-го уровня A, усредненным по уровням B. Аналогично определяется среднее j-го уровня B, или среднее j-го столб­ца. Теперь среднее i-го уровня A и j-го уровня B запишется в виде
J

1
iij
J
j
,
1
I
1

I
.
ij
i
1
Генеральным средним будем называть величину
IJ IJ

 
ij ij
IJ IJ

ij ij
 
11 11
11 1
.
Главный эффект i-го уровня A определяется как превышение среднего
i-го уровня над генеральным средним: α
i = ηi
ный эффект j-го уровня B определяется как β фекты α
и βj называют также эффектом iстроки и эффектом j-го
i
η∗∗. Аналогично глав-
η
η∗∗. Главные эф-
j =
j
столбца. Мы придаем особое значение тому, что главные эффекты од­ного фактора являются средними по уровням других факторов и, таким образом, обычно зависят от того, каковы уровни других факторов, при­сутствующих в эксперименте (когда используется модель с фиксиро­ванными факторами).
Если
мы будем определять главный эффект i-го уровня A специ­ально по отношению к j-му уровню B, то естественно определить его как превышение η
ηij − η Главный эффект i-го уровня A, определенный выше как α
фактически средним для η
над средним j-го столбца, т. е.
ij
.
j
η
ij
по столбцам: α
j
, является
i
J
1

i
()
j
1
ij j
J
Пре-
.
50
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]