Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
1 Мб
Скачать
ного числа. Число задается пользователем. Расстояние вычисляется
j
j
только по принципу «дальнего соседа» (то же самое можно сказать и про расстояние между классами, объединенными в классы – только принцип дальнего соседа при
  ).
1/2, 0
3. Метод средней связи.
Алгоритм образования кластеров совпа­дает с алгоритмом одиночной связи, однако при решении вопроса о включении нового объекта в кластер вычисления производятся по принципу средней связи. Как и в методе полной связи, все вычисленные между кластерами расстояния сравниваются с задаваемым пользовате­лем числом. И если оно (расстояние) меньше заданного числа, новый объект
включается в старый класс. Таким образом, метод средней связи отличается от метода полной связи только способом вычисления рас­стояния между кластерами.
Метод УОРДА. Пусть
4.
,,
XX
1
данные, причем каждый век-
n
тор образует один кластер. Находим матрицу расстояний, используя ка­кую-нибудь метрику (например, расстояние Махаланобиса), определяем по ней наиболее близкие друг к другу кластеры. Вычисляем сумму квадратов отклонений векторов внутри кластера
n
p
k
k – номер кластера, i – номер вектора в кластере, j – номер коор-
где динаты
X  ,
p
i
n – число векторов в кластере,
VXX


kijjk
ij
k
()

11
S по формуле:
k
2
,
X
выборочное
k
среднее
X в
друг от друга внутри кластера (нового
V следует проводить до и после объединения, причём нужно переби-
k
. Величина
S
k
характеризует отклонения векторов
V
k
+
S
k
или старого
S
i
). Расчет
S
k
рать все возможные варианты таких объединений. В дальнейшем в кластер
приводят к наименьшему изменению
S добавляются только те векторы или кластеры, которые
k
V после объединения и, как
k
следствие, которые будут расположены на минимальном расстоянии от исходного кластера
Рассмотрим далее итеративные методы.
S .
k
Сущность итеративных
методов заключается в том, что кластеризация начинается с задания не­которых начальных условий. Например, требуется задать число полу­чаемых кластеров или задать расстояние, определяющее конец процесса образования кластеров, и т. д. Начальные условия выбираются согласно результату, который нужен исследователю. Однако обычно они задают­ся по решению, найденному одним из ративным методам относят метод
агломеративных методов. К ите-
k-средних и метод поиска сгущений.
81
1. Метод k-средних. Пусть имеются векторы
необходимо разбить на чайным образом выбираем
k кластеров. На нулевом шаге из n векторов слу-
k из них, считая, что каждый образует один
кластер. Получаем множество кластеров-эталонов
(0) (0)
,,
 , определяющими число элементов в них. Индекс сверху
1
k
,,
XX и их
1
(0) (0)
,,
ee с весами
1
n
k
p
обозначает номер итерации. На этом этапе все веса равны единице. На следующем шаге из оставшегося набора данных выбираем некоторый вектор, например,
лонами
(0) (0)
,,
ee по некоторой метрике, например по евклидовой:
1
X и вычисляем матрицу расстояний между iX и эта-
i
k
2() () (0)2
(,) ( )
Xe X X

mjmj
0

ii
На основе знания вычисленной матрицы расстояний вектор
p
j
, 1,mk .
1
,
помеща-
X
i
ется в тот эталон, расстояние до которого минимально. Допустим для определенности, что это
(0)
e . Он заменяется новым, пересчитанным с
m
учетом присоединенной точки, по формуле
(0) (0)
eX

mm i
(1)
e
m
 
(0)

m
(0)
eX
mi
, включен
X
1
i
, не включен.
Кроме того, пересчитывается и вес:
(0)

(1)

m
1, включен
mi
(0)
mi
X
, не включен.
X
Если в матрице встречается два или более минимальных расстояния, то
X включают в кластер с наименьшим порядковым номером.
i
На следующем шаге выбирают следующий вектор из оставшихся,
и процедура повторяется. Таким образом, через
()nk
e
эталону
будет соответствовать вес
m
ции завершится. При большом
n и малом k алгоритм быстро сходится
()nk
и процедура кластериза-
m
nk
шагов каждому
к устойчивому решению, т. е. к решению, в котором эталоны, получен­ные после первого применения алгоритма, совпадают по количеству и составу с эталонами, найденными при повторном применении метода. Тем не менее, алгоритмическую процедуру всегда повторяют несколько раз, используя полученное в предыдущих расчетах разбиение в качестве векторов-эталонов (
как начальное приближение): найденные ранее эта-
82
лоны
s
s
s
nke
1
() ()
nk nk

,
,...,
ee
2
k
принимаются за
(0) (0)
,,
ee , и алгоритмическая
1
k
()
процедура повторяется.
Метод поиска сгущений. Это следующий итеративный алго-
2.
ритм. Он не требует априорного задания числа кластеров. На первом шаге вычисляется матрица расстояний между
,,
XX
1
n
p
по какой-нибудь
метрике. Затем случайным образом выбирают один вектор, который будет играть роль центра первого кластера. Это начальное приближение. Поло­жим, что этот вектор лежит в центре
p-мерной сферы радиуса R, причем
этот радиус задается исследователем. После этого определяются векторы
,,
XX , попавшие внутрь этой сферы, и по ним высчитывается выбо-
1
рочное математическое ожидание
s
k
k
1
XX
k
j
. Затем центр сферы пере-
j
1
носится в
итерационного процесса является равенство векторов средних ных на
X , и расчетная процедура повторяется. Условием окончания
X , найден-
m и (m+1) шагах. Попавшие внутрь сферы элементы
,,
XX
1
s
k
включаем в один кластер и исключаем их из дальнейшего исследования. Для оставшихся точек алгоритм повторяется. Алгоритм сходится при лю­бом выборе начального приближения и любом объеме исходных данных. Однако для получения устойчивого разбиения (т. е. разбиения, в котором кластеры, найденные после первого применения алгоритма, совпадают по количеству и составу с
кластерами, найденными при повторном примене­нии метода) рекомендуется повторить алгоритмическую процедуру не­сколько раз при различных значениях радиуса сферы
R. Признаком устой-
чивого разбиения будет образование одного и того же числа кластеров с одним и тем же составом.
Заметим, что задача кластеризации не имеет единственного решения. Как следствие, перебрать все допустимые разбиения данных на классы достаточно сложно и не всегда представляется возможным. Для того что­бы оценить качество различных способов
кластеризации вводят понятие функционала качества разбиения, который принимает минимальное зна­чение на наилучшем (с точки зрения исследователя) разбиении.
,,
Пусть
XX некоторая совокупность наблюдений, кото-
1
рая разбивается на классы
p
n
{, , }
SS S
, причем k заранее известно.
1
k
Тогда основные функционалы качества разбиения при известном числе кластеров имеют вид:
Взвешенная сумма внутриклассовых дисперсий
1)
k
() ( ,())
QS X al

1

lXS

1
ml
2
m
,
83
где ()al – выборочное математическое ожидание кластера
j
j
j
A
j
H
Функционал
позволяет оценить меру однородности всех кла-
()QS
1
S .
l
стеров в целом.
Сумма попарных внутриклассовых расстояний между элементами
2)
k
() ( , )
QS XX

2

lXXS

1,
ijl
2
ij
или
k
где
n – число элементов в кластере lS .
l
Обобщенная внутриклассовая дисперсия
3)
() ( , )
QS XX

2

n
lXXS

1,
l
ijl

1
QS nA
() det
3
 
где
n – число элементов в jS ,
выборочная ковариационная мат-
k
j
2
ij
j
1
,
,
рица для
S .
Функционал
()QS является средней арифметической характери-
3
стикой обобщенных внутриклассовых дисперсий, подсчитанных для каждого кластера. Как известно, обобщенная дисперсия позволяет оце­нить степень рассеивания многомерных наблюдений. Поэтому
()QS
3
позволяет оценить средний разброс векторов наблюдений в классах
,,
SS
1
сия.
. Отсюда и его названиеобобщенная внутриклассовая диспер-
k
()QS применяется в случае, когда необходимо решить задачу
3
о сжатии данных или о сосредоточении наблюдений в пространстве с размерностью меньше исходной.
Качество классификации наблюдений можно оценить и с помощью
4)
критерия Хотеллинга. Для этого применим критерий для проверки гипотезы
о равенстве векторов средних двух многомерных со-
0
вокупностей и вычислим статистику
nn
n и mn – число векторов в классах ,
где
l
исходные данные;
QS X X S X X
() ()()
4*
S объединенная ковариационная матрица класте-
*
1
ров
,
SS:
lm
SXXXX

*
nn

lm
lm
 
nn
lm

()
ll mm
2
lm lm
1
SS; ,
lm
XX – центрированные
lm
,
. Как и ранее, значение
()QS
4
сравнивают с табличным значением, вычисленным согласно формуле
84
2
H
Z
Z
j
Z
Tnn F
mnnm l m mnnm
   
,, 1 ,, 1
lm lm
(2)

nn m
m

lm
,
1
где m – исходная размерность векторов наблюдений, α – уровень зна­чимости.
Гипотеза
()
QS T
4,,
2
, и отвергается в противном случае.
mn m

принимается с вероятностью (1 ) , если
0
Оценить качество разбиения на классы можно и эмпирически. На­пример, можно сравнивать выборочные средние, найденные для каждо­го класса, с выборочным средним всей совокупности наблюдений. Если они разнятся в два раза и более, то разбиение хорошее. Более коррект­ное сравнение кластерных выборочных средних с выборочным
средним всей совокупности наблюдений приводит к использованию дисперси­онного анализа для оценки качество разбиения на классы.
Если число кластеров в
{, , }
SS S
заранее неизвестно, то ис-
1
k
пользуют следующие функционалы качества разбиения при произволь­но выбираемом целом
m:
1)
() ()
QS I S
IS XX
 , , 0,
1
() ( , )
mjl
m
k
11




nn
iXSXS
1

()
m
i
jili
S
 где
m
1
m
средняя мера внутриклас-
сового рассеяния,
1
m
1()
ZS
()
m
S , ()
2)
()(())( ())
QS I S Z S
2


nn
i
VX – число элементов в кластере, содержащем точку .iX
i
, , 0.
mm
n
VX

i
 
1
m
мера концентрации точек множества

Заметим, что при произвольном значении параметра m функционал
()
S достигает минимума, равного 1/ n , если исходное разбиение на
m
кластеры
{}
SX , так как ()1
j
{, , }
SS S является разбиением на моно кластеры
1
k
VX  . В то же время ()
i
m
S достигает максимума,
равного 1, если
так как ()
S – один кластер, содержащий все исходные данные,
VX n . В частных случаях можно показать, что
i
85
ZS
()
1
1
,
k
n
Z
I
Z
I
Z

где k – число различных кластеров в
где
n – число элементов в кластере iS , () min
i
k
()
1
Sn
1
2
n
i
2
.
i
1
{, , }
SS S
,
1
k
ZS
ZS
() max


i

 
i

i
n
n
i
n
Заметим, что в случае неизвестного числа кластеров функционалы
качества разбиения ()QS можно выбирать в виде алгебраической ком- бинации (суммы, разности, произведения, отношения) двух функциона-
лов
(),
S ()
m
растающей функцией числа классов .k Такое поведение (),
, так как первый является убывающей, а другой – воз-
S
m
m
S ()
S
m
гарантирует существование экстремума ()QS .
1.2.9. Особенности применения статистического анализа экологогеохимической информации
в случае малых выборок
Эколого-геохимическая оценка состояния окружающей среды час­то проводится с использованием небольшого объема выборки. Основ­ным фактором в данном случае являются дорогостоящие методы анали­за. Рассмотрим возможность применения методов статистической обработки при небольшом объеме выборок для сопоставления результа­тов исследований химического состава солевых образований из посуды населенных пунктов Томской и Челябинской
областей.
При построении статистических моделей предполагается, что вы­борочная совокупность удовлетворяет требованиям массовости (объем выборки
n > 30), однородности (измерения выполнены одинаковым
способом), случайности (непредсказуемость результата единичного вы­борочного измерения, объективность отбора проб) и независимости (не­зависимости результата каждого измерения от времени и места измере­ния). В ходе выполнения эколого-геохимических исследований возникают ситуации, когда требования математической статистики не могут быть приняты безоговорочно. Так, например, в силу дороговизны метода анализа приходится мириться с нарушением первого требова­ния, т. е. использовать малые выборки. В этом случае применение ста­тистических методов должно базироваться на всестороннем анализе ха­рактера решаемой задачи, выборе наиболее эффективных статистических методов обработки измерений, методов статистических оценок и статистических критериев, менее чувствительных к объему выборки или учитывающих особенность
малого объема выборки.
,
,
86
Статистический анализ эколого-геохимической информации
f
в случае малых выборок проводят поэтапно:
I. Проверка гипотезы о законе распределения с применением сово-
купности всесторонних способов:
1. Использование опыта геохимической практики [14]. Так, на-
пример, элементы с высокой концентрацией распределены по нормаль­ному закону, а элементы с низкой концентрацией распределены по ло­гарифмически нормальному закону
.
2. Графический способ придает выборке наглядную форму. Осо-
бенностью графического способа в случае малого объема выборки явля­ется не построение гистограммы, а сравнение выборочных плотностей
частот
, вычисленных по частотам ni делением их на n и на длину i-го
i
интервала, с теоретической кривой плотности распределения. В геохи­мической практике большое значение имеет нормальный закон распре-
деления. Таково распределение N(Х,
,) химических элементов с высо-
кой концентрацией Х. Для химических элементов с низкой концентрацией Х следует проверить гипотезу о распределении случай­ной величины Х по логарифмически нормальному закону, т. е. гипотезу о распределение случайной величины lnX по нормальному закону
N(lnX,
,
). Вначале по выборочным данным вычисляют точечные
L
L
несмещенные оценки математического ожидания и стандартного откло-
нения случайной величины (a и s – для и или a
L
для L и
L
),
L
и s затем рассматривают интервал (a –3s, a +3s) для случайной величины Х или (a
3sL, aL +3sL) для случайной величины lnХ, в котором находится
L
абсолютное большинство выборочных значений ( 99,73 %) нормально
распределенной случайной величины. Данный интервал разбивают на k неравномерных интервалов, где число k определяется с учетом эмпири­ческой формулы k
1+ 4lgn [42]. Затем производят последовательную
=
парную группировку элементов выборки по принципу наименьшего расстояния, когда два ближайших элемента выборки объединяют в группу, усредняя их значения для определения центра группы и т. д., пока не останется k групп. Внутренними границами интервалов выби­рают значения средних арифметических центров соседних групп. Про­иллюстрируем такой
подход на примере выборки (А) содержания X хи­мического элемента Sc в солевых отложениях населенного пункта Аргаяш Челябинской области (табл. 1.12).
Вычисляя точечные несмещенные оценки по формулам (1.16), (1.17)
nn
axs xa


nn
11

ii
11
22
,()
ii
87
1
при n = 7, получим a0,47 и s  0,33. В данном случае k = 1 + 4 lg7  4,38,
f
f
т. е. 4 < k < 5. В связи с этим рассмотрим два варианта дробления ин­тервала выборочных значений (a –3s, a +3s)
(–0,53; 1,47) на k = 4
=
и 5 интервалов
Таблица.1.12
Содержание X химического элемента Sc в солевых отложениях из посуды
с. Аргаяш Челябинской области
Sc,
мг/кг
X
lnX
1 2 3 4 5 6 7
0,26 0,27 0,29 0,38 0,38 0,52 1,2
1,347 1,309 1,238 0,968 0,968 0,654 0,182
Номер пробы
Построенные группированные распределения позволяют рассчи­тать выборочные плотности частот деля n
на n и на длину i-го интервала.
i
по соответствующим частотам ni,
i
Сравнение взаимного расположение эмпирических плотностей час­тот в координатах (
, xi) с теоретическими кривыми плотностей рас-
i
пределения по нормальному (1.10) и логнормальному (1.11) законам от­ражено на рис. 1.19.
Рис. 1.19. Взаимное расположение точечных эмпирических плотностей
частот для случаев k = 4 и 5 в координатах (
f , x
) с теоретическими
i
i
кривыми плотностей распределения по нормальному fN(x) (толстая кривая)
и логнормальному fLN(x) (тонкая кривая) законам.
Таким образом, согласно графическому способу, можно предполо­жить, что данная выборка (А) распределена скорее по логнормальному закону, чем по нормальному.
88
Гипотезу о распределении выборки (А) по нормальному закону
A
E
можно отвергнуть на том основании, что в этом случае соответствую­щий нормальный закон N(x; 0,47; 0,33) приводит к возможности при­нять случайной величиной Х отрицательное значение с вероятностью
0,08, что превышает принятый здесь уровень значимости
0,05. На
=
рис. 1.19 затемненной заливкой выделены области отрицательных зна­чений выборки (А).
Более строгим способом является аналитические критерии, рас­сматриваемые ниже.
3. Аналитические способы сравнения числовых характеристик
(Справочник …, 1987). В качестве критерия соответствия эмпирического
распределения нормальному теоретическому используют отношения выбо­рочных показателей асимметрии A и эксцесса E за вычетом их смещений
m
и m
A
венно (1.22): t
соответственно к их стандартным отклонениям А и
Е
()/
Am и t
1 =
A
()/
Em
2 =
 . Если эти отношения по аб-
E
соответст-
Е
солютной величине превышают 3, то гипотеза о нормальном распределе­нии отвергается. Для нормального распределения вероятность того, что выборочное значение этих отношений будет отличаться от математическо­го ожидания больше, чем на 3 стандартных отклонения, очень мала
(0,0027). Обычно ограничиваются асимптотическими оценками стандарт-
ных отклонений показателей асимметрии и
11
xx xxs

nn n
,,,

ik i
ii
 (1.37)


34
,3,AE
34
ss
эксцесса [4, 14, 30, 41]:
k
n
2
2
1
0, 6/ , 0, 24/
mnm n
  .
AA EE
 
Особенностью применения этого критерия в случае малых n явля­ется использование более точных оценок стандартных отклонений по­казателей асимметрии и эксцесса [4, 15, 28, 33]. Для точечных оценок показателей асимметрии
A и эксцесса E оценки стандартных отклоне-
ний показателей асимметрии и эксцесса имеют вид:
11
xx xxs A E

nn nss
,,,,3

ik i
ii


m
0, ,
AA
k
624(2)(3)
  
m
EE
,.

1(1)(3)(5)
nnnn
89
n
2
6( 2)

(1)(3)
nn
nn n
2
1
n

2
34
34
,
(1.38)
При этом сама оценка Е является смещенной. В работе [18] наряду
A
A
E
А
Е
со смещенными оценками приведены также и несмещенные
,:
E
nn
AE
(1)

nnnn
0, 0,
6( 1) 24( 1)
 

A
( 2)( 1)( 3) ( 3)( 2)( 3)( 5)
nnn nnnn
 

34
,3
2(2)(3)1
nn nn
1.5 2

22
mm
A

nn
(1)(1) 6

,
E
E
 
,

(1.39)
2
.
Из вида смещенных и несмещенных оценок показателей асиммет­рии и эксцесса следуют формулы, связывающие несмещенные оценки
,AE
со смещенными А и Е:
22 3

AAE E
nnn n
  
nn nn n nn
(1)( 2) (1)( 2)( 3) (1)
,33
В случае малого объема выборки

(1) (1)
n смещенные и несмещенные
 
.
2

оценки могут отличаться в несколько раз. Так, например, в случае вы­борки (А) вычисления по формулам (1.38) дают для смещенных оценок
А 1,39 и Е 0,30, а по формулам (1.39) для несмещенных оценок
2,27 и
5,39. Сравнение смещенных и несмещенных оценок по-
казателей асимметрии, эксцесса и критерия соответствия эмпирического распределения нормальному теоретическому
N(x; 0,47; 0,33) отражено
в табл. 1.13.
Таблица 1.13
Проверка гипотезы о нормальном законе распределения Sc по смещенным
и несмещенным оценкам показателей асимметрии А и эксцесса Е
Расчетные формулы
Е
t2
А
t1
(1.37) (1.38) (1.39) (1.37) (1.38) (1.39)
1,391 1,391 2,272 0,303 0,303 5,389
0,926 0,612 0,793 1,852 0,661 1,587
1,50 2,27 2,86 0,16 1,59 3,40
Как видно из табл. 1.13, различие в критериях t1 и t2, вычисляемых по формулам (1.29) для смещенных оценок и по формулам (1.30) для несмещенных оценок, является существенным настолько, что приводит к разным выводам относительно соответствия эмпирического распреде-
t2 =
ления нормальному теоретическому (для несмещенных оценок
3,396 > 3, т. е. распределение выборки (А) существенно отличается от нор- мального закона).
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]