Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерный статистический анализ эколого-геохимических измерений. Часть I. Математические основы. Учебное пособие
.pdf
ного числа. Число задается пользователем. Расстояние вычисляется
j
j
только по принципу «дальнего соседа» (то же самое можно сказать и
про расстояние между классами, объединенными в классы – только
принцип дальнего соседа при
).
1/2, 0
3. Метод средней связи.
Алгоритм образования кластеров совпадает с алгоритмом одиночной связи, однако при решении вопроса о
включении нового объекта в кластер вычисления производятся по
принципу средней связи. Как и в методе полной связи, все вычисленные
между кластерами расстояния сравниваются с задаваемым пользователем числом. И если оно (расстояние) меньше заданного числа, новый
объект
включается в старый класс. Таким образом, метод средней связи
отличается от метода полной связи только способом вычисления расстояния между кластерами.
Метод УОРДА. Пусть
4.
,,
XX
1
– данные, причем каждый век-
n
тор образует один кластер. Находим матрицу расстояний, используя какую-нибудь метрику (например, расстояние Махаланобиса), определяем
по ней наиболее близкие друг к другу кластеры. Вычисляем сумму
квадратов отклонений векторов внутри кластера
n
p
k
k – номер кластера, i – номер вектора в кластере, j – номер коор-
где
динаты
X ,
p
i
n – число векторов в кластере,
VXX
kijjk
ij
k
()
11
S по формуле:
k
2
,
X
– выборочное
k
среднее
X в
друг от друга внутри кластера (нового
V следует проводить до и после объединения, причём нужно переби-
k
. Величина
S
k
характеризует отклонения векторов
V
k
+
S
k
или старого
S
i
). Расчет
S
k
рать все возможные варианты таких объединений. В дальнейшем в
кластер
приводят к наименьшему изменению
S добавляются только те векторы или кластеры, которые
k
V после объединения и, как
k
следствие, которые будут расположены на минимальном расстоянии
от исходного кластера
Рассмотрим далее итеративные методы.
S .
k
Сущность итеративных
методов заключается в том, что кластеризация начинается с задания некоторых начальных условий. Например, требуется задать число получаемых кластеров или задать расстояние, определяющее конец процесса
образования кластеров, и т. д. Начальные условия выбираются согласно
результату, который нужен исследователю. Однако обычно они задаются по решению, найденному одним из
ративным методам относят метод
агломеративных методов. К ите-
k-средних и метод поиска сгущений.
81

1. Метод k-средних. Пусть имеются векторы
необходимо разбить на
чайным образом выбираем
k кластеров. На нулевом шаге из n векторов слу-
k из них, считая, что каждый образует один
кластер. Получаем множество кластеров-эталонов
(0) (0)
,,
, определяющими число элементов в них. Индекс сверху
1
k
,,
XX и их
1
(0) (0)
,,
ee с весами
1
n
k
p
обозначает номер итерации. На этом этапе все веса равны единице. На
следующем шаге из оставшегося набора данных выбираем некоторый
вектор, например,
лонами
(0) (0)
,,
ee по некоторой метрике, например по евклидовой:
1
X и вычисляем матрицу расстояний между iX и эта-
i
k
2() () (0)2
(,) ( )
Xe X X
mjmj
0
ii
На основе знания вычисленной матрицы расстояний вектор
p
j
, 1,mk .
1
,
помеща-
X
i
ется в тот эталон, расстояние до которого минимально. Допустим для
определенности, что это
(0)
e . Он заменяется новым, пересчитанным с
m
учетом присоединенной точки, по формуле
(0) (0)
eX
mm i
(1)
e
m
(0)
m
(0)
eX
mi
, включен
X
1
i
, не включен.
Кроме того, пересчитывается и вес:
(0)
(1)
m
1, включен
mi
(0)
mi
X
, не включен.
X
Если в матрице встречается два или более минимальных расстояния, то
X включают в кластер с наименьшим порядковым номером.
i
На следующем шаге выбирают следующий вектор из оставшихся,
и процедура повторяется. Таким образом, через
()nk
e
эталону
будет соответствовать вес
m
ции завершится. При большом
n и малом k алгоритм быстро сходится
()nk
и процедура кластериза-
m
nk
шагов каждому
к устойчивому решению, т. е. к решению, в котором эталоны, полученные после первого применения алгоритма, совпадают по количеству
и составу с эталонами, найденными при повторном применении метода.
Тем не менее, алгоритмическую процедуру всегда повторяют несколько
раз, используя полученное в предыдущих расчетах разбиение в качестве
векторов-эталонов (
как начальное приближение): найденные ранее эта-
82

лоны
s
s
s
nke
1
() ()
nk nk
,
,...,
ee
2
k
принимаются за
(0) (0)
,,
ee , и алгоритмическая
1
k
()
процедура повторяется.
Метод поиска сгущений. Это следующий итеративный алго-
2.
ритм. Он не требует априорного задания числа кластеров. На первом шаге
вычисляется матрица расстояний между
,,
XX
1
n
p
по какой-нибудь
метрике. Затем случайным образом выбирают один вектор, который будет
играть роль центра первого кластера. Это начальное приближение. Положим, что этот вектор лежит в центре
p-мерной сферы радиуса R, причем
этот радиус задается исследователем. После этого определяются векторы
,,
XX , попавшие внутрь этой сферы, и по ним высчитывается выбо-
1
рочное математическое ожидание
s
k
k
1
XX
k
j
. Затем центр сферы пере-
j
1
носится в
итерационного процесса является равенство векторов средних
ных на
X , и расчетная процедура повторяется. Условием окончания
X , найден-
m и (m+1) шагах. Попавшие внутрь сферы элементы
,,
XX
1
s
k
включаем в один кластер и исключаем их из дальнейшего исследования.
Для оставшихся точек алгоритм повторяется. Алгоритм сходится при любом выборе начального приближения и любом объеме исходных данных.
Однако для получения устойчивого разбиения (т. е. разбиения, в котором
кластеры, найденные после первого применения алгоритма, совпадают по
количеству и составу с
кластерами, найденными при повторном применении метода) рекомендуется повторить алгоритмическую процедуру несколько раз при различных значениях радиуса сферы
R. Признаком устой-
чивого разбиения будет образование одного и того же числа кластеров
с одним и тем же составом.
Заметим, что задача кластеризации не имеет единственного решения.
Как следствие, перебрать все допустимые разбиения данных на классы
достаточно сложно и не всегда представляется возможным. Для того чтобы оценить качество различных способов
кластеризации вводят понятие
функционала качества разбиения, который принимает минимальное значение на наилучшем (с точки зрения исследователя) разбиении.
,,
Пусть
XX – некоторая совокупность наблюдений, кото-
1
рая разбивается на классы
p
n
{, , }
SS S
, причем k заранее известно.
1
k
Тогда основные функционалы качества разбиения при известном числе
кластеров имеют вид:
Взвешенная сумма внутриклассовых дисперсий
1)
k
() ( ,())
QS X al
1
lXS
1
ml
2
m
,
83

где ()al – выборочное математическое ожидание кластера
j
j
j
A
j
H
Функционал
позволяет оценить меру однородности всех кла-
()QS
1
S .
l
стеров в целом.
Сумма попарных внутриклассовых расстояний между элементами
2)
k
() ( , )
QS XX
2
lXXS
1,
ijl
2
ij
или
k
где
n – число элементов в кластере lS .
l
Обобщенная внутриклассовая дисперсия
3)
() ( , )
QS XX
2
n
lXXS
1,
l
ijl
1
QS nA
() det
3
где
n – число элементов в jS ,
– выборочная ковариационная мат-
k
j
2
ij
j
1
,
,
рица для
S .
Функционал
()QS является средней арифметической характери-
3
стикой обобщенных внутриклассовых дисперсий, подсчитанных для
каждого кластера. Как известно, обобщенная дисперсия позволяет оценить степень рассеивания многомерных наблюдений. Поэтому
()QS
3
позволяет оценить средний разброс векторов наблюдений в классах
,,
SS
1
сия.
. Отсюда и его название – обобщенная внутриклассовая диспер-
k
()QS применяется в случае, когда необходимо решить задачу
3
о сжатии данных или о сосредоточении наблюдений в пространстве
с размерностью меньше исходной.
Качество классификации наблюдений можно оценить и с помощью
4)
критерия Хотеллинга. Для этого применим критерий для проверки
гипотезы
о равенстве векторов средних двух многомерных со-
0
вокупностей и вычислим статистику
nn
n и mn – число векторов в классах ,
где
l
исходные данные;
QS X X S X X
() ()()
4*
S – объединенная ковариационная матрица класте-
*
1
ров
,
SS:
lm
SXXXX
*
nn
lm
lm
nn
lm
()
ll mm
2
lm lm
1
SS; ,
lm
XX – центрированные
lm
,
. Как и ранее, значение
()QS
4
сравнивают с табличным значением, вычисленным согласно формуле
84

2
H
Z
Z
j
Z
Tnn F
mnnm l m mnnm
,, 1 ,, 1
lm lm
(2)
nn m
m
lm
,
1
где m – исходная размерность векторов наблюдений, α – уровень значимости.
Гипотеза
()
QS T
4,,
2
, и отвергается в противном случае.
mn m
принимается с вероятностью (1 ) , если
0
Оценить качество разбиения на классы можно и эмпирически. Например, можно сравнивать выборочные средние, найденные для каждого класса, с выборочным средним всей совокупности наблюдений. Если
они разнятся в два раза и более, то разбиение хорошее. Более корректное сравнение кластерных выборочных средних с выборочным
средним
всей совокупности наблюдений приводит к использованию дисперсионного анализа для оценки качество разбиения на классы.
Если число кластеров в
{, , }
SS S
заранее неизвестно, то ис-
1
k
пользуют следующие функционалы качества разбиения при произвольно выбираемом целом
m:
1)
() ()
QS I S
IS XX
, , 0,
1
() ( , )
mjl
m
k
11
nn
iXSXS
1
()
m
i
jili
S
где
m
1
m
– средняя мера внутриклас-
сового рассеяния,
1
m
1()
ZS
()
m
S , ()
2)
()(())( ())
QS I S Z S
2
nn
i
VX – число элементов в кластере, содержащем точку .iX
i
, , 0.
mm
n
VX
i
1
m
– мера концентрации точек множества
Заметим, что при произвольном значении параметра m функционал
()
S достигает минимума, равного 1/ n , если исходное разбиение на
m
кластеры
{}
SX , так как ()1
j
{, , }
SS S является разбиением на моно кластеры
1
k
VX . В то же время ()
i
m
S достигает максимума,
равного 1, если
так как ()
S – один кластер, содержащий все исходные данные,
VX n . В частных случаях можно показать, что
i
85
ZS
()
1
1
,
k

n
Z
I
Z
I
Z
где k – число различных кластеров в
где
n – число элементов в кластере iS , () min
i
k
()
1
Sn
1
2
n
i
2
.
i
1
{, , }
SS S
,
1
k
ZS
ZS
() max
i
i
i
n
n
i
n
Заметим, что в случае неизвестного числа кластеров функционалы
качества разбиения ()QS можно выбирать в виде алгебраической ком-
бинации (суммы, разности, произведения, отношения) двух функциона-
лов
(),
S ()
m
растающей функцией числа классов .k Такое поведение (),
, так как первый является убывающей, а другой – воз-
S
m
m
S ()
S
m
гарантирует существование экстремума ()QS .
1.2.9. Особенности применения статистического анализа
экологогеохимической информации
в случае малых выборок
Эколого-геохимическая оценка состояния окружающей среды часто проводится с использованием небольшого объема выборки. Основным фактором в данном случае являются дорогостоящие методы анализа. Рассмотрим возможность применения методов статистической
обработки при небольшом объеме выборок для сопоставления результатов исследований химического состава солевых образований из посуды
населенных пунктов Томской и Челябинской
областей.
При построении статистических моделей предполагается, что выборочная совокупность удовлетворяет требованиям массовости (объем
выборки
n > 30), однородности (измерения выполнены одинаковым
способом), случайности (непредсказуемость результата единичного выборочного измерения, объективность отбора проб) и независимости (независимости результата каждого измерения от времени и места измерения). В ходе выполнения эколого-геохимических исследований
возникают ситуации, когда требования математической статистики не
могут быть приняты безоговорочно. Так, например, в силу дороговизны
метода анализа приходится мириться с нарушением первого требования, т. е. использовать малые выборки. В этом случае применение статистических методов должно базироваться на всестороннем анализе характера решаемой задачи, выборе наиболее эффективных
статистических методов обработки измерений, методов статистических
оценок и статистических критериев, менее чувствительных к объему
выборки или учитывающих особенность
малого объема выборки.
,
,
86

Статистический анализ эколого-геохимической информации
f
в случае малых выборок проводят поэтапно:
I. Проверка гипотезы о законе распределения с применением сово-
купности всесторонних способов:
1. Использование опыта геохимической практики [14]. Так, на-
пример, элементы с высокой концентрацией распределены по нормальному закону, а элементы с низкой концентрацией распределены по логарифмически нормальному закону
.
2. Графический способ придает выборке наглядную форму. Осо-
бенностью графического способа в случае малого объема выборки является не построение гистограммы, а сравнение выборочных плотностей
частот
, вычисленных по частотам ni делением их на n и на длину i-го
i
интервала, с теоретической кривой плотности распределения. В геохимической практике большое значение имеет нормальный закон распре-
деления. Таково распределение N(Х,
,) химических элементов с высо-
кой концентрацией Х. Для химических элементов с низкой
концентрацией Х следует проверить гипотезу о распределении случайной величины Х по логарифмически нормальному закону, т. е. гипотезу
о распределение случайной величины lnX по нормальному закону
N(lnX,
,
). Вначале по выборочным данным вычисляют точечные
L
L
несмещенные оценки математического ожидания и стандартного откло-
нения случайной величины (a и s – для и или a
L
– для L и
L
),
L
и s
затем рассматривают интервал (a –3s, a +3s) для случайной величины Х
или (a
–3sL, aL +3sL) для случайной величины lnХ, в котором находится
L
абсолютное большинство выборочных значений ( 99,73 %) нормально
распределенной случайной величины. Данный интервал разбивают на k
неравномерных интервалов, где число k определяется с учетом эмпирической формулы k
1+ 4lgn [42]. Затем производят последовательную
=
парную группировку элементов выборки по принципу наименьшего
расстояния, когда два ближайших элемента выборки объединяют
в группу, усредняя их значения для определения центра группы и т. д.,
пока не останется k групп. Внутренними границами интервалов выбирают значения средних арифметических центров соседних групп. Проиллюстрируем такой
подход на примере выборки (А) содержания X химического элемента Sc в солевых отложениях населенного пункта
Аргаяш Челябинской области (табл. 1.12).
Вычисляя точечные несмещенные оценки по формулам (1.16), (1.17)
nn
axs xa
nn
11
ii
11
22
,()
ii
87
1

при n = 7, получим a 0,47 и s 0,33. В данном случае k = 1 + 4 lg7 4,38,
f
f
т. е. 4 < k < 5. В связи с этим рассмотрим два варианта дробления интервала выборочных значений (a –3s, a +3s)
(–0,53; 1,47) на k = 4
=
и 5 интервалов
Таблица.1.12
Содержание X химического элемента Sc в солевых отложениях из посуды
с. Аргаяш Челябинской области
Sc,
мг/кг
X
lnX
1 2 3 4 5 6 7
0,26 0,27 0,29 0,38 0,38 0,52 1,2
1,347 1,309 1,238 0,968 0,968 0,654 0,182
Номер пробы
Построенные группированные распределения позволяют рассчитать выборочные плотности частот
деля n
на n и на длину i-го интервала.
i
по соответствующим частотам ni,
i
Сравнение взаимного расположение эмпирических плотностей частот в координатах (
, xi) с теоретическими кривыми плотностей рас-
i
пределения по нормальному (1.10) и логнормальному (1.11) законам отражено на рис. 1.19.
Рис. 1.19. Взаимное расположение точечных эмпирических плотностей
частот для случаев k = 4 и 5 в координатах (
f , x
) с теоретическими
i
i
кривыми плотностей распределения по нормальному fN(x) (толстая кривая)
и логнормальному fLN(x) (тонкая кривая) законам.
Таким образом, согласно графическому способу, можно предположить, что данная выборка (А) распределена скорее по логнормальному
закону, чем по нормальному.
88

Гипотезу о распределении выборки (А) по нормальному закону
A
E
можно отвергнуть на том основании, что в этом случае соответствующий нормальный закон N(x; 0,47; 0,33) приводит к возможности принять случайной величиной Х отрицательное значение с вероятностью
0,08, что превышает принятый здесь уровень значимости
0,05. На
=
рис. 1.19 затемненной заливкой выделены области отрицательных значений выборки (А).
Более строгим способом является аналитические критерии, рассматриваемые ниже.
3. Аналитические способы сравнения числовых характеристик
(Справочник …, 1987). В качестве критерия соответствия эмпирического
распределения нормальному теоретическому используют отношения выборочных показателей асимметрии A и эксцесса E за вычетом их смещений
m
и m
A
венно (1.22): t
соответственно к их стандартным отклонениям А и
Е
()/
Am и t
1 =
A
()/
Em
2 =
. Если эти отношения по аб-
E
соответст-
Е
солютной величине превышают 3, то гипотеза о нормальном распределении отвергается. Для нормального распределения вероятность того, что
выборочное значение этих отношений будет отличаться от математического ожидания больше, чем на 3 стандартных отклонения, очень мала
(0,0027). Обычно ограничиваются асимптотическими оценками стандарт-
ных отклонений показателей асимметрии и
11
xx xxs
nn n
,,,
ik i
ii
(1.37)
34
,3,AE
34
ss
эксцесса [4, 14, 30, 41]:
k
n
2
2
1
0, 6/ , 0, 24/
mnm n
.
AA EE
Особенностью применения этого критерия в случае малых n является использование более точных оценок стандартных отклонений показателей асимметрии и эксцесса [4, 15, 28, 33]. Для точечных оценок
показателей асимметрии
A и эксцесса E оценки стандартных отклоне-
ний показателей асимметрии и эксцесса имеют вид:
11
xx xxs A E
nn nss
,,,,3
ik i
ii
m
0, ,
AA
k
624(2)(3)
m
EE
,.
1(1)(3)(5)
nnnn
89
n
2
6( 2)
(1)(3)
nn
nn n
2
1
n
2
34
34
,
(1.38)

При этом сама оценка Е является смещенной. В работе [18] наряду
A
A
E
А
Е
со смещенными оценками приведены также и несмещенные
,:
E
nn
AE
(1)
nnnn
0, 0,
6( 1) 24( 1)
A
( 2)( 1)( 3) ( 3)( 2)( 3)( 5)
nnn nnnn
34
,3
2(2)(3)1
nn nn
1.5 2
22
mm
A
nn
(1)(1) 6
,
E
E
,
(1.39)
2
.
Из вида смещенных и несмещенных оценок показателей асимметрии и эксцесса следуют формулы, связывающие несмещенные оценки
,AE
со смещенными А и Е:
22 3
AAE E
nnn n
nn nn n nn
(1)( 2) (1)( 2)( 3) (1)
,33
В случае малого объема выборки
(1) (1)
n смещенные и несмещенные
.
2
оценки могут отличаться в несколько раз. Так, например, в случае выборки (А) вычисления по формулам (1.38) дают для смещенных оценок
А 1,39 и Е 0,30, а по формулам (1.39) для несмещенных оценок
2,27 и
5,39. Сравнение смещенных и несмещенных оценок по-
казателей асимметрии, эксцесса и критерия соответствия эмпирического
распределения нормальному теоретическому
N(x; 0,47; 0,33) отражено
в табл. 1.13.
Таблица 1.13
Проверка гипотезы о нормальном законе распределения Sc по смещенным
и несмещенным оценкам показателей асимметрии А и эксцесса Е
Расчетные формулы
Е
t2
А
t1
(1.37) (1.38) (1.39) (1.37) (1.38) (1.39)
1,391 1,391 2,272 0,303 0,303 5,389
0,926 0,612 0,793 1,852 0,661 1,587
1,50 2,27 2,86 0,16 1,59 3,40
Как видно из табл. 1.13, различие в критериях t1 и t2, вычисляемых
по формулам (1.29) для смещенных оценок и по формулам (1.30) для
несмещенных оценок, является существенным настолько, что приводит
к разным выводам относительно соответствия эмпирического распреде-
t2 =
ления нормальному теоретическому (для несмещенных оценок
3,396
> 3, т. е. распределение выборки (А) существенно отличается от нор-
мального закона).
90
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
