Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерные статистические методы. Ч.2. Учебное пособие
.pdf
11
, 1, ,
j
jnY
Y
Y
0 0 0 0
12
, ,..., .
k
S S S S
m
i
Y
m
m
12
, ,...,
n
Y Y Y Y
стеров можно сопровождать количественной оценкой эффективности
соответствующих результатов с последующим выбором наилучшего
результата.
Логика дивизимных алгоритмов носит противоположный характер:
на начальном этапе все наблюдаемые точки
ваются как образующие первый начальный кластер. На последующих
шагах алгоритма предыдущий кластер расщепляется и образуется кластер, содержащий меньшее количество точек.
Использование неиерархических способов кластерного анализа
предполагает, что при разбиении множества
сы возможны два основополагающих подхода. При первом из них
решается оптимизационная задача, связанная с использованием целевой функции, отражающей качество решения задачи классификации.
Второй подход использует идею построения кластеров, “накрывающих” места наибольшей концентрации точек наблюдения.
Реализация первого подхода, в первую очередь, связана с так называемым алгоритмом “последовательного переноса точек из класса в
класс”. Существо алгоритма заключается в следующем. Проводится
некоторое начальное разбиение множества
При этом руководствуются какими-либо априор-
ными соображениями или результатами предварительных исследований. Для этого начального разбиения вычисляют значение целевой
функции, выбранной в определенном виде при известном или неизвестном числе кластеров
мещается в каждый из
стоятельный кластер в случае неизвестного
. Затем каждое из наблюдений
кластеров или рассматривается как само-
и оставляется в том
положении, которое соответствует наилучшему значению целевой
функции (наибольшему или наименьшему в зависимости от ее содержательного наполнения). Когда подобные перемещения перестанут
приводить к улучшению значений целевой функции, работа алгоритма
прекращается.
Реализация второго подхода к проведению кластерного анализа
может быть осуществлена, например, с помощью алгоритмов, объединенных общим названием “Форель” [12] и характеризующихся достаточно прозрачной логикой применяемого аппарата, что удачно их выделяет на фоне конкурирующих альтернатив.
Пусть множество
наблюдений необходимо раз-
бить на неизвестное число m классов. Обозначим:
рассматри-
на отдельные клас-
на классы
пере-

12
1
1
n
i
in
YY
0
R
,Y
0
max ,
I
i
R
YY
YY
0
RR
i
Y
!
Y
1
C
2
Y
1
2
1
1
i
Y
n
i
YC
Y
1n
1
C
2
Y
2
C
3
Y
2
C
, 3,4,...
j
jC
, 4,5,...
j
Yj
J
Y
1
S
1
S
Y
R
()
0
, 1,2,3,..., .R R const
()R
,
т.е. Y среднее значение всех наблюдений. Через
обозначим ра-
диус минимальной гиперсферы с центром в точке ,Y содержащей все
точки множества
.
Далее зададим произвольный радиус
, принимаемой за центр и обозначаемой как
сферу
радиусом R. В эту гиперсферу попадает ряд точек из Y,
“центр тяжести” которых обозначим как
где
количество точек, попавших в гиперсферу
центра строим новую гиперсферу
разом находим “центр тяжести”
,
радиусом R и аналогичным об-
попавших в гиперсферу
Далее процедура построения гиперсфер
продолжается до тех пор, пока точки
и из любой точки
, построим гипер-
:
. Из
не перестанут
как из
точек.
и точек
меняться. Попавшие в “остановившуюся” гиперсферу точки принимаются за первый кластер
. Для точек, не попавших в
, вновь
применяется подобная процедура, следствием чего будет еще один
кластер. Подобное построение кластеров продолжается до тех пор,
пока все точки множества
не окажутся распределенными по кластерам.
Полученная классификация может быть уточнена, если ее повторить для ряда значений радиуса
, положив, например,
Если при этом обнаружится,
что число кластеров при ряде последовательных значений
радиу-
са гиперсферы одно и то же и резко возрастает на следующем шаге, то
это является основанием для выбора числа кластеров.
Значительное число алгоритмов кластерного анализа направлено
на минимизацию внутригрупповых сумм квадратов (отклонений). Они
выражаются в терминах евклидовых расстояний и называются мето-
дами минимизации дисперсий [11]. Рассмотрим ряд характерных из
этих подходов.

13
,Y
r
.Y
1m
1
,
i l i l
T
l i l i l l i
l
r
n
Y S Y S
Y Y Y Y Y Y
l
n
l
S
lm
r
l
S
m
S
.
T
lm
lm l m l m
lm
nn
r
nn
Y Y Y Y
l
S
m
S
2
,
T
lm l m l m l m
d S S Y Y Y Y
1 . Метод полных связей
Существо метода заключатся в объединении в один кластер тех
элементов множества
некоторого порога r. Величина
мый диаметр образующего кластер подмножества множества
2. Метод локального максимального расстояния
Объекты последовательно группируются по правилу: вначале ка-
ждый объект рассматривается как одноточечный кластер; два кластера
объединяются в один, если максимальное расстояние между точками
одного кластера и точками другого минимально по сравнению с рас-
стояниями до всех остальных кластеров. Процедура состоит из
шагов.
3. Метод внутриклассовых дисперсий
В качестве характеристик отдельного кластера используется сумма
квадратов расстояний между каждым объектом кластера и “центром
тяжести” кластера, т.е. величина
расстояние между которыми не превышает
определяет максимально допусти-
где
количество элементов, содержащихся в кластере
дом шаге метода объединяются вместе такие два кластера, которые
приводят к минимальному увеличению суммы квадратов отклонений
(дисперсий). Можно показать, что увеличение
кластеров
и
в один равно:
Таким образом, метод направлен на объединение близко располо-
женных кластеров.
4. Центроидный метод
Расстояние между кластерами
,
при объединении
и
определяется по центрам:
.
. На каж-

14
2
lm
d
l
S
1
12
, ,...,
n
Y Y Y
l
YS
l
Y
l
S
Y
l
S
2
,
ñð l
dSY
1
il
T
ii
l
n
YS
Y Y Y Y
1
.
il
T
T
i l i l l l
l
n
YS
Y Y Y Y Y Y Y Y
l
YS
Y
l
S
2
ñð
d
Y
Y
Y
l
S
m
S
2
1
,
i l m
T
ñð l m i j i j
lm
d
nn
j
Y S Y S
S S Y Y Y Y
11
.
i l j m
TT
i i l j m j m
lm
T
l
m l m
nn
l
Y S Y S
Y Y Y Y Y Y Y Y
Y Y Y Y
На каждом шаге объединяются кластеры, для которых величина
окажется минимальной.
5. Двухгрупповой метод
Пусть кластер
. Обозначим, как обычно, через
средний квадрат расстояний от объекта
содержит объекты
, а объект
центр кластера
. Тогда
до всех объектов кластера
будет равен:
=
Первое слагаемое в этом выражении определяет внутригрупповую
дисперсию, а второе представляет собой квадрат расстояния от объек-
та
тельной кластеризации объединяется с тем кластером
квадрат расстояния
рующих” и претендующих на присоединение элемента
имеют соизмеримые внутригрупповые дисперсии, то элемент
до центра l-го кластера. Объект
окажется наименьшим. Если два “конкури-
в процессе последова-
, до которого
кластера
при-
соединяют к тому кластеру, расстояние до центра которого окажется
меньшим. Для кластеров с различными дисперсиями, но одинаково
удаленными от
, предпочтение отдается кластеру с меньшей внут-
ригрупповой дисперсией .
6. Метод групповых средних
Средний квадрат расстояний между двумя кластерами
и
как и выше, определяется выражением:
,
Отсюда следует, что средний квадрат расстояний между двумя класте-

15
2
ñð
d
Y
i
Y
i
Y
1
.S
1
\YS
5
RÕ
рами равняется сумме внутригрупповых дисперсий и квадрата расстояний между центрами кластеров. При последовательной кластери-
зации объединяются кластеры с минимальной величиной
первую очередь объединяются кластеры с наибольшей плотностью
точек и наименее удаленные друг от друга по центрам.
7. Метод случайных начальных точек
На множестве
случайным образом выбирается некоторая точка
, которая объявляется центром кластера. Все точки, удаленные от
на расстояние, не превышающее некоторого порога r , объединя-
ются в кластер
Среди оставшихся точек из подмножества
снова случайным образом выбирается некоторая точка, объявляемая
центром второго кластера, и весь процесс повторяется до формирования второго кластера. Затем аналогичным образом создается третий
кластер и т.д. до полного разбиения множества Yна отдельные группы. Подход допускает многочисленные модификации [1,2].
Изложенные методы обладают определенной общностью и часто
приводят к близким результатам. Выбор конкретного из них во многом определяется частными особенностями решаемой задачи. При
этом самостоятельные наработки полезно совмещать с возможностями
стандартных пакетов прикладных программ.
4.7. Примеры компонентного и кластерного анализа
В заключение данного раздела рассмотрим два примера. Первый из
них посвящен компонентному анализу и основан на результатах второй главы первой части настоящего пособия [13]. Численные значения
параметров, используемые в примере, заимствованы в [11]. Результаты проведенного компонентного анализа используются во втором
примере, в котором изучается один из вариантов выполнения кластерного анализа, использующий технику метода “Форель” из [12]. Кластерный анализ осуществляется по двум из пяти главных компонентов,
найденных при рассмотрении первого примера.
Итак, пусть некая экономическая система характеризуется пяти-
мерным вектором
экспериментальных наблюдений, проведенных на пятидесяти объектах. Численные значения наблюдений, представленных в натуральной и в стандартизованной формах, таковы.
, т.е. в

16
Пример 1 - компонентный анализ
N 50
X11_4 6265 8810 17659 10342 8901 8402 32625 31160 46461 13833( )
T
X11_5 6391 11115 6555 11085 9484 3967 15283 20874 19418 3351( )
T
X12_1 167.69 186.1 220.45 169.3 39.53 40.41 102.96 37.02 45.74 40.07( )
T
X6_1 0.4 0.26 0.4 0.5 0.4 0.19 0.250 0.44 0.17 0.39( )
T
X6_2 0.33 0.25 0.32 0.02 0.06 0.15 0.08 0.2 0.2 0.3( )
T
X6_3 0.24 0.1 0.11 0.47 0.53 0.34 0.2 0.24 0.54 0.4( )
T
X6_4 0.2 0.54 0.42 0.27 0.37 0.38 0.35 0.42 0.32 0.33( )
T
X6_5 0.29 0.3 0.56 0.42 0.26 0.16 0.45 0.31 0.08 0.68( )
T
X8_1 1.23 1.04 1.8 0.43 0.88 0.57 1.72 1.7 0.84 0.6( )
T
X8_2 0.82 0.84 0.67 1.04 0.66 0.86 0.79 0.34 1.6 1.46( )
T
X8_3 1.27 1.58 0.68 0.86 1.98 0.33 0.45 0.74 0.03 0.99( )
T
X8_4 0.24 0.57 1.22 0.68 1 0.81 1.27 1.14 1.89 0.67( )
T
X8_5 0.96 0.67 0.98 1.16 0.54 1.23 0.78 1.16 4.44 1.06( )
T
X11_1 26006 23935 22589 21220 7394 11586 26609 7801 11587 9475( )
T
X11_2 10811 6371 26761 4210 3557 14148 9872 5975 16662 9166( )
T
X11_3 15118 11429 6462 24628 49727 11470 19448 18963 9185 17478( )
T
X12_2 45.44 41.08 135.14 42.39 37.39 101.78 47.55 32.61 103.25 38.95( )
T
X12_3 81.32 67.26 59.92 107.34 512.6 53.81 80.83 59.42 36.96 91.43( )
T
X12_4 17.16 27.29 184.33 58.42 59.4 49.63 391.27 258.62 75.66 123.68( )
T
X12_5 37.21 53.37 32.87 45.63 48.41 13.58 63.99 104.55 222.11 25.76( )
T
X17_1 17.72 18.39 26.46 22.37 28.13 17.55 21.92 19.52 23.99 21.76( )
T

17
X17_2 25.68 18.13 25.74 21.21 22.97 16.38 13.21 14.48 13.38 13.69
T
X17_3 16.66 15.06 20.09 15.98 18.27 14.42 22.76 15.41 19.35 16.83
T
X17_4 30.53 17.98 22.09 18.29 26.05 26.2 17.26 18.83 19.7 16.87
T
X17_5 14.63 22.17 22.62 26.44 22.26 19.13 18.28 28.23 12.39 11.64
T
Построим объединенные векторы:
X6 stack X6_1 X6_2 X6_3 X6_4 X6_5( )
X8 stack X8_1 X8_2 X8_3 X8_4 X8_5( )
X11 stack X11_1 X11_2 X11_3 X11_4 X11_5( )
X12 stack X12_1 X12_2 X12_3 X12_4 X12_5( )
X17 stack X17_1 X17_2 X17_3 X17_4 X17_5( )
mX6 mean X6( )
DX6 Var X6( )
mX8 mean X8( )
mX8 mean X8( )
DX8 Var X8( )
mX11 mean X11( )
DX11 Var X11( )
mX12 mean X12( )
DX12 Var X12( )
DX17 Var X17( )
mX17 mean X17( )
ORIGIN 1
Z
2
X6 mX6
DX6
Z
3
X8 mX8
DX8
Z
4
X11 mX11
DX11
Z
5
X12 mX12
DX12
Z
6
X17 mX17
DX17
Пусть x1, x2, x3, x4, x5 -стандартизованные признаки X6, X8, X11, X12, X17.
Тогда целью компонентного анализа является построение модели,
Используя встроенные функции, найдем характеристики:
которая на N объектах приводит к соотношениям:

18
или в матричной форме:
X A F
,
где X имеет размерность nxN (n=5), A имеет размерность nxn, F имеет размерность
nxN. Определению подлежат матрицы А и F.
Определим корреляционную матрицу признаков. Для этого используем имеющиеся
данные и для последующего удобства проведем переобозначения:
X
3
Z
4
X
4
Z
5
X
5
Z
6
X
1
Z
2
X
2
Z
3
X
1
1.599 10
14
X
2
1.125 10
14
и т.п., т.е. столбцы у X центрированы
Найдем корреляционную матрицуа признаков, которая находится так:
R
1
N 1
XT X
R
1
0.12 8
0.21 2
0.2
0.08 6
0.12 8
1
0.37 9
0.43 1
0.24 1
0.21 2
0.37 9
1
0.78 4
0.04
0.2
0.43 1
0.78 4
1
0.09
0.08 6
0.24 1
0.04
0.09
1
Найдем вектор собственных чисел матрицы R:
eigenvals R( )
2.149
1.249
0.858
0.531
0.213
5
Сумма компонентов этого вектора равна n=5, т.е. суммарной дисперсии
стандартизованных признаков. Упорядочим компоненты вектора в
направлении их убывания:
1 reverse sort ( )( )
x
ij
ai1f
j
a
2jf2j
a
3jf3j
a
4jf4j
a
5jf5j
xiai1f1 ai2f2 ai3f3 ai4f4 ai5f5
i 1 2 ... 5.
i 1...5
j 1...N
1
T
2.149 1.249 0.858 0.531 0.213

19
111
2
13 4.256
4.256
5
0.851
,
т.е. три первые компоненты объясняют 85,1% суммарной дисперсии исходных признаков.
Находим матрицу собственных векторов матрицы R:
U eigenvecs R( )
U
0.159
0.447
0.606
0.621
0.152
0.66
0.434
0.173
0.116
0.577
0.593
0.189
0.12
0.086
0.768
0.432
0.757
0.34
0.267
0.23
0.011
0.057
0.688
0.723
0.031
Столбцы этой матрицы упорядочены в соответствии с компонентами вектора . Их же следует
упорядочить в соответствии с компонентами вектора 1, для чего следует переставить третий и
четвертый столбцы местами.
U1
1
U
1
U1
2
U
2
U1
3
U
4
U1
4
U
3
U1
5
U
5
U1
0.159
0.447
0.606
0.621
0.152
0.66
0.434
0.173
0.116
0.577
0.432
0.757
0.34
0.267
0.23
0.593
0.189
0.12
0.086
0.768
0.011
0.057
0.688
0.723
0.031
Теперь находим матрицу нагрузок A:
V diag 1
V
1.46 6
0
0
0
0
0
1.11 8
0
0
0
0
0
0.92 6
0
0
0
0
0
0.72 9
0
0
0
0
0
0.46 1
A U1 V
A
0.232
0.655
0.888
0.91
0.222
0.738
0.485
0.193
0.129
0.645
0.4
0.701
0.315
0.248
0.213
0.432
0.138
0.087
0.063
0.56
5.253 10
3
0.026
0.317
0.334
0.015
A
1
A
2
0
A
2
A
5
0
A
T
3
1.016
A
T
1
0.973
A 0.51

20
A
T
2
A
T
4
0.36
A
3
0.926
Таким образом, у матрицы нагрузок столбцы ортоональны, строки - нормированы.
Наибольшая корреляция (0.91) обнаруживается между первым компонентом и признаком X12среднегодовой стоимостью ОПФ; вторая по величине корреляция (0.888) связывает первый
компонент с X11 со среднегодовой численностью ППП. Тогда первый компонент можно
интерпретировать как показатель размера предприятия.
Суммарные нагрузки компонентов:
A
1
1.466
A
2
1.118
A
3
0.926
A
4
0.729
A
5
0.461
1
5
i
A
i
4.7
1
5
i 15j
A
i j
2
5
1
5
j
A
1 j
2
0.946
1
5
j
A
2 j
2
1.176
и т.д.
1
5
j
A
5 j
2
0.824
Вклад первого компонента в суммарную дисперсию всех исходных признаков:
1
5
i
A
i 1
2
2.149
Вклад второго компонента в суммарную дисперсию всех исходных признаков:
1
5
i
A
i 2
2
1.249
Вклад третьего компонента в суммарную дисперсию всех исходных признаков:
1
5
i
A
i 3
2
0.858
Вклад четвертого компонента в суммарную дисперсию всех исходных признаков:
1
5
i
A
i 4
2
0.531
Вклад пятого компонента в суммарную дисперсию всех исходных признаков:
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
