Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:

Многомерные статистические методы. Ч.2. Учебное пособие

.pdf
Скачиваний:
0
Добавлен:
07.09.2026
Размер:
2 Мб
Скачать
11
, 1, ,
j
jnY
Y
Y
0 0 0 0
12
, ,..., .
k
S S S S
m
i
Y
m
m
12
, ,...,
n
Y Y Y Y
стеров можно сопровождать количественной оценкой эффективности соответствующих результатов с последующим выбором наилучшего результата. Логика дивизимных алгоритмов носит противоположный характер:
на начальном этапе все наблюдаемые точки ваются как образующие первый начальный кластер. На последующих
шагах алгоритма предыдущий кластер расщепляется и образуется кла­стер, содержащий меньшее количество точек. Использование неиерархических способов кластерного анализа
предполагает, что при разбиении множества сы возможны два основополагающих подхода. При первом из них
решается оптимизационная задача, связанная с использованием целе­вой функции, отражающей качество решения задачи классификации. Второй подход использует идею построения кластеров, “накрываю­щих” места наибольшей концентрации точек наблюдения. Реализация первого подхода, в первую очередь, связана с так назы­ваемым алгоритмом “последовательного переноса точек из класса в класс”. Существо алгоритма заключается в следующем. Проводится некоторое начальное разбиение множества
При этом руководствуются какими-либо априор-
ными соображениями или результатами предварительных исследова­ний. Для этого начального разбиения вычисляют значение целевой функции, выбранной в определенном виде при известном или неиз­вестном числе кластеров
мещается в каждый из стоятельный кластер в случае неизвестного
. Затем каждое из наблюдений
кластеров или рассматривается как само-
и оставляется в том
положении, которое соответствует наилучшему значению целевой функции (наибольшему или наименьшему в зависимости от ее содер­жательного наполнения). Когда подобные перемещения перестанут приводить к улучшению значений целевой функции, работа алгоритма прекращается. Реализация второго подхода к проведению кластерного анализа может быть осуществлена, например, с помощью алгоритмов, объеди­ненных общим названием “Форель” [12] и характеризующихся доста­точно прозрачной логикой применяемого аппарата, что удачно их вы­деляет на фоне конкурирующих альтернатив.
Пусть множество
наблюдений необходимо раз-
бить на неизвестное число m классов. Обозначим:
рассматри-
на отдельные клас-
на классы
пере-
12
1
1
n
i
in
YY
0
R
,Y
0
max ,
I
i
R
YY
YY
0
RR
i
Y
!
Y
1
C
2
Y
1
2
1
1
i
Y
n
i
YC
Y
1n
1
C
2
Y
2
C
3
Y
2
C
, 3,4,...
j
jC
, 4,5,...
j
Yj
J
Y
1
S
1
S
Y
R
()
0
, 1,2,3,..., .R R const
    
()R
,
т.е. Y среднее значение всех наблюдений. Через
обозначим ра-
диус минимальной гиперсферы с центром в точке ,Y содержащей все точки множества
.
Далее зададим произвольный радиус
, принимаемой за центр и обозначаемой как
сферу
радиусом R. В эту гиперсферу попадает ряд точек из Y,
“центр тяжести” которых обозначим как
где
количество точек, попавших в гиперсферу
центра строим новую гиперсферу
разом находим “центр тяжести”
,
радиусом R и аналогичным об-
попавших в гиперсферу
Далее процедура построения гиперсфер
продолжается до тех пор, пока точки
и из любой точки
, построим гипер-
:
. Из
не перестанут
как из
точек.
и точек
меняться. Попавшие в “остановившуюся” гиперсферу точки прини­маются за первый кластер
. Для точек, не попавших в
, вновь
применяется подобная процедура, следствием чего будет еще один кластер. Подобное построение кластеров продолжается до тех пор, пока все точки множества
не окажутся распределенными по класте­рам. Полученная классификация может быть уточнена, если ее повто­рить для ряда значений радиуса
, положив, например,
Если при этом обнаружится,
что число кластеров при ряде последовательных значений
радиу-
са гиперсферы одно и то же и резко возрастает на следующем шаге, то это является основанием для выбора числа кластеров.
Значительное число алгоритмов кластерного анализа направлено на минимизацию внутригрупповых сумм квадратов (отклонений). Они выражаются в терминах евклидовых расстояний и называются мето- дами минимизации дисперсий [11]. Рассмотрим ряд характерных из этих подходов.
13
,Y
r
.Y
1m
 
1
,
i l i l
T
l i l i l l i
l
r
n


Y S Y S
Y Y Y Y Y Y
l
n
l
S
lm
r
l
S
m
S
.
T
lm
lm l m l m
lm
nn
r
nn
Y Y Y Y
l
S
m
S
2
,
T
lm l m l m l m
d S S Y Y Y Y
1 . Метод полных связей
Существо метода заключатся в объединении в один кластер тех
элементов множества некоторого порога r. Величина
мый диаметр образующего кластер подмножества множества
2. Метод локального максимального расстояния
Объекты последовательно группируются по правилу: вначале ка-
ждый объект рассматривается как одноточечный кластер; два кластера объединяются в один, если максимальное расстояние между точками одного кластера и точками другого минимально по сравнению с рас-
стояниями до всех остальных кластеров. Процедура состоит из шагов.
3. Метод внутриклассовых дисперсий
В качестве характеристик отдельного кластера используется сумма квадратов расстояний между каждым объектом кластера и “центром тяжести” кластера, т.е. величина
расстояние между которыми не превышает
определяет максимально допусти-
где
количество элементов, содержащихся в кластере
дом шаге метода объединяются вместе такие два кластера, которые приводят к минимальному увеличению суммы квадратов отклонений
(дисперсий). Можно показать, что увеличение
кластеров
и
в один равно:
Таким образом, метод направлен на объединение близко располо- женных кластеров.
4. Центроидный метод
Расстояние между кластерами
,
при объединении
и
определяется по центрам:
.
. На каж-
14
2
lm
d
l
S
1
12
, ,...,
n
Y Y Y
l
YS
l
Y
l
S
Y
l
S
2
,
ñð l
dSY
 
1
il
T
ii
l
n

YS
Y Y Y Y
1
.
il
T
T
i l i l l l
l
n

YS
Y Y Y Y Y Y Y Y
l
YS
Y
l
S
2
ñð
d
Y
Y
Y
l
S
m
S
2
1
,
i l m
T
ñð l m i j i j
lm
d
nn


j
Y S Y S
S S Y Y Y Y
 
11
.
i l j m
TT
i i l j m j m
lm
T
l
m l m
nn


l
Y S Y S
Y Y Y Y Y Y Y Y
Y Y Y Y
На каждом шаге объединяются кластеры, для которых величина
окажется минимальной.
5. Двухгрупповой метод
Пусть кластер
. Обозначим, как обычно, через
средний квадрат расстояний от объекта
содержит объекты
, а объект
центр кластера
. Тогда
до всех объектов кластера
будет равен:
=
Первое слагаемое в этом выражении определяет внутригрупповую
дисперсию, а второе представляет собой квадрат расстояния от объек-
та
тельной кластеризации объединяется с тем кластером
квадрат расстояния
рующих” и претендующих на присоединение элемента
имеют соизмеримые внутригрупповые дисперсии, то элемент
до центра l-го кластера. Объект
окажется наименьшим. Если два “конкури-
в процессе последова-
, до которого
кластера
при-
соединяют к тому кластеру, расстояние до центра которого окажется меньшим. Для кластеров с различными дисперсиями, но одинаково
удаленными от
, предпочтение отдается кластеру с меньшей внут-
ригрупповой дисперсией .
6. Метод групповых средних
Средний квадрат расстояний между двумя кластерами
и
как и выше, определяется выражением:
,
Отсюда следует, что средний квадрат расстояний между двумя класте-
15
2
ñð
d
Y
i
Y
i
Y
1
.S
1
\YS
5
RÕ
рами равняется сумме внутригрупповых дисперсий и квадрата рас­стояний между центрами кластеров. При последовательной кластери-
зации объединяются кластеры с минимальной величиной первую очередь объединяются кластеры с наибольшей плотностью
точек и наименее удаленные друг от друга по центрам.
7. Метод случайных начальных точек
На множестве
случайным образом выбирается некоторая точка
, которая объявляется центром кластера. Все точки, удаленные от на расстояние, не превышающее некоторого порога r , объединя-
ются в кластер
Среди оставшихся точек из подмножества
снова случайным образом выбирается некоторая точка, объявляемая центром второго кластера, и весь процесс повторяется до формирова­ния второго кластера. Затем аналогичным образом создается третий кластер и т.д. до полного разбиения множества Yна отдельные груп­пы. Подход допускает многочисленные модификации [1,2]. Изложенные методы обладают определенной общностью и часто приводят к близким результатам. Выбор конкретного из них во мно­гом определяется частными особенностями решаемой задачи. При этом самостоятельные наработки полезно совмещать с возможностями стандартных пакетов прикладных программ.
4.7. Примеры компонентного и кластерного анализа В заключение данного раздела рассмотрим два примера. Первый из
них посвящен компонентному анализу и основан на результатах вто­рой главы первой части настоящего пособия [13]. Численные значения параметров, используемые в примере, заимствованы в [11]. Результа­ты проведенного компонентного анализа используются во втором примере, в котором изучается один из вариантов выполнения кластер­ного анализа, использующий технику метода “Форель” из [12]. Кла­стерный анализ осуществляется по двум из пяти главных компонентов, найденных при рассмотрении первого примера. Итак, пусть некая экономическая система характеризуется пяти-
мерным вектором
экспериментальных наблюдений, проведен­ных на пятидесяти объектах. Численные значения наблюдений, пред­ставленных в натуральной и в стандартизованной формах, таковы.
, т.е. в
16
Пример 1 - компонентный анализ
N 50
X11_4 6265 8810 17659 10342 8901 8402 32625 31160 46461 13833( )
T

X11_5 6391 11115 6555 11085 9484 3967 15283 20874 19418 3351( )
T

X12_1 167.69 186.1 220.45 169.3 39.53 40.41 102.96 37.02 45.74 40.07( )
T

X6_1 0.4 0.26 0.4 0.5 0.4 0.19 0.250 0.44 0.17 0.39( )
T

X6_2 0.33 0.25 0.32 0.02 0.06 0.15 0.08 0.2 0.2 0.3( )
T

X6_3 0.24 0.1 0.11 0.47 0.53 0.34 0.2 0.24 0.54 0.4( )
T

X6_4 0.2 0.54 0.42 0.27 0.37 0.38 0.35 0.42 0.32 0.33( )
T

X6_5 0.29 0.3 0.56 0.42 0.26 0.16 0.45 0.31 0.08 0.68( )
T

X8_1 1.23 1.04 1.8 0.43 0.88 0.57 1.72 1.7 0.84 0.6( )
T

X8_2 0.82 0.84 0.67 1.04 0.66 0.86 0.79 0.34 1.6 1.46( )
T

X8_3 1.27 1.58 0.68 0.86 1.98 0.33 0.45 0.74 0.03 0.99( )
T

X8_4 0.24 0.57 1.22 0.68 1 0.81 1.27 1.14 1.89 0.67( )
T

X8_5 0.96 0.67 0.98 1.16 0.54 1.23 0.78 1.16 4.44 1.06( )
T

X11_1 26006 23935 22589 21220 7394 11586 26609 7801 11587 9475( )
T

X11_2 10811 6371 26761 4210 3557 14148 9872 5975 16662 9166( )
T

X11_3 15118 11429 6462 24628 49727 11470 19448 18963 9185 17478( )
T

X12_2 45.44 41.08 135.14 42.39 37.39 101.78 47.55 32.61 103.25 38.95( )
T

X12_3 81.32 67.26 59.92 107.34 512.6 53.81 80.83 59.42 36.96 91.43( )
T

X12_4 17.16 27.29 184.33 58.42 59.4 49.63 391.27 258.62 75.66 123.68( )
T

X12_5 37.21 53.37 32.87 45.63 48.41 13.58 63.99 104.55 222.11 25.76( )
T

X17_1 17.72 18.39 26.46 22.37 28.13 17.55 21.92 19.52 23.99 21.76( )
T

17
X17_2 25.68 18.13 25.74 21.21 22.97 16.38 13.21 14.48 13.38 13.69
T

X17_3 16.66 15.06 20.09 15.98 18.27 14.42 22.76 15.41 19.35 16.83
T

X17_4 30.53 17.98 22.09 18.29 26.05 26.2 17.26 18.83 19.7 16.87
T

X17_5 14.63 22.17 22.62 26.44 22.26 19.13 18.28 28.23 12.39 11.64
T

Построим объединенные векторы:
X6 stack X6_1 X6_2 X6_3 X6_4 X6_5( )
X8 stack X8_1 X8_2 X8_3 X8_4 X8_5( )
X11 stack X11_1 X11_2 X11_3 X11_4 X11_5( )
X12 stack X12_1 X12_2 X12_3 X12_4 X12_5( )
X17 stack X17_1 X17_2 X17_3 X17_4 X17_5( )
mX6 mean X6( )
DX6 Var X6( )
mX8 mean X8( )
mX8 mean X8( )
DX8 Var X8( )
mX11 mean X11( )
DX11 Var X11( )
mX12 mean X12( )
DX12 Var X12( )
DX17 Var X17( )
mX17 mean X17( )
ORIGIN 1
Z
2
 
X6 mX6
DX6

Z
3
 
X8 mX8
DX8

Z
4
 
X11 mX11
DX11

Z
5
 
X12 mX12
DX12

Z
6
 
X17 mX17
DX17

Пусть x1, x2, x3, x4, x5 -стандартизованные признаки X6, X8, X11, X12, X17.
Тогда целью компонентного анализа является построение модели,
Используя встроенные функции, найдем характеристики:
которая на N объектах приводит к соотношениям:
18
или в матричной форме:
X A F
,
где X имеет размерность nxN (n=5), A имеет размерность nxn, F имеет размерность
nxN. Определению подлежат матрицы А и F.
Определим корреляционную матрицу признаков. Для этого используем имеющиеся
данные и для последующего удобства проведем переобозначения:
X
3
 
Z
4
 

X
4
 
Z
5
 

X
5
 
Z
6
 

X
1
 
Z
2
 

X
2
 
Z
3
 

X
1
 
1.599 10
14
X
2
 
1.125 10
14
и т.п., т.е. столбцы у X центрированы
Найдем корреляционную матрицуа признаков, которая находится так:
R
1
N 1
XT X
R
1
0.12 8
0.21 2
0.2
0.08 6
0.12 8
1
0.37 9
0.43 1
0.24 1
0.21 2
0.37 9 1
0.78 4
0.04
0.2
0.43 1
0.78 4 1
0.09
0.08 6
0.24 1
0.04
0.09
1
  
  
Найдем вектор собственных чисел матрицы R:
eigenvals R( )
2.149
1.249
0.858
0.531
0.213
  
  
5
Сумма компонентов этого вектора равна n=5, т.е. суммарной дисперсии стандартизованных признаков. Упорядочим компоненты вектора в
направлении их убывания:
1 reverse sort ( )( )
x
ij
ai1f
j
a
2jf2j
a
3jf3j
a
4jf4j
a
5jf5j
xiai1f1 ai2f2 ai3f3 ai4f4 ai5f5
i 1 2 ... 5.
i 1...5
j 1...N
1
T
2.149 1.249 0.858 0.531 0.213
19
111
2
13 4.256
4.256 5
0.851
,
т.е. три первые компоненты объясняют 85,1% сум­марной дисперсии исходных признаков.
Находим матрицу собственных векторов матрицы R:
U eigenvecs R( )
U
0.159
0.447
0.606
0.621
0.152
0.66
0.434
0.173
0.116
0.577
0.593
0.189
0.12
0.086
0.768
0.432
0.757
0.34
0.267
0.23
0.011
0.057
0.688
0.723
0.031
  
  
Столбцы этой матрицы упорядочены в соответствии с компонентами вектора . Их же следует упорядочить в соответствии с компонентами вектора 1, для чего следует переставить третий и четвертый столбцы местами.
U1
1
 
U
1
 

U1
2
 
U
2
 

U1
3
 
U
4
 

U1
4
 
U
3
 

U1
5
 
U
5
 

U1
0.159
0.447
0.606
0.621
0.152
0.66
0.434
0.173
0.116
0.577
0.432
0.757
0.34
0.267
0.23
0.593
0.189
0.12
0.086
0.768
0.011
0.057
0.688
0.723
0.031
  
  
Теперь находим матрицу нагрузок A:
V diag 1

V
1.46 6 0 0 0 0
0
1.11 8 0 0 0
0 0
0.92 6 0 0
0 0 0
0.72 9 0
0 0 0 0
0.46 1
  
  
A U1 V
A
0.232
0.655
0.888
0.91
0.222
0.738
0.485
0.193
0.129
0.645
0.4
0.701
0.315
0.248
0.213
0.432
0.138
0.087
0.063
0.56
5.253 10
3
0.026
0.317
0.334
0.015
   
   
A
1
 
A
2
 
0
A
2
 
A
5
 
0
A
T
3
 
1.016
A
T
1
 
0.973
A 0.51
20
A
T
2
 
A
T
4
 
0.36
A
3
 
0.926
Таким образом, у матрицы нагрузок столбцы ортоональны, строки - нормированы.
Наибольшая корреляция (0.91) обнаруживается между первым компонентом и признаком X12­среднегодовой стоимостью ОПФ; вторая по величине корреляция (0.888) связывает первый компонент с X11 со среднегодовой численностью ППП. Тогда первый компонент можно интерпретировать как показатель размера предприятия.
Суммарные нагрузки компонентов:
A
1
 
1.466
A
2
 
1.118
A
3
 
0.926
A
4
 
0.729
A
5
 
0.461
1
5
i
A
i
 
4.7
1
5
i 15j
A
i j
2
5
1
5
j
A
1 j
2
0.946
1
5
j
A
2 j
2
1.176
и т.д.
1
5
j
A
5 j
2
0.824
Вклад первого компонента в суммарную дисперсию всех исходных признаков:
1
5
i
A
i 1
2
2.149
Вклад второго компонента в суммарную дисперсию всех исходных признаков:
1
5
i
A
i 2
2
1.249
Вклад третьего компонента в суммарную дисперсию всех исходных признаков:
1
5
i
A
i 3
2
0.858
Вклад четвертого компонента в суммарную дисперсию всех исходных признаков:
1
5
i
A
i 4
2
0.531
Вклад пятого компонента в суммарную дисперсию всех исходных признаков:
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]