Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерный статистический анализ в экономике. Учебное пособие
.pdf
= 4; = 7; = 2; = 2
(
)
= 3,75;
= 3; = 4; = 0; = 1
=
+
+
+
=
+
(
)
[
(4 3,75)+ (3 2)
[
(2 3,75)
(
)
(
)
(
)
+ (0 2)
+ (
+ (
+ (
+ (
]+[
]+[
(
)
(
)
(
)
(
)
(
)
(7 3,75)
(2 3,75)
)
+ (4 2)
+ (1 2)
= 2.
)
)
)
]
]
= 26,75.
2. Если добавить объект 5 в кластер 12, то
= 4; = 7; = 0
= 3; = 4; = 4
=
(
)
+
+
[
=
(4 3,67)
[
+
(7 3,67)
[
+
(0 2)
+ (
(
)
(
)
+ (3 3,67)
+ (4 3,67)
+ (4 3,67)
3. Если добавить объект 5 в кластер 3
(
(
+ (
+ (
]
4, то
= 3,67;
)
)
(
)
]
]
= 25,33
= 3,67.
)
(
)
(
)
= , .
)
)
Этот вариант уже просчитывался на шаге 2.
Таким образом, на третьем шаге добавляем объект 5 в кластер
3
4 и имеем два кластера 1
2 и 345.
На четвертом шаге объединяем все объекты в один кластер. При
этом центр этого кластера будет
(
)
= 3;
(
)
, .
= 2,4.
Использование различных алгоритмов объединения в
иерархических агломеративных методах приводит к различным
кластерным структурам и сильно влияет на качество проведения
кластеризации. Поэтому алгоритм должен выбираться с учетом
имеющихся сведений о существующей структуре совокупности
наблюдаемых объектов или с учетом требований оптимизации
математических критериев.
71

Иерархические дивизимные методы. Кроме рассмотренных
1 2 3 4
5
1 0 10
13 8 17
2
10 0 41
34
49
3
13
41 0 1
20
4 8 34 1 0
13 5 17
49
20
13
0
агломеративных методов иерархического кластерного анализа
существуют методы, противоположные им по логическому
построению процедур классификации. Они называются
иерархическими дивизимными методами. В дивизимных методах
первоначально все объекты принадлежат к одному кластеру. В
процессе классификации по определенным правилам постепенно от
этого кластера отделяются группы схожих между собой объектов.
Таким образом, на каждом шаге количество кластеров возрастает, а
мера расстояния между кластерами уменьшается.
Пример. Пусть матрица расстояний между объектами имеет вид,
показанный в табл. 3.20.
На первом шаге наиболее удаленными являются объекты 2 и 5
(
= 49). Рассмотрим расстояния от оставшихся объектов до 2-го и
5-го объектов:
<
– первый объект ближе ко второму, чем к пятому;
>
– третий объект ближе к пятому, чем ко второму;
>
– четвертый объект ближе к пятому, чем ко второму;
Исходная матрица расстояний:
Таким образом, на уровне 49 один общий кластер разбивается
на два кластера: 12 и 345.
Далее, в каждом из образовавшихся кластеров анализируем
расстояния между объектами, в каждом классе, и на очередном шаге
происходит деление того кластера, где достигается максимум
расстояний между объектами.
На втором шаге
= 10; = 1; = 20;
= 13.
Наибольшее расстояние между 3 и 5 объектами, значит, на
уровне 20 кластер 345 разделится на два. Проанализируем, в
каком из вновь отделившихся кластеров останется 4 объект.
<
– четвертый объект ближе к третьему, чем к пятому.
Таким образом, теперь имеем три кластера: 12, 34 и 5.
72

На третьем шаге
= 10;
= 1.
Значит, на уровне 10 кластер 12 разбивается на два: 1 и 2.
На четвертом шаге на уровне 1 кластер 34 разделяется на 3 и 4.
Метод k-средних. Метод k-средних принадлежит к группе
итеративных методов эталонного типа. Название метода было
предложено Дж. Мак-Куином в 1967 г. Метод удобен для обработки
больших статистических совокупностей.
Пусть имеется n наблюдений (объектов)
которых характеризуется m признаками
, , …,
, , …,
, каждое из
. Необходимо
разбить эти n наблюдений на k кластеров.
Сначала из n точек исследуемой совокупности отбираются
случайным образом или задаются исследователем исходя из какихлибо соображений k точек (объектов). Эти точки принимаются за
эталоны. Каждому эталону присваивается порядковый номер, который
одновременно является и номером кластера.
На первом шаге из оставшихся
точка
с координатами
(
, , …,
(
)
)
объектов извлекается
и проверяется, к какому из
эталонов (центров) она находится ближе всего. Для этого используется
одна из метрик, например евклидово расстояние. Проверяемый объект
присоединяется к тому эталону (центру), которому соответствует
min
(
= 1, … ,
)
. Если встречаются два или более минимальных
расстояния, то i-ый объект присоединяется к центру с наименьшим
порядковым номером.
Эталон заменяется новым, пересчитанным с учетом
присоединенной точки, и вес его (количество объектов, входящих в
данный кластер) увеличивается на единицу.
На следующем шаге выбирают точку
и для нее повторяют
всю процедуру.
Таким образом, через
(
)
шагов все точки (объекты)
совокупности окажутся отнесенными к одному из кластеров, но на
этом процесс разбиения не заканчивается.
Для того чтобы добиться устойчивости разбиения по тому же
правилу, все точки
, , … ,
опять присоединяются к полученным
кластерам, при этом веса продолжают накапливаться. Новое разбиение
сравнивается с предыдущим. Если они совпадут, то работа алгоритма
завершается. В противном случае цикл повторяется.
73

Окончательное разбиение имеет центры тяжести, которые не
№ объекта
Х1
Х2
Х3
1
0,10
10
5,0
2
0,80
14
2,0
3
0,40
12
3,0
4
0,18
11
4,0
5
0,25
13
3,2
6
0,67
15
2,4
совпадают с эталонами, их можно обозначить
каждая точка
(= 1, …, ) будет относиться к такому кластеру ,
, , … ,
. При этом
для которого
= min
,
,
.
Возможны две модификации метода k-средних. Первая
предполагает пересчет центра тяжести кластера после каждого
изменения его состава, а вторая – лишь после того, как будет завершен
просмотр всех данных. В обоих случаях итеративный алгоритм этого
метода минимизирует дисперсию внутри каждого кластера, хотя в
явном виде такой критерий оптимизации не используется.
Пример. Пусть имеются шесть объектов, которые необходимо
разбить на три класса (кластера) при помощи метода k-средних.
Каждый из объектов описывается тремя признаками (переменными)
, ,
, значения которых приведены в табл. 3.8.
Таблица 3.8
Значения признаков кластеризации
исходные значения эталонов и весов:
расстояние до каждого из эталонов по евклидовой метрике:
первому эталону, и первый эталон будет пересчитан, а второй и третий
не изменятся:
В качестве эталонов возьмем первые три объекта (k=3). Запишем
=
=(0,10; 10;5,0
=
=(0,80; 14;2,0
=
=(0,40; 12;3,0
)
,
= 1
)
,
)
,
.
= 1
= 1
На первом шаге берем четвертый объект и определяем его
(
=
=
=
(
(
0,18 0,10
0,18 0,80
0,18 0,40
)
)
)
+
+
+
(
(
(
11 10
11 14
11 12
)
)
)
(
+
4,0 5,0
(
+
4,0 2,0
(
+
4,0 3,0
)
= 1,416,
)
= 3,222,
)
= 1,431.
Следовательно, четвертый объект должен быть присоединен к
74

=
+
+ 1
=(0,14; 10,5;4,5
=
+ 1 = 1 + 1 = 2.
1 0,10 + 0,18
=
1 10 + 11
2
;
2
)
,
1 5,0 + 4,0
;
2
Таким образом, на первом шаге имеем
=(0,14; 10,5; 4,5
=(0,80; 14,0; 2,0
=(0,40; 12,0; 3,0
)
,
= 2
)
,
)
,
.
= 1
= 1
На втором шаге проверяем, к какому эталону ближе всего
находится пятый объект:
(
=
0,25 0,14
(
=
0,25 0,80
(
=
0,25 0,40
Так как
)
+
)
)
= min
(
13 10,5
(
+
13 14
(
+
13 12
(
; ;
)
(
+
3,2 4,5
)
(
+
3,2 2,0
)
(
+
3,2 3,0
)
, то пятый объект
)
= 2,820,
)
= 1,656,
)
= 1,031.
присоединяется к третьему эталону, этот эталон пересчитывается, и
вес его увеличивается:
+
+ 1
=
=(0,325; 12,5; 3,1
1 0,40 + 0,25
=
2
1 13 + 12
;
)
,
1 3,0 + 3,2
;
2
=
+ 1 = 1 + 1 = 2.
2
Таким образом, на втором шаге имеем
=(0,14; 10,5;4,5
=(0,80; 14,0;2,0
=(0,325; 12,5; 3,1
)
,
= 2
)
,
)
,
.
= 1
= 2
На третьем шаге определяем, к какому эталону ближе всего
находится шестой объект:
(
=
=
=
0,67 0,14
(
0,67 0,80
(
0,67 0,325
)
)
)
(
+
15 10,5
(
+
15 14
(
+
15 12,5
)
)
)
+
(
+
+
(
2,4 4,5
2,4 2,0
(
2,4 3,1
)
= 4,994,
)
= 1,085,
)
= 2,619.
Пересчитываем второй эталон и его вес:
+
+ 1
=
=(0,735; 14,5; 2,2
1 0,80 + 0,67
=
2
1 14 + 15
;
)
,
1 2,0 + 2,4
;
2
=
+ 1 = 1 + 1 = 2.
2
Таким образом, на втором шаге имеем
75

=(0,14; 10,5; 4,5
=(0,735; 14,5; 2,2
=(0,325; 12,5; 3,1
)
,
= 2
)
)
,
,
.
= 2
= 2
После того как просмотрены все объекты, кроме первых трех
(принятых за эталоны), первый этап завершается. В результате
расчетов получены три кластера: 13;26; 3 5.
На втором этапе присоединяем к полученным эталонам каждый
из шести исходных объектов. При этом происходит пересчет эталонов
и продолжается наращивание их весов. По окончании второго этапа
(4-9 итерации) сравниваются составы кластеров, полученных на
первом и втором этапах. Если результаты совпадают, то процесс
завершается, в противном случае переходят к третьему этапу, и опять
присоединяем к полученным эталонам каждый из шести объектов, и т.д.
Результаты расчетов занести в табл. 3.9.
Таблица 3.9
Макет таблицы для метода k-средних
После завершения процесса (когда на текущем этапе получено
такое же разбиение, как на предыдущем) вычисляют центры тяжести
полученных кластеров (в общем случае они не совпадают с
эталонами). Результаты занести в табл. 3.10.
76

Таблица 3.10
Центры полученных кластеров
После этого строится окончательное разбиение: каждый объект
относится к тому кластеру, центр которого ближе всего к этому
объекту. Расстояния от объектов до центров трех кластеров занести в
табл. 3.11.
Таблица 3.11
Матрица расстояний до центров кластеров
Метод k-средних допускает в качестве исходного разбиения
использовать группировку, полученную одним из методов
иерархического кластерного анализа.
Критерии качества классификации. При использовании
различных методов кластерного анализа для одной и той же
совокупности могут быть получены различные варианты разбиения.
Существенное влияние на характеристики кластерной структуры
оказывают: во-первых, набор признаков, по которому осуществляется
классификация, во-вторых, тип выбранного алгоритма. Например,
иерархические и итеративные методы приводят к образованию
различного числа кластеров. При этом сами кластеры различаются и
77

по составу и степени близости объектов. Выбор меры сходства также
влияет на результат разбиения. Если используются методы с
эталонными алгоритмами, например метод k-средних, то задаваемые
начальные условия разбиения в значительной степени определяют
результат разбиения.
После завершения процедур классификации необходимо
оценить полученные результаты. Для этой цели используется
некоторая мера качества классификации, которую называют
функционалом, или критерием качества. Наилучшим по выбранному
функционалу следует считать то разбиение, при котором достигается
экстремальное (минимальное или максимальное) значение целевой
функции – функционала качества.
Наиболее распространенными функционалами качества
являются:
1. Сумма квадратов расстояний до центров классов внутри
кластеров:
=
(
где – номер кластера (=1, 2,…, ),
)
,
,
- центр -го кластера;
−
вектор значений признаков для -го объекта, входящего в -й кластер;
(
)
,
− расстояние между -м объектом и центром -го кластера.
В этом случае качество разбиения оценивается по степени
удаленности объектов от центров своих кластеров.
2. Сумма внутриклассовых расстояний между объектами:
.
=
,
В этом случае получены кластеры большой «плотности»,
объекты, попавшие в один кластер, близки между собой по значениям
переменных, использовавшихся для классификации.
3. Суммарная внутриклассовая (внутригрупповая) дисперсия:
,
где
=
- дисперсия -го признака в -м кластере.
4. Средние межклассовые расстояния:
78

,
=
.
В данном случае качество разбиения оценивается по степени
удаленности кластеров друг от друга.
В большинстве случаев алгоритмы классификации и критерии
качества связаны между собой. Например, использование метода
Уорда приводит к получению кластеров с минимальной
внутриклассовой дисперсией.
Кроме названных функционалов качество классификации можно
также оценивать при помощи критерия Хоттелинга
для проверки
гипотезы о равенстве векторов средних для многомерных
совокупностей:
=
+
.
Cудить о качестве разбиения позволяют и некоторые
простейшие приемы. Например, сравнение средних значений
признаков в отдельных кластерах со средними значениями в целом по
всей совокупности объектов. Если отличие групповых средних от
общего среднего значения существенное, то это может быть
признаком хорошего разбиения. Оценка существенности отличия
может быть выполнена с помощью t-критерия Стьюдента.
Перечисленные способы оценки качества разбиения
предполагают чисто формальный подход и являются для
исследователя вспомогательными средствами. Основная роль
отводится содержательному анализу результатов классификации.
Важным показателем качества кластеризации является процент
«объяснённой дисперсии» в кластерном решении. Для оценки качества
проведенной кластеризации необходима какая-либо объективная
метрика «компактности» полученных кластеров. Необходимо
построить статистику, которая была бы близка к 0, если облако
данных является практически равномерно распределённым, без какихлибо сгущений точек в пространстве,
и близка к 100%, если в
пространстве существуют k заметно отстоящих друг от друга,
компактных групп точек. Значение этой метрики позволяет судить,
являются ли полученные кластеры действительно различимыми
группами, или же кластеры - это лишь произвольные наборы
расположенных по соседству наблюдений. Таким образом, эта
метрика помогает решить, можно ли говорить о полученной на основе
79

кластерного анализа типологии, или же кластеры - это лишь один из
,k...j,
r
n
Rn
R
ср
n
1j
2
jj
2
ср
1
2
=+
⋅
=
∑
=
2
ср
R
2
j
R
j
n
2
ср
r
2
ср
r
2
ср
r
многих равнозначных вариантов группировки точек. Указанный
показатель будет полезен всякий раз, когда кластерное решение
затруднительно представить графически на диаграмме разброса
(практически - это случаи кластеризации в более, чем 2 или 3-мерном
пространстве, а также - кластеризация очень большого числа объектов
(точек), что делает невозможным визуальный анализ групп на
диаграмме разброса).
Метрика (D), характеризующая «объясняющую» способность
кластерного решения, строится исходя из тождества:
где
- сумма средних квадратов отклонений от среднего значения
по всем переменным, участвующим в кластеризации. Она же - средний
квадрат расстояния от каждого наблюдения до общего центра (общей
средней). Она же - суммарная дисперсия переменных, участвующих в
кластеризации (вычисляется по формуле генеральной дисперсии, со
знаменателем, равным n).
- сумма квадратов расстояний от центра j-го кластера до общего
центра.
- количество наблюдений, определённых по результатам
кластеризации в j-й кластер.
n - общее количество наблюдений
- средний квадрат расстояния от каждого наблюдения до центра
своего кластера по всем кластерам.
Очевидно, что если кластеры будут компактными внутри себя и
разнородными между собой, вклад величины
(характеризующей
ошибку, рассеяние, отклонение от кластерной модели) в
формирование суммарной дисперсии будет невелик. В случае же
наличия однородного облака данных основная часть суммарной
дисперсии будет формироваться за счёт величины
.
Из этих соображений вычисляется статистика D:
80
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
