Добавил:
ivanov666
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз:
Предмет:
Файл:Многомерные статистические методы. Ч.2. Учебное пособие
.pdf
Министерство образования и науки Российской Федерации
Рязанский государственный радиотехнический университет
Е.П. ЧУРАКОВ
Многомерные статистические
методы
Часть 2
Учебное пособие
Рязань 2014

УДК 519.237(075.8)
ББК 22.172я73
Многомерные статистические методы: учеб. пособие / Е.П. Чураков, Рязан. гос. радиотехн. ун-т; Рязань, 2014. ч.2 48с.
Вторая часть пособия является естественным продолжением курса
«Многомерные статистические методы», первая часть которого под
таким же названием опубликована ранее [13]. Основное внимание во
второй части пособия уделено методам кластерного анализа и многомерного шкалирования. Приводится ряд конкретных исследований,
проведенных с использованием этих подходов. Предназначено для
студентов специальности 080116 “Математические методы в экономике” и направлений 010400 “Прикладная математика и информатика” с
профилем подготовки “Математическое и информационное обеспечение экономической деятельности” и 080500 “Бизнес-информатика”.
Библиогр.: 23 назв.
Многомерный анализ, векторные случайные величины, кластерный
анализ, многомерное шкалирование
Печатается по решению редакционно-издательского совета Рязанского государственного радиотехнического университета.
Рецензент: кафедра ЭиММ Рязанского государственного радиотехнического университета (зав. кафедрой В.К. Клочко)
Ч у р а к о в Евгений Павлович
Многомерные статистические методы
Редактор М.Е.Цветкова
Корректор С.В. Макушина
Подписано в печать18.07.14. Формат бумаги 60x84 1/16.
Бумага писчая. Печать трафаретная. Усл. печ. л 3,0.
Тираж 50 экз. Заказ
Рязанский государственный радиотехнический университет.
390005, Рязань, ул. Гагарина, 59/1.
Редакционно-издательский центр РГРТУ.
© Рязанский государственный
радиотехнический университет, 2014

4. Основы кластерного анализа
,,...,,
21 k
XXX
T
k
XXX ],...,,[21X
1
X
2X
3
X
4
X
5
X
6
X
7
X
k
n
n
11 12 1
21 22 2
12
...
...
... ... ... ...
...
n
n
kn
k k kn
x x x
x x x
R
x x x
ij
x
jki ,,1
.,1 n
j
X
4.1. Назначение кластерного анализа
Кластерный анализ в настоящее время представляет собой хорошо
развитую методологию решения задач классификации данных и обладает разнообразными подходами и обширным алгоритмическим обеспечением. Достаточно цельное изложение существа кластерного анализа содержится в работах [1] – [5]. Кратко изложим наиболее фундаментальные положения классификационных проблем, решаемых средствами кластерного анализа.
Существо кластерного анализа заключается в следующем. Пусть
некоторое экономическое (для определенности) явление характеризу-
ется kпризнаками
т.е. многомерной величиной
. Например:
ботки на одного работника;
мер оборотных производственных средств;
выпуск единицы товарной продукции;
ленно-производственного персонала;
ции;
что эти
мер, на
уровень энерговооруженности труда и т.п. Далее полагаем,
признаков были зарегистрированы на
предприятиях), т.е. каждый признак измерен nраз. В итоге
уровень среднегодовой выра-
уровень фондоотдачи;
размер затрат на
численность промыш-
рентабельность продук-
объектах (напри-
раз-
формируется матрица Xэкспериментальных данных
X=
(4.1)
где
- значение i-го признака на j-м объекте (при j-м измерении),
Произвольный j-й столбец этой матрицы, таким
образом, представляет собой значение вектора Xна
-м объекте. Так
как все компоненты вектора Xмогут иметь различные смысловое содержание и единицы измерения, элементы матрицы
обычно цен-
трируются и нормируются, т. е. осуществляется переход к стандартизованной форме представления данных. Для этого, что уже отмеча-

4
n
j
iji
x
n
x
1
1
2
2
1
1
1
n
i ij i
j
s x x
n
2
ii
ss
.,1 ki
k
kkn
k
kk
k
kk
n
n
s
xx
s
xx
s
xx
s
xx
s
xx
s
xx
s
xx
s
xx
s
xx
...
............
...
...
21
2
22
2
222
2
221
1
11
1
112
1
111
Y
X
, 1, ,
k
i
R i n iY
k
R
n
k
R
Y
k
R
nm
m
i
Y
лось, вычисляются эмпирическое среднее каждого признака, несмещенная оценка его дисперсии и среднеквадратичное отклонение, соответственно:
С использованием этих величин строится матрица
Каждый столбец этой матрицы, следовательно, является стандарти-
зованным вектором
объекте. Пусть
В пространстве
рых отображает положение соответствующего ей объекта в простран-
стве
ство Y, состоящее из nточек в пространстве
образов), где
каждая точка
ки, отнесенные к разным кластерам, опять же, в определенном смыс-
ле, разнились. Под кластером, таким образом, понимается полученная
в результате разбиения группа объектов (векторов, точек), обладающих определенной общностью. Методы построения таких групп и называются кластерным анализом (иногда численной таксономией или
распознаванием образов с самообучением).
4.2. Расстояние между объектами
Одним из начальных понятий кластерного анализа является “рас-
стояние” между двумя произвольными элементами множества Y. Это
понятие может носить различный содержательный смысл, но обычно
основывается на аксиоматике метрического пространства и удовле-
,
,
,
(4.2)
. (4.3)
, зарегистрированным на соответствующем
-й столбец матрицы Y(i-й вектор).
эти векторы формируют
точек, каждая из кото-
. Множество этих точек, как и матрицу, обозначим символом
. Задача кластерного анализа заключается в том, чтобы все множе-
, разбить на
однородных в некотором смысле групп (кластеров, таксонов,
в общем случае неизвестно, таким образом, чтобы
была отнесена только к одному кластеру и чтобы точ-

5
,
ij
Y Y Y
ql
k
s
q
q
sjsijiq
yy
1
1
)(),( YY
.1q
si
y
s
.iY
k
R
ji
YY ,
YYY
ji
,
ji
T
Jijijijijie
YYYYYYYYYYYY ,),(
Y
.2q
,,
1
ji
T
JijiM
YYWYYYY
W
EW
E
,
1
ii
wdiag
W
1
W
.,1, kiwii
q
l
.
,1
sup
,
sjsiJi
yy
ks
l
YY
1q
blockcity
(1l
),jiYY
.
s
sjsi
yy
творяет соответствующим аксиомам метрики (например, [6, 7]).
Наиболее часто используют следующие определения расстояний меж-
ду элементами
.
1. Гельдерово (или Минковского) расстояние (
Здесь и далее
2. Если пространство
делено скалярное произведение
где здесь и далее символ
расстояние является частным случаем гельдерова при
3. Расстояние Михаланобиса (обобщенное евклидово расстоя-
ние):
где
рица. В случае
ланобиса совпадает с евклидовым.
4. “Взвешенное” евклидово расстояние следует из предыдущего,
если принять
некоторая симметрическая положительно определенная мат-
-й компонент вектора
, то обычно используют евклидово расстояние:
:
,
является евклидовым, т.е. в нем опре-
означает норму вектора .Y Евклидово
единичная матрица, расстояние Миха-
т.е. если матрица
расстояние):
.
векторов
,
является
диагональной с элементами главной диагонали
5. При
супремум расстояние (
6. При
гельдерово расстояние порождает так называемое
расстояние):
получают так называемое
=
.
расстояние:

6
i
Y
i
Y
.,jiYY
l
S
,mS
,,,
mlml
SSYSYS
l
S
l
n
mm
nS
l
Y
1
,
il
i
l
n
YS
Y
1
jm
mj
m
n
YS
YY
l
S
m
S
min
min
, , .
,
l m i j
i l j m
d
S S Y Y
Y S Y S
ml
SS ,
Наиболее распространенным в кластерном анализе является евклидово расстояние. Это объясняется как наглядностью геометрического
смысла евклидова расстояния, так и математическим “комфортом”
работы с ним. Его целесообразно применять, если компоненты произ-
вольного вектора
однородны по своему физическому смыслу и все
они одинаково важны при решении вопроса об отнесении вектора
к определенному кластеру. Если последние условия не выполняются,
переходят к взвешенному расстоянию или расстоянию Михаланобиса
с более гибкими возможностями уравновешивания значимости и со-
держания различных компонентов векторов
4.3. Расстояние между кластерами
Вторым важным понятием кластерного анализа является расстоя-
ние между кластерами. Это понятие вводится также не единственным
образом и имеет различный содержательный смысл. Снова ограничим
рассмотрение наиболее характерными определениями.
Предположим, что на множестве Y выделены два кластера –
и
жество. Далее допускаем, что кластер
чек), а кластер
арифметические средние векторов, формирующих кластеры
причем
объектов. Пусть
содержит
пустое мно-
объектов (то-
и
соответственно (“центры тяжестей” кластеров). Наиболее используемыми в кластерном анализе оказываются следующие виды расстояний
между кластерами.
1. Минимальное локальное расстояние по принципу “ближайше-
го соседа”:
В этом случае на множествах
ленные друг от друга точки и расстояние между кластерами отожде-
ствляется с расстоянием между этими точками.
2. Максимальное локальное расстояние по принципу “дальнего
соседа”:
ищутся две минимально уда-

7
max
max
, , .
,
l m i j
i l j m
d
S S Y Y
Y S Y S
, , .
öò l m l m
d S S Y Y
1
,,
i l j m
ñð l m i j
lm
d
nn
Y S Y S
S S Y Y
, ( ).
T
lm
ñòàò l m l m l m
lm
nn
d
nn
S S Y Y Y Y
i
Y
j
Y
Y
11
1
, , ,
2
nn
d i j i j
ijr
Y Y Y Y Y
d
r
2
1
, 4 / 2
d
r N n
N
,,
i j j i
Y Y Y Y
, 0.
ii
YY
11
1
,
nn
T
i i i
in
Y
R Y Y Y Y Y Y
Y
Это определение аналогично предыдущему, но основано на наиболее удаленных друг от друга точках.
3. Расстояние по “центрам тяжести”:
4. Среднее расстояние между кластерами (расстояние по принци-
пу “средней связи”):
.
5. Статистическое расстояние между кластерами:
Во всех этих определениях расстояние между точками
и
понимается в одном из рассмотренных выше принципов.
4.4. Индивидуальные свойства кластеров
Третий вид характеристик, используемых в кластерном анализе,
направлен на отображение индивидуальных свойств отдельных кластеров или всего множества Y в целом. Так как существо этих характеристик сохраняется и при рассмотрении отдельного кластера, и
всего множества
, рассмотрим их применительно к Y.
1. Величина
,
называется общим расстоянием множества .Y
2. Величина
называется средним расстоянием множества Y.
В этих определениях традиционно принимается
. и
3. Квадратная матрица размерностью n
называется матрицей рассеивания множества
суммы квадратов).
(иногда матрицей

8
Y
R
Y
11
.
nn
TT
ñò i i i i
ii
r Sp Sp
Y
R Y Y Y Y Y Y Y Y
Y
R
Y
R
.
d
r YR
Y
Y
12
, ,..., ; , 1, .
mi
imS S S S Y
2
1
1
( , ).
il
m
il
lJ
YS
YY
,
il
YY
1
J
()
ñò
rl
1
J
4. След матрицы
множества
называют статистическим рассеянием
(суммой квадратов отклонений, дисперсий)
5. Определитель
матрицы
называют статистическим
рассеянием, соответствующим определителю, и обозначают
4.5. Целевые функции классификации
Разбиение множества
на отдельные классы может быть осуще-
ствлено различными способами. Многие из них описаны в различных
документах по применению пакетов прикладных программ (например,
[8], [9]). Снова ограничим рассмотрение изложением некоторых достаточно общих принципов.
Чтобы один способ предпочесть остальным, в рассмотрение вводят
некую целевую функцию (показатель качества классификации), значение которой явилось бы количественной оценкой степени совершенствования того или иного метода классификации. Тогда поиск наилучшего варианта разбиения множества на отдельные классы сводится к
поиску экстремума этой целевой функции. Разбиение, при котором
целевая функция достигает экстремального значения, и будет решением задачи классификации.
В настоящее время отсутствует строгая формализованная система
рекомендаций по выбору целевой функции. Этот выбор подчиняется
интуитивно-эмпирическим соображениями и в каждом частном случае
осуществляется индивидуально. Достаточно распространенными оказываются следующие целевые функции.
Пусть на множестве
выделены кластеры
Тогда качество классификации можно харак-
теризовать следующими функциями.
1. Сумма внутри классовых дисперсий:
Если расстояние
внутренняя сумма в
есть не что иное, как статистическое рассеяние
понимается в евклидовом смысле, то
l-го кластера (см. соответствующее определение), и
представляет собой сумму статистических рассеяний всех mкластеров:

9
1
1
.
m
ñò
l
J r l
2
J
2
1,
( , ).
j li
m
ij
l
Y Y S
YY
2
3
1,
1
, ).
i j l j
m
ij
l
l
J
n
Y Y S
(Y Y
1 2 3
,,J J J
Y
( )( )
il
T
l i l i l
YS
R Y Y Y Y
l
1
.
m
l
l
R
4
11
)( )
ll
mm
T
l i l i l
ll
J
YS
R (Y Y Y Y
1
J
4
J
i
Y
.k
1 2 3 4
, , ,J J J J
m
.m
2. Сумма квадратов попарных внутриклассовых расстояний ме-
жду объектами:
Или:
В большинстве практических задач целевые функции
водят к одним и тем же разбиениям множества
на mклассов.
при-
3. Обобщенная внутриклассовая дисперсия.
Пусть
вляется матрицей рассеяния
кластеров опишется матрицей
-го кластера. Тогда рассеяние всех m
В качестве целевой функции
принимается:
Из сопоставления с
функцию
.
можно назвать обобщенным
статистическим рассеянием, соответствующим определителю. Эту
функцию рекомендуется использовать в случаях, когда возникают
предположения о том, что наблюдения
размерности, меньшей
4. Целевые функции
ном числе
классов, на которое разбивается множество Y. В прак-
принадлежат пространству
используют при априори извест-
тических задачах это число обычно неизвестно и подлежит определению в процессе проведения классификации. В подобных случаях целевая функция должна быть ориентирована на это обстоятельство и
надлежащим образом его учитывать. Одним из приемов формирования
целевой функции при неизвестном числе mявляется использование
аддитивной структуры, приводящей к построению целевой функции в
виде суммы двух слагаемых, одно из которых является невозрастающей функцией числа классов mи характеризует, как правило, внутриклассовый разброс наблюдений, а второе является неубывающей
функцией числа классов
В частности, предлагается [10, 11]:

10
5 1 2
,J b b
1
1
( , ),
il
m
il
lb
YS
YY
2
,b cm
0c
i
Y
5
.J
, 1, ,
k
j
R j nY
где
некоторая константа, определяющая потери при возраста-
нии числа классов. Наилучшее разбиение (выбор числа классов и разнесение точек
ции
по класссам) соответствует минимуму целевой функ-
4.6. Основные алгоритмы кластерного анализа
Прежде чем рассматривать основные алгоритмы кластерного анализа, еще раз обратим внимание читателя на существование большего
числа статистических пакетов прикладных программ, средствами которых успешно решаются многие задачи обработки экспериментальных наблюдений, в том числе и сводящиеся к кластерной методологии.
Среди пакетов подобной направленности отметим такие распространенные у нас в стране, как STATISTICA, SPSS, STADIA,
STATGRAPHICS и др. Опыт и техника применения этих пакетов для
решения задач кластеризации известны из многочисленных публикаций, часть которых отражена в Internet [4]. Не ставя перед собой цели
детального погружения в технологию практической работы с этими
пакетами, отметим только одну алгоритмическую особенность, свойственную многим из них. Эта особенность проявляется в специфике
организации вычислений, направленных на решение задач кластеризации. Используемые при этом методы принято делить на ирархические
и неиерархические. Среди алгоритмов первой группы выделяются аг-
ломеративные методы и дивизимные алгоритмы.
Особенность агломеративных алгоритмов проявляется в том, что
на начальной стадии работы алгоритма все n наблюдаемых точек
принимаются за центры n начальных кластеров .
В последующем каждый из построенных таким образом кластеров
объединяется с ближайшим к нему уже существующим кластером в
рамках используемого понятия близости, что приводит к уменьшению
числа кластеров и увеличению числа объектов, их формирующих.
Этот процесс продолжают до тех пор, пока все n точек не окажутся
объединенными в один кластер. Результаты такого последовательного
построения кластеров удобно сопровождать графическими отображениями, что осуществляется использованием так называемых денд-
рогрмм, на которых в направлении оси абсцисс откладываются номера объединяемых кластеров, а в направлении оси ординат – результаты
кластеризации. Каждый этап такого эволюционного построения кла-
Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]
